OmniTools 8月22日消息,SGLang 团队发布 Weight Cache Daemon,利用 CUDA IPC 零拷贝映射技术,将模型权重加载时间从约 495 秒大幅缩短至约 0.63 秒,提速约 785 倍,端到端引擎启动时间减少 93.9%。
该守护进程在 GPU 内存中持久化存储后量化权重,支持多推理实例共享同一权重缓存,并实现亚秒级主备切换能力。
Weight Cache Daemon 是 SGLang Fast Engine Recovery Framework 的第一阶段成果,旨在提升大模型服务的高可用性与弹性恢复能力。