返回行业动态

SGLang 推出 Weight Cache Daemon,实现亚秒级大模型推理引擎重启

2026/08/21 18:14
查看原文

OmniTools 8月22日消息,SGLang 团队发布 Weight Cache Daemon,利用 CUDA IPC 零拷贝映射技术,将模型权重加载时间从约 495 秒大幅缩短至约 0.63 秒,提速约 785 倍,端到端引擎启动时间减少 93.9%。

该守护进程在 GPU 内存中持久化存储后量化权重,支持多推理实例共享同一权重缓存,并实现亚秒级主备切换能力。

Weight Cache Daemon 是 SGLang Fast Engine Recovery Framework 的第一阶段成果,旨在提升大模型服务的高可用性与弹性恢复能力。

相关背景

想继续了解,可以看这些

从这条动态出发,继续查看相关分析、产品详情和同主题更新。

最新工具

刚收录的 AI 工具,适合顺手发现可用产品。

查看全部