OmniTools 8月20日消息,LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上开展多场景服务配置优化。单节点 H20-141GB 实现 271 output tokens/s 的推理吞吐量。
该性能与 B300 GPU 的 383.7 tokens/s 相比,差距缩小至 1.42 倍,显著逼近高端硬件服务水平。
相关工作聚焦于模型服务层面的场景化调优,未涉及模型结构修改或再训练。
OmniTools 8月20日消息,LMSYS 团队针对 1.6 万亿参数的 MoE 模型 DeepSeek-V4-Pro,在 H20 GPU 上开展多场景服务配置优化。单节点 H20-141GB 实现 271 output tokens/s 的推理吞吐量。
该性能与 B300 GPU 的 383.7 tokens/s 相比,差距缩小至 1.42 倍,显著逼近高端硬件服务水平。
相关工作聚焦于模型服务层面的场景化调优,未涉及模型结构修改或再训练。
从这条动态出发,继续查看相关分析、产品详情和同主题更新。
刚收录的 AI 工具,适合顺手发现可用产品。