OmniTools 8月29日消息,Qwen3.8-27B(参数量27.3B,采用混合注意力架构,上下文窗口262,144 tokens,Apache 2.0 开源协议)已在 Mac Studio M3 Ultra 设备上完成本地部署测试。该模型经 Ollama 平台以 Q4_K_M 量化方式运行,模型体积压缩至约17GB。
实测显示,在上述配置下,文本生成速度约为14 tokens/秒。该结果为开发者在消费级高性能工作站上运行大语言模型提供了具体性能参考。
OmniTools 8月29日消息,Qwen3.8-27B(参数量27.3B,采用混合注意力架构,上下文窗口262,144 tokens,Apache 2.0 开源协议)已在 Mac Studio M3 Ultra 设备上完成本地部署测试。该模型经 Ollama 平台以 Q4_K_M 量化方式运行,模型体积压缩至约17GB。
实测显示,在上述配置下,文本生成速度约为14 tokens/秒。该结果为开发者在消费级高性能工作站上运行大语言模型提供了具体性能参考。
从这条动态出发,继续查看相关分析、产品详情和同主题更新。
刚收录的 AI 工具,适合顺手发现可用产品。