OmniTools 6月30日消息,近日,Qwen 3.6 27B 密集参数大语言模型引发开发者关注。该模型原生支持 256K 上下文长度,在本地部署场景中表现突出。据评测,在搭载 M5 芯片的 MacBook Max 上运行 llama.cpp Q8_0 量化版本(开启多 token 预测)时,推理速度可达 30 tokens/s;另有用户反馈在 RTX 5090 显卡上使用 Q6_K 量化版本可达 50 tokens/s。
该模型具备较强的任务泛化能力,可通过单条提示完成创意诗歌生成、使用 pnpm 构建六边形扫雷游戏等开发任务。评测作者称其为“首个真正具备通用智能的本地模型”。此外,该系列还提供 MoE 架构的 35B A3B 变体,但综合推荐优先使用 27B 版本。