OmniTools 8月4日消息,一个开源仓库发布了在单颗 AMD MI300X GPU 上生产级运行 DeepSeek V4 Flash 0731 模型的完整配置与补丁,无需额外量化或权重卸载。 该模型参数量为 304B,在配备 192 GB HBM 的 MI300X 上达成单流 168.6 tok/s 解码速度,8 并发流下聚合吞吐达 542 tok/s,并已验证支持 256K 上下文长度。 相关实现已开源,适用于高性能推理场景。