当业界仍在为万亿参数MoE模型的推理成本头疼时,小米用一台标准8卡GPU服务器交出了千tokens/s的答卷。6月8日至23日期间,MiMo联合TileRT_AI开放限时免费聊天体验,企业用户可申请接入API。这一速度不仅刷新了公开记录,更重要的是,它没有依赖Cerebras或Groq的定制芯片,而是基于市场通用的GPGPU节点——这意味着推理成本的断崖式下降。
具体来看,小米MiMo-V2.5-Pro-UltraSpeed在单台配备8块标准GPU的服务器上,对1万亿参数MoE模型实现了超过1,000 tokens/s的输出速度。此前要达到类似吞吐量,要么依赖晶圆级处理器(如Cerebras CS-3),要么走专用推理芯片(如Groq LPU),两者都带来高额硬件壁垒和锁定风险。小米方案证明:通过工程优化(如动态稀疏激活、流水线并行和TensorRT加速),标准集群同样能榨干MoE的潜力。
行业影响不容小觑。万亿MoE模型的推理瓶颈主要卡在显存带宽和跨节点通信。小米单节点实现千tokens/s,意味着实时交互场景(如语音助手、Agent循环)在消费级算力上成为可能。对比API定价:UltraSpeed版本价格是标准版的3倍,但输出体验提升约10倍——性价比显著优于同行。对于需要高频调用的开发者,实际成本反而更低。
不过,该方案仍处于早期阶段。8卡节点的显存容量限制意味着模型全量参数必须经过量化或稀疏化处理,精度损失需视具体任务验证。此外,单节点虽好,但多节点扩展的线性度尚未公布。企业用户可登录MiMo官网申请免费聊天体验,截止日为6月23日(PDT),符合资格者将获得100万tokens的免费配额。建议关注实时对话和Agent架构的团队优先测试,评估其与自身场景的适配度。
从趋势看,小米此举可能加速MoE模型在边缘和私有化部署中的落地。当推理成本从“专用硬件”转向“通用GPU”,中小企业和科研机构将更灵活地拥抱万亿级模型。标准集群的效率竞赛才刚刚开始。