万亿模型推理破千t/s:小米MiMo与TileRT的协同设计范式

万亿参数大模型的推理速度长期被视作“不可能三角”的典型:规模、成本与延迟难以兼得。小米MiMo与TileRT联合推出的MiMo-V2.5-Pro-UltraSpeed模式,首次在通用GPU上实现1T模型输出超过1000 tokens/s,打破了此前依赖专用硬件(如TPU、定制ASIC)才能触及的性能上限。这一突破并非单一技术点的胜利,而是模型-系统协同设计(Model-System Co-design)的系统级工程成果。

从模型侧看,核心优化集中在两个维度。其一是FP4混合量化方案——仅对MoE结构中的Expert部分进行4-bit量化,保留Attention等关键层的FP16精度。这种非均匀量化策略在压缩模型体积的同时,避免了对生成质量的大幅损伤。其二是DFlash块级masked并行推测解码:通过自回归解码时引入块级别的掩码并行猜测,使得编程场景下的平均接受长度达到6.30 tokens,大幅减少串行调用次数。两者叠加,直接将单步推理延迟从毫秒级拉低至亚毫秒级。

系统侧的贡献同样关键。TileRT引入了常驻内核引擎(Resident Kernel Engine),将频繁调用的计算内核持久化在GPU显存中,消除重复初始化和调度开销。同时,异构流水线协作允许模型的不同部分在CPU与GPU之间异步执行,进一步隐藏数据传输延迟。这种“模型-系统双端联合调优”的思路,与行业里单纯的算子优化或模型剪枝形成鲜明对比——它更强调整个推理栈的端到端协同。

对比之下,此前业界最优的万亿模型推理方案(如DeepSpeed-FastGen或vLLM的Qwen-72B)在相同硬件上仅能达到约100-150 tokens/s。1000 tokens/s意味着可支撑实时语音交互、视频流字幕生成甚至在线代码补全等低延迟场景。但需要指出的是,UltraSpeed模式的API定价为MiMo-V2.5-Pro的3倍,速度提升约10倍,性价比仍有待实际负载验证。不过,FP4权重与DFlash模型checkpoint已开源至HuggingFace,这意味着社区可以直接复现并针对具体场景微调。

对于正在构建实时AI应用的团队,这一方案提供了新思路:不必等待下一代专用硬件,而是重新审视模型架构与推理引擎的耦合关系。建议关注两个关键点:一是推测解码的接受长度对实际业务的适配性(编程场景表现优异,但对话或长文本场景可能不同);二是FP4量化后Expert的退火微调策略是否可迁移。长远看,模型与系统协同设计将成为万亿模型落地的标配,而非可选项。