推理速度翻倍、输入减半:小红书PIPO架构让长推理引擎进化

在长推理场景(如数学竞赛、代码生成)中,推理引擎面临双重挑战:输入上下文长度膨胀导致首token延迟过高,输出阶段自回归每步只生成一个token又限制了吞吐。传统加速方案如投机解码(speculative decoding)、量化或剪枝各有取舍,但始终未能从根本上同时优化输入和输出两个环节。小红书技术团队提出的PIPO架构(Parallel Input Compression and Output Prediction)试图在一个统一框架内解决这一问题——它同时改造了模型的输入端和输出端,使推理效率实现跳跃式提升。

PIPO的核心设计包含两个对称操作。在输入侧,一个轻量压缩器将连续的两个token折叠为一个潜在表示(latent),从而将输入序列长度直接减半。在输出侧,一个多token预测头(MTP head)将隐藏状态同时展开为两个输出token,实现每一步生成翻倍。这种“输入压缩-输出扩张”的对称结构,使得模型在理论和实践上都获得了效率红利。以Qwen3.5-4B和9B作为backbone的实验表明,PIPO在AIME 2025、MATH-500等长推理基准上,pass@4最高提升7.15个百分点。更重要的是,部署实测显示:首token生成时间(TTFT)加速约1.23倍,每个token平均生成时间(TPOT)加速约1.86倍——后者几乎接近理论极限的两倍加速。

这样的效果并非通过简单架构拼凑就能取得。PIPO的训练采用两阶段策略:第一阶段为监督微调(SFT),让模型同时学习压缩和MTP预测;第二阶段为On-Policy蒸馏,将外部verifier的校验能力“蒸馏”进一个极轻量的confidence head。这个confidence head在推理时无需额外验证步骤,就能判断当前生成token的置信度,从而将原本后置的验证成本前置到训练阶段。这一设计巧妙避免了推理时多次调用外部verifier带来的延迟开销,保持了端到端的推理效率。

从行业视角看,PIPO的意义不仅在于速度提升。当前主流推理引擎(如vLLM、TensorRT-LLM)多采用投机解码或KV缓存优化来提速,但这些方法在长序列场景下容易遇到显存瓶颈或模型容量限制。PIPO直接修改模型架构,通过训练阶段注入压缩与多token预测能力,使推理时无需额外模型或复杂调度,大幅降低了工程落地难度。尤其对于需要深度推理的数学、科学和长上下文对话应用,这种“训练时优化结构、推理时零额外成本”的思路,可能成为下一代推理引擎的标准范式。

展望未来,PIPO所代表的“输入压缩+输出扩张+验证前置”三位一体策略,为长推理加速提供了一条清晰的技术路径。其后续演进方向包括:更高效的压缩器设计(如自适应折叠粒度)、与KV缓存管理的深度融合、以及面向更大规模模型(如30B+)的蒸馏方案。对于从事模型工程部署的团队而言,PIPO证明了在训练阶段进行结构性改造比单纯优化推理运行时更有潜力——尤其是在延迟和吞吐同时成为瓶颈的场景下,架构级创新或许比算法级优化更具雪球效应。