PIPO统一输入压缩与输出多步预测,长推理场景推理引擎新范式

大模型推理加速正从单一维度优化走向系统性协同。小红书技术团队提出的PIPO(Parallel Input-Output)架构,将输入压缩与输出多token预测(MTP)统一到一个框架内,并在训练阶段通过蒸馏将验证器(verifier)的校验能力前置到轻量confidence head中,为长推理场景下的推理引擎设计提供了新思路。

传统推理加速方案往往割裂地优化输入或输出:输入侧通过剪枝或压缩减少token数,输出侧通过投机性解码或MTP增加单步产出。PIPO的核心创新在于对称设计——输入侧压缩器将两个token折叠为一个latent表示,使输入序列长度减半;输出侧的MTP head则从隐藏状态中展开出额外token,使每一步的输出数量翻倍。这种“一缩一展”的结构在数学推理(AIME 2025)等长上下文任务中最高带来+7.15 pass@4的提升,且在部署测评中,TTFT(首Token延迟)加速约1.23倍,TPOT(每输出Token延迟)加速约1.86倍。

训练策略是PIPO的另一关键。团队采用两阶段方案:先用SFT(监督微调)让模型适应压缩与展开的联合模式,再通过On-Policy Distillation将离线训练好的verifier的校验能力蒸馏进轻量化的confidence head中。这使得推理时无需运行完整verifier即可获得高可靠性的置信度分数,相当于将验证成本从推理阶段“前置”到训练阶段。对于需要多步判断的长推理任务(如数学证明、代码生成),这种设计大幅降低了每次解码的滞后校验开销。

从行业视角看,PIPO统一了输入和输出两个传统上独立优化的维度,且通过蒸馏将验证能力内化,避免了推理阶段引入额外模块带来的延迟。这一思路与当前业界对“推理时缩放”的探索不谋而合——当模型在生成长链推理时,每一步的效率提升都会被累积放大。小红书在基于Qwen3.5-4B/9B backbone上的实验表明,PIPO在小模型上同样能取得显著加速,这暗示着在未来端侧或小参数量的长推理场景中,类似的“对称加速”架构可能成为标配。

对于从事模型加速的团队,PIPO带来了两点启示:一是输入输出端的联合优化存在更大的协同增益空间,二是将可验证的知识通过蒸馏“固化”到模型主干中,是减少推理开销的务实路径。参考PIPO的训练和部署代码(已在小红书技术公众号公开),开发者可以将其集成到现有的推理框架中,尤其是在需要高吞吐、低延迟的长推理服务场景下,该架构的实用性值得认真评估。