标题:PIPO架构:输入压缩与多token预测统一,大模型长推理效率的革命性突破
摘要:小红书提出PIPO架构,通过输入侧压缩器将两个token折叠为一个latent,输出侧MTP head展开为额外token,实现输入长度减半、每步输出翻倍。基于Qwen3.5-4B/9B,AIME 2025上pass@4提升7.15%,TTFT加速1.23×,TPOT加速1.86×。训练采用SFT与On-Policy Distillation两阶段,将verifier校验能力蒸馏进轻量confidence head,预置验证成本,为长推理场景打造下一代推理引擎雏形。
大语言模型(LLM)在长推理任务(如数学证明、代码生成、多步规划)中面临核心矛盾:输入序列随推理链持续膨胀,而每步仅输出一个token。这导致TTFT(首token延迟)和TPOT(每输出token延迟)双重恶化,推理引擎在长序列下沦为“串行瓶颈”。小红书的PIPO(Paired Input & Prediction Output)架构针对这一痛点,将输入压缩与输出多token预测统一到一个框架内,从根本上改变推理节奏。
PIPO的核心设计分为两阶段。在输入侧,一个轻量压缩器将连续的两个token折叠为一个latent向量,使KV cache长度减半,直接降低TTFT。在输出侧,MTP(Multi-Token Prediction)head将隐藏状态展开为额外token,使每步推理同时输出两个token,TPOT相应减半。这种“压缩-展开”对称结构本质上是将序列变换运算嵌入推理流程,而非在外部加装模块,从而避免了额外延迟。基于Qwen3.5-4B和9B backbone的实验表明,在AIME 2025等需要长推理的基准上,PIPO的pass@4最高提升7.15个百分点,验证了长序列场景下的精确性收益。
更值得关注的是其训练工艺的巧妙之处。PIPO采用SFT(监督微调)先对backbone进行基础适应,随后通过On-Policy Distillation将verifier(校验器)的能力蒸馏进一个轻量confidence head。这意味着验证成本从推理时后置校验变成训练时前置蒸馏——在部署时,模型内部自动具备多token置信度判断,无需外部verifier额外调用。这种“成本前置”策略大大简化了推理堆栈,使PIPO不仅是加速方案,更是推理架构的演化方向。
从部署测评数据看,PIPO在标准配置下TTFT加速约1.23×,TPOT加速约1.86×。需要指出,TTFT提升幅度相对温和(1.23×)是因为输入压缩仍需要一次编码,但KV cache减半后对长序列的效果会进一步放大;TPOT接近翻倍的表现则直接体现了多token预测的价值。在模型加速领域,现有方案多聚焦于单点优化(如FlashAttention、推测解码),而PIPO通过统一输入和输出改造,触及了推理引擎的底层拓扑,具有更高的可扩展性。
对于关注部署与工程的团队,PIPO提供了几点启示:第一,长推理场景的重心应从“降低单步延迟”转向“减少总步数”,输入压缩与多输出结合是实现这一转变的有效路径;第二,蒸馏verifier能力进confidence head的做法可用于其他需要验证链的长任务,例如代码执行检查或数学推导验证;第三,PIPO的双阶段训练流水线可复用于其他backbone,只需调整latent维度与MTP头结构。当前,PIPO已在AIME 2025等基准上展示了潜力,下一步若能在更大模型(如14B、72B)上验证,或将成为下一代推理引擎的标配设计。