在AI推理框架的工程实践中,性能调优长期依赖个人经验与临时脚本。调试CUDA内核、对比不同量化方案、微调扩散模型这些重复劳动,往往随着人员流动而流失。LMSYS Chatbot Arena团队的博客文章揭示了SGLang团队的新尝试:他们将这类工程知识固化为可执行的SKILL.md文件、脚本、基准合约和审查循环,形成一套名为“Loop Engineering”的方法论。
这套体系的核心并不是某个具体的优化技巧,而是将“如何获得SOTA性能”这一模糊目标拆解为可重复的流程。SGLang团队定义了一个“SOTA Performance Loop”:公平基准测试 → 差距分析 → 性能剖析 → 补丁实现 → 重新验证。每一步都配有明确的证据规范——Profile证据成为性能工作的核心产出,而非仅仅是最终数字。Humanize/RLCR环节引入外部审查,Codex Goal则试图以更低协调成本执行相同循环。
目前公开的技能库已涵盖多个方向:SGLang .claude/skills针对CUDA调试、内核集成与性能分析;SGLang diffusion .claude/skills聚焦扩散模型添加与调优;BBuf/AI-Infra-Auto-Driven-SKILLS提供跨框架SOTA循环的自动化模板;KDA(MLSys 2026 FlashInfer内核竞赛获胜方案)以及BBuf/KDA-Pilot(已合并三个SGLang集成PR)则展示了这一理念在实际项目中的落地效果。
值得注意的是,“评审”环节在流程中被显著前置。开发者不再只是编写代码并等待测试结果,而是需要预先定义问题、选择合适的证据类型、设计工作流,并判断结果是否达到生产可用的标准。这种转变意味着工程团队的组织方式正在从“结果导向”转向“过程可审计”,在调试过程中主动创造可复用的证据资产。
从行业视角看,这一做法与软件工程中“基础设施即代码”的趋势一脉相承,但更进一步——它试图将工程师的隐性决策逻辑也显性化。对于正在自建推理框架或优化AI服务的团队,借鉴LMSYS Chatbot Arena团队的思路,将基准测试、性能剖析和调试流程脚本化为可复用的技能包,可能比临时编写一次性脚本更能积累长期工程能力。毕竟,当GPU内核演进而人员更替时,真正的壁垒不是某个优化补丁,而是让新成员也能重新跑通并改进全流程的“循环工程”资产。