极限编程实验:Qwen3.7-Max如何用一份文档自我纠错交付双端应用

通义实验室发布的这份实验报告,隐去了精美的演示和满分分数,转而呈现一幅完全不同的画面:当Agent被推到“从0到1交付真实应用”的极限边缘,会发生什么?答案是一份约15万字的产品调研文档,一个完全隔离的沙盒环境,以及Qwen3.7-Max全自动完成的移动端(APK)与Web端双端应用交付。单端耗时约4小时,全程无人工接管。

这并非传统意义上的“验证已存在的系统”,而是一种更接近工程混沌测试的实验:给予模型尽可能少的约束——无设计稿、无后端代码,仅凭一份聚焦于产品需求与业务逻辑的纯文本文档——然后让它在未知领域中自主决定如何构建一套完整的双端软件系统。模型甚至不具备图像理解能力,只能通过像素坐标反推界面布局约束。某种意义上,这是在迫使Agent模仿人类在无法“看见”全貌时的决策能力。

实验的过程机制是整个事件中最具工程参考价值的部分。通义实验室设计了“分阶段注入约束→逐层验收→带错纠正”的闭环控制系统。具体而言,工作流被拆解为规划、架构、编码等明确阶段,每个阶段产出都要经过静态检查、编译自检(0 error)、路由完整性(Web端34条路由全部可达)、功能扫描甚至真机冷启动冒烟测试的层层过滤。一旦失败,错误文本会自动注入下一轮重试循环,迫使模型在数小时内自我纠正直至收敛。

这种做法本质上放弃了传统的“一次推理完美输出”假设。它更接近于一种容错设计与渐进式修正的结合。将复杂的工程交付转化成一系列可局部验证的子任务,并利用每一次错误的因果反馈去微调下一步的行动路径。这不是简单的链式构建,而是一个具备自我纠错能力的闭环系统。

在行业背景下,通常Agent产品往往只展示“一次成功”的炫技时刻,却忽略了真实工程环境中“混乱与失败”的常态。通义实验室的实验不仅展现了Qwen3.7-Max在长程任务中的模型天花板,更暴露并解决了Agent在复杂、多步骤变局下的收敛问题。对于所有正在探索Agent开发的团队而言,这套约束与容错机制本身比模型评测分数更具传播与复制价值。

这也给后续类似实验带来直接启示:一是必须强制构建可复用的验收机制,尤其是在无人工接管场景下;二是要设计足够粗粒度的阶段性验证点,而非仅依赖最终产出。三是在长程交付中,错误反馈的注入时效性和结构性决定了系统能否在合理时间内完成收敛。

当这些条件全部满足,Agent才真正具备了从“演示”到“工程”的跨越基础。这份实验不只是一次模型能力测试,它就是一套可被其他团队快速复刻的闭环方法论——所有Agent开发者,都应按此标准审视自己的产品。