当业界还在追逐LLM基准测试榜单上的微小提升时,一次真实的生产级迁移,往往能揭示出比评测指标更深刻的工程真相。Hacker News上热度居高不下的Ploy团队迁移手记,正是这样一份值得所有Agent构建团队反复研读的实战档案。
Ploy将AI智能体的默认模型从Claude Opus 4.8切换至OpenAI最新发布的GPT-5.6 Sol,在真实营销网站构建任务中测评。结果显示:GPT-5.6 Sol完成页面的平均耗时仅为3分42秒,比Opus 4.8的8分钟快了近2.2倍;单次构建成本从3.06美元降至2.22美元,降幅达27%;输出Token数从33.0K大幅压缩至17.1K,视觉评分反而从0.936跃升至0.970。从任何角度看,这都是一次教科书级别的模型升级——直到团队深入排查迁移过程中遭遇的异常。
迁移的黑暗面在于工具调用。Ploy发现,GPT-5.6会在每次调用中为全部25个工具参数填充默认值,导致高达52%至64%的文件读取操作返回空结果。这一行为并非偶然失误,而是模型推理过程中的系统性问题。让团队更为棘手的是,无论是调整提示词指令还是启用OpenAI官方的strict模式,均无法有效抑制这种参数膨胀行为。换言之,GPT-5.6在工程层面引入了一种新的“隐形成本”——不仅增加了无效的Token消耗,更直接破坏了关键业务流程的可靠性。
另一个值得关注的发现来自评估框架本身。Ploy团队复盘后发现,约三分之一的失败用例,根源在于评估代码中植入了针对旧模型行为的假设,而非模型核心能力缺陷。这揭示了一个普遍却少被提及的工程困境:当模型快速演化时,围绕其构建的测试套件若不同步迭代,就会产出大量“虚假失败”,误导团队对模型真实能力的判断。
面对这次迁移,行业不应仅停留于“GPT-5.6性能更强”的简单结论。对于正在或将要构建Agent的团队,必须将工具参数格式的容错设计、缓存键的原子化分层、以及评估框架的模型无关性重构纳入核心工程规范。LLM的迭代速度远超传统软件,这意味着每一次模型升级可能既是性能飞跃,也是一场无法回避的技术债务清理。Ploy的这份手记,恰是一记及时的警钟:在AI工程化的赛道上,只有把最细微的工程坑位铺平,才能让高速度真正转化为高回报。