GPT-5.6 Sol实战:成本降27%却陷工具参数默认值泥潭

在AI智能体竞争白热化的节点,Ploy将其核心智能体默认模型从Claude Opus 4.8切换至OpenAI今晨发布的GPT-5.6 Sol。这一迁移并非简单的替换测试——通过真实营销网站构建对比,Ploy团队揭示了新模型的显著性能提升与一系列隐晦工程陷阱,为行业输送了第一手实战避坑指南。

基准测试数据令人振奋:在相同任务下,GPT-5.6 Sol完成页面平均耗时3分42秒,较Opus 4.8的8分钟快2.2倍;每次构建成本从3.06美元降至2.22美元,降幅达27%。输出token从33.0K锐减至17.1K,视觉评分却从0.936跃升至0.970。这意味着新模型以更低延迟、更低成本、更高质量完成了同等任务,性价比优势一目了然。

然而,迁移过程中暴露的系统性问题更值得关注。Ploy团队发现,GPT-5.6 Sol会为所有25个工具参数填充默认值,导致52%-64%的文件读取请求返回空结果——因为模型“自作主张”补上了不存在的参数值。团队尝试在提示词中明确指示“仅填写显式提供的参数”,甚至启用了OpenAI strict模式(即严格遵循函数定义),但均无法修正这一行为。这一发现直指模型底层推理逻辑与现有工具调用框架的错配,对于依赖精准参数传递的agent应用而言,轻则功能失灵,重则产生错误输出且难以溯源。

更隐蔽的问题是缓存键设计。由于GPT-5.6 Sol对每一组工具参数填充默认值后,生成的缓存键与旧模型显式省略默认参数的版本不同,导致缓存命中率骤降,原本缓存的重复查询被迫重新计算,进一步放大了延迟和成本——尽管在单次测试中成本下降,但在高频调用场景下,缓存失效可能抵消部分收益。此外,评估框架中约三分之一的原始失败案例被追溯为“针对旧模型的假设”——例如,Claude Opus 4.8倾向于简洁返回,而GPT-5.6 Sol可能返回更详细的中间推理,数据解析逻辑若不匹配则判定为错误。这提示所有进行模型迁移的团队:评估指标必须针对新模型特性重新校准,而非机械复用旧测试集。

从行业视角看,GPT-5.6 Sol的参数填充行为很可能源于训练数据中隐含的“完整性偏好”——模型倾向于为函数调用提供所有合法字段,在语义上追求“完整”而牺牲“精确”。OpenAI的strict模式本该限制此类行为,实际却未能奏效,说明当前严格模式的设计边界仍落后于模型的生成自由度。对于Ploy这类以Agent为核心产品的团队,解决路径只有两条:要么在应用层对所有工具参数进行后过滤,强制丢弃默认值;要么等待OpenAI在API层面提供“禁止填充默认参数”的开关。

总之,GPT-5.6 Sol在性能和成本上的进步不可忽视,但迁移绝不能是“一键切换”的体力活。工具参数膨胀、缓存键冲突、评估标准不适配是三个必然要面对的工程坑。AI模型迭代加速,但每一次版本跃迁都要求系统架构、评估体系和缓存策略同步进化。Ploy的实践再次证明:在Agent落地的深水区,模型能力只是起点,工程适配才是撬动价值的支点。