Claude 4.7自主操控机器狗:速度碾压人类20倍,代码量锐减90%

Anthropic 最新公布的“Project Fetch”实验第二阶段结果,为“语言模型操控物理世界”这一命题画出了一条清晰可见的进度条。配备 Claude Opus 4.7 的自主系统在操控四足机器人时,不仅完全甩掉了人类协作者,更在速度与代码效率上实现了数量级碾压——这在不到一年前还被认为是一项遥不可及的假设。

回顾 2024 年 8 月的第一阶段实验,人类团队在 Claude Opus 4.1 的辅助下,已经展现出对无 AI 团队的显著优势。而新实验结果则将这场竞赛的维度彻底改变:Claude Opus 4.7 以全自主模式完成所有任务,速度比最快的“人类+Claude 4.1”团队快约 20 倍,比不带 Claude 的人类团队快 37 倍以上,同时编码量减少了近 10 倍。这意味着,一个具备通用推理能力的语言模型,已能在无人干预的情况下完成传感器连接、路径规划等复杂操作链条。

值得注意的是,这些进展并非来自针对机器人领域的专项训练或微调。Anthropic 强调,Claude Opus 4.7 的突破完全依赖于通用模型规模化带来的推理能力跃升。这与当前具身智能领域的主流路径——如谷歌 RT-2 那样需要海量机器人操作数据进行端到端训练——形成了鲜明对比。通用模型无需专属数据即可上手物理工具,暗示了一条更高效的规模化道路:只要语言模型本身的认知能力足够强,“看懂”传感器数据并“规划”执行序列就可以自然涌现。

然而,实验也暴露了当前模型的软肋。在“精确移动沙滩球”等闭环控制任务中,Claude Opus 4.7 仍存在困难。这背后涉及对实时触觉反馈的建模、微小误差的修正以及对非结构化环境的自适应——这些恰恰是当今大语言模型最薄弱的环节:推理在一维符号空间中完成,而物理世界是连续、非线性且充满噪声的。当任务对“感觉-行动回路”的精度要求逼近毫秒级时,模型当前的架构瓶颈就会暴露。

从行业视角看,Anthropic 的实验已为智能体(Agent)落地提供了一个可视化锚点:语言模型可以成为物理世界操作系统的“中央处理器”,但外围的传感器适配、运动控制闭环仍需专用系统配合。对于正在布局具身智能的团队而言,一个务实的选择或许是:用大规模通用模型做高层规划与决策,用轻量级专用模块处理底层实时控制。Claude Opus 4.7 在高层任务上的表现已经足够惊艳,真正要攻克的下一个堡垒是“物理直觉”——让模型像人类一样理解重心、摩擦力与力矩。

无独有偶,同一周内 xAI 的 Grok TTS 模型在语音盲测中以 96 分(接近真人的 100 分)夺冠。两个跨模态的进展共同指向一个趋势:通用智能的规模化正在系统性地填平数字世界与物理世界之间的沟壑。如果说 2024 年是语言模型学会“看见”的一年,那么 2025 年将是它学会“动手”的元年。