视觉语言模型(VLM)在二维图像理解上已接近人类水平,但在三维空间推理——例如判断物体深度、相对位置、遮挡关系时——却频频失手。这一短板直接制约了其在机器人操作、自动驾驶、视频动作识别等需要精确空间感知场景中的应用。NVIDIA Research 最新发布的 SpatialClaw 框架,以“代码作为动作接口”的设计,为这一问题提供了一条无需重新训练的解决路径。
SpatialClaw 的核心思路是用可执行的代码段替代传统的工具调用范式。传统方法下,智能体通过预定义的工具调用函数(如 get_depth()、get_mask())来获取信息,但这种方式受限于工具集的固定组合与调用顺序,难以灵活应对复杂空间推理需求。SpatialClaw 则允许 VLM 直接编写并执行 Python 代码,底层调用 Depth Anything 3 和 SAM 3 等感知工具,并将输出自由组合——比如先对图像做深度估计,再对特定区域做分割,最后将两个结果做算术运算。这种“程序即行动”的模式,赋予模型更大的组合灵活性,也规避了工具调用中常见的接口适配成本。
实验数据印证了该设计的有效性。在涵盖物体计数、相对位置判断、路径规划等 20 项空间推理基准测试上,SpatialClaw 的平均准确率达到 59.9%,比近期专为空间任务设计的智能体 SpaceTools 高出 11.2 个百分点,比无工具基线条高 6.5 个百分点,比结构化的工具调用方式高 3.2 个百分点。更关键的是,这一性能提升完全来自框架设计本身,而非模型微调——同一套提示词和工具集可直接跨越所有 20 个基准,并适配从 26B 到 397B 参数的多种骨干网络(包括 Qwen3.5/3.6 和 Gemma4)。这意味着开发者无需为不同任务或不同模型重复训练,真正实现了“即插即用”。
从行业背景看,SpatialClaw 的突破在于将智能体的“行动层”从固定 API 调用升级为可编程的代码生成。这种思路并非首创——Code as Action 在具身智能领域已有探索,但 NVIDIA 首次将其系统化为空间推理的通用框架,并验证了在零样本、多基准条件下的一致性提升。它暗示了一个趋势:在 VLM 基础能力短期内难以根本性提升的情况下,通过外围的动作接口设计来弥补模型短板,可能是更务实的工程路径。对于机器人操控和视频理解领域的研究者而言,SpatialClaw 的仓库已经开放,建议直接跑一下其对标的几个困难基准(如“物体遮挡排序”“三维距离估算”),以评估其在具体任务上的增益。值得一提的是,框架不要求模型拥有代码生成能力以外的特殊技能,这进一步降低了采用门槛。