NVIDIA SpatialClaw:用代码替代工具调用,空间推理免训练提效11%

视觉语言模型(VLM)在二维图像识别上表现优异,但一旦涉及三维空间推理——如判断物体前后关系、测量距离、规划抓取路径——准确率便显著下降。这一根本性短板长期制约着机器人和视频理解等场景的落地。NVIDIA Research发布的框架,提供了一个反常规的解决方案:放弃传统的工具调用(Tool Calling)范式,转而用代码(Code)作为智能体与感知工具之间的动作接口,在不重新训练任何模型的前提下,将空间推理准确率拉升到一个新台阶。

SpatialClaw的核心设计思路是“代码即接口”。以往智能体调用感知工具(如深度估计模型、分割模型)时,往往依赖预设的函数签名或结构化参数传递,这种刚性耦合限制了工具组合的灵活性。SpatialClaw则让智能体直接生成Python代码,动态调用Depth Anything 3、SAM 3等感知工具,并能自由组合输出——比如先对图像做深度估计,再在深度图上执行实例分割,最后通过坐标计算得出空间关系。这种“写代码”的方式,本质上把工具调用变成了一个可编程推理过程,规避了结构化接口带来的表达能力瓶颈。

实验数据验证了这一思路的有效性。在涵盖空间关系判断、物体计数、尺寸估计等任务的20项基准测试中,SpatialClaw的平均准确率达到59.9%,较近期代表性智能体SpaceTools高出11.2个百分点,比“无工具基线”高出6.5个百分点,比传统的“结构化工具调用”高出3.2个百分点。更关键的是,这些提升全部来自框架本身的架构设计,而非针对特定模型或任务的训练。同一套提示词和工具集,可以在Qwen3.5/3.6、Gemma4等从26B到397B参数规模的模型上直接运行,无需微调或适配。

从行业背景看,SpatialClaw的出现并非孤立创新。近年来,让大模型生成代码来实现环境交互(如Code as Policies)已被证明在机器人控制中有效,但将其引入空间推理的感知层,NVIDIA是首次系统化实践。这暗示了多模态智能体发展的一个趋势:未来的“智能体操作系统”可能不再需要固定API栈,而是让模型根据任务动态编写驱动代码,真正实现“即插即用”。对于从事机器人操作、视频语义理解、AR/VR空间计算的研发团队,直接克隆SpatialClaw的仓库并运行其基准测试,应能快速评估自身场景的适配性。下一步值得观察的是,当这种“代码接口”能力扩展到更多感官模态(如触觉、力觉)时,通用空间智能是否会迎来更实质的突破。