视觉语言模型(VLM)在2D图像理解上已接近人类水平,但面对3D空间推理——如坐标定位、物体间距离判断、遮挡关系——其“语言与像素”对齐的固有缺陷被无限放大。传统解决方案依赖结构化工具调用(如预定义API函数),但灵活性和组合能力有限,且常需针对不同模型或场景重新训练。NVIDIA Research最新发布的SpatialClaw,以一种“代码即动作接口”的设计,彻底改写了这一范式。
SpatialClaw的核心突破在于:它不再要求智能体通过预设的函数调用来获取3D信息,而是让模型直接生成Python代码,动态调用Depth Anything 3、SAM 3等感知工具,并自由组合它们的输出。这意味着智能体可以根据任务需求,在运行时编写自定义的几何推理流程——比如先调用深度估计提取点云,再用分割模型提取物体轮廓,然后通过代码计算相对位置——整个过程无需任何模型微调或参数更新。
实测数据极具说服力。在覆盖20项空间推理基准的全面评测中,SpatialClaw平均准确率达到59.9%,比近期代表性智能体SpaceTools高出11.2个百分点,比无工具基线提升6.5个百分点,比结构化工具调用方法高出3.2个百分点。更重要的是,这一优势无需更换提示词或工具集:同一套代码和工具配置可以无缝跨所有基准和骨干网络运行,支持从26B到397B参数的多种模型,包括Qwen3.5/3.6全系列以及Gemma4。
这种“免训练即插即用”的特性,大幅降低了空间推理在应用中的落地门槛。传统方法需要为每个新模型或新场景定制工具接口和训练流程,而SpatialClaw通过将代码生成本身作为通用接口,让智能体自动适应工具的组合逻辑,本质上利用了语言模型擅长的序列生成能力去“编写”空间推理脚本。这相当于把工程师手动调参和写API调用的工作,交给了模型自身。
对于机器人导航、3D场景理解、视频动作定位等应用,这一框架提供了立即可用的加速路径。建议相关研究者直接尝试其开源repo,将SpatialClaw集成到现有感知管线中测试。从趋势看,代码作为工具调用的中间表示,有望成为智能体与外部世界交互的新范式——它比结构化函数更灵活,比自然语言更精确,且天然具备可组合、可调试的优势。NVIDIA这一研究,或许正在为VLM从“看图说话”走向“空间操作”铺平道路。