把边界当信号:蚂蚁机器人的1B视觉模型如何“以小搏大”

当主流视觉基础模型还在追逐更大的参数量、更复杂的架构时,一个反直觉的思路正在重新定义“小而美”的能力边界。

蚂蚁集团旗下具身智能公司Robbyant开源的LingBot-Vision系列模型,将边界信息从辅助信号升级为自监督预训练的核心驱动力。这套包含ViT-g(1.1B)、ViT-L(300M)、ViT-B(86M)和ViT-S四个规模的视觉Transformer家族,在深度估计、法向估计等密集空间感知任务中,旗舰模型以7倍于DINOv3的参数规模优势完成了跨越式追赶。

视觉基础模型训练长期受困于一个难题:如何在不依赖人工标注的前提下,让模型学会理解场景的几何结构。传统的对比学习依赖图像级特征对齐,掩膜图像建模则聚焦于像素级重建,两者都忽略了边界——这个人类视觉系统中最基础的几何线索。LingBot-Vision的突破在于将边界检测作为预训练代理任务,模型被迫学习从被掩膜覆盖的图像中恢复物体的轮廓与边缘,这本质上是对三维结构理解能力的直接训练。

从技术细节看,模型采用掩膜边界建模(Masked Boundary Modeling)方法,在训练时随机遮盖图像块,迫使模型根据可见区域重建高分辨率的边界图。这种机制与人类视觉系统的“边界完成”现象高度相似——大脑会根据片段的边缘信息快速推测物体整体形状。实验结果验证了这一设计的有效性:ViT-g在Scannet数据集上的深度估计任务超越7B DINOv3,同时在室内场景理解指标上达到新的SOTA。

这种做法对机器人领域的意义尤为深远。传统视觉模型在城市或风景数据集上表现优异,但当部署到桌面、仓库这类小范围、高密度的空间中,深度图的准确度往往大幅下降。LingBot-Vision预处理后的边界信息天然适配密集空间,能辅助机器人区分靠在一起的物体、识别透明或反光表面。更重要的是,模型以Apache-2.0许可证在Hugging Face开源,开发者可以直接用于机器人导航、抓取、避障等实时任务。

回顾视觉基础模型的发展趋势,从DINOv3到Swin Transformer,业界长期在参数量和推理效率之间做权衡。LingBot-Vision提供了第三条路径:训练阶段的设计创新可以显著降低推理阶段的参数量需求。对于机器人这类依赖低延迟、低功耗的设备,参数冗余的代价远高于云服务器。

不过需注意,该模型在ImageNet分类等高层语义任务上的表现尚需验证。当前的高密集空间感知能力来自对边界特征的偏向性学习,而在通用视觉任务中,这种设计可能会引入额外的归纳偏置。开发者应根据具体任务场景评估是否需要将LingBot-Vision与传统骨干网络组合使用。

选择模型时,建议遵循以下策略:若任务涉及空间结构感知,优先尝试ViT-B(86M)版本验证效果;若对实时性要求极高,ViT-S(约86M以下)可作为轻量级替代;对精度敏感的科研场景可直接使用ViT-g。开源社区已有人尝试将其与位置编码模块拼接,用于端到端的抓取姿态预测,值得跟进实验。

边界信号的价值或许比预想的更大。当大模型狂飙渐入冷静期,扎实的预训练任务设计可能成为下一个竞争焦点。