蚂蚁开源LingBot-Vision:1B参数视觉模型用边界信号挑战规模定律

视觉基础模型的“军备竞赛”正迎来一个反常识的转折点。蚂蚁集团旗下具身智能公司Robbyant开源的LingBot-Vision,以1B参数规模在密集空间感知任务中匹敌甚至超越7B参数的DINOv3——这一对照结果直接挑战了“更大参数=更强泛化”的行业信条。更核心的差异在于预训练信号选择:LingBot-Vision放弃了传统的对比学习或掩膜图像建模,转而将边界(boundary)作为原生监督信号,通过掩膜边界建模(Masked Boundary Modeling)训练整个视觉Transformer家族。

该系列包含四个规模:ViT-g/16(约1.1B参数)、ViT-L(300M)、ViT-B(86M)和ViT-S。所有模型均采用自监督方式,在无需标注数据的前提下学习空间结构。其训练流程可概括为:对输入图像随机掩膜部分区域,令模型预测被掩部分的边界信息(而非像素值或语义标签)。这种设计看似反直觉——边界信息稀疏且几何化,但在深度估计、表面法线预测、物体完整分割等密集空间任务上,实验表明1B模型不仅稳定高于同尺寸对比方法,甚至超越参数7倍以上的DINOv3 ViT-g/14。这意味着预训练信号的选择比模型容量更关键

将LingBot-Vision置于当前视觉基础模型演变中可发现,它的思路与主流掩膜自编码器(MAE)对比学习(CLIP/DINO)形成鲜明分野。MAE预训练目标为像素重建,容易陷入纹理冗余;对比学习依赖正负样本对构建,对密集预测任务支持不足。而边界作为物体形状和空间布局的底层表征,天然具备跨尺度不变性几何先验,使模型在泛化时更关注结构化信息。这种策略在机器人感知场景中价值尤为突出:移动机器人通常需要在有限算力下实时完成深度估计、碰撞检测、抓取规划,LingBot-Vision的经济参数+高空间精度组合,有望替代传统基于图像分割或深度学习的流水线。

Robbyant以Apache-2.0许可证在Hugging Face上完整开源了四个模型权重和训练代码,这为学术研究和工业落地提供了低门槛入口。对于机器人领域从业者,建议优先尝试ViT-B(86M)ViT-L(300M)版,它们可以在边缘设备上以较低推理代价获得与DINOv3大模型相当的深度感知能力。同时,该模型也暴露出一个开放问题:边界信号对高动态场景(如快速运动的机械臂)和弱纹理区域(如纯色墙壁)的鲁棒性如何?这需要进一步在真实机器人数据集上验证。

LingBot-Vision的发布,实际上宣告了视觉基础模型的一条新路径:预训练信号的结构化程度,正在取代参数量,成为衡量模型效率的关键标尺。推而广之,未来非生成式视觉模型的竞争将聚焦于低级特征的自监督设计——深度、法线、边界、光流等几何信号都可能被重新挖掘。对社区而言,这比单纯堆叠参数更具工程意义,也更接近视觉智能的底层原理。