反常识突破:蚂蚁开源自监督视觉模型,1B参数深度估计超越7B规模模型

视觉基础模型的发展正迎来一个重新思考设计范式的节点。当业界普遍追逐更大规模参数和更多标注数据时,蚂蚁集团旗下具身智能公司Robbyant开源的LingBot-Vision家族给出了一个反常识的答案:将“边界”——这个在传统视觉理解中被视为低层特征的信息——作为核心预训练信号,竟能实现令人瞩目的性能跃升。

该模型家族的核心创新在于掩膜边界建模训练策略。不同于主流自监督方法如DINOv3或MAE依赖全局对比学习或像素重构,LingBot-Vision将物体的几何边界作为原生的预训练信号,强制模型在预训练阶段就建立对空间结构的深刻理解。这种设计对于密集空间感知任务——如深度估计、表面法线预测、分割——具有天然优势,因为这些任务本质上都需要模型精确识别物体边界。

LingBot-Vision提供完整的不同规模版本,覆盖不同计算需求:ViT-g/16(约1.1B参数)、ViT-L(约300M参数)、ViT-B(约86M参数)以及更轻量的ViT-S。最令人关注的是,其旗舰1B模型在多个密集空间感知基准上,超越了参数规模高达7倍的模型(如7B参数量的DINOv3)。这是一个重要的效率信号:在机器人等真实世界应用中,计算资源往往受限,1B模型带来的性价比优势极其明显。

从行业背景看,当前视觉基础模型的设计趋同:更大规模、更多数据、更复杂的辅助任务。LingBot-Vision的发布提出了一个关键问题:我们是否过度复杂化了视觉预训练?蚂蚁团队选择回归视觉感知的本质——几何边界是理解空间结构的最基础线索,而将这一信号深度注入自监督流程中,反而获得了更专注、更高效的密集空间理解能力。这一思路与近年神经科学领域研究发现一致:哺乳动物视觉皮层的早期处理阶段就对边缘信息高度敏感。

对所有从事机器人、自动驾驶、增强现实等领域的开发者而言,LingBot-Vision值得深入评估。该模型已以Apache-2.0许可证在Hugging Face开源,提供了完整的不同规模预训练权重。建议重点关注两个方向:其一,将其迁移到自身垂直场景中测试对深度估计和分割任务的提升;其二,探索将边界信号纳入其他模态或任务中的可能性。当然,也需要留意该模型在非密集空间任务(如图像分类、视觉问答)上的表现,以及其在数据分布差异较大的场景下的泛化能力。

这可能会开启视觉基础模型设计的一个新方向:更专注、更本质的空间理解,而非一味追求参数规模的军备竞赛。对于机器人行业从业者而言,这不仅是模型的选择,更是对预训练信号设计哲学的一次重新审视。