视觉基础模型的发展长期遵循“学习特征不变性”的主旋律——从对比学习到掩码自编码,模型被训练去忽略纹理、光照、遮挡带来的变化,聚焦语义抽象。但蚂蚁集团旗下具身智能公司Robbyant近日开源的LingBot-Vision,选择了一条反直觉的路径:将边界(Boundary)作为预训练的天然信号。这套自监督视觉Transformer家族,专为密集空间感知设计,其旗舰模型ViT-g/16仅1.1B参数,却在深度估计、表面法线、边缘检测等任务中,匹配甚至超越参数规模高达7倍的模型(如7B DINOv3)。
LingBot-Vision的核心创新在于掩膜边界建模(Masked Boundary Modeling)。传统自监督方法通常把边界视为干扰,通过数据增强或策略刻意抹去;Robbyant团队则反其道而行,将边界作为“原生预训练信号”,引导模型学习几何结构而非语义区隔。这种设计尤其契合具身智能的场景需求:机器人导航、抓取、场景重建依赖的是连续的空间关系,而非标签式的物体分类。在NYUv2、ScanNet等标准密集空间基准上,LingBot-Vision的1B模型在深度估计的RMSE指标上比DINOv3-large(300M)降低15%以上,与7B的DINOv3-Giant持平甚至更优。
“小参数、高性能”的策略对行业有实际意义。大规模视觉模型虽然性能强劲,但部署成本高,难以在边缘设备或机器人本体上实时运行。LingBot-Vision通过紧凑架构和针对性预训练,在理论效率和落地可及性之间找到折中点。模型家族包含四个规格:ViT-g(1.1B)、ViT-L(300M)、ViT-B(86M)、ViT-S,覆盖从云端到端侧的不同算力层级。全部模型以Apache-2.0许可证在Hugging Face开源,支持即插即用。
值得留意的是,LingBot-Vision并非孤立的技术突破。它代表了视觉基础模型从“语义为中心”向“空间为中心”演进的趋势。当前主流ViT(如Meta的DINOv2、Google的SigLIP)在分类、检索等语义任务上表现卓越,却在需要精确定位的密集任务上力不从心。Robbyant的团队选择将边界信息直接注入预训练信号,相当于为模型安装了一把“空间标尺”,使其天然适应需要像素级精度的场景。对于机器人、自动驾驶、工业检测等应用,这种范式切换价值显著。
对开发者而言,LingBot-Vision的实用建议:若项目以密集空间感知为核心(如深度估计、3D重建、视觉SLAM),可直接替换原有DINOv3或MAE特征提取器,微调成本极低;若任务偏向语义理解(如图像分类、目标检测),则现有语义模型仍是更稳妥选择。Robbyant的下一步可能将边界信号与语义信号融合,但至少这一开源动作打开了“从结构而非语义学习空间”的新窗口。