标题:蚂蚁开源GUI定位模型VISTA-4B:自验证训练打破智能体落地瓶颈
摘要:蚂蚁 inclusionAI 开源的 VISTA-4B 模型基于 Qwen3.5-4B 架构,通过视图一致 GRPO 与自验证交叉视图锚定训练,在 GUI 定位基准上实现小幅提升。该模型可输入截图与自然语言指令输出归一化坐标,开源于 HuggingFace,为桌面自动化开发者提供了可直接部署的实用工具,尤其推荐使用 [x,y] 格式解析结果。这项技术标志着智能体在视觉接地领域迈出了重要一步。
智能体技术正从实验室走向实际应用,其核心能力之一在于能够精确理解图形用户界面(GUI)中的元素。长期以来,如何将自然语言指令与屏幕截图中的像素坐标精准映射,是制约桌面自动化效率的瓶颈。蚂蚁集团旗下 inclusionAI 团队开源了一款名为 VISTA-4B 的 GUI 定位模型,为新一波智能体落地提供了关键基础设施。
VISTA-4B 基于通义千问 Qwen3.5-4B 作为骨干网络构建,其核心创新在于引入了一种全新的训练范式:视图一致 GRPO(Group Relative Policy Optimization)结合自验证交叉视图锚定。传统方法在处理多分辨率、多设备屏幕时,常因视角差异导致定位偏移。VISTA-4B 通过在不同视图间强制保持定位一致性,并利用自验证机制动态调整锚点,使得模型对复杂界面元素的抓取更稳定。
在基准测试中,VISTA-4B 展现了差异化的性能表现:SSPro 得分 64.2,相比基于 GRPO-4B 的基线提升 2.0 个点;OSWorld-G 得分 61.2(提升 1.3);OSWorld-G-R 得分 69.7(提升 0.5)。值得注意的是,在 SSV2 基准上得分 93.8,略降 0.4。这种“有得有失”的调性并不意外:为提升跨设备泛化能力,模型可能牺牲了部分预设评测集内的过拟合优势。整体而言,边际提升虽非“跳跃式”,但训练方法的可复制价值远高于单一数字增长。
对于开发者而言,VISTA-4B 的最大卖点在于“开箱即用”。该模型已完整开源至 HuggingFace,用户只需提供屏幕截图与自然语言指令,即可获得归一化至 0-1000 区间的坐标输出。推荐使用 [x,y] 格式解析结果,以确保与主流自动化框架的无缝集成。这一设计直击桌面自动化开发者的痛点:无需自行标注大量 GUI 数据,即可快速获得一个经过验证的“眼睛”。
从行业视角看,VISTA-4B 的发布暗示了智能体技术的一个新趋势:未来模型竞争将不再仅看单一基准峰值,而是转向训练方法的可复用性与实际部署的易用性。视图一致 GRPO 和自验证交叉视图锚定这两个方法,完全可以被其他厂商应用于各自的骨干模型之上,从而更快构建定制化的 GUI 定位能力。这意味着,开源社区将获得一把“钥匙”,而不仅是一个“锁”。
展望未来,桌面自动化与 RPA(机器人流程自动化)的智能化拐点正在逼近。当模型能够稳定理解任意窗口、任意分辨率的 GUI 元素,企业级自动化系统将从“基于规则”全面转向“基于感知”。蚂蚁 inclusionAI 的这一开源贡献,为这一转变拉低了技术门槛。建议正在开发智能体应用的团队,立即将 VISTA-4B 纳入实验管线,尤其是在跨设备兼容性场景中,其视图一致训练所带来的优势将率先显现。