阿里开源Page Agent:让网页AI副驾不再需要“截图”,DOM直读时代来了

在浏览器自动化与AI助手融合的浪潮中,传统的“外部操控”方案——如Playwright、Puppeteer——往往依赖截图配合多模态模型来理解网页,试图让AI“看懂”像素。但这一路径不仅成本高昂,且对页面动态变化的适应性有限。阿里巴巴最近开源的Page Agent提供了一种截然不同的技术切口:嵌入页面内部的JavaScript客户端库,不再通过截图“看”界面,而是直接读取并理解当前的文档对象模型(DOM)。

Page Agent的核心创新在于FlatDomTree技术。它并非原封不动地搬运整个DOM树——那将导致大量冗余的样式、脚本和注释信息涌入语言模型的上下文窗口——而是对实时DOM进行“脱水压缩”,生成结构化的文本映射。纯文本语言模型(如阿里自家的qwen3.5-plus或其他兼容OpenAI接口的模型)得以绕过视觉理解的门槛,直接操作具体元素:点击按钮、填写表单、抓取数据片段。由于它运行在浏览器环境内,自动继承当前页面的cookies和用户会话,无需部署独立后端或处理登录态同步问题,这大幅降低了从概念验证到产品落地的工程成本。

值得业界关注的是Page Agent与现有自动化方案的结构性差异。常规工具如同外置的“遥控机器人”,需要通过网络协议向浏览器发送指令,依赖对页面结构(如CSS选择器、XPath)的预定义规则。而Page Agent更像一个内嵌于页面的“智能导航仪”,AI助手的操作逻辑与用户浏览行为同源,更适应SPA(单页应用)中频繁的虚拟DOM变更。当然,这种设计也带来明确限制:其作用域被严格限定在当前页面,无法像Playwright那样跨页面、跨源进行复杂的端到端流程编排。对于涉及交易确认、权限修改等高风险操作,文章亦强调仍需在服务端补充安全验证。

从行业趋势来看,Page Agent精准切中了SaaS产品“AI Copilot”场景的痛点。过去开发嵌入产品的对话式助手,一个常见的两难选择是:要么依赖昂贵的视觉模型而牺牲响应速度,要么在代码中硬编码规则而失去灵活性。Page Agent揭示了一条中间路线——将页面的结构化数据(DOM)直接翻译为模型可读的文本空间,实现低成本、高精度的指令执行。对于计划在自有应用中构建智能表单填充、无障碍浏览辅助或通用操作助手的团队,这个采用MIT许可证的项目几乎是一个开箱即用的技术底座。但值得注意的是,它并不意在取代测试自动化框架,而是补全“页内智能体”这一长期被忽略的工程领域。在AI对代码的抽象理解能力不断提升的背景下,由DOM直读驱动的Web交互,可能重新定义人与浏览器的协作边界