阿里巴巴开源Page Agent:告别截图,用自然语言直接操控网页DOM

浏览器自动化的传统路径——无论是Playwright、Puppeteer还是Selenium,都依赖外部进程驱动,通过截图或DOM快照让模型理解页面状态。这条路虽然成熟,但在SaaS产品中嵌入AI助手时,始终面临两个痛点:一是截图方案需要多模态模型,成本高、响应慢;二是外部驱动与前端框架的耦合度低,容易因安全策略、cookies同步等问题造成部署摩擦。阿里巴巴近期开源的Page Agent,则用一种完全不同的思路打破了这一局面。

Page Agent本质上是一个轻量的JavaScript客户端库,直接嵌入目标网页后,通过自然语言指令即可操作DOM元素。它的核心创新在于:不依赖截图或多模态模型,而是将实时DOM“脱水”压缩为一种名为FlatDomTree的纯文本映射。这个映射保留了元素的结构层级、可交互属性和文本内容,却能以极低的token消耗输入给任意纯文本语言模型。模型返回的指令(如“点击提交按钮”、“填写邮箱字段”),再由Page Agent解析并直接作用于真实DOM。相比外部驱动的自动化工具,这种方式无需单独的后端服务,且自动继承用户的cookies与会话,天然规避了登录态同步问题。

从工程角度看,Page Agent的设计极具实用性:它支持任意OpenAI兼容端点的模型,示例中使用的是阿里自研的qwen3.5-plus,但理论上可替换为GPT-4o、Claude等。整个项目采用MIT许可证,对商业集成友好。但需要明确的是,它的作用域被限定在单页面范围——无法跨页面跳转或操控多个标签页,同时高风险操作(如支付提交)仍需服务端二次验证。这决定了它更适合作为AI副驾、智能表单填充、无障碍控制等页面内的辅助工具,而非取代传统的端到端测试框架。

在SaaS产品中嵌入AI助手的场景,Page Agent的价值尤其突出。传统方案要么依赖昂贵的多模态模型对屏幕截图做推理,要么需要搭建复杂的后端代理来解析DOM。Page Agent将全部逻辑下沉到前端,模型成本可从数美分降至几厘,延迟也因省去截图传输而大幅降低。更重要的是,它完全遵循现有网页的安全边界——不注入额外权限,不离开用户当前上下文,这使得产品团队能以最低的合规风险快速验证AI交互功能。

综合来看,Page Agent代表了一种范式:将自动化从“外部遥控”转向“内部感知”。它的出现并不意味着Playwright等工具过时,而是为特定场景——在自己产品内构建一次性的、轻量的AI copilot——提供了更精准、更低成本的选项。对于正在探索AI功能嵌入的团队,建议在原型阶段优先尝试Page Agent,但需注意其单页局限,并提前设计好操作回滚与风险验证机制。随着前端AI交互需求的爆发,这类“页面内原生”的自动化方式,很可能成为SaaS产品标配的能力层。