传统浏览器自动化多依赖Playwright或Puppeteer这类外部工具,它们模拟用户行为,依赖截图或复杂的视觉模型来理解页面。然而,这方式不仅成本高、对多模态模型依赖重,而且在单页应用或动态网页中容易出现偏差。阿里巴巴开源的Page Agent,开创性地将自动化引擎从外部驱动变成页面内部嵌入的JavaScript库,直接通过自然语言指令操作DOM。
与同类工具最大的不同在于,Page Agent始终驻留在网页内部。它会实时将页面DOM“脱水”压缩为FlatDomTree文本映射,而非依赖截图或多模态模型来进行视觉识别。这个结构化的文本表示,使得任意纯文本模型都能精准理解页面结构,从而执行点击、表单填写、滚动等具体操作。用户用自然语言说“点击提交按钮”或“填写邮箱字段”,模型通过FlatDomTree找到对应元素并直接完成动作。整个过程无需外部浏览器或独立后端,完全在单个页面内闭环。
Page Agent还直接继承了用户的cookies和会话状态,这意味着它无需模拟登录或重复授权,天然与用户当前上下文一致。兼容任意OpenAI兼容端点的模型(官方示例使用qwen3.5-plus),同时给开发者保留了模型选择的灵活性。由于采用MIT许可证,降低了在自有应用内集成AI副驾的门槛。
在实践中,Page Agent的应用场景非常明确:SaaS产品中加入智能表单自动填充、无障碍辅助操作、任务型对话引导等。相比调用外部工具,它能节省调用多模态模型的费用,同时由于依赖文本结构而非截图,响应速度更快、错误率更低。但需特别注意的是,Page Agent默认限于单页面范围,即它的操作边界不会跨越到第三方或新标签页。对于高风险操作(如支付、删除),仍需通过服务端进行二次验证,以避免误触发。
对技术团队而言,Page Agent的价值不仅仅是降低了成本,更在于把AI控制权还给了产品侧。产品经理无需依赖客户端或BFF层改写DOM接口,通过一句自然语言指令就能实现页面功能组合。这一方式在智能客服、低代码平台、RPA工具中尤其实用。
如果你正在为自己的Web应用寻找一个低门槛、低成本的AI副驾嵌入方案,Page Agent是当前一个值得认真考虑的选项。随着更多基于文本结构的推理模型成熟,这种“嵌入而非模拟”的自动化方式,可能会逐渐替代传统截图识别方案,成为浏览器内AI操作的主流范式。