Page Agent是什么?
Page Agent 是由阿里巴巴开源的一款「网页内 GUI 智能体(GUI Agent)」框架。它的核心理念是“让 AI 直接住进网页里”,用户或开发者只需通过一行代码或简单的配置,即可让任何网页具备自然语言交互能力,从而通过自然语言指令控制网页界面元素(如点击、输入、导航等)。
Page Agent 的主要功能
- 纯前端 DOM 操作:无需截图、OCR 或多模态大模型,它直接通过解析网页的 DOM 结构来理解页面并执行操作,大幅降低了 Token 消耗和执行延迟。
- 多模型支持:兼容 OpenAI API 格式的模型(如通义千问、GPT、DeepSeek、Claude 等),同时支持接入 Ollama 等本地部署的模型,保障数据隐私。
- 零后端部署:无需 Python 环境、无头浏览器或复杂的后端服务,通过 CDN 或 NPM 包即可快速集成到现有前端项目中。
- 安全与人机协同:内置 Human-in-the-Loop(HITL)人工审批 UI,在执行高风险操作前可弹出确认框;支持操作黑白名单、数据脱敏以及自定义业务知识注入。
- 跨页面与外部控制(可选):核心库仅支持单页面操作,但官方提供了可选的 Chrome 扩展以实现跨标签页任务,并提供 Beta 版的 MCP Server 供外部 AI Agent 控制浏览器。
Page Agent 的使用场景
- SaaS 产品 AI Copilot:在 ERP、CRM 等企业管理后台嵌入 AI 助手,用户可用自然语言完成复杂查询、表单填写等操作,无需记忆繁琐的点击路径。
- 老旧系统智能化改造:无需重构前端架构或后端逻辑,仅需在前端加一行 JS,即可让交互老旧、操作复杂的传统后台系统秒变 AI 原生应用。
- 无障碍访问增强:为视障用户、老年用户或操作不便的人群提供自然语言或语音驱动的交互界面,实现“零门槛”操作网页应用。
- 内部工具自动化:为团队内部的运营、审核等重复性 Web 操作工作流提供自动化脚本的快速开发能力,提升内部流转效率。
Page Agent 的项目地址
如何使用Page Agent?
Page Agent 提供了多种接入方式,满足不同阶段的需求:
- 零代码快速体验(书签栏拖拽):
访问官方体验页面,将页面上的蓝色 JavaScript 按钮直接拖拽到浏览器的收藏夹(书签栏)。在任意网页中点击该书签,即可唤出 AI 对话框,输入自然语言指令进行操作。
- CDN 脚本引入(适合快速测试):
在网页的 HTML 中直接引入一行 <script> 标签(如使用阿里提供的免费测试 LLM API 的 Demo 脚本),页面右下角即会出现 AI 对话框,无需安装任何依赖。
- NPM 编程接入(适合生产环境):
- 安装依赖:
npm install page-agent
- 在项目中引入并初始化:配置自定义的大模型 API Key、Base URL 及模型名称等参数。
- 执行指令:调用
await agent.execute('自然语言指令') 即可让 AI 自动执行页面操作。
同类产品对比
与传统浏览器自动化工具相比,Page Agent 的定位和适用场景有显著差异:
| 特性 |
Page Agent |
browser-use |
Playwright / Selenium |
| 运行环境 |
纯浏览器 JS(前端内嵌) |
Python + 浏览器 |
Python/Node + 无头浏览器 |
| 是否需要截图 |
不需要(基于 DOM 文本分析) |
需要(依赖多模态视觉模型) |
不需要 |
| 嵌入现有产品 |
极易(一行代码即可) |
困难 |
困难 |
| 核心优势 |
轻量、内嵌、自然语言交互 |
服务端自动化、视觉理解 |
自动化测试、大规模批量操作 |
| 适合场景 |
前端增强、SaaS Copilot、老系统改造 |
服务端自动化爬取、视觉判断 |
自动化测试、服务器端批量任务 |
简而言之,如果你的需求是“给自有产品加一个 AI 助手,让用户用自然语言操作页面”,Page Agent 是最优选择;如果需要“服务器端大规模自动化测试、跨网站爬取或处理复杂的视觉识别”,则更适合 Playwright 或 browser-use 等工具。