丘成桐邀王虹邓煜回国任教:清北斗了20年竟发现对手不是彼此
2026-07-24 3422095
2026-07-24 0
基于 alibaba/page-agent 来实现自动化测试,但它与传统的自动化测试工具(如 Playwright、Selenium)有很大的不同。
page-agent 是阿里巴巴开源的一个 基于大语言模型(LLM)驱动的纯前端浏览器自动化库。它颠覆了传统测试中“依赖繁琐、易碎的 DOM 选择器(Selectors)”的模式,允许你用纯自然语言(Natural Language)来编写和执行测试用例。
以下是关于如何使用它进行自动化测试的详细分析、优势、以及局限性:
在传统测试中,如果一个按钮的 class 变了,测试脚本就会崩溃。而使用 page-agent,它会通过内置的 AI Agent 运行在浏览器端,读取当前页面的 DOM 结构并进行语义分析,然后直接调度原生浏览器事件。
你可以将其整合进测试工作流(例如结合 Playwright 或传统的测试框架):
以前的测试脚本 (Playwright):
JavaScript
await page.locator('#username').fill('testuser');await page.locator('.btn-submit-active').click();
使用 page-agent 的测试脚本:
JavaScript
import { PageAgent } from 'page-agent';const agent = new PageAgent({model: 'gpt-4', // 或 qwen-plus, claude 等apiKey: process.env.LLM_API_KEY,});// 直接用自然语言下达测试指令await agent.execute("用 'testuser' 填充用户名,并点击登录按钮");
标签注入到前端页面中运行。虽然它很强大,但目前将其完全替代传统自动化测试还为时过早,通常更建议将其作为辅助增强工具:
page-agent 每走一步都需要调用 LLM API 进行推理和决策,测试执行速度较慢,且会产生 API Token 费用。如果 CI/CD 流程中每天要跑 10,000 个测试用例,全盘使用它成本会非常高。page-agent 目前主要基于文本和 DOM 树进行状态理解。如果你的测试需要验证“图片是否渲染正确”、“弹窗是否样式错位”等视觉层面的 Outcome,它不如端到端视觉 Agent。如果你想引入 alibaba/page-agent,最佳的落地场景是:
page-agent 让 AI 来接管这段高成本的交互逻辑。