Midscene.js 三步上手:用AI视觉驱动跨平台自动化测试 Midscene.js 三步上手用AI视觉驱动跨平台自动化测试【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene想验证一条关键用户路径时你通常要写选择器、等待页面元素、UI 一改就修脚本。Midscene.js 换了个思路直接读截图理解界面用自然语言执行操作。它是一个面向 E2E 测试的跨平台 GUI Agent覆盖 Web、Android、iOS、HarmonyOS 和桌面端。 最小运行路径在手机上跑通第一条自然语言指令第一步验证设备连接。在手机的开发者选项中开启 USB 调试用数据线连接电脑然后执行adb devices -l终端出现设备行说明 adb 已经连上。第二步启动 Playground。它是一个浏览器交互界面不需要搭项目npx --yes midscene/android-playground第三步配置模型并输入指令。点击窗口左上角的齿轮图标粘贴模型配置API Key、模型名称等并保存然后在输入框输入“打开设置查看当前 Android 版本号”。左侧会列出 AI 规划出的每一步定位、点击、读取右侧是设备实时画面。Playground 与 Android SDK 共享同一套实现你在界面上验证通过的流程写成脚本跑起来行为完全一致。 同一条指令换平台也能跑Midscene.js 在所有平台用同一组 APIaiAct执行操作、aiQuery提取数据、aiAssert断言界面。给手机写好的指令搬到浏览器上基本不用改只是换了一个 Agent 类。另一个实用形态是桥接模式在 Chrome 扩展里开启 Bridge Mode本地脚本就能连上并控制这个浏览器。你已经在浏览器里登录的账号、Cookie、手动操作都直接可用不必每次让脚本从头走一遍登录流程。 三类核心动作执行、查询、断言带规划的多步操作aiAct场景测试注册流程中间有弹窗字段顺序还可能随版本变化。实现aiAct接收自然语言目标执行过程中持续观察最新界面自主规划并操作await agent.aiAct(搜索耳机将第一件商品加入购物车);效果你不用为任何一步写选择器。只要是人在屏幕上能看到的Midscene.js 就能定位包括纯图标按钮、自定义控件和canvas区域。提取数据与断言结果aiQuery / aiAssert场景每次发版后需要核对商品列表的价格和合计金额是否正确展示。实现aiQuery按你指定的结构返回数据aiAssert用自然语言判断某个界面状态是否成立不成立时直接抛错并附带模型给出的原因。效果运行结束后自动生成 HTML 报告可以回放每一步的截图、指令和结果出问题时不再需要翻当时的屏幕截图。 实战建议开启缓存省模型调用创建 Agent 时传cache: { id: my-cache }重复执行会直接复用已缓存的规划与定位结果。官方文档的案例中一次任务执行耗时从 51 秒降到 28 秒。选对模型优先用 UI 定位能力强的多模态模型官方支持的包括 Qwen、Doubao-Seed、GLM、UI-TARS 等也可自托管开源模型。小元素用 deepLocate目标较小或与周围元素容易混淆时加一轮深度定位能提高点击准确度。用 aiWaitFor 代替固定 sleep等待某个界面状态出现后再继续下一步脚本在慢网环境下更稳。给 Agent 留业务上下文setAIActContext可以说明“出现 Cookie 弹窗时先关闭”减少偶发弹窗导致的失败。想继续深入可以从 官方文档 开始或查看 核心引擎 里 AI 规划与元素定位的实现。把“描述步骤”直接变成测试脚本这就是 Midscene.js 的出发点。【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考