Google 开源了 Artemis,我先看的是它的证据链
Google 把 Artemis 开源了。我看到这条消息时,第一反应不是它能做什么,而是这份成绩单是谁测出来的。
先把它干了什么说清楚。这东西让编码 agent 通过 MCP 直接操作真机:点按、滑动、读屏、回传结果。接进来的客户端有 Claude Code、Codex 和 Antigravity。Cursor 和 Windsurf 也在支持列表里。agent 能自己装包、走一遍登录流程、拉截图和 Logcat,全程不用人碰设备。
移动端 QA 一直是手工活。后端和 Web 测试早被 agent 接管了,手机界面没跟上。我把原因归到界面上。原生控件、Compose 和 Flutter 组件混着放,加上一闪而过的弹窗。脚本一碰就碎。Artemis 把无障碍树、OCR 和视觉模型拼起来,去认那些没有干净标签的元素。
那个数字的来源,我先看清楚。AndroidWorld 是 Google Research 自己的基准。100 多个多步任务,覆盖 20 多款应用,完成率报的是百分之九十九。跑出这个成绩的,是做工具的那批人,也是出考卷的那批人。仓库里没有第三方复现的记录。
架构这块我看得最细,它分成两档。
Pro 那一档里分了三个角色:
- planner 维护带检查点的任务清单。
- operator 执行,工具权限含 ADB 诊断。
- checker 逐里程碑对着原始目标复核。
我把这个分法和今年 agent 工具市场的走向对了一遍,对得上。便宜的执行走量,昂贵的校验负责可信。
首次运行时,Artemis 会在设备上装一个轻量无障碍服务,用来读屏幕结构。这么做是为了避开系统级的 UiAutomation 连接,不跟别的测试工具抢。Google 的文档说这个助手只在本地监听,不上传任何数据。我看这句话和那个成绩是同一个出处:项目自证,没有外部审计。
无障碍服务看起来是权限更小的一档。我的判断是,它把问题挪了个位置:能不能读到屏幕不是关键,谁能证明它没往外传才是。
路线图上有三样,都还没发:
- Android Studio 插件
- iOS 支持
- 端侧轻量视觉模型
代码基于移动自动化创业公司 Minitap,许可是 Apache 2.0。企业可以 fork 改,不用买商业授权。这些信息对应 2026 年九月十五日的仓库状态。
谁该用,我说具体点。已经在用 Claude Code、Codex 的团队,接起来最顺。Antigravity、Cursor、Windsurf 同理。
理由也简单。把同一个 agent 伸到移动端 QA,接的是同一套东西。Appium 或 Espresso 那条流水线可以不用另养。
真要用,先把自己那套回归跑一遍。Google 没有公开 AndroidWorld 之外的任务级失败数据。别拿那个成绩直接往生产应用上套。
到这里我换个说法。Artemis 表面上解决的是人手问题,测试得一台台点。被它挪动的是瓶颈的位置:从排期挪到了信任。人手不够可以加人,证据不够只能等别人复现。
我以前判断一个自动化框架,先问它能不能跑通。现在顺序反过来了:先看它的证据链能不能被外部复现,再看跑不跑得通。这条顺序只对一种情况成立,要进生产流水线的工具。自己写脚本玩玩,跑通就够了。
Artemis 干的是件具体的事:把移动端 QA 接进 agent 的工作流。这件事背后有一条规律。这类工具的可信度不由发布方的数字决定,由第三方能不能复现决定。基准是自己搭的,跑出来的分就带着这一层保留。
所以下次再看到新工具发布,我会先去翻它的失败数据有没有公开。这个动作比记住任何一个百分比都耐用。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.