谷歌开发者关系团队正在GitHub上发布一套Agent Skills,用于帮助AI代理与自家技术交互。但如何测试这些技能是否有效?团队负责人表示,可靠的性能信号对于持续改进至关重要。
正如你不会不写单元测试就部署生产API一样,AI代理也应遵循同样的标准。正如Joe Spiro在“设计AI评估”系列文章中所示,规模化使用AI工具意味着要超越终端中的“感觉测试”,转而搭建结构化的自动化评估管线。评估(evals)是你要求代理执行的动作,通过评分器(例如rubrics)来判定代理是否成功。本文聚焦于评估本身,评分标准的技巧将在后续文章中讨论。
![]()
然而,AI评估消耗真实的token。你需要确保这些token被尽可能高效地使用,它们必须提供真实价值,帮助你构建更好的工具。糟糕的评估会提供虚假信号、浪费token预算,并在指标中制造噪音。
以下是谷歌团队在实践中总结的五条规则,用于设计更可信的评估。遵循它们,确保你花费的每个token都能产生有用的指标。
规则一:先理解框架的设定与限制
在编写评估之前,你需要了解所选框架的设定和限制。这包括Harbor、Inspect AI等系统,或Agent Development Kit等开发工具中的集成方案。它是否使用临时沙箱?有哪些工具可用?输出是如何捕获的?
规则二:警惕高基线准确率
如果评估显示基线准确率很高(即不借助你的Agent工具也能轻松答对),那可能说明你的工具没有体现出价值,或者评估提示词过于简单。
规则三:评估与提示词必须互补
评估应只测试提示中明确要求的内容。评估提示词和评分器(grader)应当是互补关系,超出提示范围的要求既不公平,也会污染指标。
规则四:接受Agent“绕路”的事实
Agent自带模型知识,它可能完全跳过你定制的工具,直接给出正确答案。这本身是一条有价值的反馈:你的工具在什么场景下是必要的,什么场景下是多余的?
规则五:多样性优先,避免过拟合
一套好的评估套件应覆盖真实、多样的用例。反复测试同一个能力会导致过拟合,让指标充满噪音。如果评估结果总是一成不变,那大概率是测试集设计得太窄了。
把评估当单元测试来对待
这五条规则的核心逻辑很简单:你无法改进无法准确衡量的东西。如果把AI评估放到和传统单元测试同等重要的位置,你的指标质量会提升,信号也会更稳健。
最终效果是,测试套件不再产生噪音,而是给出可操作的反馈,直接指导工程决策。至于具体怎么设计评分标准(rubrics),谷歌团队表示会在下一篇文章里展开。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.