一个AI代理在Terminal-Bench和SWE-Bench等知名基准测试中拿到近乎满分的成绩,却连一项真实任务都没解决。加州大学伯克利分校研究团队揭露的这个现象,让整个行业开始重新审视:我们用来衡量AI能力的基准测试,本身是否就存在漏洞?
就在这种质疑声中,亚马逊云科技发布了开源基准测试工具aws-bench。它的定位很明确:评估AI代理完成真实AWS任务的准确性,比如诊断配置错误、配置基础设施、运营实时云环境。和传统静态测试环境不同,aws-bench选择在一次性真实AWS账户中部署实际资源,试图更准确地反映开发者在真实工作中的表现。
![]()
一次性真实账户,任务全程自动化
每个基准测试都会在隔离的AWS账户中部署一个场景,由CDK堆栈定义的一组AWS资源构成。场景就绪后,待评估的智能代理使用范围限定凭证,在沙箱容器中执行任务。任务完成后,结果交给自动化验证器评分——验证器可以是大语言模型(LLM)评判器,也可以是对实时AWS状态进行程序化检查。
这种设计思路和传统静态基准测试有明显区别。静态环境里的题目往往有固定答案,代理可能通过记忆或模式匹配"作弊";而aws-bench的一次性真实账户环境,让代理面对的是动态、真实的云环境状态,评估结果更贴近实际工作场景。
预置任务覆盖八大场景,支持主流代理
基准测试附带预定义数据集,包含基础任务和高级任务,覆盖可观测性、计算与数据、数据库与存储、EC2多区域、无服务器、流处理与物联网、参考架构以及多服务故障排除等用例。虽然主要面向AI研究人员和模型提供商,但工程团队也可以扩展现有场景和任务,满足自己的特定需求。
技术上,aws-bench基于开源框架Harbor构建,并扩展了AWS资源配置、场景和验证器等功能。内置适配器支持Claude Code、Codex、Kiro CLI和Mini-SWE-Agent,同时也兼容Harbor已支持的其他代理,如Gemini CLI和OpenCode。
运行门槛不低,性能数据尚未公布
想跑这个基准测试,需要本地安装,还要有能访问组织管理账户的凭据,以及管理成员账户和组织单元的权限。目前配置仅限us-east-1区域,而且会创建持久化资源——即使不使用也可能产生费用。这些门槛意味着它更适合有AWS基础设施的团队,而不是个人开发者。
值得注意的是,这次发布没有包含任何性能指标。亚马逊云科技尚未公布基准测试结果或标准化排行榜,但这两项内容已列入未来路线图。基准测试及数据集已在GitHub上发布,遵循Apache-2.0许可。
LLM评判器的隐患:遗留状态可能导致误判
aws-bench的发布时机耐人寻味。伯克利研究团队在报告中指出:"这些并非孤立的事件。它们是一个系统性问题的征兆:我们用来衡量人工智能能力的基准测试,本身就容易受到其声称要衡量的那些能力的利用。"
aws-bench自身也面临类似挑战。大多数任务通过LLM评判器自动评估,而亚马逊云科技官方文档明确提及,系统遗留状态可能导致非预期的任务通过或随机失败问题。这意味着,即便aws-bench试图用真实环境提升评估可靠性,评判环节本身仍存在不确定性。
基准测试的可靠性问题没有一劳永逸的解法。aws-bench的价值在于提供了一种更接近真实工作环境的评估思路,但它能否经受住"被利用"的考验,还需要时间和实际数据来验证。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.