最近,亚马逊云科技发布了 aws-bench。这是一个开源基准测试工具,用于评估 AI 代理完成真实 AWS 任务的准确性,例如诊断配置错误、配置基础设施以及运营实时云环境。
该项目声称,他们采用了与传统静态测试环境基准测试不同的方法。该公司表示,使用在一次性真实亚马逊云科技账户中创建的实际资源,可以在一些开发人员和团队经常在 AWS 上执行的工作中更准确地评估智能代理的表现。
每个基准测试都会在隔离的亚马逊云科技账户中部署一个场景,由 CDK 堆栈中定义的一组 AWS 资源组成。当场景就绪后,待评估的智能代理会使用范围限定凭证,在沙箱容器中运行一项任务。任务完成后,结果将通过自动化验证器进行评分。该验证器可以是大语言模型(LLM)评判器,也可以是对实时 AWS 状态进行程序化检查。
该基准测试附带预定义的数据集,包含基础任务和高级任务。这些任务涵盖可观测性、计算与数据、数据库与存储、EC2 多区域、无服务器、流处理与物联网、参考架构以及多服务故障排除等用例。
尽管这次发布主要面向的是人工智能研究人员和模型提供商,但工程团队也可以尝试使用该基准测试,并通过扩展现有的场景和任务来满足自己特有的用例需求。
该项目基于 Harbor 构建,后者是一个用于评估 AI 代理的开源框架。该项目对其进行了扩展,以便提供 AWS 资源配置、场景和验证器等额外的功能。内置适配器支持多种已经正式发布的智能代理和模型,包括 Claude Code、Codex、Kiro CLI 和 Mini-SWE-Agent。它还支持所有 Harbor 已经包含的智能代理,例如 Gemini CLI 和 OpenCode。
要运行该基准测试,不仅需要本地安装,还需要有可以访问组织管理账户的凭据,以及管理成员账户和组织单位的权限。当前,该配置仅限于 us-east-1 区域,而且会创建持久化资源,即使未使用也可能产生费用。
值得注意的是,此次发布中尚未包含性能指标。亚马逊云科技目前尚未公布任何基准测试结果或标准化排行榜。不过这两项内容均被列入了未来的路线图。
该基准测试及数据集已经在 GitHub 上发布,遵循 Apache-2.0 许可。
aws-bench 发布之际,恰逢人们对智能代理评估基准可靠性的质疑声持续升温。加州大学伯克利分校“负责任去中心化智能研究中心”的一组研究人员发表了一篇文章。该文阐述了他们如何创建一个智能代理,并在包括 Terminal-Bench 和 SWE-Bench 在内的若干最知名的基准测试中获得了近乎满分的成绩,却未解决任何一项任务。
在这份报告中,研究人员指出:
这些并非孤立的事件。它们是一个系统性问题的征兆:我们用来衡量人工智能能力的基准测试,本身就容易受到其声称要衡量的那些能力的利用。
随着应用范围的扩大,基准测试抵御被利用的能力将受到审视:aws-bench 中的大多数任务都是通过大语言模型(LLM)评判器自动评估的,而亚马逊云科技官方文档中也明确提及,系统遗留状态可能导致非预期的任务通过或随机失败问题。
原文链接:https://www.infoq.com/news/2026/08/aws-bench-agent-evaluation/





