写点什么

AWS 发布 Aws-Bench,用于评估云任务中的智能代理

作者:Gianmarco Nalin
  • 2026-09-01
    北京
  • 本文字数:1192 字

    阅读完需:约 4 分钟

AI摘要

aws-bench 是亚马逊云科技开源的 AI 代理基准测试工具,基于真实 AWS 账户与 CDK 部署的动态沙箱环境评估代理在实际运维任务中的准确性。其验证机制融合 LLM 评判器与程序化 AWS 状态检查,支持可扩展的任务集。

采用一次性真实账户而非模拟环境,提升评估真实性;验证层支持 LLM 评判与实时云状态校验双模式;预置任务覆盖可观测性、多区域 EC2、无服务器等 8 类典型云运维场景。

适合 AI 研究人员、大模型提供商、云平台工程团队阅读。

最近,亚马逊云科技发布了 aws-bench。这是一个开源基准测试工具,用于评估 AI 代理完成真实 AWS 任务的准确性,例如诊断配置错误、配置基础设施以及运营实时云环境。

该项目声称,他们采用了与传统静态测试环境基准测试不同的方法。该公司表示,使用在一次性真实亚马逊云科技账户中创建的实际资源,可以在一些开发人员和团队经常在 AWS 上执行的工作中更准确地评估智能代理的表现。

每个基准测试都会在隔离的亚马逊云科技账户中部署一个场景,由 CDK 堆栈中定义的一组 AWS 资源组成。当场景就绪后,待评估的智能代理会使用范围限定凭证,在沙箱容器中运行一项任务。任务完成后,结果将通过自动化验证器进行评分。该验证器可以是大语言模型(LLM)评判器,也可以是对实时 AWS 状态进行程序化检查。

该基准测试附带预定义的数据集,包含基础任务和高级任务。这些任务涵盖可观测性、计算与数据、数据库与存储、EC2 多区域、无服务器、流处理与物联网、参考架构以及多服务故障排除等用例。

尽管这次发布主要面向的是人工智能研究人员和模型提供商,但工程团队也可以尝试使用该基准测试,并通过扩展现有的场景和任务来满足自己特有的用例需求。

该项目基于 Harbor 构建,后者是一个用于评估 AI 代理的开源框架。该项目对其进行了扩展,以便提供 AWS 资源配置、场景和验证器等额外的功能。内置适配器支持多种已经正式发布的智能代理和模型,包括 Claude Code、Codex、Kiro CLI 和 Mini-SWE-Agent。它还支持所有 Harbor 已经包含的智能代理,例如 Gemini CLI 和 OpenCode。

要运行该基准测试,不仅需要本地安装,还需要有可以访问组织管理账户的凭据,以及管理成员账户和组织单位的权限。当前,该配置仅限于 us-east-1 区域,而且会创建持久化资源,即使未使用也可能产生费用。

值得注意的是,此次发布中尚未包含性能指标。亚马逊云科技目前尚未公布任何基准测试结果或标准化排行榜。不过这两项内容均被列入了未来的路线图。

基准测试数据集已经在 GitHub 上发布,遵循 Apache-2.0 许可。

aws-bench 发布之际,恰逢人们对智能代理评估基准可靠性的质疑声持续升温。加州大学伯克利分校“负责任去中心化智能研究中心”的一组研究人员发表了一篇文章。该文阐述了他们如何创建一个智能代理,并在包括 Terminal-BenchSWE-Bench 在内的若干最知名的基准测试中获得了近乎满分的成绩,却未解决任何一项任务。

在这份报告中,研究人员指出:

这些并非孤立的事件。它们是一个系统性问题的征兆:我们用来衡量人工智能能力的基准测试,本身就容易受到其声称要衡量的那些能力的利用。

随着应用范围的扩大,基准测试抵御被利用的能力将受到审视:aws-bench 中的大多数任务都是通过大语言模型(LLM)评判器自动评估的,而亚马逊云科技官方文档中也明确提及,系统遗留状态可能导致非预期的任务通过或随机失败问题。

原文链接:https://www.infoq.com/news/2026/08/aws-bench-agent-evaluation/