上午 8:42,一名开发者打开笔记本电脑,映入眼帘的是环境构建失败、测试报错,还有一条等待发布的代码分支。过去,她可能需要花费大量时间逐一排查日志、比对代码提交记录、追溯仓库历史;而如今,她只需向 AI 编码智能体下达一句简单指令:
"修复失败的测试。找出 bug、提交补丁、重跑测试并汇总改动内容。”
敲几下键盘,喝上一口茶的时间,智能体就返回了已通过测试的补丁,并附上简洁的说明。对用户而言,效果如同瞬时魔法:输入需求,输出结果。但在系统内部,实现这一结果的过程一点也不简单。
仅一条提示词就可以触发请求解析、任务创建、策略检查、代码库检索、上下文拼接、Token(词元)编码、模型调用、工具验证、沙箱路由、文件编辑、测试运行、遥测采集与最终结果核验。模型调用固然关键,但它只是工作负载的一环,真正体现工程能力的是对任务图的协调与编排。
智能体 AI 会进行规划、检索、执行、校验、重试和反馈。随着 AI 从孤立的提示-响应交互模式转向持续工作流模式,性能的衡量维度也从 Token 转向完整的任务交付。
模型调用已不再等同于全部工作负载
长期以来,AI 基础设施主要以模型执行为衡量标准:预填充(prefill)、解码(decode)、每秒生成 Token 数、首 Token 延迟、吞吐量、批处理效率、内存占用以及加速器利用率。这些指标依然重要,但随着智能体 AI 的兴起,系统的关键路径已不再局限于模型执行本身。
传统的推理请求有明确的边界:从提示词到结果输出。而智能体工作流可能涉及任务规划、上下文检索、状态管理、工具与 API 调用、沙箱运行、结果验证、遥测采集以及重试。最终输出可能是一个答案、一段代码变更、一条数据库查询、一次工具调用,或是一个搜集更多信息的决策。
简而言之,智能体 AI 让推理演变为一个分布式系统问题。GPU 对于高强度模型执行仍然不可或缺,但围绕 GPU 展开的工作正日益成为系统性能的决定性因素:哪些任务在运行、在哪里运行、伴随哪些上下文、允许使用哪些工具,结果是否满足用户需求。
这个周边的技术栈为模型增加了多个层级,其中大量协调工作都由 CPU 承担,包括编排、内存与检索、工具调用、运行时与沙箱、策略系统以及可观测性等。模型则提供智能、推理和生成能力,而外围系统能将这些能力转化为可执行的行动。
为什么传统推理基准已无法全面衡量系统性能
对于聊天机器人,Token 吞吐量可以体现出模型响应速度与生成效率,以及系统能服务多少用户。但对于智能体 AI,这个评判视角并不够全面。
开发者并不会以每秒多少原始 Token 来感知系统性能。她真正关注的是:bug 是否定位准确、补丁修复是否正确、测试是否全部通过、权限是否合规、结果是否可信且可验证。对于企业、科研、安全、运营以及物理世界的各类智能体而言,同样如此,用户关心的是最终成果。
这意味着,智能体 AI 时代需要采用工作流级别的性能指标,包括:单项任务完成成本、工具调用延迟、检索延迟、沙箱启动时间以及单节点智能体数量。核心评判标准从“模型生成得有多快?”转变为“系统完成任务的效率有多高?”
CPU 发挥决定性的作用
CPU 在智能体 AI 中的价值,体现在围绕模型调用的各环节中。模型运行前,系统解析请求、初始化运行环境、加载策略、读取工程文件、查询检索系统、排序上下文、统计 Token 数量并准备请求。模型调用期间,CPU 负责处理路由、Token 化、批处理、流式传输和 Schema 配置。调用完成后,CPU 验证输出、路由工具调用、管理沙箱与子进程、采集日志、归类故障、更新状态并整合遥测数据。
在编码智能体的例子中,一些最耗费 CPU 资源的工作往往发生在模型生成修复方案之后:运行测试、调用编译器、启动子进程、归类故障、自主选择重试逻辑。这些操作会对 CPU 核心、缓存、内存、存储和编排软件形成压力。
这正是智能体 AI 看似“瞬间完成任务”背后隐藏的关键计算工作。
头节点正演变为整个系统的控制中枢
随着智能体系统规模化,头节点(head node)的角色变得具有战略意义。AI 头节点不只是加速器旁边的一颗 CPU。它是核心控制中枢,负责让异构 AI 系统以统一、可靠的方式协同运作:路由请求、管理状态、准备上下文、协调加速器、调用管理 API 与工具、执行策略、采集遥测,并保持工作流的可观测性。
编排的本质,在于决定执行什么任务、在哪里执行、携带哪些上下文、允许调用哪些工具,以及如何判断任务已经完成。而头节点则是支撑这一能力的基础设施控制中枢,负责在 CPU、GPU、加速器、内存、存储、网络、运行时、数据库、规则管理系统以及可观测性工具之间协调资源,并将这些编排决策贯穿整个系统。
随着 AI 基础设施日益异构化,模型、工具、内存、加速器、API、沙箱、规则管理、追踪和评估循环都必须保持同步协作。而头节点正是这一协调能力得以统一执行和运转的控制中枢。
Arm 的机遇:全链路智能体工作流优化
对 Arm 而言,智能体 AI 代表着一次平台级机遇。其对基础设施的要求,正对应了云基础设施建设者最关心的关键能力:性能、能效、扩展性、软件成熟度以及选择自由度。行业评判标准不再局限于 Token 生成速度,而是平台能否在延迟、功耗、成本、资源利用率、稳定性、开发迭代效率等现实约束下,高效完成更多工作流。
Arm 提供了一个为异构基础设施打造的计算平台。在智能体时代,AI 系统由 CPU、GPU、加速器、内存、存储、网络、运行时、API、工具、可观测系统和规则控制协同组成。Arm 的核心价值,在于帮助整个系统实现更高效率、更强扩展能力,并使系统级优化更加容易。
这一价值始于 Arm 深厚的技术底座:基于灵活的 Arm Neoverse IP 与计算子系统(CSS) 打造的计算平台、软件支持体系以及合作伙伴生态,为 AI 基础设施建设者提供了针对特定工作负载设计和部署基础设施的多元路径。智能体 AI 让这种选择灵活性变得更加重要,因为没有任何单一计算配置能够高效承载工作流的每一个环节。
这也是为什么 Arm 的价值应当从工作流层面来衡量。更优秀的智能体基础设施应当体现在这些成果上:更低的单项任务成本、更低的延迟、更高的资源利用率、更可预测的执行效果。这些关键指标能够直接体现 CPU 和头节点的价值,并将其与业务成果紧密关联起来。
Arm 将这一理念继续延伸,推出面向智能体 AI 基础设施的自研芯片 Arm AGI CPU,提供另一种部署 Arm 架构算力的选择。在这套方案中,CPU 协调围绕模型展开的工作:控制、内存、检索、工具、API、运行时、沙箱以及可观测性。
其目标并不是削弱 GPU 或其他加速器的作用,而是让整个异构系统更好地协同运作。智能体 AI 时代,真正占据优势的将是那些能够优化整个任务图(Task Graph),而非仅仅优化 Token 流的基础设施。
下一代基准:以任务完成为核心
回到前文那位等待修复结果的开发者,她需要的不是 Token,而是问题修复 bug。这就是智能体 AI 带来的基础设施架构转变。在提示词驱动的传统问答时代,模型性能是显而易见的重心。在智能体时代,系统必须优化全链路闭环:模型智能、内存、工具、状态、规则管理、执行、验证与可观测性。
下一代 AI 基础设施的评判标准,将是它能否快速、准确、安全、可观测且高效地完成任务。在此背景下,Arm AGI CPU 为 AI 基础设施建设者提供了部署 Arm 架构算力的新选择,用于承载编排与任务执行等关键工作负载,帮助将模型输出转化为真正有价值的行动。





