随着生成式 AI 从试验走向规模化部署,企业开始关注模型调用量、推理成本和投资回报率。但在 Akamai 大中华区副总裁张珂看来,Token 成本不应只被视为财务问题,它也可能是识别 AI 安全事件的重要信号。
在近日的一场分享中,张珂表示,许多企业已经接入第三方大模型,或者建设了自有推理服务,却仍然缺少 Token 级别的成本观测能力。
当调用量异常增长时,企业往往只能看到月底账单上升,却难以及时判断这些 Token 究竟来自正常业务增长、低效应用设计,还是 API 被盗用和恶意攻击。
根据 Akamai《2026 年 AI 推理现状报告》,77%的受访企业缺乏一致的推理成本单位经济效益指标,尚未建立按 Token、单次查询或具体业务任务统计成本的统一方法。
这种“看不见”,一方面可能使 AI 项目的真实投入高于预期,另一方面也会削弱企业发现异常调用的能力。
Token 异常消耗,可能对应一场安全事件
传统互联网应用遭遇攻击时,异常流量往往首先表现为带宽、请求数或服务器负载上升。进入大模型应用后,每次请求还会触发推理计算,攻击者不仅可以占用网络资源,也可能直接消耗企业购买或部署的模型算力。
张珂重点提到了一种被称为“拒绝钱包攻击”(Denial of Wallet,DoW)的风险。它与传统拒绝服务攻击类似,但目标不是单纯让服务宕机,而是通过大量请求、复杂提示词或反复调用模型,持续推高受害企业的 Token 消耗和云服务账单。
如果模型 API 缺乏访问控制,攻击者还可能盗取密钥或 Token 通道,借用企业账户调用模型。对于电商客服、内容生成和智能搜索等对外开放的 AI 应用,一旦接口暴露或凭证泄漏,企业购买的推理能力就可能被用于处理与自身业务无关的任务。
AI 爬虫也带来了类似变化。传统爬虫主要消耗网站带宽和服务器资源,而具备智能体能力的爬虫可能反复抓取内容、触发检索增强生成流程,甚至与客服机器人连续对话。表面上只是请求数量增加,背后却可能引发多轮模型推理,使单次访问的成本远高于普通网页抓取。
因此,Token 消耗异常激增具有双重含义:它既可能代表成本管理失效,也可能是一项安全警报。企业如果只在财务结算时检查账单,就很难在攻击发生期间采取措施。
从月底核算转向实时管控
针对上述问题,张珂认为,Token 管理需要从财务统计前移到应用和基础设施架构中。
首先是建立推理可观测性。企业需要为每次模型请求记录模型类型、输入与输出 Token 数量、调用应用、用户身份及业务场景等元数据,并根据部门、项目和模型分别统计成本。这样才能判断 Token 具体消耗在哪里,以及调用量增长是否与实际业务相匹配。
其次,可以通过 AI 网关统一管理不同推理入口。目前,企业内部的 AI 调用可能分散在第三方模型、自建模型和多个 Token 平台中。如果缺少统一入口,权限、账单和调用记录就很难形成完整视图。
AI 网关可以记录用量、设置调用额度,并通过语义缓存减少内容相近的重复推理。对于员工自行使用外部模型形成的“影子 AI”,企业也可以设置身份验证、调用范围和使用上限,避免缺乏授权的应用持续消耗 Token 或者传输敏感数据。
在身份认证方面,Akamai 提出使用 Web Bot Auth 等机制验证 AI Bot 和智能体的身份。其基本思路是,不再仅凭 User-Agent 等容易伪造的信息识别爬虫,而是通过更可靠的身份凭证判断访问者是否为其所声称的 Bot,减少仿冒智能体进入模型接口或盗用推理资源的可能性。
不过,技术管控也需要平衡安全性与可用性。过于严格的限额可能影响正常业务,语义缓存则需要处理数据时效性和隐私边界。企业仍需结合业务风险,决定哪些请求可以缓存、哪些操作必须实时推理,以及出现何种异常时自动限流或要求人工确认。
不同任务不一定都要使用 GPU
除控制外部模型调用外,Akamai 还建议企业评估自建推理能力,以降低对单一 Token 平台的依赖。
张珂表示,模型部署不应默认等同于使用高端 GPU。对于计算量有限、实时性要求不高或处于验证阶段的任务,CPU 也可能满足需求;当业务量扩大或者模型复杂度提高后,再切换到 GPU。企业需要根据任务规模、时延和成本选择算力,而不是让所有 AI 工作负载采用同一种配置。
Akamai Cloud 目前已引入 NVIDIA Blackwell GPU,并针对后训练等场景采用 RTX PRO 6000。与此同时,Akamai 与 NVIDIA 推出 AI Grid 框架,通过编排层决定模型和请求应当运行在哪个节点,尝试将部分推理部署到距离用户更近的位置。
Akamai 称,其分布式网络覆盖 130 多个国家和 700 个城市,拥有 4000 多个网络接入点。对于实时交互、内容审核和本地化服务等场景,边缘部署有机会减少数据往返远端数据中心产生的时延,但实际成本仍取决于模型规模、节点利用率和业务请求分布。
Akamai 列举的案例显示,专利检索服务商 GoVeda 在早期使用 CPU 推理,随后根据需求切换至 GPU 并采用分布式部署。按照 Akamai 提供的数据,该方案使性能提高 30%、成本降低 20%。通信平台 SARV 迁移部分工作负载后也降低了运营成本,但分享中未披露具体幅度。
从这些实践来看,AI 成本管理正在从“选择哪一个模型”扩展为一项系统工程。企业不仅需要比较 Token 单价,还要追踪调用来源、识别异常消耗,并在模型、CPU、GPU 和不同部署位置之间进行调度。
当 Token 成为企业持续采购的计算资源后,一笔突然增加的账单可能意味着应用增长,也可能意味着接口遭到盗用。能否解释每一个 Token 从哪里来、由谁调用并服务于什么业务,正在同时成为 AI 成本治理和安全治理的基础。





