写点什么

Token 价格一降再降,但不会让边缘 AI 退场:企业算力账越来越细

  • 2026-09-29
    北京
  • 本文字数:3274 字

    阅读完需:约 11 分钟

AI摘要

企业规模化应用AI后,Token单价下降难抵上下文膨胀与推理量激增,导致实际云成本居高不下;边缘侧AI部署成为兼顾成本、时延、隐私与数据主权的必要路径。

边缘部署可缓解云端账单压力;业务敏感性(如隐私、供应链)倒逼AI负载本地化;推理需求增速已超过单价降幅,总成本呈上升趋势。

适合AI架构师、企业基础设施负责人、边缘计算工程师阅读。

“我们作为一家公司自己也在用 AI 解决问题,每个月的 AI 账单是非常恐怖的。”

 

视源股份商用显示 BG 副总裁王玉龙发现,云端大模型的 Token 价格虽然持续下降,但企业真正把 AI 用起来后,成本并没有想象中那么低。

 

“Token 的成本确实在降低,但是真正要用起来,所需要的上下文的量在快速扩张,因为我们发现真正要输出好的效果,是需要非常完善的上下文的。”在王玉龙看来,如果仅仅依靠云端支撑企业 AI 应用,长期成本可能超出不少用户的承受能力。这也是视源股份与英特尔合作推进边缘侧 AI 算力的重要原因。

 

但成本只是问题的一部分。零售门店的点餐和结算需要快速响应,课堂视频涉及未成年人隐私,电子制造企业的核心算法和供应链数据不能随意离开内部网络。这些业务即使能够调用更便宜的云端模型,也未必适合将完整工作负载迁移到云端。

 

英特尔行业及解决方案业务部总经理王景佳表示,过去两三年,特别是过去一年与客户合作的过程中,英特尔越来越发现,端侧 AI 部署不仅是成本问题,还需要综合考量服务器、时延、响应速度、隐私安全等多个维度。

 

“随着模型能力持续演进,推理的成本在下降,但推理的需求也在成倍增长,所以我们看到虽然单价在下降,但是账单未必会随之下降。”

 

随着 AI 进一步进入业务流程,企业正在重新思考云、边、端的分工:不是将全部任务从云端搬到本地,而是根据实际业务需求,决定哪些计算必须靠近现场,哪些工作可以交给云端,以及如何让不同计算资源协同运行。

 

便宜的 Token,不意味着便宜的 AI 任务

 

企业 AI 成本正在从单次模型调用,扩展到完整任务的执行过程。

 

随着 Agent 持续执行任务,上下文规模和 Token 消耗也会进一步增加。这意味着,即使每百万 Token 价格持续下降,企业的实际账单也未必同步减少。尤其是需要长期运行的业务,算力成本必须与调用次数、上下文规模以及实际任务量一起计算。

 

本地化部署因此开始具备新的经济价值。但在具体业务中,企业并不需要把所有模型都搬到端侧,而是可以根据任务特点选择不同的计算位置。

 

商米科技执行董事、产品线总经理陈桂鸿介绍道,门店经营中的不同任务,对算力的要求并不相同。点餐、商品加入购物车和结算等操作强调实时响应,如果完全依赖云端,可能受到网络带宽和稳定性影响;而“智慧店长”需要综合大量经营数据,计算更加复杂,但并不要求实时返回,因此可以更多使用云端算力。

 

“端、云、边这三者可能是融合的,在部署的网络里,在大模型里面肯定是要进行拆解的。”陈桂鸿说道。

 

企业实际需要的,是根据工作负载重新分配算力,而不是在纯云端和纯本地之间做单一选择。

 

哪些不能完全依赖云端

 

相比单纯的成本差异,网络环境和数据安全往往会直接决定 AI 应用能否投入使用。

 

王景佳举了一个实际经历:部分汽车虽然能够完成语音问答,但在无网或弱网环境下,导航等功能可能无法正常工作。如果恰好遇到复杂路况,用户体验就会明显受到影响。对于需要连续运行的行业设备而言,网络连接不能成为所有功能正常工作的唯一前提。

 

数据隐私则提出了更加明确的处理边界。王景佳表示,一些客户认为,制造能力本身可能逐渐普及,但对行业的理解、数据积累和经验沉淀,仍是企业长期竞争力的重要组成部分。

 

教育领域就是一个典型例子。视源股份旗下希沃从三四年前开始探索课堂观察,通过音视频采集分析教学过程,生成课堂评估报告,以 AI 辅助传统教研老师完成部分听课和教学评价工作。

王玉龙介绍,考虑到未成年人隐私保护,课堂采集的视频首先在教室内进行预处理,将内容结构化并提取脱敏数据,再结合班级历史学习情况等上下文生成报告。

 

“所有的隐私敏感数据全部在本地进行处理,上传到云端都是脱敏后的数据。”在这个过程中,本地设备不需要运行特别大的模型。课堂观察使用 32—48 TOPS 的本地算力基本能够满足需求,端侧主要负责小模型的快速处理,后续再通过云边协同完成综合分析。

 

制造业对数据私有化的要求同样明确。成都派兹互连电子技术有限公司首席运营官周懿透露,公司自身的核心算法和图形计算引擎不能接触外网,编程服务器采用内部部署;部分电子制造业客户的供应链数据也严禁外传。

 

不过,本地部署并不意味着企业必须为所有任务配置同一种模型。周懿表示,公司此前部署的部分本地编程模型已经能够满足提效及投资回报要求,企业可以根据实际应用,决定是否需要多模态能力,以及哪些任务适合上云。

 

真正难的是理解业务流程

 

如果说成本和数据安全决定了 AI 应该部署在哪里,那么对行业流程的理解,则决定了 AI 能否真正创造业务价值。

 

王玉龙表示,行业化是当前 AI 大规模落地的重要挑战。通用文本模型虽然能力不断提升,但许多垂直行业的专业知识,难以仅通过通用文本数据获得。

 

在他看来,AI Coding 和短剧生成等应用之所以能够形成较明确的业务场景,与大量企业围绕特定领域进行训练和应用开发有关。其他行业同样需要持续积累数据,围绕真实业务进行深入适配,而不是直接将通用模型接入现有系统。

 

以教育为例,课堂观察并不是简单把视频交给模型生成总结,而是将传统教研老师的部分工作转化为 AI 流程。除了课堂观察,视源股份还在推进 AI 批阅机,用于完成学生作业扫描、自动批改及学情数据整理。

 

制造业的需求则更加专业。派兹互连此次发布的 AI EDA 一体机,采用英特尔 Agent Box 方案,结合 CPU、锐炫 Pro B70 GPU 及行业软件能力,经过模型适配和算法调校,将 EDA、仿真及行业知识库整合在同一套软硬件系统中。

 

“不是大模型直接去布线,而是大模型去操作了一个 EDA 去进行自动布线器的布线工作,这也是我们现在在做的方向。”周懿特别说道。

 

行业需求还在进一步延伸。“我们公司的产品从前端的电路板设计、器件的选型方案到最后装配,把所有后端的工作放到前端来做了。”周懿表示,客户希望使用更高线程数的处理器,在前端设计时同步完成电热磁和装配协同仿真。这意味着 AI 不只是辅助完成某个独立设计任务,还要提前参与从设计到生产的完整工作流程。

 

让不同算力适应不同任务

 

随着 AI 进入具体业务,企业对算力的需求也越来越难通过统一配置满足。

 

王景佳表示,近年来工作负载出现了两个明显变化:一是 AI 从训练逐渐走向大规模推理;二是 Agent 部署、调度和运行过程中,出现大量需要 CPU 承担的操作和处理。这些变化不仅发生在云端,也正在消费级、企业级和行业场景中体现。

 

物理 AI 进一步扩大了不同任务之间的算力需求差异。强实时任务强调反馈速度,规模更大的世界模型和 VLA 可能需要更多 GPU 矩阵计算能力,而工业现场又往往要求控制功耗。此外,工业应用与普通消费终端存在明显区别,部分场景需要 7×24 小时运行,同时满足低功耗、防尘、防震和电磁兼容等条件。

 

“这也是我们近年来观察到 XPU 架构较适用于物理 AI 和边缘 AI 场景的原因之一。”王景佳表示,在硬件之外,还需要完整的软件框架,使不同计算组件能够统一编程和调度,发挥整体效率。

不过,企业是否选择本地算力,还取决于硬件投入与业务收益之间的关系。

 

王景佳承认,近年来硬件成本承压是客观存在的,但客户的采购方式正在变化。过去主要是直接购买系统,如今,租赁、订阅以及与业务效果挂钩的合作模式逐渐增多。

 

“客户并非不愿意为 AI 投入,而是更关注 AI 带来的价值。”如果 AI 只是增加一项便利功能,却没有真正实现降本或增效,客户未必愿意持续付费;但如果能够带来明确的业务改善,企业仍有投入意愿。

 

王玉龙也观察到,一些企业现阶段可能先通过 SaaS 模式使用 AI 提效工具,以避免一次性建设本地算力设备;但在高安全要求的业务中,客户又会优先考虑本地部署。周懿则认为,即便使用云端方案,企业也需要计算达到相应隐私保护和安全级别所需的综合成本。

 

作为算力提供商,王景佳将英特尔未来一到两年的规划归纳为两个方面:一是完善混合 AI 方案,在设备侧、端侧和云侧建立能够调度不同算力、适应不同需求的解决方案;二是加强芯片产品与软件生态协同,以跟进 AI 技术和行业应用的快速迭代。

 

对于英特尔而言,接下来的产品和生态挑战也因此更加清晰,即如何让 CPU、GPU 及统一软件框架适应不同的行业工作负载,使本地设备既能承担实时任务和敏感数据处理,又能与云端模型协同,最终让 AI 的投入转化为可衡量的业务收益。