写点什么

大模型下沉车规芯片:超六成的车企座舱,为何选中了同一个“端侧大脑”?

青和
  • 2026-09-29
    北京
  • 本文字数:3146 字

    阅读完需:约 10 分钟

AI摘要

斑马智能发布端侧23B全模态大模型AutoOmni 2.0-23B-A3B,采用MoE架构突破车规级芯片算力与内存限制,实现端侧推理能力达同任务下云模型的80%–100%。

端侧部署避免云端延迟、弱网失效与数据出车风险;MoE稀疏激活显著降低车端计算负载;23B规模在座舱SoC上兼顾多屏渲染与底层安全等硬实时需求。

适合车载AI工程师、智舱系统架构师、边缘大模型优化工程师阅读。

大模型上车,正遭遇一个极其现实的矛盾:一面,云端模型动辄数百 B 参数,越做越大;而另一面,汽车作为一个在算力内存、功耗和成本上都高度受限的终端,无法像云端那样无底线堆叠 GPU。

于是过去两年里,所谓“大模型上车”,大多成了悬在云端的传话筒——车端收音、送上云端处理、再把指令传回。随之而来的,是驾驶场景下难以回避的硬伤:1 到 3 秒的通信延迟、进地库隧道瞬间哑火的弱网死角,以及私密数据出车的合规隐患与高昂的 Token 账单。体验看似升级了,但被动迟缓的交互范式却未见质变。

要把体验做透,行业必须把这颗越来越大的“大脑”真正搬进车里。

在今年的云栖大会上,斑马智能带来全模态端侧大模型 AutoOmni 2.0-23B-A3B,将端侧总参数规模直接推至 23B。官方披露,其在普通智舱任务上的能力堪比 10 倍参数量级云模型,复杂任务也能达到后者的 80%至 90%。

23B 背后的 MoE 解法

要让大模型在车规级芯片上落地,首先要解开硬件资源的“物理锁”。

与云端服务器动辄数张专业加速卡的冗余环境不同,车端座舱 SoC 的计算单元与运行内存,必须优先保障全车多屏渲染、仪表底层安全与车身电子控制的绝对稳定。在有限的硬件开销下,如果强行部署传统的 23B 稠密型模型(Dense Model),巨大的计算负荷足以让车载系统不堪重负。

图片

在云栖大会的论坛现场,斑马智能首席技术官司罗拆解了 AutoOmni 2.0 的技术解法。该模型的核心突破,在于采用了 MoE(混合专家模型)架构。

其型号后缀中的“23B-A3B”,正是破局的关键逻辑:

  • 23B 总参数量:构建了一个具备深厚世界知识的大脑,确保在面对模糊意图、复杂逻辑推理和跨域指令时,具备充足的理解深度;

  • A3B(激活 3B 参数):在实际推理过程中,通过稀疏激活的门控路由,每次仅调度最契合当前指令的 3B 参数专家子网络参与计算。

通过将“知识容量”与“实时计算开销”有效解耦,AutoOmni 2.0 在智能座舱场景中实现了跨越式表现:普通任务处理能力堪比 10 倍参数量的云端模型,复杂任务处理能力亦达到 10 倍参数量云模型的 80%至 90%。

但模型结构的优化只是第一步,真正的考验在于芯片底层的适配。

“把端模型刻在芯上,把安全刻在心上。”司罗在活动现场强调。车端算力环境高度异构,不同主机厂采用的芯片计算架构截然不同。据司罗透露,AutoOmni 已经与国内外 10 家芯片企业展开了深度的底层协同优化。

通过深度重构模型算子、优化内存访问机制以及应用先进的量化技术,团队在车规芯片上取得了关键突破:

  • 推理速度提升 5 到 6 倍,让多模态交互时延压缩至毫秒级;

  • 量化保真度保持在 99%以上,彻底解决了模型轻量化后常出现的性能断崖;

  • 运行内存占用降低 50%以上,并支撑起 8 路以上多任务稳定并发。

在技术演示环节,司罗展示了基于该端侧大模型的实车运行状态:即便在离线环境下,车辆依然能自如处理多意图叠加的复杂导航规划、车控调节以及跨域交互。而依靠本地构建的车规级端侧 AI 安全纵深防御体系,车内乘客的语音偏好和视觉数据无需离车传输,既兼顾了系统性能开销,也从物理层面筑牢了数据安全底线。

智驾分化,智舱收敛

底层技术的突破,直接反映在了整车量产的前沿阵地上。

在本次云栖大会的斑马智能展台上,一个颇具行业戏剧性的场景引发了广泛关注:腾势 Z9GT、智己 LS6、神行者 8、红旗天工 06,四款热门新车并排亮相。

细看这四台车的智能化配置,其辅助驾驶方案呈现出百家争鸣的格局——比亚迪天神之眼、Momenta、华为乾崑与卓驭各踞一方,各大车企在智驾赛道上视彼此为强劲对手,技术路线高度分化。然而,在关乎人车交互核心体验的座舱大脑上,这四款车型却无一例外地接入了斑马智能元神 AI。

据现场公布的数据,元神 AI 目前已实现对主流车企 68%的服务覆盖;而在端侧大模型上车的阵营中,有 63%的企业选择了斑马智能。

为什么在“全栈自研”成为行业口号的今天,主流主机厂在核心座舱端模型上,反而形成了高度一致的选择?

在现场交流中,这一产业现象背后的逻辑逐渐清晰:车企的研发资源正在经历务实的重新校准。

在斑马智能首席战略官邢悦看来,智舱的核心差距不在于单纯的大模型算法,而在于落地周期与工程能力:“斑马利用这一年的时间窗口,提前完成了大量场景的植入。我们不仅是一家模型公司,更是一家具备落地能力的 AI 工程公司。”

此外,车企的核心顾虑还在于底层安全与权限控制。

“车厂要把核心能力开放给你,关键在于他们‘放不放心’。”斑马智能首席产品官蔡明在采访中直言,端模型的数据不出舱特性,天然打消了车企对数据合规与系统失控的顾虑,“在端侧处理让车厂安心,他们才愿意打开权限,让模型去调度控制车辆的各类底层应用。”

从“机械响应”到“读懂意图”

端侧模型在车规芯片上的成功着陆,终极目标是为了改写长期停滞的人车交互逻辑。

过去十年间,车载语音系统普遍受制于“唤醒词+死板指令”的单线逻辑。打断车内正常交谈的机械唤醒、对口语化表达的误读,让很多车机交互始终停留在“能用但不好用”的初级阶段。

图片

“端智能的核心价值是开启交互新范式。”斑马智能联席 CEO 郝飞指出,新范式成立的前提,是基于端模型的全车全时免唤醒,以及连贯的上下文和长效记忆。

郝飞解释,只有当强大的感知与推理模型常驻于端侧,车辆才真正具备了灵敏的神经中枢。在毫秒级端侧推理的支撑下,系统不再依赖机械的特定词汇唤醒,而是能够结合声场定位、乘员视线与对话语境,自然辨别车内声音是成员间的日常闲聊还是对车辆的真实需求,主动迎宾、无感智能停车付费等数十项从“被动响应”转向“主动服务”的场景才得以真正成立。

而在斑马智能首席产品官蔡明看来,交互重构的背后,是 AI 对“认知世界”的边界重塑。

图片

“AI 上车不代表赢得用户,深度使用才是真正的战场。”蔡明在现场提出了一组深刻的观察:汽车智能化需要理解两个世界。

  • “表世界”:由道路物理空间、运行规律和行驶轨迹构成,这是智驾系统的核心发力点;

  • “里世界”:由用户个人意图、生活偏好和连续生活场景构成,这才是智舱 AI 必须攻克的领域。

理解“里世界”的最大障碍,在于汽车物理空间的封闭性。用户每天在车内的时间通常只有 1 小时,而在车外还有 23 小时。如果车机数据无法与移动端联通,车载 AI 就只能成为记忆碎片化的单点工具。

针对这一断层,AI 数据终端公司 YoooClaw 创始人、CEO 肖睿哲给出了协同解法。他表示,通过与斑马智能的深度联合,在数据严格合规的前提下,团队正致力于将用户在车内 1 小时与车外 23 小时的上下文彻底打通。

在现场展示的 AutoClaw 2.0 实车方案中,这种协同已经落地:车端与云端的算力灵活调用,车机、手机等多终端的场景数据连贯继承,跨应用的服务需求顺畅调度。当 AI 具备了跨越时空的记忆连续性,汽车才真正从一台被动受控的机械设备,蜕变为了解用户习惯的个人智能助理。

汽车或是具身最好的“中试场”

站在更广阔的技术坐标系中审视,端侧大模型在汽车上的成功突围,其意义已远远溢出了座舱本身的边界。

当前,具身智能作为 AI 落地的终极形态引发了全球关注,行业目光多被双足人形机器人所吸引。然而,人形机器人在动力续航、高动态步态运控与结构耐用性上的物理瓶颈,短时间内依然制约着其商业化进程。

相比之下,奔跑在道路上的智能汽车,早已具备了走向物理实体的完整要素。

“智能汽车是具身智能最大的中试场和规模化压测平台。”司罗总结。在他看来,现代智能汽车拥有充足的动力电池、分布周身的高清传感器组、强大的车载计算中枢以及高精度的线控底盘执行系统。从物理架构而言,它就是当今工业界体量最大、运行最稳定、与现实社会交互最深度的轮式具身智能载体。

司罗透露,斑马智能的技术路线正从聚焦车端的 AutoOmni 向覆盖更广泛边缘设备的 EdgeOmni 演进。这一演进的实质,是以汽车为支点,将 AI 从单一终端的单体智能,推向多端协同的群体智能,让大模型在现实世界中持续经受复杂场景的压测与进化。