大模型能力持续演进,但 AI 的下一阶段竞争正在发生变化。模型能力之外,如何构建可靠的智能体、完善 AI 工程体系,并让 AI 在复杂业务环境中稳定运行,正在成为产业探索的新重点。
8 月 21 日-22 日,AICon 全球人工智能开发与应用大会将在深圳举办。大会全日程现已 100%上线,来自产业一线的技术专家将围绕 Agent 工程化、大模型基础设施、AI Native 研发、具身智能等前沿方向,分享 AI 时代的技术探索与工程实践,共同探讨 AI 从能力突破走向系统构建的新路径。
华为 2012 实验室大模型系统工程技术专家李柏潮已确认出席 “AI Infra、推理工程与异构计算” 专题,并发表题为《盘古训练与推理通信优化实践:亲和昇腾平台的性能探索》的主题分享。通信开销是大模型训练和推理中不可忽视的性能瓶颈。在 MoE 模型中,AllToAll 通信占总端到端时间的 30% 以上,是一直以来的优化重点;而 1M 超长上下文场景下,Host to Device 的 KV Cache 传输延迟已成为推理 TTFT 的新“拦路虎”。深度亲和昇腾硬件进行通信优化,才能最大化将昇腾算力潜能转化为模型训练/推理性能提升。
本次分享围绕昇腾平台的两类通信优化展开:第一部分聚焦 MoE 场景下的 AllToAll,通过适配昇腾 950 的网络拓扑和 CCU 通信加速器,在盘古模型的 EP 通信域 AllToAll 上实现了 10% 以上的性能提升;第二部分关注超长序列推理中的 KV Cache 卸载,通过 Omni Cache 高效的 H2D 和 D2H 通信,实现 TTFT 提升 10 %以上。更进一步,他们将展望如何通过昇腾亲和实现最优的通算掩盖,使得通信不再成为暴露在训练/推理端到端时延中的短板。

李柏潮,华为 2012 实验室 大模型系统工程技术专家,中山大学博士,在华为长期从事通信协议的研究工作,研究方向覆盖数据中心网络、广域网络、终端无线网络。当前聚焦优化盘古模型训练/推理的通信性能,主导盘古模型在昇腾 950 上的通信算子性能优化。他在本次会议的详细演讲内容如下:
演讲提纲:
1. 大模型的训练/推理在通信方面面临哪些技术挑战?
MoE 阶段的 AllToAll 通信是长期以来的关键瓶颈
在超长上下文场景,H2D 通信成为推理场景新出现的性能瓶颈
2. 亲和昇腾硬件,加速 EP 域的 AllToAll
拓扑亲和案例:DeepEP 方案不适用于昇腾 910A3
算力亲和案例:发挥昇腾 950 专门通信加速引擎 CCU 的最大效用
模型亲和案例:使用自定义通信算子实现灵活的集合通信新语义
3. 硬件软件双管齐下,加速 H2D(Host to Device)的通信交互
硬件优化:昇腾 950 为每个 NPU 提供专用的 H2D 通路
软件优化:Omni Cache 实现高效 KV cache 卸载
4. 总结和展望
优化抓手:尽量减少未被掩盖的通信时间
进一步优化:亲和昇腾硬件实现融合算子/多流并行的流水编排
实践痛点
针对昇腾 950 硬件平台进行通信优化,牺牲普适性,换取性能提升
同样的策略用到其他平台上(例如昇腾 910A2/A3,NVIDIA H20)会失效,甚至带来性能劣化
听众收益
了解昇腾 950 的硬件特性,帮助其他模型的训练/推理部署亲和硬件,提供模型端到端性能
了解盘古模型在通信算子、并行策略方面的优化方面的实践,给其他模型的部署优化提供借鉴
除此之外,本次大会还策划了AI Infra、推理工程与异构计算、超级个体与蜂群智能的共生进化、迈向机器人 AGI 的关键技术与产业实践、Agent 安全:从风险到可控、大模型效率工程与 Agent 系统实践、AI Agent 高价值商业场景实战等 10 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。
日程已 100%上线!AICon 深圳站:10 大专题+1 个动手实验室、近 60 场重磅议题,集结浙大知名高校教授及阿里、腾讯、华为、快手、Google Cloud 团队等头部企业技术专家,聚焦 Agent 工程化,构建可靠智能的技术路径。更多详情可扫码或联系票务经理 13269078023 进行咨询。






