写点什么

面向多模态推理的高效长上下文建模|AICon 深圳

  • 2026-08-15
    北京
  • 本文字数:2461 字

    阅读完需:约 8 分钟

AI摘要

大模型正从能力突破转向系统化工程落地,效率成为多模态长上下文场景规模化应用的核心瓶颈。庄博涵将分享算法—系统协同设计的最新实践,覆盖高效注意力、KV-cache优化与并行解码等关键技术路径。

多模态大模型效率瓶颈集中于长上下文推理开销;

KV-cache压缩与缓存管理显著降低显存占用;

并行解码与线性注意力支撑实时Agent交互需求。

适合AI基础设施工程师、大模型系统优化工程师、Agent架构师阅读。

大模型能力持续演进,但 AI 的下一阶段竞争正在发生变化。模型能力之外,如何构建可靠的智能体、完善 AI 工程体系,并让 AI 在复杂业务环境中稳定运行,正在成为产业探索的新重点。

8 月 21 日-22 日,AICon 全球人工智能开发与应用大会将在深圳举办。大会全日程现已 100%上线,来自产业一线的技术专家将围绕 Agent 工程化、大模型基础设施、AI Native 研发、具身智能等前沿方向,分享 AI 时代的技术探索与工程实践,共同探讨 AI 从能力突破走向系统构建的新路径。

浙江大学百人计划研究员庄博涵已确认出席 “大模型效率工程与 Agent 系统实践” 专题,并发表题为面向多模态推理的高效长上下文建模的主题分享。2026 年,多模态大模型正从“被动感知”走向“主动执行”,而不断增长的上下文长度与生成成本,使“效率”成为其规模化落地的核心瓶颈。本次分享围绕面向多模态理解与生成的高效推理,介绍团队在大模型“算法—系统协同设计”上的最新进展:高效注意力方面,覆盖支撑长上下文的稀疏 / 线性注意力;高效记忆方面,介绍基于 KV-cache 压缩与缓存管理的显存优化;高效解码方面,分享近期并行解码策略。在此基础上,串联多模态大模型(Agent)在理解、生成等核心能力上的实践;并进一步简单介绍面向视频生成对齐的高效扩散强化学习,以及在交互式世界模型评测上的探索。最后分享对高效基础模型未来走向的思考,包括 agentic loop 等。在本次演讲中,庄博涵将对此展开详细介绍。

庄博涵,浙江大学百人计划研究员、博士生导师,入选国家级高层次青年人才计划。主要研究高效大模型算法与系统协同优化,致力于打造极致 Token 性价比,并围绕 Agent Loops、World Models 和 Embodied AI 开展前沿研究。曾任 Monash University 长聘助理教授并创立 ZIP Lab,与多家全球头部科技企业保持深度科研合作。实验室首批 7 名博士毕业生均进入顶尖企业或高校,包括 DeepSeek、ByteDance Seed 等,多人入选头部人才计划;本科毕业生多赴世界一流高校攻读 PhD,有成员获 UC Berkeley 博士奖学金。他在本次会议的详细演讲内容如下:

演讲提纲:

  1. Efficient AI:算法与 infra 协同设计

  • 高效注意力:化解注意力随序列长度二次增长的瓶颈,支撑长上下文理解与长视频生成。

  • 高效记忆:通过 KV-cache 压缩与缓存管理,突破长序列推理的显存瓶颈。

  • 高效解码:通过并行解码提升推理吞吐、降低生成时延。

2. 多模态大模型(Agent)的核心能力:理解与生成

  • 理解:在有限算力下高效理解长视频,并支撑空间推理与决策。(场景:空间推理、视频推理)

  • 生成:以更低成本实现世界模型生成。(场景:3D 世界生成重建,长视频生成)

  • 评测:用可诊断的基准牵引世界模型的演进。

3. 总结与展望

实践场景说明:

  • World Model 推理提速

  • 面向游戏,具身等仿真场景,World Model 不仅需要生成高质量视频,还需要支持低延迟的实时交互的生成速度,对此,我们团队做了很多工作。

  • 在系统层面,我们提出了 FPSAttention 针对视频 DiT 的三维注意力进行改进。在 NVIDIA H20 上运行 Wan2.1-14B、生成 720p 视频时,注意力算子最高加速 7.09×,端到端视频生成加速 4.96×,同时保持生成质量基本无损。

  • 在算法层面,我们也做了许多工作,其中 FlashBlock 在 block diffusion 范式探索新的缓存机制,在长文本和视频生成实验中实现最高 1.44× token 吞吐提升和 1.6× 注意力耗时降低,并且几乎不影响生成质量。近期的工作 Mirage 将视频模型的空间记忆保存在潜空间中,使得三维缓存的显存占用降低最高 55 倍,并且有最高 10x 的端到端加速,并且在 WorldScore 上取得了最佳结果。

  • 根据我们针对 Block Diffusion 范式的系统与算法的研究,正在持续整合到我们的统一的框架 Inferix,Inferix 进一步提供面向 World Model 的 Block Diffusion 推理引擎,支持 KV-cache 管理、流式视频生成和交互式 world rollout

  • Agent loop 里面的效率问题

    在现在的 Agent 框架,比如 Claude Code,Codex,OpenClaw 中,上下文长度正在越积越长,首轮 prefill 时间和 KV cache 的显存占用正在不断上升。

    在系统层面,为了解决上述问题,我们提出了很多工作,比如 TriAttention 面向长推理中的 KV-cache 压缩,在 AIME25 的 32K token 生成实验中,在保持与完整注意力相当推理准确率的情况下,实现 2.5× 吞吐提升或 10.7× KV-cache 显存压缩。

    在算法层面,我们也提出一些加速方案,例如我们探索在 Agent 任务中进行大小模型协同工作来提高效率。R-Stitch 根据熵来切换大小模型。其在不同尺寸的模型的推理任务上分别实现 3-4 倍的加速,同时保持接近完整大模型解码的准确率,而 Agent-as-a-Router 将模型选择本身设计成 Agent Loop,在 2900 个编码任务上测试,带 router 的框架的平均任务得分高于 opus 的分数,并且成本不到 opus 的一半。

这样的技术在实践过程中有哪些痛点?

  • 效率与质量的权衡问题。稀疏/线性注意力、KV-cache 压缩等手段可显著降本提速,但往往会带来可控但非零的质量损失,且最优适配区间会随任务、模态、序列长度发生漂移,需要投入大量精力调参与验证,无法通过一套配置适配所有场景。

听众收益

  1. 系统了解面向多模态理解与生成的高效推理全链路方法(稀疏 / 线性注意力、KV-cache 压缩与缓存管理、并行解码)及其算法—系统协同设计思路。

  2. 了解这些效率技术如何落地到多模态 Agent 的理解、生成等能力,以及视频生成对齐、世界模型评测的最新实践。

  3. 获得对高效基础模型未来方向的判断,为自身技术选型与工程落地提供参考。

除此之外,本次大会还策划了AI Infra、推理工程与异构计算超级个体与蜂群智能的共生进化迈向机器人 AGI 的关键技术与产业实践Agent 安全:从风险到可控大模型效率工程与 Agent 系统实践AI Agent 高价值商业场景实战等 10 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。

日程已 100%上线!AICon 深圳站:10 大专题+1 个动手实验室、近 60 场重磅议题,集结浙大知名高校教授及阿里、腾讯、华为、快手、Google Cloud 团队等头部企业技术专家,聚焦 Agent 工程化,构建可靠智能的技术路径。更多详情可扫码或联系票务经理 13269078023 进行咨询。