写点什么

Open Code Review:百万真实任务验证的确定性工程与 Agent 协同|QCon 上海

  • 2026-09-09
    北京
  • 本文字数:2772 字

    阅读完需:约 9 分钟

AI摘要

AI正从工具演进为具备自主规划与执行能力的软件系统,工程重心转向构建稳定、可信、可控的AI Native架构。QCon上海站聚焦AI系统化落地,覆盖Agent Runtime、AI Infra、安全可观测等关键实践方向。

关键观点:AI Native时代核心挑战是系统级可靠性,而非单点模型优化;Agent Runtime与Framework成为工程新基础设施;Loop Engineering和Vibe Coding代表人机协同新范式。

适合AI架构师、平台工程师、MLOps工程师阅读。

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!

推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。

在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

阿里巴巴高级研发工程师李峥峰已确认出席 “AI 驱动的软件工程” 专题,并发表题为Open Code Review:百万真实任务验证的确定性工程与 Agent 协同的主题分享。本次分享将结合阿里 Open Code Review 的建设实践,介绍如何通过确定性工程 + Agent 协同,将通用 Agent 收敛为适用于代码评审场景的垂直领域 Agent。分享将围绕分治并发、精准定位、规则模板引擎、工具链蒸馏、上下文分层管理等关键工程实践,探讨如何将工程逻辑与模型能力结合,让确定性的工作交给工程系统,让需要语义理解的任务交给大模型,实现更高的稳定性、更低的成本和更好的评审质量。同时,分享还将结合百万真实任务、阿里内部 2 万余名开发者的使用数据以及 Open Code Review 开源项目实践,介绍 AI Review 在生产环境中的效果验证,并进一步探讨 AI 深度参与研发后,如何建立新的评估体系,推动 AI Code Review 从"辅助工具"走向研发流程中的质量基础设施。

李峥峰,阿里巴巴高级研发工程师、Open Code Review 作者、阿里集团 AI 代码评审负责人。主要研究 AI Agent、程序分析等方向,先后负责了集团内代码导航、代码洞察、代码评审智能化等项目的落地,服务了数万阿里集团开发者,在实际业务中取得显著效果。在 AI Agent 系统设计、场景化工具链蒸馏、大规模生产环境下的质量-成本-速度平衡等方面积累了一定的经验。主导开源了 Open Code Review 项目及业界首个多语言、具备存储库上下文感知的 Code Review Benchmark(AACR-Bench),为行业提供了更精准的质量评估标准。他在本次会议的详细演讲内容如下:

演讲提纲:

1. AI Coding 普及后,代码评审成为新的效率瓶颈

  • AI Coding 改变了代码生产方式

  • 为什么交付质量成为新的核心问题

  • AI Code Review 在研发流程中的价值

2. 为什么通用 Agent 难以支撑生产级 Code Review

  • Demo 与生产环境的差异

  • 覆盖率、定位准确率与稳定性挑战

  • Token 成本与上下文膨胀问题

  • 根因分析:Prompt 驱动为什么不足以解决工程问题

3. 确定性工程 + Agent 协同:五大工程实践

  • 分治并发 —— 提升覆盖率

    文件选择与智能分组策略

    从串行 Review 到并行 Agent 协同

  • 精准定位 —— 保证评审可落地

    三层定位机制(文件→代码段→行号)

    幻觉拦截:确保评论可对应到真实代码

  • 规则模板引擎 —— 提升稳定性与一致性

    从 Prompt 驱动到规则驱动

    按文件类型/语言动态注入评审上下文

  • 工具链蒸馏 —— 提升 Agent 可预测性和安全性

    从真实任务中收敛高频工具调用模式

    减少探索性调用,降低不确定性

  • 上下文分层管理 —— 降低 Token 消耗

    冻结区:不变的全局背景

    压缩区:可摘要的历史上下文

    活跃区:当前推理所需的最小上下文

4. 百万真实任务验证

  • 阿里内部生产数据

    2W+ 开发者使用行为分析

    AI Review 使用趋势与渗透率变化

  • Benchmark 量化对比

    准确率与召回率

    Token 消耗与成本效率

  • Open Code Review 开源实践

    AI 写 → AI 审 → AI 改:完整研发闭环

    社区场景下的效果复现

5. AI 时代如何重新定义研发度量体系

  • 为什么采纳率与 AI 评论占比开始失效?

  • 如何建立新的 AI Review 评估体系?

6. 总结与展望

  • 从通用 Agent 到垂直 Agent 的工程范式

  • AI Review 与 AI Coding 的协同演进

  • AI 驱动研发质量体系的发展方向

实践痛点

1. 规则模板引擎的维护成本与泛化瓶颈

  • 模板引擎提升了精度和稳定性,但代价是每新增一种文件类型、框架或业务场景都需要人工编写规则模板。通用 Agent 天然具备零样本泛化能力,而模板引擎在遇到从未见过的模式时是沉默的。规则库本身也会腐化 —— 代码规范在演进,模板如果不跟着更新就会产生过时建议

2. 度量体系本身的维护成本与时效性

  • AACR-Bench 的 Ground Truth 是人工标注的某个时间切片。代码模式在变、框架在更新、AI 生成代码的缺陷分布也在漂移,Benchmark 如果不持续投入更新就会与生产现实脱节。而每次更新的标注成本极高,这不是一个能高频迭代的闭环

演讲亮点

  • 完整呈现从通用 Agent 到垂直领域 Agent 的收敛路径 —— 不是理论推导,而是经过百万真实任务验证的工程实践,包含分治并发、精准定位、工具链蒸馏、上下文分层等可复用的设计模式

  • 深入探讨当采纳率等传统指标在 AI 深度参与时代失效后,如何构建科学的度量体系来驱动系统持续迭代 —— 这是当前业界普遍面临但少有系统性解法的问题

听众收益

  • 理解 AI Code Review 在真实生产环境中的核心挑战,以及为什么通用 Agent 难以直接满足大规模研发需求

  • 掌握确定性工程、上下文管理、工具链蒸馏、规则模板等关键工程实践,学习如何构建稳定、可控、可扩展的垂直 Agent 系统

  • 了解百万真实任务验证下的 AI Review 落地效果,以及 AI Coding 与 AI Review 协同构建研发闭环的工程经验

  • 理解 AI 深度参与研发后的质量评估新范式,学习如何构建更加科学的研发度量体系,为 AI 驱动的软件工程实践提供参考

除此之外,本次大会还策划了Loop Engineering千行百业 Agent 创新实践Agent 自主进化:从记忆到持续学习Agent as a ServiceVibe Coding 时代的新质量债理性驾驭 AI 的 SRE 可靠性工程金融 AI Native工程实践:从研发提效到业务破局AI Infra:算力效率决定规模化落地AI Native 架构等 20 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。8 折倒计时进入最后一周,现在报名立减 1360,查看更多详情可扫码或联系票务经理 18514549229 进行咨询。