写点什么

从 Harness 到 Loop:阿福 Agent 小队如何处理持续涌入的线上 Badcase|QCon 上海

  • 2026-09-07
    北京
  • 本文字数:2739 字

    阅读完需:约 9 分钟

AI摘要

AI正从工具演进为具备自主规划与执行能力的软件系统,工程重心转向构建稳定、可信、可控的AI Native架构。QCon上海站聚焦AI系统化落地,覆盖Agent Runtime、AI Infra、安全可观测等关键实践方向。

关键观点:AI Native时代核心挑战是系统级工程而非单点模型优化;Agent Runtime与Framework成为生产环境关键基础设施;端云协同、Loop Engineering等新范式支撑AI从实验走向规模化交付。

适合AI平台工程师、MLOps工程师、系统架构师阅读。

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!

推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。

在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

蚂蚁集团阿福 Harness 架构组负责人肖汉松已确认出席 “Loop Engineering” 专题,并发表题为从 Harness 到 Loop:阿福 Agent 小队如何处理持续涌入的线上 Badcase的主题分享。Agent 进入生产环境后,随着用户量增长,线上 badcase 也会持续增加。蚂蚁阿福上线后同样面临这一问题。从 badcase 的发现、归因和分派,到修复、验证和结果回流,各环节都需要工程师人工衔接。即使有 AI 辅助,处理能力仍不足以应对持续新增的问题。为此,他们分两个阶段推进:先用 Harness Engineering 解决“如何可靠修好 badcase”,再用 Loop Engineering 解决“如何持续修复 badcase”。

第一个问题是:如何减少人工参与,让 Agent 自主完成 badcase 的修复和验证?他们为 Agent 接入开发、部署和评测工具,通过执行约束保障长任务持续运行,再通过评测约束判断问题是否真正修好。在一次真实任务中,Agent 连续迭代 16 轮,改动最终经人工复核后上线。

当修复和验证能够稳定运行后,新的瓶颈随之出现:发现、归因、分派和结果回流仍依赖人工。如何把这些环节也交给 Agent,不再由工程师逐条发起 badcase 修复任务?他们将完整流程组织成两个相互衔接的循环(Loop):内循环负责修复和验证,外循环负责发现、归因、分派和结果回流。两个循环衔接后,系统可以持续处理 badcase;异常改派和最终上线仍由人把关。

本次分享将结合真实案例,展示 badcase 如何入池、分派、修复和验证,并说明当前哪些环节仍需人工决策。

肖汉松,蚂蚁集团技术专家,阿福 Harness 架构组负责人,参与阿福从 0 到 1 的建设。长期从事 Agent 相关工作,实践方向包括 Agent 强化学习和 Harness Engineering。他在本次会议的详细演讲内容如下:

演讲提纲:

1. 业务背景与 badcase 处理现状

  • badcase 持续进入,工程师需要逐条分析、修改、部署和评测,现有处理能力难以覆盖不断新增的问题

  • 一个 badcase 从发现、归因、分派到修复、验证和关闭,需要多名工程师在不同环节手工交接

  • 两阶段改造思路:先让 Agent 自己完成修复和验证,再让 Agent 持续接收和处理新问题

2. Harness 设计与单 Agent 自主迭代

  • 工具接入:把开发、部署、发起评测和获取结果变成 Agent 可以直接调用的工具

  • 长任务运行:解决任务提前结束、重复空转和上下文不足等问题;主 Agent 负责目标管理,子 Agent 执行每轮分析和修改

  • 避免只优化评测分数:隔离开发数据与验证数据,并在每轮修改后重新与当前基线对比

  • 实践结果:Agent 连续迭代 16 轮,改动经人工复核后上线

3. Loop 架构与内外循环协作

  • 修复效率提升后,问题发现、归因、分派和结果回收仍依赖人工,成为新的瓶颈

  • 外循环 Agent 小队负责接收问题、分派任务,并根据处理结果决定后续流向;内循环 Agent 小队负责诊断、修改和验证

  • 两组 Agent 共用 Harness 提供的工具、状态记录、执行约束和评测

4. Agent 小队任务处理与验证流程

  • 接收与分派:先对一批 badcase 去重、归类和初步归因,再按问题归属创建任务

  • 诊断与修改:根据证据定位问题所在层级,确认修改范围后,审查方案并实施修改

  • 独立验证:验证者不参与修改,独立确认目标问题是否解决,并检查是否对其他问题造成影响

  • 失败后改派:当前小队无法处理时,将判断结果和证据返回外循环,经人工确认后重新分派

5. 落地效果与实践经验

  • 明确当前可由 Agent 处理的 badcase 类型,以及仍需人工介入的问题

  • 工程师不再逐项执行重复操作,但仍负责制定约束、抽样复核、异常决策和最终确认

  • 从自动化评测开始,先让一个边界清晰、结果可验证的小型 Harness 稳定运行,再通过定时任务驱动 Loop 持续处理问题

实践痛点

  • 如何让 Agent 在长时间、多轮执行中保持稳定,避免早停

  • 如何判断 Agent 是否真正解决了问题,而不是只提高了评测分数

  • 如何保证多 Agent 之间的任务、状态和证据能够可靠交接,并划清自动执行与人工决策的边界

演讲亮点

  • 以线上 badcase 处理为真实案例,复盘从 Harness 到 Loop 的两阶段演进:先用 Harness 支撑 Agent 稳定完成修复和验证,再由两支 Agent 小队共用这套 Harness,持续接收、分派和处理新问题

  • 不只展示成功结果,也通过失败案例说明评测、独立验证和证据回流在闭环中为何缺一不可

  • 不追求“全自动化”,而是明确 Agent 自动执行与人工决策、复核和最终责任之间的边界

听众收益

  • 判断自己的场景处于哪个阶段:应先建设 Agent Harness,还是需要引入 Loop 处理持续问题

  • 掌握一套判断 Agent 是否真正形成闭环的检查方法:能否持续执行、是否经过独立验证、失败后是否有明确的后续处理流程

  • 获得一条明确的实施路径:从自动化评测和边界清晰、结果可验证的小型 Harness 开始,逐步扩大 Agent 的自主范围,同时保留人工决策与最终责任

除此之外,本次大会还策划了Loop Engineering千行百业 Agent 创新实践Agent 自主进化:从记忆到持续学习Agent as a ServiceVibe Coding 时代的新质量债理性驾驭 AI 的 SRE 可靠性工程金融 AI Native工程实践:从研发提效到业务破局AI Infra:算力效率决定规模化落地AI Native 架构等 20 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。8 折倒计时进入最后一周,现在报名立减 1360,查看更多详情可扫码或联系票务经理 18514549229 进行咨询。