写点什么

复杂业务 Agent 的持续进化:快手电商导购的 Harness Loop 实践|QCon 上海

  • 2026-09-22
    北京
  • 本文字数:3393 字

    阅读完需:约 11 分钟

AI摘要

AI正从工具演进为具备自主规划与执行能力的软件系统,工程重心转向构建稳定、可信、可控的AI Native架构。QCon上海站聚焦AI系统化落地,覆盖Agent Runtime、AI Infra、安全可观测等关键实践方向。

关键观点:AI Native时代核心挑战是系统级工程而非单点模型优化;Agent Runtime与Framework成为支撑自主AI的关键基础设施;端云协同、Loop Engineering等新范式正在定义AI生产化路径。

适合AI平台工程师、MLOps工程师、系统架构师阅读。

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!

推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。

在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

快手 & 资深技术专家包磊已确认出席 “Loop Engineering” 专题,并发表题为复杂业务 Agent 的持续进化:快手电商导购的 Harness Loop 实践的主题分享。电商导购并非简单的问答或商品检索,而是一个横跨导购决策、搜索推荐、营销优惠、商品信息、交易履约与售后服务等多个业务域的复杂 Agent 场景。我们基于 Agent Loop 范式构建生产级导购助手,通过统一 Tool 协议、动态上下文管理、任务规划与多域工具编排,让模型能够理解用户隐含需求,并在复杂链路中完成信息查询、商品筛选、优惠计算与服务决策。实践中重点解决了工具数量膨胀、跨域信息冲突、链路超时、错误传播及模型与 Harness 问题难以区分等挑战,并通过轨迹观测、评测回归和策略治理持续优化效果。实践表明,复杂业务 Agent 落地的关键,不只是模型能力,而是构建一套可编排、可观测、可评测、可持续迭代的 Harness 工程体系。

11 年互联网经验,曾任蚂蚁集团高级技术专家,现任快手电商 AI 基座工程团队负责人,负责商业体系的 AgentOS、大模型 MaaS 等基础平台能力建设。

演讲提纲

1. 问题背景:复杂导购 Agent 为什么不能只靠一次性优化

  • 电商导购不是简单问答,而是跨搜索推荐、商品信息、营销优惠、交易履约和售后服务等多个业务域的复杂决策过程。Agent 需要在动态上下文中完成意图理解、任务规划、工具选择和结果整合,任何一个环节发生偏差,都可能导致最终任务失败

  • 固定 Workflow 难以覆盖开放式需求,而完全依赖模型自主决策,又容易出现工具误用、参数错误、重复调用和链路失控。因此,复杂业务 Agent 的核心问题逐渐从“如何把链路跑起来”,转向“如何基于真实线上反馈持续变好”

2. 基础建设:让每一次线上执行都可观测、可回放

  • 围绕生产级 Agent Harness,建设统一的 Tool 协议、Context/Memory 管理、任务执行控制和全链路 Trajectory 体系

  • 重点记录用户输入、上下文组装、规划过程、工具选择、调用参数、工具结果、异常重试和最终输出,并关联模型、Prompt、Tool、配置和知识版本,使线上问题能够被完整还原,为后续归因和优化提供可靠依据

3. 线上轨迹:从海量执行中识别真正的问题

  • 将线上执行轨迹、用户反馈、工具异常和业务效果统一采集,结合规则、指标和模型判断发现潜在 Bad Case

  • 不仅关注最终答案是否正确,还关注任务是否完成、工具调用是否合理、链路是否冗余、成本与时延是否异常,以及结果是否真正满足用户需求。通过一个典型导购案例,展示 Agent 如何在商品搜索、优惠查询、库存履约和售后判断过程中暴露问题

4. Bad Case 归因:判断问题到底出在哪里

建立面向 Agent 全链路的失败归因体系,将问题拆解为:

  • 任务理解与规划错误

  • Tool 选择或参数生成错误

  • Context 组织与 Memory 召回错误

  • 工具执行、超时与异常恢复问题

  • 模型推理与约束遵循问题

  • 多业务域协同和结果整合问题

结合轨迹回放、同类案例聚类、模型对比和局部重放,判断问题应该通过模型能力、Prompt、Tool、Context/Memory,还是 Runtime 机制进行修复,避免针对单个 Case 不断堆叠规则。

5. 策略变更:从失败原因生成可执行的优化方案

根据归因结果,将优化策略作用到不同层次:

  • 调整 Prompt、任务拆解和执行策略

  • 优化 Tool 描述、参数 Schema、动态注入和调用策略

  • 调整 Context 组装、Token Budget 和 Memory 检索策略

  • 增加参数校验、结果校验、重试、降级和人工接管机制

  • 必要时调整模型选型、路由策略或进入训练优化

通过版本化管理记录每次策略变更,确保优化对象、适用范围和预期收益清晰可追踪。

6. 回归评测:证明优化不是只修复了一个 Case

  • 将典型 Bad Case 和同类问题沉淀为场景化回归集,分别评估单点能力、执行轨迹、任务成功率及业务指标

  • 采用新旧版本对照、同一 Case 多次运行和跨场景退化检查,综合评估任务成功率、工具调用准确率、执行步骤、时延和 Token 成本,防止策略只对少量样本有效,或在修复一个问题的同时引入新的退化

7. 灰度上线:让每次变更安全进入真实业务

  • 通过小流量灰度、版本隔离和 Champion-Challenger 机制,将通过离线回归的策略逐步放入真实流量

  • 持续观察任务成功率、用户反馈、业务转化、链路异常和资源成本;达到预期后逐步放量,出现异常则快速回滚,并将新的线上问题再次进入轨迹采集和归因流程

  • 最终形成:线上轨迹 → Bad Case 归因 → 策略变更 → 回归评测 → 灰度上线 → 新轨迹回流

8. 实施效果与核心结论

  • 通过这套闭环,导购 Agent 的问题定位从依赖人工排查转向轨迹驱动,效果优化从零散 Case 修复转向体系化迭代,链路稳定性、问题定位效率和版本迭代效率均得到明显提升。

实践痛点

  • 在实践中,最大的痛点是复杂业务 Agent 很难同时做到高自主性、高稳定性和低成本。Tool 越多,模型可解决的问题越广,但工具选择、参数生成和跨域结果冲突的概率也会增加;对模型施加更多规则、校验和固定流程,可以提升可控性,却会限制其应对开放式需求的能力

  • 其次,长链路任务往往需要多轮推理和多次工具调用,效果提升通常伴随着时延和计算成本上升。为了保证用户体验,必须在信息完整度、执行轮次和响应速度之间做取舍。过早终止可能导致结果不充分,而过度搜索和重试又容易造成无效消耗

  • 自进化也并非完全自动化。线上 Badcase 的失败原因常常是模型、工具、数据、上下文和业务规则共同作用的结果,自动归因可能产生错误优化,甚至在修复某类问题时引入新的回归。因此,策略调整仍需要经过离线评测、人工审核和灰度验证

演讲亮点

  • 复杂跨域 Tool 的生产级编排:区别于简单问答或单工具调用,本次实践覆盖搜索推荐、商品、营销、履约和售后等多个业务域,通过动态 Tool 注入、参数校验、结果压缩和执行治理,解决复杂链路中的工具选择、数据冲突与稳定性问题

  • 基于执行轨迹的 Agent 自进化:区别于依赖人工分析 Badcase 和单点调整 ,我们将线上轨迹、评测结果与用户反馈统一采集,对规划、工具、上下文和模型问题进行归因,并形成“问题发现—策略优化—回归评测—灰度验证”的持续进化闭环

听众收益

  • 理解电商导购这类复杂 Agent 场景中,如何在搜索推荐、商品、营销、履约和售后等多域之间通过 Subagent、Skill/Tool 注入完成体系化的 Agent 搭建

  • 掌握生产级 Agent 落地中的实践踩坑

  • 了解如何基于线上 Badcase、执行轨迹和评测结果,建立从失败归因到策略优化、回归验证和灰度上线的自进化闭环,减少重复试错

除此之外,本次大会还策划了Loop Engineering千行百业 Agent 创新实践Agent 自主进化:从记忆到持续学习Agent as a ServiceVibe Coding 时代的新质量债理性驾驭 AI 的 SRE 可靠性工程金融 AI Native工程实践:从研发提效到业务破局AI Infra:算力效率决定规模化落地AI Native 架构等 20 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周,现在报名立减 680,查看更多详情可扫码或联系票务经理 18514549229 进行咨询。