Agent 时代,哪些方向正在成为行业关键变量?50 + 实战案例揭晓答案!
模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么? 答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。
在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。
腾讯高级后台开发工程师、项目组 Agent 落地负责人任磊达已确认出席 “Harness Engineering:模型之外的智能体工程” 专题,并发表题为《业务研发中的 Loop Engineering:基于事前-事中-事后架构的实践》的主题分享。AI 时代,研发提效的关键不再只是让 Agent 更快写代码,而是让团队能持续证明代码“做对了”、质量“兜得住”。本次分享以“事前-事中-事后”Harness Engineering 为主线,结合游戏后端质量验证实践,探讨如何把 Agent 执行、测试策略、集成测试、Review 沉淀与 Skill 评估组织成质量飞轮。分享将从“查杀分离”这一核心理念出发,说明为什么测试需要独立于实现路径,为什么 Agent 自写自测存在认知同源风险;随后展开 TDD、tester skill、lobbytest / ugctest、skill evaluator 四类实践,分别对应事前结构化、事中自动化验证和事后沉淀回灌。最终目标是让人聚焦业务边界、风险判断和质量标准,让 Agent 承担执行、验证与重复性修复,使同类问题越来越少,质量资产持续复利。

任磊达,腾讯高级后台开发工程师、项目组 Agent 落地负责人,推动百人规模项目组开发团队从 Token Maxing 向 Token Apocalypse 转型,将 Harness 的目标明确聚焦于 ROI。基于事前、事中、事后的架构构建 Harness Loop,降低认知成本,实现单人月耗百亿 Token 的开发模式,并完成团队推广。基于 18 年线上项目运营经验,持续探索 100% Coding Vibe 场景下的质量投入模式与 ROI。在实践中,可于 20 天内完成原本约 100 人天的需求,并通过后续 2–3 个月的质量工程化手段恢复系统的可控性。他在本次会议的详细演讲内容如下:
演讲提纲:
引言:Agent 时代的质量焦虑
最大的问题不再是“能不能写代码”,而是“怎么证明写对了”
研发质量的目标:让问题更早暴露、更少重复、更容易回灌
引出核心框架:事前结构化、事中自动化、事后沉淀
2. 两层 Harness:执行托底与项目组织
Agent-CLI 侧 Harness:托住长程执行,控制失控风险
项目侧 Harness:拆清需求、测试、Review 和沉淀入口
最终目标:白天做判断,夜里跑执行,第二天复盘回灌
3. 质量验证的核心理念:查杀分离
类比机器学习:训练集与验证集必须分离
类比业务安全:发现问题的“查”和线上处置的“杀”需要独立
映射到研发质量:Development 与 Test 要形成独立验证路径
Test vs Review:测试通过真实执行路径验证,Review 更多依赖代码文本和经验判断
4. 事前:把需求、验收和测试策略结构化
/workflow:clarify:把模糊需求变成边界、风险和验收条件
TDD 在 Agent 时代的新定位:测试即规格,先定义“怎么算做对”
Agent 自写自测的风险:认知同源,容易“用训练集验证训练集”
解决方向:上下文隔离、跨模型验证、属性测试、不变量测试
tester skill repo:从“怎么测”升级到“该测什么”
Push vs Pull:从过度测试转向风险驱动的恰到好处测试
5. 事中:Agent 执行,自动化测试与 Hooks 盯防
按 plan.yaml 分 stage 执行:实现、验证、失败重试、提交
Hooks / linter / auto review:把确定性问题前移到执行过程中
lobbytest / ugctest:游戏后端集成测试的实践样本
从 CLI 工具到插件化,再到服务化架构
真实服务、模拟客户端、TraceID、日志分析共同支撑事中验证
事中困惑:用例维护成本、并发测试资源、复杂场景定位成本
6. 事后:Review、Issue 与 Skill Evaluator 沉淀闭环
Review 放到 MR:沉淀代码上下文、判断依据和处理结果
Test 放到 Issue:沉淀验收标准、失败案例和回归入口
高频问题回灌为 Hook、Linter、Skill、Workflow
Skill Evaluator:验证对象从代码升级到流程本身
两类评估:Skill 是否被正确触发,Skill 是否完成预期任务
7. 开发自测的三阶段价值定位
阶段一:手工测试最佳实践沉淀为可执行用例
阶段二:风险评估驱动低风险变更直发
阶段三:测试团队主导质量系统化,开发团队提供技术支撑
风险模型:风险等级 = 失效影响 × 失效可能性
低风险 + 集成测试通过,可以进入更轻量发布路径
8. 效率飞轮:从质量验证到工程资产复利
事前:clarify、TDD、tester skill 定义清楚输入
事中:Agent、Hooks、lobbytest / ugctest 自动执行验证
事后:MR、Issue、Skill Evaluator 沉淀判断并回灌
观测指标:MR 评论数、重复评论占比、Harness 回灌率、自动放行率、事前澄清耗时
9. 结语:让人的判断越来越值钱
人负责业务边界、风险判断和质量标准
Agent 负责执行、验证、修复和重复性反馈处理
Harness 的价值不是让 Agent 一次写得更快,而是让团队越跑越稳、同类问题越来越少、质量资产越来越厚。
这样的技术在实践过程中有哪些痛点?
token 消耗较大,会有一定认知成本和管理成本的压力。
听众收益
了解 token maxxing 的上限边界,掌握通过认知管控提升该上限的方法。
明晰 vibe coding 的质量保障路径,该路径并非局限于常规的 tdd、单元测试、接口测试,而是要实现功能覆盖度与维护 ROI 的平衡。
如果组织选择不缩减 HC,以及保证相对稳定的组织架构的形态下,如何借力 AI 实现效能 ROI 的收益。
除此之外,本次大会还策划了AI Infra、推理工程与异构计算、超级个体与蜂群智能的共生进化、迈向机器人 AGI 的关键技术与产业实践、Agent 安全:从风险到可控、端侧智能与 AI 原生终端、AI Agent 高价值商业场景实战等 10 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。
大会限时早鸟票享 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。






