写点什么

DataBuddy:数据语义驱动的企业 Agent Runtime 设计与落地|AICon 深圳

  • 2026-07-31
    北京
  • 本文字数:2367 字

    阅读完需:约 8 分钟

AI摘要

核心内容:Agent 时代竞争力正从模型能力转向智能系统规模化构建能力,尤其聚焦执行可控、语义可信与系统可进化三大工程挑战;DataBuddy 以数据语义驱动的 Agent Runtime 为实践范例,揭示语义冷启动、持续优化与安全兜底的设计路径。

关键观点:Agent 竞争力本质是系统工程与组织级落地能力;语义可信需知识记忆与安全双底座支撑;Text-to-SQL 是语义执行的安全兜底机制。

适合AI平台工程师、智能体架构师、数据基础设施负责人阅读

Agent 时代,哪些方向正在成为行业关键变量?50 + 实战案例揭晓答案!

模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么? 答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。

在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。

腾讯 DataBuddy Harness 工程负责人彭锦文已确认出席 “智能体时代的数据供给与治理” 专题,并发表题为DataBuddy:数据语义驱动的企业 Agent Runtime 设计与落地的主题分享。本次分享将拆解 DataBuddy 如何用一套 Agent Runtime 回答三个核心问题:执行可控、语义可信、系统可进化。以真实的端到端案例让大家看到 Agent 跑起来的样子,再自底向上讲清背后的架构及承载这一切的 Agent Runtime 执行内核;随后重点放在「语义」这条主线:语义如何冷启动、如何越用越准、如何用 Text-to-SQL 进行安全兜底;并介绍支撑语义可信的知识记忆与安全两大底座。既有设计取舍,也坦诚当前边界。

彭锦文,腾讯 DataBuddy Harness 工程负责人,10 余年研发经历,曾参与 QQ 兴趣部落/腾讯看点/ QQ 浏览器/ QQ /腾讯云大数据等业务,长期负责核心业务与技术体系建设,覆盖 C 端高并发场景与 B 端平台。近年聚焦 Agent 与工程治理提效,主导了团队自研 Agent 与 AI Coding 体系落地。擅长在复杂组织与跨域场景中,持续产出可量化结果并沉淀可复用方法论。他在本次会议的详细演讲内容如下:

演讲提纲:

1. 为什么企业数据 Agent 更难

  • 数据 Agent 不止是 Text-to-SQL 封装

  • 从「答错一句话」到「在有权限的环境里执行错误动作」的风险跃迁

  • 三个核心设计问题:执行可控、语义可信、系统可进化

2. 「建仓 + 同步」端到端案例

  • 一句话诉求「接入 MySQL 销售库、建 ODS/DWD/DWS 三层、配置每日增量同步」的完整链路

  • 从案例中直观感受 Agent 的动态行为:自主规划 + 能力契约 + Hook Guardrail + Trace 产物

  • 这条链路为什么可控、可信、可进化,后续逐层展开

3. 总体架构

  • 控制面与数据面分离

  • 五层架构与 Runtime 隔离设计

  • 推理与执行解耦、能力与安全解耦、短期状态与长期知识解耦

4. Agent Runtime

  • WorkBuddy 同源 Harness

  • Agent Runtime 生命周期与可观测性

  • 能力组织:专家能力与业务语义、执行契约、安全等级

    数据领域 loop 的特点和差异

    数据领域专有工具能力

5. 语义:让 SQL 从能跑到可信

  • 语义的冷热启动——冷启动期元数据缺失、口径未沉淀,靠约定与人工兜底;热启动后语义资产累积,准确率与自动化程度同步抬升

  • 抽象沉淀——把一次次临时查询与口径修正萃取为可复用的语义抽象,让语义覆盖度随使用持续增长

  • 语义 coverage——划定可信边界、选择执行路径与人工确认强度,让 Agent 清楚自己哪里可信、哪里该谨慎

  • Text-to-SQL 兜底——语义层未覆盖时降级至受约束的 Text-to-SQL,并进入静态分析、语义对齐、权限收敛的防护链路

  • 覆盖度与降级决策沿 ReAct Loop 逐步收敛

6. 知识:分层记忆 + 数据图谱

  • 纵向分层——Session、Personal、Team、Enterprise 四层记忆,按作用域 × 生命周期定位,权威性逐层增强

  • 横向成图——表/列、指标/维度、血缘、质量规则、SQL 模板互连成资产关系图;检索融合文本相关性 + 资产热度 + 血缘中心度 + 权威性

  • 经验复利闭环——使用、修正、沉淀、审核、复用,Agent 既是知识消费者也是生产者,越用越准

7. 安全体系

  • 风险三要素

  • 多层纵深防御,Agent 识别 + 规则引擎 + 审计 Agent 异步协同

  • SQL 多段防护:Prompt、Text-to-SQL、静态分析、语义对齐、权限、改写、HITL、执行、结果脱敏、审计

  • 敏感隔离:敏感信息不进对话、不进上下文、不进记忆

8. 评测

  • 离线回归 + 在线观测双体系

  • 确定性校验 + LLM-as-Judge + 人工标注三层评判

  • 数据 Agent 评测三难题:语义正确性、确认门自动化、防作弊

演讲痛点

  • 语义正确性难验证——SQL 能跑通不代表口径对,join 漏条件、粒度翻倍这类错误不报错却最致命,且没法全自动校验,最终仍靠人对数

  • 知识冷启动悖论——"越用越准"的前提是有人先用,但初期元数据缺失、口径未沉淀导致准确率低,没人敢用,早期信任低谷难熬

  • 安全与体验对立——纵深防御累加延迟,确认太多变手工、太少会出事,HITL 的"度"要在生产里反复磨

  • 动作可控性——长链路任务中途失败,有副作用的写/调度难回滚、难幂等

  • 组织信任——"敢把核心数据交给 Agent"本质是责任归属和信任问题,从只读分析到可写生产循序渐进建立

听众收益

  • 一套可复用的数据 Agent 架构心智:模型推理、Harness 执行、知识与记忆、安全边界

  • 语义可信的工程主线:冷热启动、抽象沉淀、语义 coverage、Text-to-SQL 兜底,全部跑在同一套 Agent Runtime 上,让 Agent 越用越准且知道自己边界

  • 数据 Agent 的安全方法论:风险三要素、纵深防御

  • 让 Agent「越用越准」的知识路径:知识与记忆 + 数据图谱 + 经验萃取的治理闭环

除此之外,本次大会还策划了AI Infra、推理工程与异构计算超级个体与蜂群智能的共生进化迈向机器人 AGI 的关键技术与产业实践Agent 安全:从风险到可控大模型效率工程与 Agent 系统实践AI Agent 高价值商业场景实战等 10 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。

AICon 全球人工智能开发与应用大会·深圳站,限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。