写点什么

从失控到可控:基于系统控制论的 Agent 安全防御体系设计与实践|AICon 深圳

  • 2026-08-09
    北京
  • 本文字数:2295 字

    阅读完需:约 8 分钟

AI摘要

Agent 安全正从单点防护转向系统级可控,需以控制论构建动态闭环防御体系。vivo 提出覆盖感知、决策、执行、反馈全链路的安全架构,并在真实业务中验证其可观测性与恢复能力。

Agent 安全是开放系统问题,需建模风险状态与环境反馈;

动态授权与行为约束替代静态规则,应对目标漂移与链式放大;

Red Team 验证+持续进化机制定义工程边界与演进路径。

适合AI安全工程师、智能体系统架构师、大模型平台负责人阅读。

Agent 时代,哪些方向正在成为行业关键变量?50 + 实战案例揭晓答案!

模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么? 答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。

在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。

vivoAI 安全工程师张栋已确认出席 “Agent 安全:从风险到可控” 专题,并发表题为从失控到可控:基于系统控制论的 Agent 安全防御体系设计与实践的主题分享。随着大模型从内容生成走向自主规划、工具调用和跨系统执行,Agent 的安全问题正在由“单点风险”演变为“复杂系统失控”。传统依赖规则、权限和静态检测的防御方式,难以应对目标漂移、链式放大、环境反馈和长周期任务中的动态风险。本议题将从系统控制论出发,将 Agent 视为一个持续感知、决策、行动和反馈的开放系统,介绍如何围绕风险状态建模、异常感知、动态授权、行为约束、结果校验、恢复纠偏和持续进化,构建可观测、可判断、可控制、可审计、可恢复的安全闭环。同时结合真实业务实践,分享控制论方法如何转化为 Agent 防御架构、策略机制和 Red Team 验证体系,以及其在复杂场景中的实际效果、工程边界与演进方向。

张栋,vivoAI 安全工程师,长期聚焦大模型与智能体安全、LLM/Agent Red Team、AI 安全治理及可信控制体系建设。近年来重点研究如何将系统控制论、复杂系统理论与工程安全结合,构建覆盖风险感知、动态决策、行为约束、异常恢复和持续进化的 Agent 安全防御闭环,相关方案已应用于实际业务。曾多次在国内外行业会议和技术社区分享大模型攻击防御、认知安全与智能体可信治理实践。他在本次会议的详细演讲内容如下:

演讲提纲:

1. Agent 安全问题为何发生了本质变化

  • 从内容生成走向任务规划、工具调用、跨应用执行和长期运行后,风险不再只是单次模型输出错误,而是由模型、工具、权限、环境和反馈共同形成的复杂系统失控

2. 传统安全方案的能力边界

  • 分析静态规则、权限控制、内容审核和单点检测在多步骤任务、目标漂移、错误累积及链式风险面前的局限

3. 系统控制论视角下的 Agent 风险建模

  • 将 Agent 抽象为“目标—状态—行动—环境—反馈”的动态系统,识别可观测性不足、控制失效、反馈延迟、扰动放大等关键风险

4. Agent 安全防御闭环设计

  • 介绍“感知—判断—控制—恢复—进化”五层防御体系,以及可观测、可判断、可授权、可约束、可审计、可恢复的核心能力

  • 关键安全机制与工程实现:包括风险状态建模、动态授权、执行前校验、过程监测、结果验证、异常中断、回滚恢复和策略持续优化

  • 真实业务实践与 Red Team 验证:结合手机端和 PC 端 Agent 项目,说明如何将理论框架转化为安全需求、架构机制、测试用例及上线治理闭环

5. 效果、边界与未来演进

  • 总结控制论方法适用的场景、当前工程约束,以及面向长期任务、多 Agent 协作和自主进化系统的后续方向

演讲痛点

1. 系统状态难以完整观测

  • Agent 的意图、规划链路、工具调用和环境状态分散在不同模块,难以形成统一、实时且可信的风险视图

2. 安全控制与用户体验存在明显权衡

  • 过度确认和严格限制会降低任务成功率与流畅度;控制过弱又可能导致越权执行、错误传播和不可逆后果

3. 复杂风险难以通过静态规则覆盖

  • 许多风险并非来自单次恶意请求,而是在多步骤执行、上下文变化和工具组合中逐渐形成,规则数量容易快速膨胀

4. 恢复机制比阻断机制更难建设

  • Agent 已经修改文件、发送信息或调用外部系统后,仅依赖拦截并不能解决问题,还需要事务记录、结果校验、撤销和补偿机制

5. 理论模型与工程系统之间存在落差

  • 控制论能够提供统一框架,但落地时仍需结合具体业务定义状态变量、风险阈值和控制动作,无法直接套用一套通用参数

6. 安全效果缺乏成熟评价标准

  • 当前难以同时量化风险降低程度、误拦截率、任务成功率和控制成本,需要通过 Red Team、回归测试及线上数据持续校准

听众收益

1. 获得一套区别于传统规则防御的 Agent 安全分析框架

  • 能够从复杂系统和闭环控制视角,重新理解目标漂移、工具越权、错误累积和执行失控等问题

2. 掌握可直接应用于项目的防御架构与落地方法

  • 包括风险建模、动态授权、过程控制、结果验证、异常恢复及 Red Team 验证的完整实施路径

3. 了解真实 Agent 项目中的工程权衡与实践经验

  • 理解安全性、任务成功率、用户体验和研发成本之间的 trade-off,减少只做静态规则或单点能力建设的试错成本

除此之外,本次大会还策划了AI Infra、推理工程与异构计算超级个体与蜂群智能的共生进化迈向机器人 AGI 的关键技术与产业实践Agent 安全:从风险到可控大模型效率工程与 Agent 系统实践AI Agent 高价值商业场景实战等 10 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。

2026 年 AICon 人工智能开发与应用大会 · 深圳站将于 8 月 21 日—22 日举办,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。更多详情可扫码或联系票务经理 13269078023 进行咨询。