写点什么

Read, Don't Write: 重塑大模型评价体系,构建全自动、可进化的“探测式”评测管线|QCon 上海

  • 2026-09-13
    北京
  • 本文字数:2450 字

    阅读完需:约 8 分钟

AI摘要

AI正从能力组件演进为具备自主规划与执行的软件系统,工程重心转向构建稳定、可信、可控的AI Native架构。QCon上海站聚焦AI系统化落地,覆盖Agent Runtime、AI Infra、安全可观测等关键实践方向。

关键观点:AI Native要求重构软件工程范式,重心从模型调优转向系统可靠性;Agent Runtime与Framework成为支撑自主任务执行的核心基础设施;端云协同、Loop Engineering等新范式加速AI从实验走向规模化生产。

适合AI系统工程师、平台架构师、MLOps工程师阅读。

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!

推理模型持续突破能力边界,Coding Agent 深度参与研发流程,Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型,演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力,而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化:团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt,而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。

在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题,并发表题为Read, Don't Write: 重塑大模型评价体系,构建全自动、可进化的“探测式”评测管线的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时,我们是否走错了路?传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”:不仅全量评测成本高昂,更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP(Bootstrapped Regression Probing)。他们不再让模型“写”评语,而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术,他们将评测成本降低了 97%,同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线,包括如何在无标注流量中自动孵化评测标准,以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地,为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例,展示 badcase 如何入池、分派、修复和验证,并说明当前哪些环节仍需人工决策。

孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作,此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下:

演讲提纲:

  1. 行业趋势与评测困境

  • 开放式对话评测的现状:指标 Gap 与滞后的用户反馈。

  • 传统生成式 Judge 的三大“税”:成本税、延迟税、偏置税(中心化倾向、字数偏置)。

2. BoRP 技术架构:从“读”取代“写”

  • 对比表示(Contrastive Representation):如何通过 Suffix-only Prompt 剥离对话背景,提取纯净的满意度信号。

  • 几何感知探测引擎:利用向量范数(Norm)与离群度(Outlierness)量化极端样本。

3. PLS 回归头设计

  • 相比 PCA,如何通过有监督回归过滤话题噪音,提升样本效率。

  • 冷启动与自动化对齐管线:自引导(Bootstrapping)如何在无标注流量中通过“极化挖掘”自动生成评测标准(Rubric)。

  • 专家对齐:仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。

4. 工业级落地优化与 A/B Test 实践

  • KV-Cache 复用与前缀共享:如何支撑单卡 A100 日处理百万级会话。

  • 不确定性预警:利用中间层与输出层差异作为“认知冲突”代理,过滤异常预测。

5. 总结与未来演进

  • 骨干模型进化:更换 Backbone 时如何实现“免重训”迁移。

  • 局限性与未来:复杂推理场景下的生成式补充。

实践痛点:

  1. 极端样本挖掘难(“大海捞针”):在大规模工业流量中,极好或极差的“极化样本”分布极稀疏,传统随机抽样很难构建高质量的评测基准。

  2. 评测成本与全量监控的矛盾:生成式模型评测 Token 消耗巨大,导致企业只能进行抽样评测,无法在 A/B Test 中捕捉微小的满意度波动。

  3. 生成式评测的“不公平”偏置:模型容易因为回复更长或回复位置不同而给出高分,这种系统性偏置严重干扰了模型的真实优化方向。

  4. 模型升级的沉没成本:每次升级 Base 模型,往往需要重新构建数万条评测数据集并重新 SFT 专用评测模型,开发周期极长。

前沿亮点

  1. 范式创新:提出了“Read, Don't Write”的评测新范式。不再依赖模型的生成能力,而是挖掘 LLM 的 latent knowledge,从底层逻辑上消除了字数偏置和格式敏感性。

  2. 极高性价比的工程实现:通过 Suffix-only Probing 和多维度特征增强,实现了在 8B 模型上对齐 GPT-4 级的评测精度,且成本降低至前者的 3% 左右。

  3. 可解释的评测不确定性:创新性地利用层间隐状态的“认知冲突”来量化评测结果的可信度,为工业界提供了自动化的“坏案例(Bad-case)”过滤机制。

听众收益:

  1. 技术方案:掌握一套可落地的、基于回归探测的低成本 LLM 评测架构,解决评测算力贵的瓶颈。

  2. 方法论:学习如何利用 Bootstrapping 从无标注数据中自动化提炼业务评测标准(Rubric)。

  3. 实战经验:了解如何将 LLM 内部信号与传统 A/B Test 指标结合,提升线上实验的灵敏度和方差削减(Variance Reduction)。

除此之外,本次大会还策划了Loop Engineering千行百业 Agent 创新实践Agent 自主进化:从记忆到持续学习Agent as a ServiceVibe Coding 时代的新质量债理性驾驭 AI 的 SRE 可靠性工程金融 AI Native工程实践:从研发提效到业务破局AI Infra:算力效率决定规模化落地AI Native 架构等 20 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。

QCon 全球软件开发大会·2026(上海站)将于 10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。