Netflix 开源了一个用于观察性因果推断(OCI)的智能代理工作流。该工作流可以减轻因果分析过程中的繁琐工作。基于观察数据和人类用户的分析计划,该智能代理能够利用行为者-批评者循环来评估因果关系、撰写报告并提出后续步骤的建议。
该智能代理工作流基于 Netflix 现有的 OCI 工具构建。其目标是自动化易出错或重复性任务(如敏感性分析或跟踪多次迭代),将更高层次的任务(如问题构建和结果评估)留给人类用户。OCI 分析被定义为目标试验仿真,即寻找能够解答该问题的最优 A/B 测试方案。Netflix 团队使用大西洋因果推断会议(ACIC)竞赛数据集对该工作流进行了评估,发现其与各类基准系统相比非常“具有竞争力”。据 Netflix 说:
在因果推断中使用智能代理面临着一个挑战:在没有真实标注数据的情况下,我们如何评估智能代理在各项任务中的表现?为了应对这一挑战,我们的工作流程将流程审核与人工监督相结合。为了让其他人能够借鉴并评判这一工作流程,我们已经将一个轻量级的独立版本开源。我们希望,这项工作能激发更多在没有真实标注数据的情况下对智能代理进行评估的研究与开发。
人类分析师可以通过创建一个基于模板的 Jupyter 笔记本和一份分析计划来设置该流程。执行代理会根据该计划生成规格说明书,填写笔记本中的参数并执行笔记本。评审员审查笔记本的输出结果;对其进行评级:not_satisfactory、satisfactory_with_caveats 或 fully_satisfactory;并提出规格说明书修改建议。

OCI 智能代理工作流(图片来源: Netflix 博客 )
为了展示该系统的实际应用,Netflix 发布了一份案例研究,介绍如何利用该工作流来评估新型娱乐内容(如游戏)对用户留存率的影响。分析计划将“干预变量”定义为接触新型娱乐内容的天数,将“结果指标”定义为 2 个月的留存率。作为基准对照,他们将该方案输入到 Claude 大模型中,由它自动执行简单线性回归,输出估算的效果值。
当研究团队使用 oci-agent 工作流时,得出的估算效果值“仅为基准值的 25%”。评审代理指出了几个问题,包括潜在的早期采用者偏差以及安慰剂测试失败。该工作流为智能代理提供了针对这些场景及其他场景的操作指南,并能自动使用调整后的参数进行多次分析。
Owkin 高级产品经理 Fabio Piazza 在 LinkedIn 上写道:
Netflix 继续悄无声息地在应用人工智能领域树立标杆。他们不仅检查智能代理的输出结果,还让每个步骤都透明化。智能代理会发布计划、规格说明、流程图和手册,供人类检查并重新执行。他们将这些流程审计与人工监督相结合,并将工作分配给两个智能代理:一个负责运行分析,另一个负责评审分析结果并指出不足之处。这提醒我们:技术前沿不仅在于更优秀的模型,更在于围绕这些模型构建更完善的工作流程。
Indeed.com 软件工程总监 Taikai Takeda 在 X 上发文称:
我对因果推断了解不多,所以如果我只是随口向大语言模型(LLM)抛出这个问题,它可能会做一些半吊子的回归分析,而我最终却会对此感到满意…… [OCI] 的设计初衷并非让智能代理直接输出答案,而是引导其遵循正确的步骤,同时留下可供专家后续进行验证的执行记录。这篇文章通俗易懂,其中包含了在公开数据集上开展的实验以及案例研究。在降低专业任务的入门门槛方面,AI 智能代理确实非常出色,不是吗?
感兴趣的读者可以从 GitHub 上获取 oci-agent 的源代码。





