写点什么

@ 一下就能派活?谷歌推出办公 Agent,拥有独立账号、能够创建子 Agent,还能调用 Claude

  • 2026-10-09
    北京
  • 本文字数:4298 字

    阅读完需:约 14 分钟

AI摘要

Gemini Agent 是谷歌云推出的通用办公智能体,支持通过单提示框执行知识工作、内容创作与代码执行,并可创建协作子Agent;首创“同事型智能体”设计,赋予其企业邮箱、日历与持久化存储等组织身份。

支持多模型调用,当前兼容Claude,后续将扩展闭源与开源模型。

Coworker Agent 实现长期上下文感知与团队级协同,非临时性工具而是组织成员。

适合AI平台工程师、企业IT架构师、SaaS产品负责人阅读

作者| 林绮蓓

编辑| 蔡芳芳

智能体化身成“数字同事”了。

如今,AI Agent 可以拥有自己的企业邮箱、日历和云端硬盘,也能够像普通员工一样被拉进工作群、接收任务,甚至在文档中留下修改记录。

10 月 8 日,谷歌云(Google Cloud) 在 Gemini at Work 2026 活动上正式推出面向企业的通用 AI Agent——Gemini agent。谷歌云 CEO Thomas Kurian 介绍到,Gemini agent 是一款全新的通用办公智能体,仅需一个提示框,就能够完成从知识工作到问答、从内容创作到代码执行等各类任务。

此外,Gemini agent 还可以创建多个子 Agent 协作。更特别的是,Google 引入了 Coworker Agent(同事型智能体)的概念:企业可以为 Agent 分配专属的身份,包括邮箱、日历和持久化存储空间,让它以团队成员的身份参与长期工作。

在底层模型选择上,Google 也没有将 Agent 限定在 Gemini 系列模型之内。根据官方介绍,Gemini agent 目前支持调用 Anthropic Claude,并计划继续接入其他闭源和开源模型。

一个 Agent,就能完成跨应用办公任务

Google 将 Gemini agent 定义为“单一、通用的工作智能体”(Single, Universal Agent for Work)。

按照 Google 的介绍,用户不需要逐步告诉 Agent 应该打开哪个应用、查找哪些文件或执行什么操作,而是可以直接描述希望它完成的工作目标。Gemini agent 会规划执行步骤,选择所需工具,并在相关应用中完成任务。

目前,Google 公布的应用范围覆盖 Gmail、Google Drive、Docs、Slides、Sheets、Chat 和 Calendar 等 Workspace 产品,同时支持连接 Microsoft 365、Slack、Confluence、Salesforce、ServiceNow、Jira 等第三方企业软件。

以安排会议为例,用户可以要求 Gemini agent 在下周组织一次与区域活动负责人参加的会议,无须提供每位参会者的姓名和邮箱。根据 Google 的演示场景,Gemini 可以从已有的工作群和历史邮件中识别相关人员,查看相关人员的日程安排,再通过邮件协调会议时间,同时包括联系外部参会者。

类似地,Gemini agent 能够用来处理跨应用的工作。同样以 Google 提供的演示场景为例,用户可以让 Gemini agent 调研市场趋势,在 Sheets 中建立财务模型,再根据研究结果制作演示文稿。整个过程中,Agent 能够沿用此前的工作上下文,不需要用户在不同应用之间反复解释任务背景。

除响应用户指令外,Gemini agent 还支持主动识别可以委派的工作。例如,当用户收到上级要求制作项目进展汇报的邮件时,Workspace Intelligence 可以识别这一任务,并提供交给 Gemini 处理的入口。

为了支持这些操作,Google 为 Gemini agent 设计了工具、技能和上下文三部分能力。

其中,工具负责连接企业现有软件及数据系统,支持通过 Model Context Protocol(MCP)接入外部服务;技能(Skills)则用于保存可复用的任务流程、操作说明和专业知识。企业可以建立共享的工具和技能注册表,供不同团队使用。

在记忆机制上,Gemini agent 包含四种类型:用于保存当前任务上下文的会话记忆、用于组织知识的语义记忆、用于保存工作方法的程序性记忆,以及记录历史操作的情景记忆。这些信息在云端运营,因此用户从电脑切换到手机,或在不同应用中与 Agent 交互时,可以继续使用相关上下文。对于持续数小时甚至数天的任务,即使用户关闭电脑,Agent 仍可以在云端继续执行。

能创建子 Agent,还能拥有自己的企业邮箱

除了跨应用执行,Gemini agent 还能创建子 Agent,实现多智能体协作。

Google 介绍,Gemini agent 可以根据任务需要,动态创建多个具有独立身份的子 Agent,将复杂任务拆分后交给它们执行。这些子 Agent 可以并行或依次工作,并通过相互通信协调任务进度。

不过,Google 此次还区分了两种不同的 Agent:第一种是为特定任务临时创建的子 Agent。它们围绕明确的工作目标运行,承担任务分解后的不同部分。第二种则是 Coworker Agent,即具有持续身份和固定职责的同事型智能体。

与临时子 Agent 不同,Coworker Agent 可以在不同日期、不同会话之间持续承担工作职责。企业只需要描述需要的岗位角色,Gemini 就能根据要求创建对应的 Agent。Coworker Agent 可以拥有独立的 Workspace 账户,包括企业邮箱、日历、Google Drive 存储空间,以及公司通讯录中的身份。这意味着,员工可以像与其他同事协作一样,将 Agent 添加到 Google Chat 群组,或者通过 @ 提及的方式向其分配任务。

Google 举了一个营销团队的例子:市场经理可以在工作群中要求负责活动协调的 Agent 起草产品发布准备文档。Agent 完成后,可以直接将文档发送回群组。员工还可以在 Google Docs 的评论区提及这个 Agent,让它提出修改建议。Agent 能以自己的身份回复评论,其修改记录也会显示对应的 Agent 名称。

这一机制还有一个区别:Coworker Agent 使用的是自己的身份,而不是直接冒用发起任务的员工身份。

Google 表示,Agent 只能访问用户或团队明确共享给它的内容,相关权限遵循 Workspace 现有的文件共享与成员管理机制。对于企业而言,这意味着 Agent 不仅需要具备执行任务的能力,还需要拥有可以管理、授权和审计的独立身份。

不只使用 Gemini,Google 的 Agent 还能调用 Claude

此次发布还有一个值得注意的技术设计:Google 将 Agent 与底层大模型分离。按照官方介绍,Gemini agent 负责接收任务、规划流程和组织执行,但完成每项任务所使用的模型可以动态调整。

目前,这一机制已经支持 Google Gemini 系列模型,以及 Anthropic 的 Claude 系列模型。Google 计划未来进一步接入其他领先的闭源和开源模型。

换句话说,企业使用 Gemini agent,不意味着所有推理请求都必须由 Google 自家的模型处理。

在具体执行过程中,Gemini 可以根据任务需求选择模型,也可以在一个复杂项目中组合使用多个模型。

Google 同时介绍了 Smart Routing(智能路由)机制,用于对不同工作负载的需求进行分类,以便每个工作负载都能以最低成本实现最高性能。

成本控制也是此次发布的重点之一。企业可以在 Google Cloud Billing Console 中,为单个项目设置 AI 支出的硬性上限。系统会持续追踪 Token 使用量及沙盒运行成本。当项目触及预算上限时,对应的 Agent 将暂停执行,管理员可以在控制台中选择恢复运行。这种方式也允许企业按照项目划分费用,并进一步将 AI 使用成本归集至不同部门。

Agent 拥有独立身份后,如何管理权限?

当 Agent 能够访问企业数据、修改文档并长期执行任务时,权限和安全管理也成为产品设计的一部分。

Google 在此次发布中介绍了面向 Agent 的身份、授权、审计和网络控制机制。

首先,每个 Agent 都可以拥有独立身份,并采用最小权限原则进行管理。管理员可以根据岗位或任务,为不同 Agent 设置细粒度的访问权限。当 Agent 需要连接外部系统时,身份和授权信息可以通过 OAuth 等标准传递。

其次,Agent 执行的操作会记录在审计日志中。与将所有操作归属于员工不同,Google 允许企业按照 Agent 身份追踪执行记录,包括 Agent 启动虚拟机运行代码时产生的相关日志。

在执行环境方面,Google 引入了 Agent Sandbox 和 Agent Gateway。

其中,Agent Sandbox 为执行任务的 Agent 提供隔离环境;Agent Gateway 则负责管理 Agent 与外部系统,以及不同 Agent 之间的网络通信。

企业可以通过统一策略限制 Agent 的行为。例如,管理员可以禁止所有 Agent 访问标记为特定保密等级的文件,而不必逐个配置。

除通用办公任务外,Google 还公布了面向数据分析、金融和法律领域的专用能力。数据分析方面,Gemini 可以调用 BigQuery 等工具,根据自然语言要求生成 SQL、Spark 或 Python 代码,完成数据查询和报告制作。金融与法律领域的专用版本目前处于预览阶段,其他行业支持将陆续推出。

与 Meta Muse 相比,Google Agent 有什么不同?

在 Google 发布 Gemini agent 之前,Meta 在今年 9 月推出了个人 AI Agent——Muse,引起了众多关注。

这两款产品有不少相似之处:都支持根据目标自主执行任务、跨应用操作、记忆用户上下文,也都能够在用户离开应用后继续处理工作。但从双方公开的产品设计来看,它们目前的主要使用场景并不相同。

Meta 最初将 Muse 定位为个人 AI Agent,面向日常生活和个人事务管理。用户可以通过 Muse 应用或 WhatsApp 向其布置任务,包括发送邮件、预订旅行、购物以及安排长期计划。Muse 可以打开浏览器、填写表单,并在获得相应授权后代替用户执行操作。Meta 还为 Muse 接入了 Stripe 的 Link 支付服务,用于完成线上购买。

相比之下,Google Gemini agent 主要面向企业工作环境。它的任务范围集中在企业知识管理、办公协作、代码执行、数据分析等领域,并通过 Workspace 和第三方企业系统连接组织内部的工作流程。

这也体现出二者的身份与组织方式之间的区别。

Muse 的核心设计围绕个人展开。用户拥有自己的 Muse,向其提供个人信息和应用访问权限,Muse 再根据这些信息执行任务、管理计划或主动提出建议。

Google 则进一步提供了企业团队层面的身份机制。Gemini agent 不仅可以作为个人助手,还能被创建为长期存在的 Coworker Agent,拥有独立邮箱、日历和企业通讯录身份,并与多个员工协作。

不过,Muse 也并非只面向个人生活场景。9 月 29 日,Meta 发布了 Muse for Small Business,加入 Asana、Canva、Notion、Shopify、Slack、Stripe、Zoom 等工具连接能力,支持商家分析销售数据、制定营销计划和处理经营任务。此外,Meta 还宣布成立 Meta Enterprise Platform,计划将 Muse、Muse API、Muse Code 等产品进一步推向企业市场。

本质上看,两款 Agent 都承担着替用户完成具体任务的角色,因此,任务如何执行、权限如何管理、安全如何保障,都值得进一步关注。在底层执行和安全架构方面,Meta 为 Muse 提供了专用的 Muse Secure VM。每个用户的 Agent 运行在独立的云端虚拟机中,连接服务所需的数据和凭据保存在相应的安全环境内;还配有独立的 Sentinel Agent,用于检查对外操作,并在涉及敏感行为时请求用户授权。例如,发送邮件、购买商品等操作需要用户确认。

Google Gemini agent 同样提供隔离执行环境,但更强调企业级身份、访问权限和统一策略管理。其 Agent Sandbox 负责隔离任务执行,Agent Gateway 负责实施网络访问策略,企业管理员还可以集中查看操作日志、配置权限及费用限制。

模型调度的选择也是二者最大的区别之一。Muse 由 Muse Spark 模型驱动。Google 则明确将多模型编排作为 Gemini agent 的架构能力,支持在 Gemini 与 Claude 等模型之间进行选择。

在开放范围上,Muse 已面向美国和加拿大用户提供服务,基础功能免费,并设有订阅方案;Google 此次推出的企业版 Gemini agent 则仍处于私有预览阶段,尚未公布 Gemini agent 面向所有企业客户的正式开放日期及完整定价信息。