写点什么

Gemini 3.7 Flash 突袭:性能逼近旗舰、价格打“骨折”!!DeepMind 新帅重画性价比斩杀线

  • 2026-08-14
    北京
  • 本文字数:4647 字

    阅读完需:约 15 分钟

AI摘要

Gemini 3.7 Flash 是谷歌三周内发布的迭代模型,定位为当前最智能的主力模型,聚焦编程与 Agent 场景;其快速发布源于开发者反馈与算法创新,并紧随 DeepMind 权力重组完成仅八天。

Gemini 迭代周期压缩至三周,反映工程化节奏显著提速;Koray 实质接掌 Gemini 全栈研发与前沿 AI 决策权;模型定位从通用转向编程/Agent 垂直优化。

适合AI基础设施工程师、大模型应用架构师、AI平台产品负责人阅读。

谷歌正在以前所未有的速度更新 Gemini。

昨晚 当地时间 8 月 13 日,Google DeepMind 正式发布 Gemini 3.7 Flash。谷歌给它的定义非常直接:“迄今最智能的主力模型(workhorse model)”,重点面向编程和 Agent。

有意思的是,3.7 Flash 的发布时间,距离 Gemini 3.6 Flash 发布,仅仅过去了三周。谷歌自己也在官方博客开头特意强调了这一点:Gemini 3.7 Flash 是在 3.6 Flash 发布仅三周后推出的,背后来自开发者反馈以及一系列算法创新。

更微妙的是,距离 Google DeepMind 完成近年来最剧烈的一次权力重组,也只有八天。

8 月 5 日,Demis Hassabis 卸任 Google DeepMind CEO,转任 Google DeepMind 董事长和 Alphabet 首席科学家;Google DeepMind CTO、Alphabet 首席 AI 架构师 Koray Kavukcuoglu 则正式接过日常管理权。

严格来说,Koray 并没有获得 CEO 头衔,而是升任 Google DeepMind 高级副总裁。但从实际权力来看,他已经成为 Google AI 新一代“掌门人”:Gemini 模型研发、Frontier AI 研究、Gemini App 和开发者团队全部归他负责,并直接向 Sundar Pichai 汇报。谷歌随后还向路透确认,Koray 将对 DeepMind 的重大决策拥有最终决定权。

于是,一个很难忽略的时间线出现了:

8 月 5 日,DeepMind 换帅 然后 8 月 13 日,Gemini 3.7 Flash 发布。

如果再把谷歌过去几个月发生的事情串在一起,这次 Flash 更新看起来就不只是一场普通的模型迭代。

三周迭代一次,谷歌开始抢时间

谷歌把 Gemini 3.7 Flash 的重点几乎全部压在了两个关键词上:Coding 和 Agent。

这样的重心并不让人意外,因为过去一年,大模型竞争的重心已经从聊天、知识问答,迅速转向代码生成、工具调用、Computer Use 和长链条 Agent 任务,单次 Benchmark 的胜利不足以让用户为之付费了,但一个模型如果能连续几十步调用工具、修改代码、读文档、访问系统并完成实际任务,还是值得期待的。

Gemini 3.7 Flash 正是在这个方向上强化。

按照谷歌官方数据,在衡量生产级代码质量的 FrontierCode 1.1 Main 中,Gemini 3.7 Flash 得分达到 43.6%,相比 Gemini 3.6 Flash 的 34.4% 明显提升。

在考察长周期软件工程任务的 DeepSWE v1.1 中,成绩则从 3.6 Flash 的约 49% 提升到 65.3%。

Web 开发同样是这次升级的重点。

谷歌称,3.7 Flash 可以用更少的 Prompt 生成更加完整、功能可用的 Web 应用,对截图、图片以及完整 Design System 的还原能力也有所提升。

在 WebDev Arena 上,其 Elo 分数从 3.6 Flash 的 1538 提升到 1588。

从简单的文本提示到完全可玩的 3D 游戏,使用了 Gemini 3.7 Flash 和 Nano Banana 来实时动态生成角色、物品和纹理。

从静态 PDF 到交互式数据故事。观看复杂的年度报告如何转化为吸引人的网页体验,其中包含实时图表和汇总分析。

Agent 能力的变化更加明显。

在 Terminal-bench 2.1 的 Agentic Terminal Coding 测试中,Gemini 3.7 Flash 达到 85.8%,高于 3.6 Flash 的 78.0%;更困难的 Terminal-bench 3.0 中,则从 5.4% 一口气提高到 14.9%。

在测试企业真实工作流自动化能力的 AutomationBench 中,3.7 Flash 从 17.0% 提升到 30.4%。

Computer Use 也出现了明显进步。在 OSWorld 2.0 上,3.7 Flash 得到 47.9%,而 3.6 Flash 为 33.8%。

换句话说,3.7 Flash 并不是简单提高数学或者知识问答得分,而是集中攻击谷歌目前最需要补强的区域:代码、工具调用和 Agent 执行。

谷歌甚至在博客中专门强调,3.7 Flash 在遇到执行障碍时会更主动调整策略,在必要时澄清用户意图,并且更加严格地遵循指令。

一次生成即可打造很好的交互式落地页。使用 Gemini 3.7 Flash 来协调子代理,并使用 Gemini Omni 创建流畅的交互式视差组件。

模型会在多步骤规划和工具调用中“投入更多思考”,减少人工监督和重复重试。

这句话背后的目标非常现实:模型不能只停留于“第一次回答得不错”,现在需要它把任务彻底完成。

Flash 开始逼近旗舰模型

如果只看谷歌公布的模型卡,3.7 Flash 的另一个变化也很明显:Flash 与高价旗舰模型之间的性能差距正在缩小。

在 Artificial Analysis Intelligence Index 上,Gemini 3.7 Flash 得分 56,Claude Sonnet 5 为 55,GPT-5.6 Terra 为 57。

FrontierCode 1.1 中,3.7 Flash 的 43.6% 高于 Claude Sonnet 5 的 42.7% 和 GPT-5.6 Terra 的 41.3%。

Web 开发 Code Arena 中,3.7 Flash Elo 达到 1588,同样高于谷歌模型卡列出的 Claude Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2。

当然,这并不意味着 Gemini 3.7 Flash 已经全面超过旗舰模型。

例如 DeepSWE v1.1 中,GPT-5.6 Terra 仍然达到 69.6%;Terminal-bench 3.0 中,GPT-5.6 Terra 为 20.8%,明显高于 3.7 Flash 的 14.9%;GDPVal-AA v2 知识工作测试中,3.7 Flash 也落后于几款竞争模型。

但这恰恰说明了谷歌现在对 Flash 的定位:它不需要在所有 Benchmark 上成为绝对第一,转而希望用接近前沿模型的能力,更低的价格和更高的吞吐量,成为真正能够大规模跑 Agent 的模型。

这也是“workhorse model”这个表述真正值得注意的地方。

谷歌也要打 Agent 成本战了

Gemini 3.7 Flash 更猛烈的地方其实是价格。今年年底之前,其介绍期价格为:输入 0.75 美元/100 万 Token,输出 3.75 美元/100 万 Token。按照谷歌的说法,这相当于 Gemini 3.6 Flash 最初价格的一半。

这不是永久的价格,但现阶段谷歌还是想参与到这场成本战中来。

Google DeepMind 模型卡显示,3.7 Flash 的促销价格将在 2026 年 12 月 31 日结束。

从 2027 年 1 月 1 日起,价格将恢复至输入 1.5 美元/百万 Token、输出 7.5 美元/百万 Token。

即便如此,这个定价策略仍然说明,谷歌正在越来越认真地争夺 Agent 的实际工作负载。因为进入 Agent 时代之后,大模型成本结构发生了变化。

一个聊天机器人可能只调用模型一两次,但一个真正工作的 Agent 可能需要规划任务、搜索资料、读十几个文件、调用多个工具、失败后重试,再不断把执行结果送回模型。

Agent 一旦规模化,Token 和工具调用次数会迅速膨胀。

谁能够以最低成本,让一个足够聪明的模型运行几十步甚至几百步,可能才是杀出重围的关键,Flash 正在承担这个角色。

Gemini 3.7 Flash 发布当天,谷歌就将其部署到了 Gemini Spark。

Spark 是谷歌在今年 I/O 上推出的个人 AI Agent,面向 Google AI Pro 和 Ultra 用户,目前覆盖超过 160 个国家和地区。谷歌把它定义为一个可以 24 小时持续运行、在用户控制下代替用户采取行动的个人 Agent。

3.7 Flash 上线之后,Spark 将使用新模型处理 Google Workspace 等工具调用。谷歌给出的场景包括整合多个文件、起草邮件以及更新项目状态文档。

也就是说,Gemini 3.7 Flash 并不是一个只用来刷 Benchmark 的模型。

发布当天,它就进入了谷歌自己的 Agent 产品。与此同时,开发者可以通过 Gemini API、Google AI Studio、Android Studio 和 Google Antigravity 使用 3.7 Flash;企业用户则可以通过 Gemini Enterprise Agent Platform 等产品调用。

但又有一个问题来了,Flash 都已经从 3.6 更新到 3.7 了,Gemini 3.5 Pro 在哪里?

答案是:还没有正式发布。

早在 7 月 21 日发布 Gemini 3.6 Flash 时,谷歌就表示,Gemini 3.5 Pro 正在与合作伙伴测试,会在准备完成之后尽快公开。

当时谷歌甚至已经宣布,Gemini 4 正在进行公司“迄今最雄心勃勃”的预训练。

但直到 3.7 Flash 发布,谷歌依然没有公布 3.5 Pro 的正式发布时间。

路透在 8 月 13 日的报道中也特别指出,这次发布没有提供任何关于旗舰 Pro 模型何时上线的新消息。

这就让 Gemini 3.7 Flash 的突然出现显得更加耐人寻味。因为就在一天前,路透刚刚披露了 Google DeepMind 大重组背后的更多细节。

“内斗”真相浮出水面

如果一定要用“内斗”形容这次谷歌 AI 巨震,它实际上并不是简单的高管私人恩怨,而是几组长期矛盾同时爆发:科研与商业化、伦敦与硅谷、不同 Gemini 技术负责人,以及有限算力到底应该投向哪里。

路透援引多位知情人士称,今年 4 月,在 Anthropic 推进 Claude 新模型时,Google 联合创始人 Sergey Brin 曾在一次数百人规模的内部会议上要求 DeepMind “加快速度”,把更多精力投入 Gemini。

而到了 8 月,Google 原计划推出的新一代旗舰 Gemini 已经推迟约两个月。

知情人士称,内部测试显示,它在代码等关键能力上仍然落后于部分竞争对手。

更麻烦的是组织结构。

路透称,Gemini 项目长期存在多位负责人之间的意见分歧,加上计算资源受限,使一些后来证明非常重要的方向——包括 Coding——没有及时获得足够资源。

与此同时,Google Cloud 与 DeepMind 之间围绕有限 TPU 算力如何分配也存在紧张关系。一些 Google Cloud 高管认为,Koray 接管 DeepMind 后,有望缓解这种资源分配矛盾。

权力也正在从伦敦进一步转向 Mountain View。

Koray 去年已经从伦敦迁往谷歌总部,并成为 Alphabet 首席 AI 架构师。一些伦敦团队负责人随后感受到自己对 Gemini 技术路线的影响力下降。

与 Hassabis 相比,Koray 在 Google 内部也一直被认为更接近产品与商业化体系。他此前就是 DeepMind 与 Google Cloud 之间更加主要的接口。

8 月 5 日重组之后,这种权力迁移被正式固定下来。Hassabis 转向 AGI、科学研究和长期战略,Koray 则直接掌管 Gemini。一些非技术团队也开始从 DeepMind 转入 Google 公司体系。

在 X 上,有网友很贴切地将 DeepMind 这种独立性描述为一种和平时代的“特权”,只要市场出现一些风吹草动,这种“特权”岌岌可危。他写道:

“DeepMind 能保持独立,说到底只是太平日子里的"特权"罢了。Alphabet 一慌,2014 年的协议直接作废,布林亲自下场开全员会。”

与此同时,Google AI 多位最重量级人物选择离开。Jeff Dean、Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 离职创建 Discovery Loop,其中 Jeff Dean 和 Oriol Vinyals 都曾是 Gemini 最初的技术联合负责人。

更早之前,Noam Shazeer 已经转投 OpenAI,AlphaFold 核心研究者 John Jumper 则加入 Anthropic。

过去由大量明星研究者共同推动的 Gemini,正在变成一个权力更加集中的项目。

Gemini 3.7 Flash,是 Koray 时代的第一声枪响

所以再来看 Gemini 3.7 Flash,就会发现它的意义可能不只是 Benchmark 又涨了几个百分点。

它几乎精准对应了 Google DeepMind 新阶段最关心的问题:更快发布、更强 Coding、更强 Agent、更低成本,以及更直接地进入产品和商业场景。

Pichai 在宣布重组时已经把话说得相当清楚:谷歌必须继续加快速度,在 AI 前沿研究上保持专注。

而 3.7 Flash 距离上一代只有三周,这种速度上的追赶是重组后的 DeepMind 最直观的变化之一。

Hassabis 时代最重要的标签是 AlphaGo、AlphaFold、科学突破和 AGI。

到了 Koray 手里,Google DeepMind 面临的问题则更加现实:Gemini 能不能更快迭代?能不能把 Coding 抢回来?能不能真正跑进 Agent?以及,能不能把 Google 庞大的 TPU、Cloud、Workspace、Android 和 Gemini 用户规模真正组织成一个统一的商业机器?

Gemini 3.7 Flash 还回答不了所有这些问题。

特别是迟迟没有正式亮相的 Gemini 3.5 Pro,依然是判断谷歌是否真正重回最前沿的一场更关键考试。

但至少从 3.7 Flash 开始,一个信号已经非常明显:换帅之后的 DeepMind,首先选择了提速。

参考链接:

https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/

https://deepmind.google/models/gemini/

https://www.reuters.com/world/inside-google-executive-moves-that-led-its-big-ai-reshuffle-2026-08-12/?utm_source