谷歌近日宣布,AlphaEvolve 已经在 Gemini 企业级代理平台上正式发布(GA),将这一发现新型矩阵乘法算法的 DeepMind 研究项目转化为了一款产品,任何谷歌云客户都可以将其应用于自身代码。
AlphaEvolve 是一款进化式代码优化代理。它以基线算法为起点,利用 Gemini 模型生成变异候选程序,根据用户定义的评估函数对每个候选程序进行评分,并不断迭代,直至搜索收敛到经过优化的、易于人类阅读的代码。
对于无法共享代码的企业而言,该部署模型提供了一种至关重要的方式,可以实现关注点分离。用户的评估程序在客户端运行,部署在用户自己的基础设施上,无论是笔记本电脑、私有集群还是超级计算机。AlphaEvolve 的 API 生成候选程序;用户的环境在本地对它们进行评分,并将结果提交回来。
该工作流包括四个步骤:定义基准种子算法和问题背景,针对关键指标建立评分函数,运行代理式优化框架,并将生成的算法部署到生产环境。
该 GA 公告提供了详实的客户案例,并附有具体的数据。Klarna 将其机器学习训练的吞吐量提升了一倍,在三周内探索了约 6000 个候选程序,同时保持了金融服务监管所要求的位级精确可复现性。JetBrains 的 IDE 代码补全延迟降低了 15% 至 20%。
FM Logistic 将仓库拣货路线缩短了 10.4%,而该基准路线此前已经做过生产环境优化。在 Kinaxis,预测准确率提高了 22%,而运行时间缩短了 90%。橡树岭国家实验室在其百亿亿级系统 Frontier 上运行 AlphaEvolve,为科学计算工作负载生成经过优化的 GPU 内核。在该产品发布前,谷歌就已经开始在内部使用它。根据公告,AlphaEvolve 已经优化了下一代 TPU 的芯片设计,将 Google Spanner 中 LSM 树压缩的写入放大率降低了 20%,并将占用的存储空间减少了 9%。
JetBrains 的用户评价最精辟地阐明了工程团队将面临哪些变化:
工程师仍然掌握着基准测试、审查和发布决策权。真正缩小的是搜索空间。
针对研究论文发布时从业者提出的问题,这种分工给出了务实可行的解决方案。在 Hacker News 上,在 5 月份讨论扩展版 AlphaEvolve 论文时,一位评论者总结了 Redis 创建者 Salvatore Sanfilippo 将该方法应用于 Redis 内部实现后引发的两极化反应:
反响主要有两种:“哦,这对我绝对行不通”和“我看到原本需要数月才能完成的工作,现在一小时就搞定了”,我认为这两种说法都对。
在同一讨论贴中,另一位评论者指出了大多数生产团队会遇到的局限性:
我最感兴趣的是,在没有明确指标的、杂乱无章的真实代码库中,这套方案如何落地。大多数生产软件不是芯片设计或内核优化,而是成功标准不明确的业务逻辑。基础设施方面的成果固然令人印象深刻,但我更想看看他们如何处理那些评估函数本身就模棱两可的领域。
决定采用哪种反应模式所遵循的规律是:当问题具有可测量且可自动化的评估函数时,AlphaEvolve 就能发挥作用。有明确基准、评分指标或可验证正确性的代码是可以优化的;而质量依赖于人为判断的代码则无法优化。谷歌的客户名单就反映了这一点:预测管道(WMAPE)、仓库路由(距离)、GPU 内核(吞吐量)、芯片布局(面积和功耗)。每种情况都有一个待优化的数值。
评估 AlphaEvolve 的从业者应注意公告中未包含的内容。所有性能数据均来自供应商或发布在谷歌官方博客上的客户评价,其中并不包含独立的基准测试结果。公告中也未披露定价信息。一位研究过 Evolve 相关文献的从业者指出了那些不那么引人注目的工作:
所有 Evolve 相关的文献都展示了非常令人印象深刻的结果,但根据我对已经发布的信息的研读,我感觉人们的关注点都集中在大型语言模型(LLM)和 AI 方面,尽管所报告的结果几乎无一例外都是得益于为大型语言模型和进化算法精心设计的运行环境。
这种环境设计是一项真正的挑战:团队必须构建一个能够捕获所有关键属性的评分框架,因为进化搜索会利用评估程序未能测量的所有因素,例如生成运行速度快但存在无法通过测试捕获的细微错误的代码。
AlphaEvolve 已经在 Gemini Enterprise Agent Platform 上正式发布。此外,谷歌还发布了一个 AlphaEvolve Skill,将优化工作流集成到了智能编程工具中。对于希望尝试这种基于大型语言模型(LLM)的进化方法而又没有 Gemini 企业级代理平台的团队,OpenEvolve 提供了一个开源实现。
原文链接:https://www.infoq.com/news/2026/07/alphaevolve-generally-available/





