生成式AI领域的最新成果都在这里!抢 QCon 展区门票 了解详情
写点什么

谷歌发布史上最大 AI 模型 PaLM-E:5620 亿参数,无需特殊训练可操纵机器人

  • 2023-03-09
    北京
  • 本文字数:1938 字

    阅读完需:约 6 分钟

谷歌发布史上最大AI模型 PaLM-E:5620 亿参数,无需特殊训练可操纵机器人

本周一,来自谷歌和柏林工业大学的 AI 研究团队推出了 PaLM-E,这是一种多模态视觉语言模型(VLM),具有 5620 亿个参数,集成了可控制机器人的视觉和语言能力。据称这是有史以来规模最大的视觉语言模型,能够执行各种任务且无需重新训练,这套与 ChatGPT 有几分相似的 AI 模型新增视觉功能。


根据谷歌的介绍,只要给出一条高级命令,比如“把抽屉里的脆片拿给我”,PaLM-E 就能为机械手臂平台(由 Google Robotics 开发)生成相应的操纵指令。



在演示视频中,由 PaLM-E 控制的机械臂正伸手取一袋薯片。


PaLM-E 的基本工作原理,是分析机器人摄像头采集到的数据,且无需对场景表示做任何预处理。该模型消除了对数据预处理和标注的需求,有望将机器人的自主水平提升至新的层次。


谷歌称,该模型还具有一定弹性,能够对周边环境做出反应。例如,PaLM-E 模型能够引导机器人从厨房中取出袋装薯片,并通过将 PaLM-E 集成至控制回路当中,能够应对执行期间可能发生的意外状况。此外,同一套 PaLM-E 模型能成功通过复杂的指令序列实现了对机器人的自主控制,以往这类任务只能由人类引导完成。


谷歌在研究论文中解释了 PaLM-E 如何将指令转化为行动:我们展示了 PaLM-E 面对具有挑战性的多样移动操作中,表现出的实际性能。我们主要参考 Ahn 等人的设置方案(2022 年),机器人需要根据人类的指令规划一系列导航与操作动作。例如,给出指令“我把饮料弄洒了,能给我拿东西清理一下吗?”,机器人就会规划一连串“1. 找清洁棉;2. 捡起清洁棉;3. 递给用户;4. 放下清洁棉”的行动。受任务启发,我们设计出三个用例来测试 PaLM-E 的具身推理能力,具体包括可供性预测、故障检测和长期规划。低级策略来自 RT-1(Brohan 等人,2022 年),这是一套采用 RGB 图像加自然语言指令、能够向末端执行器输出控制命令的 transformer 模型。

PaLM-E 到底是个啥?


PaLM-E 是一款下一令牌预测器,取名“PaLM-E”是因为其基于谷歌的 PaLM 大语言模型(LLM,与 ChatGPT 的底层技术相似)。谷歌进一步向其中添加了感官信息和机器人控制功能,帮助 PaLM 实现了“具身化”。


由于基于语言模型,PaLM-E 会进行连续观察,例如接收图像或传感器数据,并将其编码为一系列与语言令牌大小相同的向量。如此一来,模型就能继续以处理语言的方式“理解”感官信息。


除了 RT-1 机器人 transformer 之外,PaLM-E 还借鉴了谷歌之前在 ViT-22B 上的经验积累——今年 2 月发布的视觉 transformer 模型。ViT-22B 已经接受过各种视觉任务训练,包括图像分类、对象检测、语义分割和图像描述。


Google Robotics 并不是唯一尝试使用神经网络进行机器人控制的研究小组。这项特殊工作与微软最近发布的《ChatGPT for Robotics》论文有相通之处,该文章也尝试以类似方式将视觉数据同大语言模型相结合,探索对机器人进行控制。


除了机器人技术之外,谷歌研究人员还观察到其他一些有趣的效果,其明显来自 PaLM-E 的大语言模型核心。首先,它表现出了“正迁移”,又称助长式迁移,意味着它能把一项任务中学到的知识和技能迁移至另一项任务,而且与单任务机器人模型相比具有“明显更高的性能水平”。

谷歌称正在探索 PaLM-E 模型更多应用场景


此外,研究人员还观察到模型规模有越来越大的趋势:“语言模型越大,在视觉语言和机器人任务训练时就越能保持住这种语言能力。从数量上讲,5620 亿参数的 PaLM-E 模型几乎保留了全部的语言能力。”



在另一不同领域,同一套 PaLM-E 模型能够实时控制机器人。在此之前,机器人还需要人工引导才能完成很长的操作任务(interactive-language.github.io),但现在 PaLM-E 已经能够自主学习这些任务。



谷歌称,“PaLM-E 是迄今为止已公开的最大视觉语言模型。我们观察到,尽管只接受了单图像提示训练,但 PaLM-E 仍然掌握了多模态思维推理和多图像推理等新能力。虽然不是我们的工作重点,PaLM-E 在 OK-VQA 基准测试上创下新的同类最佳性能”。


研究人员宣称,PaLM-E 还展现出随机应变的能力,例如尽管只接受过单图像提示训练,仍可实现多模态思维链推理(允许模型对包含语言和视觉信息在内的一系列输入进行分析)和多图像推理(同时使用多张输入图像进行推理或预测)。从这个角度看,随着深度学习模型变得越来越复杂,PaLM-E 似乎正带给我们更多惊喜。


谷歌研究人员还计划探索 PaLM-E 模型在现实场景中的更多应用,例如家庭自动化或工业机器人。他们希望 PaLM-E 能够启发出更多关于多模态推理和具身化 AI 的研究。


如今“多模态”已经成为新的流行语。相信随着企业着力研发具备类人常规任务执行能力的人工通用智能(AGI),多模态的大名也将越来越多为人们所听闻。


参考链接:

https://arstechnica.com/information-technology/2023/03/embodied-ai-googles-palm-e-allows-robot-control-with-natural-commands/

公众号推荐:

2024 年 1 月,InfoQ 研究中心重磅发布《大语言模型综合能力测评报告 2024》,揭示了 10 个大模型在语义理解、文学创作、知识问答等领域的卓越表现。ChatGPT-4、文心一言等领先模型在编程、逻辑推理等方面展现出惊人的进步,预示着大模型将在 2024 年迎来更广泛的应用和创新。关注公众号「AI 前线」,回复「大模型报告」免费获取电子版研究报告。

AI 前线公众号
2023-03-09 12:5910230
用户头像
李冬梅 加V:busulishang4668

发布了 804 篇内容, 共 372.9 次阅读, 收获喜欢 996 次。

关注

评论

发布
暂无评论
发现更多内容

Java 常见 bean mapper 的性能及原理分析

Java小咖秀

Java bean Copier

合约量化交易APP开发|合约量化交易系统软件开发

系统开发

在有道 | L同学:一位十五年有道人的成长故事

有道技术团队

分享 访谈录 阅读 网易有道

合约跟单系统开发|合约跟单APP软件开发

聪明人的训练(十六)

Changing Lin

4月日更

计算机原理学习笔记 Day6

穿过生命散发芬芳

计算机原理 4月日更

Python基础之:struct和格式化字符

程序那些事

Python 数据分析 程序那些事

磁盘快照服务USnap:公有云连续数据保护(CDP)系统升级改造实践

UCloud技术

维度数据模型建模过程(Kimball)

大数据技术指南

数据仓库 维度建模 4月日更

Java-技术专题-Stream.foreach和foreach

洛神灬殇

Java stream collection

GraphX图计算组件最短路算法实战

小舰

4月日更

拍乐云入选 2021 爱分析·产业数字化厂商全景报告

拍乐云Pano

RTC

很坑的Could not transfer artifact报错

01Running

maven Mac IDEA

Golang Slice 数组和切片

escray

学习 极客时间 Go 语言 4月日更

LeetCode题解:17. 电话号码的字母组合,回溯,JavaScript,详细注释

Lee Chen

算法 大前端 LeetCode

一周信创舆情观察(4.5~4.11)

统小信uos

使用Python映射,过滤和缩减函数:所有您需要知道的

华为云开发者联盟

Python 函数 映射 内置函数

流计算:流式处理框架

正向成长

流式计算框架

构建智慧金融新引擎|DataPipeline与巨杉数据库完成产品兼容互认证

DataPipeline数见科技

征服耶鲁教授的算法大神程序媛,是如何践行“以人为本”开发智慧社区大脑的?

华为云开发者联盟

算法 音视频 智慧社区 华为智慧园区数字平台 数字平台

Markdown 文档可折叠化展示

耳东@Erdong

4月日更

中国SaaS的终局:神仙打架,小鬼遭殃

ToB行业头条

【有奖征文】WEB前端大作战,走在技术最前端!

华为云开发者联盟

node.js Vue 大前端 Web Web框架

借助 Serverless 容器服务Cube,筷子科技轻松打造 10 万+ 爆款短视频

UCloud技术

建议收藏!看完全面掌握,最详细的Redis总结(2021最新版)

民工哥

运维 后端 redis cluster NoSQL数据库

车行易携手睿象云:告警管理体系全升级

睿象云

Python OpenCV 图像2D直方图,取经之旅第 27 天

梦想橡皮擦

Python OpenCV 4月日更

使用transform制作书本翻页效果

空城机

JavaScript 大前端 4月日更 书本翻页

const与指针交集的那些事

Bob

c++ 编程语言 4月日更

安于现状的人,不值得同情

小天同学

深度思考 个人感悟 4月日更 突破现状

web简易视频聊天室+媒体流插入

anyRTC开发者

大前端 音视频 WebRTC RTC

谷歌发布史上最大AI模型 PaLM-E:5620 亿参数,无需特殊训练可操纵机器人_AI&大模型_Benj Edwards_InfoQ精选文章