大厂Data+Agent 秘籍:腾讯/阿里/字节解析如何提升数据分析智能。 了解详情
写点什么

通用视觉的 GPT 时刻来临?智源推出通用分割模型 SegGPT,可「分割一切 」

  • 2023-04-09
    北京
  • 本文字数:1663 字

    阅读完需:约 5 分钟

通用视觉的GPT时刻来临?智源推出通用分割模型SegGPT,可「分割一切 」

ChatGPT 引发了语言大模型狂潮,AI 另一个重大领域 — 视觉的 GPT 时刻何时到来?


4 月 8 日,智源研究院视觉团队推出通用分割模型 SegGPT(Segment Everything In Context)——首个利用视觉提示(prompt)完成任意分割任务的通用视觉模型。

 

SegGPT 与 Meta AI 图像分割基础模型 SAM 同时发布,两者的差异在于:


• SegGPT“一通百通”:给出一个或几个示例图像和意图掩码,模型就能 get 用户意图,“有样学样”地完成类似分割任务。用户在画面上标注识别一类物体,即可批量化识别分割同类物体,无论是在当前画面还是其他画面或视频环境中。


• SAM“一触即通”:通过一个点或边界框,在待预测图片上给出交互提示,识别分割画面上的指定物体。

无论是“一触即通”还是“一通百通”,都意味着视觉模型已经“理解”了图像结构。SAM 精细标注能力与 SegGPT 的通用分割标注能力相结合,能把任意图像从像素阵列解析为视觉结构单元,像生物视觉那样理解任意场景,通用视觉 GPT 曙光乍现。

 


论文地址:https://arxiv.org/abs/2304.03284

代码地址:https://github.com/baaivision/Painter

Demo:https://huggingface.co/spaces/BAAI/SegGPT

 

SegGPT 是智源通用视觉模型 Painter 的衍生模型,针对分割一切物体的目标做出优化。SegGPT 训练完成后无需微调,只需提供示例即可自动推理并完成对应分割任务,包括图像和视频中的实例、类别、零部件、轮廓、文本、人脸等等。

 

该模型具有以下优势能力:


1. 通用能力:SegGPT 具有上下文推理能力,模型能够根据提供的分割示例(prompt),对预测进行自适应的调整,实现对“everything”的分割,包括实例、类别、零部件、轮廓、文本、人脸、医学图像等。

2. 灵活推理能力:支持任意数量的 prompt;支持针对特定场景的 tuned prompt;可以用不同颜色的 mask 表示不同目标,实现并行分割推理。

3. 自动视频分割和追踪能力:以第一帧图像和对应的物体掩码作为上下文示例,SegGPT 能够自动对后续视频帧进行分割,并且可以用掩码的颜色作为物体的 ID,实现自动追踪。

 

案例展示

 

1. 标注出一个画面中的彩虹(上图),可批量化分割其他画面中的彩虹(下图)



2. 作者在广泛的任务上对 SegGPT 进行了评估,包括少样本语义分割、视频对象分割、语义分割和全景分割。下图中具体展示了 SegGPT 在实例、类别、零部件、轮廓、文本和任意形状物体上的分割结果。




3. 用画笔大致圈出行星环带(上图),在预测图中准确输出目标图像中的行星环带(下图)。

 



4. SegGPT 能够根据用户提供的宇航员头盔掩码这一上下文(上图),在新的图片中预测出对应的宇航员头盔区域(下图)。




训练方法

 

SegGPT 将不同的分割任务统一到一个通用的上下文学习框架中,通过将各类分割数据转换为相同格式的图像来统一各式各样的数据形式。


具体来说,SegGPT 的训练被定义为一个上下文着色问题,对于每个数据样本都有随机的颜色映射。目标是根据上下文完成各种任务,而不是依赖于特定的颜色。训练后,SegGPT 可以通过上下文推理在图像或视频中执行任意分割任务,例如实例、类别、零部件、轮廓、文本等。



Test-time techniques

 

如何通过 test-time techniques 解锁各种能力是通用模型的一大亮点。SegGPT 论文中提出了多个技术来解锁和增强各类分割能力,比如下图所示的不同的 context ensemble 方法。所提出的 Feature Ensemble 方法可以支持任意数量的 prompt 示例,实现丰俭由人的推理效果。

 


此外,SegGPT 还支持对特定场景优化专用 prompt 提示。对于针对性的使用场景,SegGPT 可以通过 prompt tuning 得到对应 prompt,无需更新模型参数来适用于特定场景。比如,针对某一数据集自动构建一个对应的 prompt,或者针对一个房间来构建专用 prompt。如下图所示:

 


结果展示

 

模型只需少数 prompt 示例,在 COCO 和 PASCAL 数据集上取得最优性能。SegGPT 显示出强大的零样本场景迁移能力,比如在少样本语义分割测试集 FSS-1000 上,在无需训练的情况下取得 state-of-the-art 性能。




无需视频训练数据,SegGPT 可直接进行视频物体分割,并取得和针对视频物体分割专门优化的模型相当的性能。



以下是基于 tuned prompt 在语义分割和实例分割任务上的效果展示:



2023-04-09 12:567260
用户头像
刘燕 InfoQ高级技术编辑

发布了 1112 篇内容, 共 574.7 次阅读, 收获喜欢 1981 次。

关注

评论 1 条评论

发布
用户头像
謝謝分享。
2023-04-10 13:43 · 中国香港
回复
没有更多了
发现更多内容

话题讨论 | go、php 、java、python、cpp谁才能成为后端的主流

sinsy

Java c++ php 话题讨论 Go 语言

我是程序员,我用这种方式铭记历史

kokohuang

Hexo GitHub Pages python 爬虫 中国历史 铭记历史

线程上下文切换,这些是你需要掌握的

田维常

系统上下文

话题讨论 | 2020年你有什么推荐的书

soolaugust

话题讨论

App自动化《元素定位方式、元素操作、混合应用、分层设计、代码方式执行Pytest 命令》

清菡软件测试

App

什么是工作流?工作流有什么作用?怎样配置工作流程?

Marilyn

敏捷开发 工作流

花火交易所APP软件系统开发(现成)

系统开发

数据资产管理平台规划概要

马踏飞机747

大数据 数据治理 数据资产

架构师训练营第 1 期第 11 周作业

owl

极客大学架构师训练营

突破容量极限:TiDB 的海量数据“无感扩容”秘籍

京东科技开发者

分布式数据库 #TiDB

阿里云Lindorm与Intel、OSIsoft共建IT & OT超融合工业数据云

许力

数据库 大数据 IoT 工业互联网 工业物联网

云计算领域-杨明越加入InfoQ协作平台

杨明越

《写给大忙人看的JAVA核心技术》.pdf

田维常

电子书

源码深度解析 Handler 机制及应用

vivo互联网技术

android 客户端开发

探秘密码学:深入了解对称加密与密钥协商技术

京东科技开发者

网络安全 密码学

架构师训练营第 1 期第 11 周总结

owl

极客大学架构师训练营

智慧公安情报指挥合成作战管控平台开发

t13823115967

智慧公安情报研判系统开发 智慧公安 合成作战管控平台

低成本快速上链 智臻链开放联盟网络正式对外开放

京东科技开发者

区块链 京东

第十一周 安全稳定总结

蓝黑

极客大学架构师训练营

基于区块链技术落地应用开发-食品溯源

13828808769

公安情报研判管控分析平台建设解决方案

t13823115967

智慧公安情报研判系统开发 智慧公安 情报研判管控分析平台

第七周总结

小兵

阿里巴巴内部秘密培养的“Java架构师养成计划”图谱曝光,全是干货!

Java架构追梦

Java 学习 架构 面试 阿里巴巴人才培养计划

教你用Python自制拼图小游戏,轻松搞定熊孩子

华为云开发者联盟

Python 游戏 拼图

KMP —— 字符串分析算法

三钻

算法 大前端 KMP

话题讨论 | 程序员摸鱼的时候都喜欢干些什么

soolaugust

话题讨论

手撸一个在线css三角形生成器

徐小夕

CSS css3 大前端 CSS小技巧

话题讨论 | 深入浅出Linux内存管理,图解物理内存和虚拟内存

程序员柠檬

话题讨论

第十一周 安全稳定作业

蓝黑

极客大学架构师训练营

话题讨论 | 作为开发你是如何阅读源码的?

程序员小航

话题讨论

Seata是什么?一文了解其实现原理

vivo互联网技术

分布式 分布式事务 分布式架构

通用视觉的GPT时刻来临?智源推出通用分割模型SegGPT,可「分割一切 」_AI&大模型_刘燕_InfoQ精选文章