免费注册!6月19-20日,「亚马逊云科技中国峰会」重磅来袭! 了解详情
写点什么

Infinity:视觉自回归生成新路线|AICon 北京

  • 2025-05-28
    北京
  • 本文字数:1110 字

    阅读完需:约 4 分钟

大小:592.99K时长:03:22
Infinity:视觉自回归生成新路线|AICon北京

6 月 27 日-6 月 28 日,AICon 全球人工智能开发与应用大会北京站即将拉开帷幕。本次大会将汇聚 AI 前沿技术与落地实践,邀请来自腾讯、阿里、百度、字节跳动等头部大厂以及智谱、硅基流动、智象未来、声智科技等 AI 企业的 50+资深专家,深度探讨 AI Agent、多模态应用、推理性能优化以及 AI 在软件研发、数据分析、业务运营等场景的具体落地实践。


字节跳动 AIGC 算法工程师韩剑已确认出席并发表题为《Infinity:视觉自回归生成新路线》的主题分享,探讨以 ChatGPT、DeepSeek 为代表的大语言模型(LLM)取得了巨大的成功,掀起了全球新一轮 AI 浪潮,但是在视觉生成领域,目前主流的方法却是一直以扩散模型为主导。与大语言模型采取相同技术路线的视觉自回归方法因为具有更好的 scaling 特性,能够统一理解 &生成任务,隐藏着巨大的潜力,正受到人们越来越多的重视。本次演讲中,韩剑将以被选为 CVPR 2025 Oral 的工作 Infinity 为例,详细介绍自回归视觉生成的底层技术原理。并以图像生成和视频生成两个具体场景,分享最新的研究成果和相关思考。



韩剑,硕士毕业于清华大学电子系,现就职于字节跳动商业化技术团队,该团队在视觉生成领域先后推出了 VAR、LllamaGen、Infinity、Goku 等多项重要研究成果。韩剑的主要研究方向为图像生成和视频生成,在自回归图像生成和视频生成领域积累了丰富的经验,其最新研究成果 Infinity 被选中在 CVPR 2025 上做口头报告。他在本次会议的详细演讲内容如下:


演讲提纲

1. 自回归模型和 Scaling Law

2. 视觉自回归 v.s. 扩散模型

3. Infinity:视觉自回归生成新路线

  • 离散 Visual Tokenizer

  • Bitwise AutoRegressive Modeling

  • 图像生成实践

  • 视频生成实践

4. 分析和思考


您认为,这样的技术在实践过程中有哪些痛点?目前看以 Infinity 为代表的视觉自回归模型在视频生成任务上相比 SOTA 的扩散模型生成速度具有明显优势,但是效果上还有一些差距。


您的演讲有哪些前沿亮点?这是一个非常详尽的视觉自回归技术分享,通过这次分享,读者可以深入了解到视觉自回归的底层技术实现、目前达到的效果水位,以及未来可能的研究方向。


听众收益

  • 视觉自回归的技术原理、实现方法、目前达到的生成效果

  • 视觉自回归技术的优缺点以及未来的发展方向

  • 如何基于视觉自回归构建图像/视频生成模型


除此之外,本次大会还策划了AI Agent 构建与多场景实践多模态实践与应用大模型助力研发的实战经验AI 在业务运营中的深度落地大模型时代的数据处理与分析AI 变革下的工程师等 10 多个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在 AICon 北京站现场带来前沿技术洞察和一线实践经验。


现在报名即可以享受 9 折优惠,单张门票立省 580 元,详情可扫码或联系票务经理 13269078023 咨询。



2025-05-28 14:003246

评论

发布
暂无评论

ppt文字描边怎么设置?用这2个软件轻松制作!

职场工具箱

职场 PPT 办公软件 AI生成PPT

【活动预告】Apache TsFile 干货总结在 COSCON'24 等你~!

Apache IoTDB

资源成本降低60%,揭秘Serverless的省钱秘籍

华为云开发者联盟

容器 运维 #Serverless CCE

倒计时1天 | 袋鼠云秋季发布会明日10:00开幕,我们云上见!

袋鼠云数栈

NFTScan | 10.21~10.27 NFT 市场热点汇总

NFT Research

NFT\

基于纯血鸿蒙开发,微信适配情况如何?

博文视点Broadview

【FAQ】HarmonyOS SDK 闭源开放能力 —Push Kit(4)

HarmonyOS SDK

HarmonyOS

公链实体矿机矿池搭建系统开发指南

区块链软件开发推广运营

交易所开发 dapp开发 链游开发 钱包开发 代币开发

1688跨境寻原通数据接口对接:跨境电商卖家必看!

tbapi

1688API 1688代采系统 1688跨境寻源通 1688跨境代采

利用 EMQX ECP 实现边缘服务配置的版本管理与参数化下发

EMQ映云科技

边缘计算 智能IoT边缘服务 emqx EMQX ECP

解锁热带雨林:Mint Expedition 第四季正式开启!

NFT Research

blockchain NFT\ #Web3

掌握数据,赢得市场 —— 淘宝商品详情API让电商运营更精准

技术冰糖葫芦

API 接口 API 测试 API 协议 API 优先

如何技术上配置对接Teams Direct Routing

cts喜友科技

通讯 云通讯 通讯通信

雷鸟发布 AR 眼镜雷鸟 Air 3:售价 1699 元;苹果 M4 版 iMac 发布 10999 元起丨 RTE 开发者日报

声网

云电脑的性价比高么

青椒云云电脑

云电脑

汇聚全球智慧·共绘软件蓝图,2025北京软博会

AIOTE智博会

软博会 世亚软博会 北京软博会

构建区块链生态系统:公链、浏览器、钱包与节点搭建全攻略

区块链软件开发推广运营

交易所开发 dapp开发 链游开发 钱包开发 代币开发

CQ社区版 v2024.10 | 支持k8s、helm部署!

BinTools图尔兹

k8s Helm 数据安全 数据库管理 CloudQuery

Infinity:视觉自回归生成新路线|AICon北京_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选文章