【AICon】AI 基础设施、LLM运维、大模型训练与推理,一场会议,全方位涵盖! >>> 了解详情
写点什么

阿里文娱资深算法专家任海兵:CV 落地最大的挑战是算法的稳定性

  • 2020-02-27
  • 本文字数:1687 字

    阅读完需:约 6 分钟

阿里文娱资深算法专家任海兵:CV落地最大的挑战是算法的稳定性

计算机视觉已发展多年,近年来,该技术已经成为了人工智能领域最为“吸睛”的方向之一,不仅吸引了大量的投资,也吸引了不少 AI 技术专家进行钻研。但是,随着整个 AI 行业“退烧”,落地难也成为了计算机视觉领域的难题,算法的质量及稳定性尤其引人关注。

在将于 7 月 24 日-25 日举办的AICon 全球人工智能与机器学习大会(上海站)上,阿里巴巴文娱资深算法专家任海兵将作为计算机视觉专题出品人,InfoQ 提前对任海兵老师进行了专访,请他来谈一谈深耕计算机视觉二十余年总结的经验与思考。


InfoQ:您是如何与计算机视觉结缘的,并在这个领域深耕二十余年的?


任海兵:本科五年级上学期的时候,我后来的博士导师徐光佑教授跟我说,计算机视觉是特别富有挑战性的研究领域,研究的课题都很困难,可以研究一辈子。我觉得:这个方向可以研究一辈子,感觉挺有意思的,所以就选择了计算机视觉做为我的直博专业方向。从此就跟计算机视觉结缘,一路下来二十多年了。


InfoQ:深耕计算机视觉二十余年,您能否用几句话总结下您的心得和收获?


任海兵:在这二十年中,我主要从事将计算机视觉算法落地工业场景的工作。最大的体会是,由于计算机视觉算法的局限性,我们需要对落地场景非常了解,定制化的设计解决方案,不能闭门造车。因为看似非常相似的落地场景,具体分析下来对算法的要求、评估方式等差别很大,常常需要结合实际场景定制化的去设计最优解决方案。那种希望用一种算法解决各种问题的想法是不切实际的。


InfoQ:过去一年中(2019 年),您认为在计算机视觉领域最值得关注的技术突破有哪些?能否谈谈原因。


任海兵:在过去的一年中,我最关注的技术是视频物体分割。2019 年出现的 space-time memory network 算法极大的提高了视频物体分割的准确性和计算速度,指出了视频物体分割技术的新发展方向。结合 CVPR 2020 该方向的论文投稿来看,视频物物体分割技术沿着这个方向将会有持续的提高,逐渐成熟起来。


InfoQ:能否请您用几个例子来谈谈,目前阿里巴巴在计算机视觉方面有哪些应用场景?


任海兵:阿里巴巴是个巨大的经济体,其业务涉及非常多的领域。其中很多领域中,计算机视觉起着重要的作用。例如智慧城市中的安防监控,智能交通中 3D 城市重建、文化娱乐产业中素材智能生产等。


InfoQ:在这些场景中,您负责的项目有哪些?有哪些重要的突破是您认为值得分享的?


任海兵:跟阿里文娱相关的场景是文化娱乐产业中素材智能生产。由于素材生产的目的是给人观看,因此不能有肉眼可见的瑕疵,这对素材智能生产提出了很高的要求。以前的素材生产,例如图像抠图,都是纯手工 PS,费时费力。这两年在图像分割领域取得了巨大的成就。既有图像语义理解、实例分割、全景分割,又有精细抠图(image matting)和显著性区域分割。综合这些技术,我们可以得到高精度的图像抠图解决方案。下面给出几个我们的抠图结果:


这些已经广泛用于阿里文娱的各项业务场景中。


InfoQ:从技术的研发到落地,您认为最大的挑战是什么?是否有可以分享的经验?


任海兵:我最近的工作主要跟视频内容智能生产相关,从这个方面看,目前最大的挑战还是算法的稳定性。在一个视频中,如果有一帧图像的结果不好,那么整个视频都是不合格的。我的一项经验是,有些领域目前业界算法还不能达到全自动的智能生产,例如视频抠图,但可以辅助很少量的人工交互,利用交互式视频抠图算法,达到效率和精度的一个平衡。


InfoQ:在您看来,计算机视觉接下来会如何发展?您和团队有什么重点规划?


任海兵:我认为,目前人工设计网络已经到达一个瓶颈阶段,接下来深度网络的自动搜索将引领计算机视觉登上一个新的高峰,我的团队也将在这个方向进行布局。


采访嘉宾介绍


任海兵,阿里巴巴资深算法专家,2003 年清华大学计算机系计算机应用专业博士毕业。先在三星中国技术院工作 11 年,先后担任计算机视觉和医疗图像算法团队负责人,曾带领团队获得 FRGC 人脸识别竞争第一名。2014 年加入英特尔中国研究院,从事机器人视觉感知研究工作。2018 年底,任海兵加入阿里文娱摩酷实验室,从事视频理解算法研究。任海兵在计算机视觉领域有 20 多年的研究经验,担任 CVPR、ICCV、ECCV 等国际顶级学术会议审稿人,发表 40 余篇论文,拥有 30 多项专利。


公众号推荐:

跳进 AI 的奇妙世界,一起探索未来工作的新风貌!想要深入了解 AI 如何成为产业创新的新引擎?好奇哪些城市正成为 AI 人才的新磁场?《中国生成式 AI 开发者洞察 2024》由 InfoQ 研究中心精心打造,为你深度解锁生成式 AI 领域的最新开发者动态。无论你是资深研发者,还是对生成式 AI 充满好奇的新手,这份报告都是你不可错过的知识宝典。欢迎大家扫码关注「AI前线」公众号,回复「开发者洞察」领取。

2020-02-27 15:071239
用户头像
陈思 InfoQ编辑

发布了 576 篇内容, 共 263.1 次阅读, 收获喜欢 1293 次。

关注

评论

发布
暂无评论
发现更多内容

电脑网站支付报错“验签出错,建议检查签名字符串或私钥与应用公钥是否匹配”问题解决记录

盐焗代码虾

Java 支付宝报错 排查思路

Linux系统中软链接和硬链接

高端章鱼哥

Linux 软链接

2023贡献者、开源项目评选正式启动!

开放原子开源基金会

App Cleaner & Uninstaller Pro for Mac 支持M1

影影绰绰一往直前

WinZip for Mac(压缩解压工具)激活版下载

影影绰绰一往直前

全能媒体格式转换器:Permute 3 for mac中文版

影影绰绰一往直前

别试错了,是该关注一下软件内在质量了

伤感汤姆布利柏

编程 微服务 敏捷开发 软件开发

悦数图数据库 v3.6.0 发布:支持 Zone 管理,提升业务安全性和连续性

最新动态

【专家观点】社会化架构支撑产业链服务

用友BIP

产业链

光纤接入网的方式有哪几种?

小魏写代码

零一万物回应「抄袭 LLaMA」;京东原副总裁试用可穿戴人工喉丨 RTE 开发者日报 Vol.85

声网

Microsoft Office LTSC 2021 for Mac(office系列全套装)

影影绰绰一往直前

百度曹海涛:AI原生应用,推动产业智能

新消费日报

【云栖2023】姜伟华:Hologres Serverless之路——揭秘弹性计算组

阿里云大数据AI技术

大数据

pycharm pro最新激活码 pycharm pro中文破解版下载

影影绰绰一往直前

IntelliJ IDEA插件开发入门实战

树上有只程序猿

IntelliJ IDEA

营销数智化解析第3期:促销、信用、费用、返利管理

用友BIP

数智营销

AutoCAD 2024完美破解版下载(cad设计绘图工具)

影影绰绰一往直前

应用架构的演进 I 使用无服务器保证数据一致性

亚马逊云科技 (Amazon Web Services)

Serverless 微服务 Amazon DynamoDB Amazon Step Functions

复古艺术效果照片编辑软件JixiPix Chromatic Edges mac激活版下载

影影绰绰一往直前

医院智慧运营管理转型,到底应该如何推动?

用友BIP

C++异常处理:如何使用try、catch、throw

互联网工科生

C++

香港服务器助您实现在线业务的成功之路

一只扑棱蛾子

香港服务器

Uniapp导出的iOS应用上架详解

雪奈椰子

「智造」第7期:浅谈工业生产设备采集方式

用友BIP

智能制造

从“用数据说话”到“让数据说话”,全面数据服务焕发酒店生意新生

用友BIP

数据资产

用PHP使用API接口获取虾皮商品详情

Noah

你应该知道的主流开源数据库

这我可不懂

MySQL 数据库

油猴Safari浏览器插件 Tampermonkey最新中文版

mac大玩家j

Mac软件 油猴插件

Mosaic for Mac(窗口布局管理软件)激活版下载

影影绰绰一往直前

MacOS虚拟定位工具AnyGo永久激活版下载

iMac小白

阿里文娱资深算法专家任海兵:CV落地最大的挑战是算法的稳定性_AI&大模型_陈思_InfoQ精选文章