写点什么

阿里文娱资深算法专家任海兵:CV 落地最大的挑战是算法的稳定性

  • 2020-02-27
  • 本文字数:1687 字

    阅读完需:约 6 分钟

阿里文娱资深算法专家任海兵:CV落地最大的挑战是算法的稳定性

计算机视觉已发展多年,近年来,该技术已经成为了人工智能领域最为“吸睛”的方向之一,不仅吸引了大量的投资,也吸引了不少 AI 技术专家进行钻研。但是,随着整个 AI 行业“退烧”,落地难也成为了计算机视觉领域的难题,算法的质量及稳定性尤其引人关注。

在将于 7 月 24 日-25 日举办的AICon 全球人工智能与机器学习大会(上海站)上,阿里巴巴文娱资深算法专家任海兵将作为计算机视觉专题出品人,InfoQ 提前对任海兵老师进行了专访,请他来谈一谈深耕计算机视觉二十余年总结的经验与思考。


InfoQ:您是如何与计算机视觉结缘的,并在这个领域深耕二十余年的?


任海兵:本科五年级上学期的时候,我后来的博士导师徐光佑教授跟我说,计算机视觉是特别富有挑战性的研究领域,研究的课题都很困难,可以研究一辈子。我觉得:这个方向可以研究一辈子,感觉挺有意思的,所以就选择了计算机视觉做为我的直博专业方向。从此就跟计算机视觉结缘,一路下来二十多年了。


InfoQ:深耕计算机视觉二十余年,您能否用几句话总结下您的心得和收获?


任海兵:在这二十年中,我主要从事将计算机视觉算法落地工业场景的工作。最大的体会是,由于计算机视觉算法的局限性,我们需要对落地场景非常了解,定制化的设计解决方案,不能闭门造车。因为看似非常相似的落地场景,具体分析下来对算法的要求、评估方式等差别很大,常常需要结合实际场景定制化的去设计最优解决方案。那种希望用一种算法解决各种问题的想法是不切实际的。


InfoQ:过去一年中(2019 年),您认为在计算机视觉领域最值得关注的技术突破有哪些?能否谈谈原因。


任海兵:在过去的一年中,我最关注的技术是视频物体分割。2019 年出现的 space-time memory network 算法极大的提高了视频物体分割的准确性和计算速度,指出了视频物体分割技术的新发展方向。结合 CVPR 2020 该方向的论文投稿来看,视频物物体分割技术沿着这个方向将会有持续的提高,逐渐成熟起来。


InfoQ:能否请您用几个例子来谈谈,目前阿里巴巴在计算机视觉方面有哪些应用场景?


任海兵:阿里巴巴是个巨大的经济体,其业务涉及非常多的领域。其中很多领域中,计算机视觉起着重要的作用。例如智慧城市中的安防监控,智能交通中 3D 城市重建、文化娱乐产业中素材智能生产等。


InfoQ:在这些场景中,您负责的项目有哪些?有哪些重要的突破是您认为值得分享的?


任海兵:跟阿里文娱相关的场景是文化娱乐产业中素材智能生产。由于素材生产的目的是给人观看,因此不能有肉眼可见的瑕疵,这对素材智能生产提出了很高的要求。以前的素材生产,例如图像抠图,都是纯手工 PS,费时费力。这两年在图像分割领域取得了巨大的成就。既有图像语义理解、实例分割、全景分割,又有精细抠图(image matting)和显著性区域分割。综合这些技术,我们可以得到高精度的图像抠图解决方案。下面给出几个我们的抠图结果:


这些已经广泛用于阿里文娱的各项业务场景中。


InfoQ:从技术的研发到落地,您认为最大的挑战是什么?是否有可以分享的经验?


任海兵:我最近的工作主要跟视频内容智能生产相关,从这个方面看,目前最大的挑战还是算法的稳定性。在一个视频中,如果有一帧图像的结果不好,那么整个视频都是不合格的。我的一项经验是,有些领域目前业界算法还不能达到全自动的智能生产,例如视频抠图,但可以辅助很少量的人工交互,利用交互式视频抠图算法,达到效率和精度的一个平衡。


InfoQ:在您看来,计算机视觉接下来会如何发展?您和团队有什么重点规划?


任海兵:我认为,目前人工设计网络已经到达一个瓶颈阶段,接下来深度网络的自动搜索将引领计算机视觉登上一个新的高峰,我的团队也将在这个方向进行布局。


采访嘉宾介绍


任海兵,阿里巴巴资深算法专家,2003 年清华大学计算机系计算机应用专业博士毕业。先在三星中国技术院工作 11 年,先后担任计算机视觉和医疗图像算法团队负责人,曾带领团队获得 FRGC 人脸识别竞争第一名。2014 年加入英特尔中国研究院,从事机器人视觉感知研究工作。2018 年底,任海兵加入阿里文娱摩酷实验室,从事视频理解算法研究。任海兵在计算机视觉领域有 20 多年的研究经验,担任 CVPR、ICCV、ECCV 等国际顶级学术会议审稿人,发表 40 余篇论文,拥有 30 多项专利。


2020-02-27 15:071704
用户头像
陈思 InfoQ编辑

发布了 576 篇内容, 共 292.7 次阅读, 收获喜欢 1305 次。

关注

评论

发布
暂无评论
发现更多内容

降价背后,函数计算规格自主选配功能揭秘

Serverless Devs

Serverless 前端 函数计算FC

SAP MM 为UB类型的STO执行VL10B,报错-没有项目类别表存在(表T184L NL 0002 V)-之对策

SAP虾客

SAP MM UB类型STO VL10B T184L

广西移动圆满完成区运会通信保障任务

极客天地

Ansible最佳实践之 AWX 构建高级作业工作流的创建和调度

山河已无恙

12月月更

【python小脚本】监听日志文件异常数据发送告警短信

山河已无恙

12月月更

预告|2022 星策 Summit MLOps 分论坛议程公布!

星策开源社区

人工智能 机器学习 开源 AI MLOps

Ansible之Ansible Tower使用User和Team管理访问权限的笔记

山河已无恙

12月月更

拿到8000元的火焰杯比赛奖金,感谢霍格沃兹测试开发学社

测吧(北京)科技有限公司

软件测试比赛

Ansible最佳实践之 AWX 创建管理项目的一些笔记

山河已无恙

12月月更

Ansible最佳实践之 AWX 启用facts缓存和模板问卷调查

山河已无恙

12月月更

Ansible最佳实践之 AWX 作业创建和启动

山河已无恙

12月月更

react源码分析:babel如何解析jsx

flyzz177

React

互联网医疗领域月度观察——数字乡村建设加快,“互联网+医疗健康”带动乡村高质量发展

易观分析

数字化 互联网医疗

镕铭微电子加入龙蜥社区,推动开源 OS 在音视频产业的应用

OpenAnolis小助手

操作系统 芯片 数据存储 龙蜥社区 镕铭微电子

MySQL从入门到实战讲解,京东T5大牛学习笔记分享,看完我哭了!

钟奕礼

Java 程序员 java面试 java编程

Ansible最佳实践之 AWX 使用 Ansible 与 API 通信tags

山河已无恙

12月月更

Ansible之 AWX 管理清单和凭据的一些笔记

山河已无恙

12月月更

多引擎可视化数据流实现方案

元年技术洞察

数据中台 数字化转型 专利解析 方舟企业数字化 PaaS 平台 #方舟平台

关于 Git 重写历史的一些笔记

山河已无恙

12月月更

react源码中的协调与调度

flyzz177

React

OpenMLDB Meetup No.7 回顾 | OpenMLDB+AutoX:整合自动特征工程,拥抱高效机器学习

第四范式开发者社区

人工智能 机器学习 数据库 开源 特征

Java jar 如何防止被反编译?代码写的太烂,害怕被人发现

小小怪下士

Java 程序员 反编译

Redis之String类型和Hash类型的介绍和案例应用

C++后台开发

redis 数据结构 hash 后端开发 C++开发

PGL图学习项目合集&数据集分享&技术归纳业务落地技巧[系列十]

汀丶人工智能

神经网络 图神经网络 12月日更 11月月更 12月月更

Serverless Devs 重大更新,基于 Serverless 架构的 CI/CD 框架:Serverless-cd

Serverless Devs

Serverless Serverless Devs

Ansible最佳实践之AWK VS Anssible Tower 界面介绍

山河已无恙

12月月更

裸辞不慌!入职蚂蚁金服P6,掌握并发编程我是这样吊打面试官的

钟奕礼

Java java面试 java编程 程序员‘

Ansible最佳实践之Playbook高级循环任务如何操作

山河已无恙

12月月更

react源码中的生命周期和事件系统

flyzz177

React

教育部公布2022年第一批产学合作协同育人项目,千锋教育57个项目成功立项

千锋IT教育

教你用JavaScript实现乘法游戏

小院里的霍大侠

JavaScript 前端开发 编程实战 实战案例 初学者

阿里文娱资深算法专家任海兵:CV落地最大的挑战是算法的稳定性_AI&大模型_陈思_InfoQ精选文章