写点什么

BC-GNN:用于时序动作提名生成任务的融合边界内容的图神经网络

  • 2020-08-11
  • 本文字数:2967 字

    阅读完需:约 10 分钟

BC-GNN:用于时序动作提名生成任务的融合边界内容的图神经网络

近日,计算机视觉顶会 ECCV 2020 已正式公布论文接收结果。本文介绍的是来自爱奇艺团队的一篇论文,研究者提出了 Boundary Content Graph Neural Network (BC-GNN),通过图神经网络对边界和内容预测之间的关系进行建模,生成更精确的时序边界和可靠的内容置信度分数。

概述

时序动作提名生成(Temporal action proposal generation)任务需要从未处理的长视频中精确定位包含高质量动作内容的片段,该任务在视频理解中起着重要的作用。现有的方法多采用先生成起止边界,再将起止边界组合成候选动作提名,然后再生成候选时序片段的内容置信度,这种处理方式忽略了边界预测与内容预测之间的联系。


为了解决这个问题,爱奇艺提出了 Boundary Content Graph Neural Network (BC-GNN),通过图神经网络对边界和内容预测之间的关系进行建模,通过利用两者之间的内在联系生成更精确的时序边界和可靠的内容置信度分数。


在 BC-GNN 中, 将候选时序片段的内容(content)作为图的边(edge),将候选时序片段的边界(boundary,开始点和结束点)作为图的节点(node),然后设计了一种更新边和节点特征的推理方法,将更新之后的特征用来预测起始点概率和内容的置信度,最终生成高质量的 proposal。 这一 方法最终在 ActivityNet-1.3 和 THUMOS14 这两个公开数据集的时序动作提名生成任务以及时序行为检测任务上均达到了领先水平。

方法介绍


上图是 BC-GNN 的整体框架图,主要包括五个流程,分别为:


1)特征提取(Feature Encoding)


2)基础模块(Base Module)


3)图构建模块(Graph Construction Module,GCM)


4)图推理模块(Graph Reasoning Module,GRM)


5)输出模块 (Output Module)

特征提取模块

我们使用在视频行为识别中取得良好效果的 two-stream 网络将视频编码成特征。Two-stream 由 spatial 和 temporal 两个分支网络构成,spatial 分支网络的输入是单张 rgb 图像,用来提取空间特征,temporal 分支网络的输入是多张光流图像,用来提取运动特征。对于一个未处理的长视频,将对应的视频帧切分为 T 个可处理单元(snippet),每个可处理单元经 two-stream 之后被编码成为 D 维的特征向量,其中 D 维特征向量由 spatial 和 temporal 分支网络的最后一层输出拼接而成,从而视频被编码成一个 TxD 的特征矩阵,T 是特征序列的长度,D 表示特征的维度。


BC-GNN 主要包括四个模块:基础模块、图构建模块、图推理模块和输出模块。

基础模块

基础模块由两层 1D 卷积组成,主要用来扩大感受野并作为整个网络的基础。

图构建模块


图构建模块用来构建一个边界内容图,构建图的过程如上图所示。


我们构建的边界内容图是一个二分图,二分图是一类特殊的 ,它的顶点由两个 独立集UV 组成,并且所有的边都是连结一个 U 中的点和一个 V 中的点。


在构建图的过程中,视频的每个处理单元 snippet 对应的时刻可以看作是 proposal 的起始点和结束点,从而可以得到起始点集合 Ns 和结束点集合 NeNsNe 作为边界内容图的两个互相独立的顶点集。用 ts,ite,j 分别表示 Ns 中的任意起始点 ns,iNe 中的任意结束点 ne,j 对应的时刻,其中 i , j =1,2,…,T,当满足 te,j > ts,ins,ine,j 之间有边连接,用 di,j 表示。


当连接起始点和结束点之间的边没有方向时可以得到(a)所示的无向图。由于起始点代表 proposal 的开始时间,结束点代表 proposal 的结束时间,连接起始点和结束点的边应该带有方向性,并且从起始点到结束点的边代表的信息与从结束点到起始点的边代表的信息是不同的,因此我们将(a)所示的无向图转换为图(b)所示的有向图。具体的转换过程为,将无向图中的无向边分成两个有相同节点和相反方向的有向边。


在进行图推理操作之前,我们为构建的边界内容图中的每个节点和边赋予其特征。为了得到节点和边的特征,我们在基础模块后面连接三个并行的 1D 卷积,从而得到三个特征矩阵,分别为起始点特征矩阵 Fs 、结束点特征矩阵 Fe 和内容特征矩阵 Fc ,这三个特征矩阵的时间维度和特征维度均相同,大小为 TxD’。对于任意起始节点 ns,i ,对应的时间为 ts,i ,则该节点的特征为 Fs 特征矩阵第 i -1 行对应的特征向量。同理,对于任意的结束节点 ne,j ,其特征为 Fe 特征矩阵第 j -1 行对应的特征向量。若 ns,ine,j 之间有边连接,边 di,j 对应的特征获取过程为:


1)首先对 Fc 特征矩阵第 i -1 行到 j -1 对应的特征矩阵在时序方向上进行线性插值,得到固定大小的特征矩阵 NxD’(N 为人为设置的常数);


2) 然后将 NxD’转化为(NxD’)x1;


3)在(N·D’)x1 特征后连接一个全连接层,得到维度为 D’的特征向量即为边 di,j 对应的特征。在有向图中,节点和边的特征更新之前,连接两个节点方向不同的两条边共享同一个特征向量。

图推理模块

为了实现节点和边缘之间的信息交换,爱奇艺提出了一种新的图推理方法,该推理方法可分为边特征更新和节点特征更新两个步骤。边特征更新步骤旨在汇总有边连接的两个节点的属性,更新过程如下所示:



其中 σ 表示激活函数 ReLU, θ s2e 和 θ e2s 代表不同的可训练的参数,×代表矩阵相乘,∗代表 element-wise 相乘。


节点特征更新步骤旨在聚合边及其相邻节点的属性,更新过程如下所示:




其中 e ( h , t )表示从头结点 h 指向尾节点 t 的边对应的特征,K 表示以 h 为头节点的边的总数。为了避免输出特征数值规模的增加,我们在更新节点特征前先对对应的边的特征进行归一化,之后再把更新后的边的特征作为相应头结点特征的权重。 σ 表示激活函数 ReLU, θnode 代表可训练的参数。

输出模块

如 BC-GNN 的整体框架图所示,候选 proposal 由一对节点与连接它的边产生,并且其起始点、结束点和内容的置信度分别基于更新后的节点特征和边特征生成,具体过程如下所示:


实验

我们在 ActivityNet-1.3 和 THUMOS-14 这两个公开数据集上分别进行时序动作提名生成实验和时序行为检测实验。


1)时序动作提名生成实验:




从上面两个表中可以看出,我们在两个通用的数据集上的效果均达到领先水平。


2)时序行为检测实验:




采用对 proposal 进行分类的方式得到时序行为检测结果,从上面两个图中可以看出,在两个数据上我们提出的方法均取得领先的结果。


3)消融实验:


在 BC-GNN 算法中,相比于直接使用传统的 GCN,将无向图转变成有向图,并且增加了边特征更新步骤,为了验证这两个策略的有效性,在 ActivityNet-1.3 数据集的时序动作提名生成任务上进行了消融实验。从下图的表格和结果曲线上可以看出,这两种策略均有利于结果的提升。



创新点

相比于目前通用的将边界预测与内容预测划分为两个步骤的算法,本文提出的方法使用图神经网络,对边界预测与内容预测的关系进行建模,将边界预测和内容预测的过程联系起来。高质量的动作内容有利于边界的调整,同时精确的边界定位会帮助内容置信度的预测。此外,我们还提出一种新的图推理方法,融合边界信息和内容信息去更新对应的节点和边的信息。本文提出的对有关联的两个步骤进行建模的方法可以应用于其他相似任务中。


包括本文在内,目前学术界在时序行为检测任务上取得不错效果的方法大多采用先提取动作提名再对动作提名进行分类的方法,这种两阶段的方式增加了整个流程的复杂度和运算量,未来将针对这类问题将有更多的设计与探索。


论文收录链接:


https://eccv2020.eu/accepted-papers


论文原文链接:


http://arxiv.org/abs/2008.01432


2020-08-11 17:491598

评论

发布
暂无评论
发现更多内容

【阿里云大咖说】填问卷送好礼正式上线,快来参与吧!

大咖说

大咖说 问卷 礼品

在MAUI中使用Masa Blazor

MASA技术团队

C# .net 微软 组件 组件库

EasyCV开源|开箱即用的视觉自监督+Transformer算法库

阿里云大数据AI技术

算法 计算机视觉 开源技术

Hoo虎符研究院|Cradle调研报告

区块链前沿News

虎符 Hoo 虎符研究院

跨域处理

源字节1号

软件开发 后端开发 租房小程序

Windows服务器运维用什么软件好?不想加班了!

行云管家

运维 IT运维 行云管家 服务器运维 Windows服务器

化繁为简!阿里新产亿级流量系统设计核心原理高级笔记(终极版)

Java全栈架构师

Java 程序员 架构 面试 架构师

这是一个有关自律的复杂故事

Coffee Cat

数据分析 监控 自律 跑步 可观测

活动预告 | 洞见科技纪凯受邀出席「隐私计算应用与发展论坛」

洞见科技

企评家,助力创业板企业成长性评价

企评家

企业评价 企业大数据 创业板 评价维度 成长性

BIGO 的数据管理与应用实践

NebulaGraph

数据库 图数据库 数据管理

丁未篇 「元宇宙超次元 」 《「內元宇宙」聯載》

因田木

命書 我富網

宣布 Databricks 支持 Amazon Graviton2,性价比提高 3 倍

亚马逊云科技 (Amazon Web Services)

Tech 专栏

开拓新领域 OpenHarmony多行业软件发行版逐步落地

科技汇

培训学习选择java好还是前端好

@零度

JAVA开发 web前端

JavaScript的事件循环机制浅析

程序猿布欧

JavaScript 前端 前端面试 防抖节流

OpenHarmony 技术日直播回顾丨共建新技术,开拓新领域

OpenHarmony开发者

OpenHarmony 技术日

手把手推导Ring All-reduce的数学性质

OneFlow

深度学习 reduce-scatter all-gather 环状算法

netty系列之:netty对marshalling的支持

程序那些事

Java Netty 程序那些事 4月月更

观察者模式 vs 发布订阅模式,千万不要再混淆了

战场小包

前端 设计模式 4月月更

双许可、先决条件、附加条款……开源许可证的疑难杂问

一君

「Substrate Evangelist Program」顺利开幕,期待各位布道者共建 Substrate 生态!

One Block Community

Substrate 区块链资讯 波卡生态 Parity

即时通讯软件建设,聚焦数据安全

a13823115807

什么是敏捷开发,敏捷开发落地指南之迭代排期

阿里云云效

云计算 阿里云 敏捷开发 研发 研发敏捷

javaScript深拷贝和浅拷贝简单梳理

程序猿布欧

JavaScript 前端 深拷贝 浅拷贝 深拷贝与浅拷贝

想参加培训学习web前端不知道靠不靠谱

@零度

web前端开发

《数字经济全景白皮书》Z世代用户洞察篇(3)重磅发布!

易观分析

用户分析 Z世代

全面解读OpenHarmony 3.1 Release版本,夯实技术底座 打造繁荣生态

科技汇

一文详解Java日志框架JUL

华为云开发者联盟

Java 日志 框架 日志框架 JUL

新零售SaaS架构:组织管理的底层逻辑与架构设计

架构师汤师爷

系统架构 SaaS 架构设计 组织架构

linux监控软件有哪些?用什么软件好?

行云管家

Linux 运维 监控软件

BC-GNN:用于时序动作提名生成任务的融合边界内容的图神经网络_AI&大模型_爱奇艺技术产品团队_InfoQ精选文章