点击蓝字

关注我们
AI TIME欢迎每一位AI爱好者的加入!

得利于数码相机的便利和社交网络的发展,每秒钟都有大量视频都在生成和传播。因此,视频分析和理解成为计算机视觉界最重要的研究课题之一。最近,视频分析的重点逐渐的从片段视频的动作分类转向未修剪视频的时序定位。这是因为在许多现实世界的应用中,通常会呈现长的、未修剪的视频,而不是短的视频剪辑。未修剪的原始视频通常具有单调的背景场景和包含特定动作的前景片段,因此我们需要一个视频模型来执行时间定位任务从原始视频中定位前景运动。比如说,根据不同的场景,我们期望自动定位特定的动作,或者预测与给定句子匹配的一小段剪辑。总体来说,我们需要一个面向实时、灵活、精确的解决方案。
本期AI TIME PhD直播间,我们邀请到阿卜杜拉国王科技大学——许蒙蒙,为我们带来报告分享《视频中的时序定位——面向实时、灵活、精确的解决方案》。

许蒙蒙:
阿卜杜拉国王科技大学(KAUST)图像和视频理解实验室(IVUL)博士生,其导师为Bernard Ghanem教授。许蒙蒙于2017年获得中国浙江大学学士学位,并于2019年在KAUST获得硕士学位。博士期间,他曾在三星、亚马逊等公司实习。目前,许蒙蒙专注于图像和视频的理解。他感兴趣的问题是通过具有新颖模型架构的自监督学习来表示未修剪的长视频。他还对视频时序定位任务感兴趣,例如时序动作定位和视频语言定位。
今天我们主要介绍的问题是视频中的时序定位问题,希望可以得到面向实时、灵活、精确的解决方案。
1
Temporal Action Localization
Videos on different platforms
随着科技发展,视频数据海量生成。对于视频数据的研究也成为了一个热门的方向。下面是一些视频平台的统计数据。
● Facebook:视频每天有80亿次点击,共有1亿小时的视频。
● YouTube: 每分钟有超过500小时的内容上传(截至2019)。
● Netflix:目前在云端存储有220万分钟的内容
计算机视觉中的一个方向就是让AI理解视频。最近的研究,正在从视频行为的理解转向长视频的理解。长视频一般包含两种内容:一种是感兴趣的前景内容,比如某次报告;一种是单调、甚至乏味的内容,比如两场报告之间的空白休息时间。我们希望可以把更加重要的内容(前景)呈现给用户。
Facebook发现一个有趣的现象:视频的浏览量往往会随着视频的时间长度增加而下降。如果可以把长视频的内容压缩抽象到短时间之中,比如把一段长视频的精华放到开始,就更有利于吸引观众。实现这样的功能需要我们首先了解三个问题:
● 观众想看什么视频?
● 观众想看的是哪一片段?
● 那一片段都有什么内容?
我们自己可以通过观看视频很好的了解都发生了几件什么样的事情,但是这对于机器来说相当困难。
目前主流的方法是通过两步训练实现的,如下图所示:

尽管任务内容上可能有微小的差距,一般解决思路是用视频理解的模型和定位的模型共同发挥作用。对于视频理解模型,我们会对视频的类别进行分类训练,训练好的视频理解模型会将视频抽象为视频特征,而视频特征就可以用于之后定位模型的输入。另一方面,定位模型只需观察这些视频特征,就可以估计并排序这些有可能发生的行为。下面是我们给出的一个研究例子:Example of Localization Model: G-TAD

G-TAD这里只是一个定位模型,所以其输入就是视频特征,输出就是前景动作在哪里。我们也通过借鉴和采用更新的方法使得定位模型效果更好。要注意,这方面的研究集中于如何设计定位模型,毕竟其输入只是视频特征。这类研究的一个优势是它作为轻量级的模型可以很快达到收敛并迭代优化。
Video encoder: Task Discrepancy Problem
在研究理解模型的时候,我们发现有个任务不一致的问题。这是因为视频理解模型的预训练任务通常是去分类某个行为,但是现在需要视频模型对定位问题有着更深的理解。所以,如果直接把视频理解模型用于视频定位,效果就会有比较大的差距。一个直接的解决方法是将视频理解模型和视频定位模型放在一起训练优化,但是这样却很难实现。
●restricted by the large input size of untrimmed videos
● subject to the memory constraint of GPUs.
● joint optimization is challenging for TAL!
我们文章的贡献:
● 提出了任务不一致的问题:视频模型的预训练通常是在识别任务上,但最终任务需要一个定位模型。
● 提出low-fidelity (LoFi)使得协同训练得以实现。
● 当与现成的TAL模型结合使用时,会产生新的SOTA性能
2
Low-Fidelity Optimization
low-fidelity video encoder optimization
● 通过调整视频理解模型的训练,使其不仅有利于视频识别,也可以促进视频定位。
● 也可以满足一定的硬件约束。

上图中有三个模块,是在之前两步训练法的中间加入了一步,这一步使得我们可以协调两个网络一起进行训练。为了让协同训练能够满足硬件的要求,我们的方法是降低训练视频的保真度,并在不同的训练环境中进行不同的调整。这个想法本质上是在不同维度上减少视频分辨率,来达到端到端训练的效果。这样的设计使得我们的训练梯度可以从定位的网络反传到视频理解的网络,从而使得视频理解的网络可以提供更好的视频特征来促进视频定位。
以下是具体的实验细节,前三步是不同的减小分辨率的设计,第四部步提供了一种周期性的训练方法。

通过这样一个中间环节的训练,我们使得视频理解模型和定位模型一起进行训练。该方法的核心就是降低时间和空间的分辨率,这种调节性的改变可以使我们的模型满足运算的硬件限制,也可以使梯度反传到视频理解网络。
3
Results and Discussion
我们的方法在一些主流的数据集上进行了验证,这两个数据集都是大规模的视频理解挑战。


我们发现,最优的方法是通过多种不同低保真度的设置,来进行周期的训练。我们方法不仅可以在性能上达到最优,而且还可以应用到非常小的模型。

同时,对于不同的硬件限制可以部署不同的视频模型。

假设我们的硬件设备,可以不断的升级更新。我们的显存可以越来越高,从而使的我们的解决方案效果越来越好。

最后,通过协同训练的方法,视频网络就能够帮助去做视频定位的问题。对于这一大类问题,我们也可以把视频理解网络拿出来,放在其他视频问题上出来。这样也可以使模型得到一个较好效果。

4
Conclusion
● low-fidelity video encoder optimization:直观且有效
● 视频特征表示的学习和改进能有益于多种视频理解的下游任务
提
醒
论文题目:
Low-Fidelity Video Encoder Optimization for Temporal Action Localization
论文链接:
https://papers.nips.cc/paper/2021/file/522a9ae9a99880d39e5daec35375e999-Paper.pdf
点击“阅读原文”,即可观看本场回放
整理:林 则
作者:许蒙蒙
往期精彩文章推荐
记得关注我们呀!每天都有新知识!
关于AI TIME
AI TIME源起于2019年,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,加强思想碰撞,链接全球AI学者、行业专家和爱好者,希望以辩论的形式,探讨人工智能和人类未来之间的矛盾,探索人工智能领域的未来。
迄今为止,AI TIME已经邀请了700多位海内外讲者,举办了逾350场活动,超280万人次观看。

我知道你
在看
哦
~

点击 阅读原文 查看回放!
本文探讨了视频时序定位的重要性,特别是在海量视频数据背景下。研究指出,传统两步训练方法存在任务不一致问题,为此提出了低保真(LoFi)优化方法,允许视频理解模型与定位模型协同训练,以提高性能并适应硬件限制。实验结果显示,这种方法在多个数据集上取得最优效果,并能应用于不同规模的模型和硬件环境。

154

被折叠的 条评论
为什么被折叠?



