1. 项目概述:为什么我们需要“预判”动作?
在计算机视觉领域,动作识别已经是一个相当成熟的方向了。给你一段完整的视频,比如一个人从起跑到跨栏再到落地的全过程,现在的模型能相当准确地告诉你:“这是110米跨栏”。但如果我们把问题变一下呢?只给你视频的前10%、20%,也就是运动员刚刚起跑、甚至还没离开起跑器的瞬间,模型还能不能“猜”出他后续要完成的是跨栏,而不是百米冲刺或者跳远?
这就是“早期动作预测”要解决的核心问题。它要求模型在动作尚未完成、甚至刚刚开始的极早期阶段,就对其最终类别做出准确判断。这不仅仅是学术上的趣味挑战,其应用场景非常广泛且迫切。想象一下智能监控场景,如果能提前几百毫秒预测出有人意图翻越围栏或实施暴力行为,安防系统就能更早地发出预警。在自动驾驶中,提前预判行人是要径直穿过马路还是仅仅在路边等待,可能直接关系到行车策略和安全性。在人机交互和机器人领域,机器人若能提前理解人的意图,交互将更加自然流畅。
然而,早期预测的难点是显而易见的。早期帧所包含的信息往往是模糊、不完整且充满歧义的。一个抬手的动作,可能是挥手告别,也可能是准备投篮。传统基于3D卷积神经网络的方法,如I3D、SlowFast等,虽然在完整动作识别上表现出色,但它们本质上是一种“事后诸葛亮”式的强归纳模型,擅长从完整时序中提取丰富的时空特征,却对早期稀疏、微弱的信号不敏感。它们缺乏一种主动的、面向未来的推理机制。
正是在这样的背景下, EAST 应运而生。这个项目全称是“基于Vision Transformer与动态掩码的早期动作预测方法”。它巧妙地结合了当前的两个热点: Vision Transformer 和 动态掩码 ,旨在教会模型一种“窥一斑而知全豹”的能力。简单来说,EAST的核心思想是:与其被动地等待信息输入,不如主动地模拟信息缺失的过程,让模型在训练时就学会如何在“只知道开头”的情况下,推理出“完整的剧本”。接下来,我将深入拆解EAST的设计思路、技术实现细节,并分享在复现和调优过程中的实战经验。
2. EAST的核心设计思路与架构拆解
EAST的整体设计哲学可以概括为“以教为学”。我们如何训练一个模型,让它具备早期预测能力?最直接的想法是,在训练时也只给模型看视频的前面一部分。但这会带来两个问题:第一,数据利用率低,我们丢弃了视频后半部分的宝贵信息;第二,模型学到的仅仅是“看短视频分类”,而非“由局部推理全局”的能力。
EAST提出了一个更巧妙的方案: 在训练阶段,让模型看到完整的视频,但通过一种精心设计的“动态掩码”机制,主动、随机地遮挡(掩码)掉视频序列中靠后的部分帧,模拟测试时“只能看到早期片段”的情况。 同时,利用 Vision Transformer 强大的全局建模和特征交互能力,让模型基于未被掩码的早期帧,去尝试重建或推理被掩码掉的后续帧的语义信息,最终完成对整个视频动作的分类。
2.1 为什么是Vision Transformer?
在EAST中,选择Vision Transformer作为骨干网络,绝非盲目跟风,而是基于其架构特性与早期预测任务需求的高度契合。
-
序列建模的天然优势 :ViT将图像或视频片段视为一系列“图像块”的序列。对于视频数据,我们可以很自然地将时空联合的立方体划分为时空块序列。这种序列化的表示方式,与早期预测任务中“按时间顺序观察局部信息”的认知过程是一致的。模型处理的是一个有序的令牌序列,这比3D CNN的隐式时序建模更为直观和灵活。
-
强大的全局注意力机制 :这是ViT的核心。自注意力机制允许序列中的任何一个令牌(即任何一个时空块)与所有其他令牌进行交互。在早期预测的上下文中,这意味着模型可以利用早期帧中某个关键区域(例如手部)的信息,去直接关注和影响对后期帧中相关区域(例如球)的理解,即使它们被掩码了。这种远距离的、内容相关的依赖建模能力,是卷积网络通过堆叠局部感受野难以高效实现的,对于从稀疏线索推理全局至关重要。
-
对掩码机制的友好性 :Transformer架构最初就在自然语言处理的BERT模型中成功应用了掩码语言模型。在ViT中,我们可以类似地引入“掩码令牌”。被掩码的时空块在输入时被替换为一个可学习的掩码令牌,模型的目标之一就是在最终特征中“恢复”这些被掩码令牌应有的语义。这种设计与早期预测的任务目标——根据可见部分推理不可见部分——完美吻合。
注意 :虽然ViT是理想选择,但直接使用为图像分类设计的标准ViT处理视频,计算量会爆炸。EAST在实际实现中,通常需要对视频进行时空下采样,并可能采用更高效的视频Transformer变体(如TimeSformer,它分解了时空注意力)作为基础,以控制计算成本。
2.2 动态掩码策略:任务驱动的数据模拟
动态掩码是EAST方法区别于普通视频分类训练的关键,也是其实现早期预测能力的“训练秘诀”。它的设计直接决定了模型学习到的推理模式。
-
随机时序掩码 :这是最核心的策略。对于每一个训练样本(一个完整的视频),我们随机生成一个掩码比例
r(例如,从10%到50%均匀采样)。然后,从视频的 结尾部分开始向前 ,按比例掩码掉相应数量的帧(或时空块)。这意味着模型在训练时, 永远看不到视频结尾附近的内容 ,但每次被掩码的具体位置和比例是随机的。- 为什么从结尾开始掩码? 这直接模拟了早期预测的测试场景:我们总是只有视频的开头部分。如果随机掩码中间部分,模型可能会学到利用后半段信息来“作弊”,这违背了训练目标。
- 为什么掩码比例要动态变化? 固定比例(如只保留前20%)会让模型只适应一种观测长度。动态比例迫使模型学会处理从“信息极少”(如10%)到“信息相对较多”(如50%)的各种困难情况,从而获得更鲁棒的泛化能力。
-
掩码的实现方式 :被选中的时空块,其对应的令牌会被替换为同一个可学习的
[MASK]向量。同时,为了告诉模型每个令牌的时序位置,需要加上标准的位置编码。模型需要基于那些未被掩码的、真实的早期令牌,来理解这个[MASK]令牌在当前位置应该蕴含什么样的视觉语义。 -
双任务学习目标 :为了充分利用完整视频的监督信息,EAST通常采用多任务学习。
- 主任务(早期动作分类) :基于被掩码后的序列(即只有早期部分可见)提取的特征,通过一个分类头,预测整个视频的动作类别。这是我们的终极目标。
- 辅助任务(掩码令牌预测) :在Transform


245

被折叠的 条评论
为什么被折叠?



