【arXiv 2026】GenCeption:视频生成模型是通用视觉学习者|从生成式视觉预训练范式视角

摘要

本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出 GenCeption,把大规模文生视频扩散模型改造为单步前馈的通用视觉感知模型,通过统一 RGB 表示可学习 token统一 $L_2$ 损失,让 8 类稠密/稀疏任务共用一个骨干与解码器,其特别之处在于仅用纯合成视频数据训练,即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsRel 0.008、指代分割 MeViS J&F 70.0,且数据效率达 $7\times$-$500\times$,为计算机视觉的生成式预训练范式提供了系统性证据。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)Video Generation Models are General-Purpose Vision Learners
标题(中文)视频生成模型是通用视觉学习者
作者Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
机构Google DeepMind · U. Toronto · UCL · Oxford · MIT · Lund
会议arXiv 2026
arXivhttps://arxiv.org/abs/2607.09024
项目网站https://genception.github.io

背景与动机

NLP 靠 next-token prediction 从任务专用模型收敛为通用基础模型;计算机视觉却仍停留在"专用模型"阶段——SAM 系列管分割、Depth Anything 系列管深度,每个任务都要定制架构。作者提出,通用视觉预训练需满足三条准则:时空演化(内化 4D 因果与物理)、视觉-语言对齐(原生继承指令跟随)、可规模化(数据与算力可扩展)。

现有工作各有短板:MAE/VideoMAE、DINO 等自监督表征缺少显式多模态对齐;CLIP/SigLIP 对齐了图文却难做视频级表征且规模受限;扩散复用路线(MarigoldGenPerceptDiception)多为单图单任务且依赖多步采样;视频侧 DepthCrafter/NormalCrafter 聚焦单一稠密任务;同期工作 Vision Banana 只覆盖二维图像空间。GenCeption 的关键差异是:原生视频域 + 单步前馈 + 稠密/稀疏任务统一,在标准 benchmark 上全面超越专用 SOTA。

研究主线:从问题到结论

Mermaid 图 1

图 12:GenCeption 研究主线——从"视频生成"到"通用感知"(Mermaid 流程图)

基准/方法设计

GenCeption 的方法论由三条原则驱动:

  1. 多模态生成预训练即表征学习——文生视频扩散模型作通用骨干,生成高保真视频强制内化时空先验、3D 几何与物理规律,同时原生对齐视觉语言概念;为保留先验,最大化兼容原预训练范式、最小化改动。
  2. 任务无关的统一后训练——把感知任务视为统一的序列到序列映射,稠密任务输出编码进标准 RGB 空间($[0,1]$),文本提示切换任务,单骨干单解码器单损失。
  3. 前馈重构——把多步迭代采样改造成单步确定性预测,兼顾精度与效率。

GenCeption 视频生成预训练与后训练范式总览图

图 1:方法总览——视频生成模型作预训练基座(左),多任务后训练为前馈感知模型;右图为从专用模型到通用模型的范式转移

分类全景

Mermaid 图 2

图 13:GenCeption 任务分类——稠密任务统一进 RGB 空间,稀疏任务由可学习 token 承载(Mermaid 流程图)

方法细节

前馈重构:干净视频潜在 $x_0$ 直接输入 DiT,时间步固定 $t=0$(Rectified Flow 终止点);DiT 输出速度 $v = \epsilon - x_0$,取负后 $-v = x_0 - \epsilon$ 更接近目标潜在,加速收敛。本质是把 DiT 重铸为特征提取器,特征直接取自最后一层,与解码器原生对齐。

稠密任务统一到 RGB:深度/分割单通道复制为三通道,法向/DensePose 天然三维;相机位姿以像素级 raymap 表示(6 通道),通过空间分区——中心放射线原点、四周放射线方向——压缩进 3 通道,保持单解码器框架。

稀疏任务用可学习 token:每帧追加一个可学习 query token,经 MLP 解码为 $K$ 维坐标;沿用原生 3D RoPE(空间位置可学习),时间位置用插值压缩到预训练所见范围,优于额外注意力层方案。

数据级消歧:深度按场景中值归一化,再用非线性映射 $d' = \mathrm{clip}(\alpha \log(d+1), 0, 1)$ 压到 RGB 范围,彻底免去 scale-invariant 等专用损失——任务差异化全部下沉到数据表示。

合成数据管线:800 个 RenderPeople 模型 × 200 段 CMU 动作,Blender 多渲染通道生成 7,500 段视频,同时产出法向、深度、分割、2D/3D 关键点真值;离线预计算视频/文本潜在加速训练。训练补充 TartanAir、Virtual KITTI、MVS Synth(深度),指代分割用 MeViS/Ref-COCO/YouTube-VOS 真实数据。

GenCeption 统一架构示意图

图 2:架构总览——输入视频 + 文本提示,一次前向输出目标模态;稠密任务在 RGB 潜在空间监督,稀疏任务由可学习 token 承载

GenCeption 相机位姿 raymap 表示

图 3:"Rothko" Raymap——把相机位姿的六通道射线数据压缩进标准 3 通道 RGB

训练配置:WAN 2.1 基座(1.3B/14B),480×832 分辨率、81 帧 @24fps;batch 64 × 256 v6e TPU,Adam lr $5e^{-5}$,15,000 步,250 步 warmup;gradient clipping + gradient dropping 保证稳定。

实验设计与结果

评测协议:法向用 Hi4D(Sapiens/DAVID 协议,1,195 帧)与 SINTEL;深度用 KITTI/SINTEL/ETH3D/Goliath(DAVID 子集 2.2k 帧);相机位姿用 SINTEL(ATE/RPE-T/RPE-R);前景分割用 VideoMatte/PhotoMatte 85/PPM-100(MSE);指代分割用 RefVOS-DAVIS 与 MeViS(J&F);3D 关键点用 EMDB(MPJPE)。除指代分割外全部纯合成数据训练,未使用任何评测集训练数据。

与专用 SOTA 对比主表

任务(指标↓)最强专用GenCeption L胜出幅度
法向 Hi4D (mAE)Sapiens 12.1410.99-1.15
法向 SINTEL (mAE)Lotus-2 30.329.3-1.0
深度 SINTEL (AbsRel)D4RT 0.1480.130-12%
深度 Goliath (AbsRel)DepthAnything 3 0.0120.008-33%
相机位姿 SINTEL (ATE)VGGT-Ω 0.0570.050-12%
指代分割 MeViS (J&F)ReferEverything 60.370.0+16%
3D 关键点 EMDB (MPJPE)Genmo 73.071.8-1.2
前景分割 VideoMatte (MSE)RVM 0.00100.0010(Generalist)持平

预训练范式与缩放(深度平均 AbsRel)

方法规模训练帧数Avg AbsRel↓
V-JEPA - H0.6B0.9M0.281
VideoMAE V2 - G1B0.9M0.154
Ours - WAN 2.1 - S1.3B0.9M0.122
Ours - WAN 2.1 - L14B0.9M0.093
DepthAnything 3 - G1.15B~200M0.096
D4RT1B~86M0.082
VGGT-Ω1B~600M0.067
Ours - WAN 2.1 - L (4 数据集)14B1.23M0.071

GenCeption 多任务能力展示图

图 4:能力总览——法向、深度、前景分割、指代分割、稠密人体语义、2D/3D 关键点、相机位姿,仅训练于合成人体视频却泛化到动物与卡通角色

GenCeption 通用能力雷达图与数据效率图

图 5:左:通用能力雷达图——匹配或超越各任务专用模型;右:深度估计数据效率——$7\times$-$500\times$ 更少训练数据达到同等性能

GenCeption 预训练迁移消融图

图 6:预训练迁移消融——迁移预训练层数越多性能越高,随机初始化 DiT 学习曲线近乎平坦

GenCeption 深度与法向定性结果图

图 7:深度与表面法向估计定性结果(首帧)

GenCeption 指代分割定性结果图

图 8:指代分割定性结果——识别物体、颜色、空间关系与运动,并分割未见类别

GenCeption 多实例泛化结果图

图 9:涌现泛化(a)——训练数据单物体,零样本迁移到真实多人场景

GenCeption OOD 类别泛化结果图

图 10:涌现泛化(b)——仅训练人体类别,泛化到猫等未见类别

GenCeption 3D 姿态估计结果图

图 11:3D 姿态估计——滑雪/单板视频(每 10 帧取一帧),无需人体检测或 2D 关键点预处理

推理成本:1.3B 模型 81 帧 480×832 单次前向 5.92s @ 13.6 FPS(DiT 0.96s)、15.3GB 显存;14B 模型 10.03s @ 8.0 FPS(DiT 5.11s)、42.8GB 显存——对比 WAN 2.1 原版 50 步扩散采样,推理成本降低约一个数量级。

结果对比总结

Mermaid 图 3

图 14:GenCeption 与各任务专用 SOTA 的对比总结(Mermaid 流程图)

关键发现

  • 生成式预训练范式完胜:同数据同规模下,WAN 2.1 生成式预训练平均 AbsRel 0.093(14B),大幅优于 V-JEPA 的 0.281 与 VideoMAE V2 的 0.154——关键在生成目标本身,而非数据集或规模。
  • 数据效率惊人:14B 模型用 1.23M 帧达到 VGGT-Ω(约 600M 帧)同级水平,即 $7\times$-$500\times$ 更少训练数据;D4RT(约 86M 帧)同样被 1.23M 帧追平。
  • 缩放性质初现:1.3B → 14B、数据翻倍,深度误差单调下降;从零训练 DiT 曲线近乎水平,预训练层数越多收敛越好。
  • 涌现行为显著:纯合成人体视频训练,零样本迁移到真实多人场景与猫、机器人等 OOD 类别,猫胡须等细节甚至超过训练数据画质。
  • 联合训练有代价:前景分割受益于多任务联合训练,但 3D 关键点 MPJPE 明显退化——token 坐标回归偏离像素空间先验,可学习 token 干扰原生注意力。
  • 推理效率数量级提升:14B 单次前向 DiT 5.11s,对比 50 步扩散采样,成本降低约一个数量级。

局限性

  • 稀疏任务退化:联合训练使 3D 关键点明显变差——token 回归与像素空间预训练本质相悖,可学习 token 从零训练破坏预训练注意力。
  • 合成域依赖:训练数据以人体为中心,背景与物体多样性受限;指代分割仍需 MeViS/Ref-COCO/YouTube-VOS 等真实数据补充。
  • 分辨率与显存开销:480×832 输入,14B 模型单次前向需 5.11s 与 42.8GB 显存,虽比 50 步扩散快得多仍非实时。
  • 并发竞争:与 Vision Banana、Wiedemer et al. 等工作同期,范式归属与基准差异需后续检验。
  • 作者展望:后训练应最小化对预训练骨干的架构改动,或从根本上重新设计预训练目标以原生容纳多样化下游任务。

常见问题(FAQ)

GenCeption 和 Vision Banana 有什么区别?

两者同为"生成模型是通用视觉学习者"的同期工作,但 Vision Banana 只覆盖二维图像空间且采用多步生成,GenCeption 扩展到原生视频域、采用单步前馈架构,并在更广泛的任务谱系上做了定量评测。

为什么视频生成预训练比 CLIP、MAE 更好?

因为生成高保真视频强制模型内化时空因果、3D 几何与物理交互,且文本条件生成天然对齐视觉-语言语义;CLIP 等对比方法缺时空建模,MAE 等掩码方法缺模态对齐,且视频表征模型规模普遍小一个量级。

相机位姿怎么编码进 RGB 图像?

采用像素级 raymap:每个像素记录一条射线的原点与方向(共 6 通道),通过空间分区——中心放射线原点、四周放射线方向——压缩进标准 3 通道 RGB,保持单解码器框架不变。

GenCeption 训练数据量有多大?

核心合成数据集 7,500 段视频(800 个 RenderPeople 模型 × 200 段 CMU 动作),深度补充 TartanAir、Virtual KITTI、MVS Synth,指代分割用 MeViS/Ref-COCO/YouTube-VOS;14B 模型全部训练帧约 1.23M,仅为 D4RT 的约 1/70。

为什么联合训练会损害 3D 关键点?

token 式坐标回归偏离连续像素空间预训练,且从零训练的可学习 token 会扰乱预训练 DiT 层的原生注意力机制——说明后训练应最小化对预训练骨干的架构改动。

GenCeption 开源吗?

论文基于开源的开源权重文生视频模型 WAN 2.1,但 GenCeption 本身暂未发布权重与代码;项目页面(genception.github.io)提供更多演示与细节。

参考链接

  • arXiv 论文:https://arxiv.org/abs/2607.09024
  • 项目页面:https://genception.github.io
  • Vision Banana(同期 2D 图像版本):https://arxiv.org/abs/2604.20329
  • Marigold(扩散复用开山之作):https://arxiv.org/abs/2311.17120
  • B 站视频讲解:https://www.bilibili.com/video/BV1n78G65Euk

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

标题基于SpringBoot的学生读书笔记共享平台设计研究AI更换标题第1章引言介绍学生读书笔记共享平台的研究背景、意义、国内外研究现状、论文方法以及创新点。1.1研究背景与意义阐述学生读书笔记共享平台在当前教育环境下的重要性。1.2国内外研究现状分析国内外学生读书笔记共享平台的研究进展与现状。1.3研究方法及创新点概述本文的研究方法与平台设计的创新点。第2章相关理论总结和评述与SpringBoot及读书笔记共享平台相关的理论。2.1SpringBoot框架介绍阐述SpringBoot框架的特点、优势及其在Web开发中的应用。2.2读书笔记共享平台相关理论介绍读书笔记共享平台的设计原则、功能需求及用户体验理论。2.3数据库设计与优化理论简述数据库设计的基本原则及优化策略。第3章平台设计详细介绍基于SpringBoot的学生读书笔记共享平台的设计方案。3.1平台架构设计平台的整体架构,包括前端、后端及数据库的设计。3.2功能模块设计阐述平台的主要功能模块,如用户管理、笔记上传、笔记分享等。3.3数据库设计介绍数据库的设计方案,包括表结构、索引及关系设计。第4章平台实现详细描述平台的具体实现过程,包括技术选型、开发环境搭建等。4.1技术选型与开发环境介绍开发平台所采用的技术栈及开发环境配置。4.2关键代码实现展示平台实现过程中的关键代码片段,如用户登录、笔记上传等功能的实现。4.3平台测试与优化平台的测试过程及优化策略,确保平台的稳定性和性能。第5章平台应用与分析对平台的应用效果进行分析,包括用户反馈、使用数据等。5.1用户反馈收集与分析收集用户反馈,分析用户对平台的满意度及改进建议。5.2使用数据分析通过数据分析工具,分析平台的使用情况,如用户活跃度、笔记分享量等。5.3对比方法分析对比其他类似平台,分析本平台的优势与不足。第6章结论与展望总结本文的研究成果,并对未来研究方向
内容概要:本文针对多渗透率电动汽车接入对配电网的影响,开展承载能力评估研究,提出了一套融合多类型分布式资源的综合评估体系。研究构建了包含电动汽车、分布式光伏及静止无功补偿器(SVC)的配电网协同运行基础模型,建立了涵盖一次设备安全性、负荷平稳性、电能质量与系统运行效率的多维度评价指标体系,并采用熵权法与模糊综合评价相结合的双层模型实现指标客观赋权与系统承载能力的量化评分。通过Matlab仿真平台,系统分析了不同电动汽车渗透率下各项指标的演变规律与敏感性特征,揭示了高比例电动汽车接入对配电网的潜在压力,从而为电网的规划决策、扩容改造以及电动汽车的有序充电管理提供了科学、量化的技术支撑。; 适合人群:具备电力系统、电气工程或相关领域基础知识,从事新能源并网、智能配电网、电动汽车与电网互动(V2G)等方向研究的研究生、科研人员及电力系统工程技术人员。; 使用场景及目标:①评估大规模电动汽车无序或有序接入对配电网安全稳定运行的综合影响;②为配电网络的升级改造、设备选型及电动汽车充电基础设施布局提供决策依据;③学习并复现基于熵权-模糊综合评价法的多指标体系构建与量化评估方法,掌握其在复杂电力系统分析中的应用。; 阅读建议:建议结合文中提供的Matlab代码进行仿真复现,重点理解算例参数设置、多维指标体系的设计逻辑以及双层评价模型的具体实现步骤,通过调整渗透率等关键参数进行对比实验,以深化对评估方法原理与实际应用效果的理解。
内容概要:本文围绕电力系统状态估计问题,深入研究了加权最小二乘法(WLSM)与因子分解法(FDM)在状态估计中的应用,并提供了完整的Matlab代码实现。文章系统阐述了电力系统状态估计的基本原理、数学建模过程以及两种算法的核心流程,通过仿真实验全面对比了WLSM与FDM在估计精度、计算效率、收敛性等方面的表现。研究发现,FDM在处理大规模稀疏矩阵时展现出更高的计算效率,更适合实时性要求较高的场景;而WLSM在估计精度上更具优势,适用于对准确性要求严格的场合。两者各有侧重,可根据实际系统需求灵活选用。配套的Matlab代码有助于读者深入理解算法细节并进行实践复现。; 适合人群:具备电力系统分析基础知识和Matlab编程能力的高校研究生、科研人员,以及从事电力系统运行、调度与控制等相关领域的工程技术人员。; 使用场景及目标:①系统学习电力系统状态估计的理论基础与主流算法实现;②对比分析WLSM与FDM在不同电网规模下的性能差异;③借助Matlab代码进行算法仿真与优化,提升科研能力与工程实践水平。; 阅读建议:建议读者结合经典电力系统状态估计教材,按照文中所述理论推导与代码结构逐步实现算法,并在标准测试系统(如IEEE 14、30节点系统)上进行验证,以深入掌握算法特性及其适用边界。
内容概要:本文详细阐述了基于Flowable 6.8.0的企业级工作流(审批流)完整实现方案,旨在解决传统硬编码审批逻辑存在的代码冗余、流程固化、不可视化等问题。方案采用SpringBoot + MyBatis-Plus + MySQL技术栈,集成Flowable工作流引擎支持BPMN 2.0标准,结合Spring Security或Sa-Token实现权限控制,并通过Flowable Modeler实现流程的可视化拖拽设计。系统覆盖单人审批、会签、或签、条件分支、驳回、加签、抄送等99%的企业审批场景,支持流程动态配置、审批溯源、超时提醒与异步通知(RabbitMQ),确保流程可扩展、可审计、可追溯。架构上实现业务系统与工作流引擎解耦,通过biz_approval_form和biz_approval_record两张业务表实现流程与数据的关联绑定,保障系统的灵活性与复用性。; 适合人群:具备Java开发基础,熟悉SpringBoot、MyBatis、MySQL的中高级研发人员,尤其是参与企业内部管理系统、OA、ERP等涉及复杂审批流程开发的开发者;1-5年工作经验的技术人员尤为适用。; 使用场景及目标:①构建可配置化、可视化的通用审批流程平台;②实现业务系统与工作流引擎的解耦设计;③掌握Flowable在SpringBoot项目中的集成方式与核心表结构应用;④实现审批流程的动态管理、操作溯源与审计合规;⑤支持多角色、多节点、复杂条件流转的审批业务落地。; 阅读建议:学习本方案时应结合实际项目进行流程建模与代码实践,重点关注流程定义部署、运行时任务处理、历史数据归档以及业务表与Flowable表的关联设计,同时调试核心API调用与权限集成逻辑,深入理解工作流引擎与业务系统的协作机制。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值