一文解读 OpenAI Sora 核心技术

OpenAI Sora原理探究 春节假日期间,美国人工智能研究公司OpenAI发布了Sora模型。在文生文、文生图之后,Sora突破了文生视频技术,可以根据文本指令生成长达1分钟的逼真和富有想象力的视频,引起网络和公众高度关注。那么Sora模型的基本原理是什么?可能会带来哪些变化和影响?我们将sora的整个训练过程可以划分为四个大的步骤步骤一:使用 DALLE 3( CLIP )把文本和图像对 建立关联性; 阅读详情

▼最近直播超级多,预约保你有收获

今天直播:《大模型Agent应用落地实战

1

Sora 技术原理解读

如果用一句话来描述 Sora 训练建模过程,那就是:将原始视频通过一个视觉编码器(visual encoder)编码到隐空间(latent space)形成隐时空块(spacetime latent patches),这些隐时空块(结合 text 信息)通过 transformer 做 diffusion 的训练和生成,将生成的隐时空块再通过视觉解码器(visual decoder)解码到像素空间(pixel space)。

整个过程如下:visual encoding -> latent diffusion with diffusion transformer (DiT) -> visual decoding。

d3c633d422221877ab4dfd871d7ed2ac.png

2

Sora 算不算世界模型?

世界模型分为广义的和狭义的。

广义的世界模型,就是任何能理解世界潜在物理规律的模型,比如可以预见未来结果的模型,比如:如果一个模型能预测玻璃杯掉下后的状态,说明该模型具备这样的能力;再比如:知道世界中实体或抽象概念之间相互联系的模型,比如:一个模型知道玻璃杯的硬度低于水泥地会导致玻璃破碎。

狭义的世界模型,更强调理解物理世界的动力(dynamics)或者运动等物理规律的模型,了解过强化学习的朋友们一定特别熟悉这些。在强化学习中,一大分支便是 model-based RL,这里的 model,其实就是典型的狭义世界模型。在此模型中,给定某一时刻的状态 s_t 和该时刻做的动作 a_t,模型可以预测出下一个时刻的状态 s_t+1。所以说,狭义的世界模型其实是因果的。回到上面的例子,s_t 可以是刚下落的杯子和干净的水泥地,a_t 则是自由落体这个动作,s_t+1 则是水泥地上碎掉的杯子这样一个状态。

Sora 算广义世界模型,同时也是隐式的狭义世界模型。

Sora 的 diffusion 过程其实是在从噪声状态在 text prompts 的约束下,预测可能的结果(视频)。这个过程看似跟狭义世界模型没有关系,但其实可以这么理解:

标准的狭义世界模型的状态转移过程为:s_0 -> a_0 -> s_1 -> a_1 -> s_2 -> ... -> a_T-1 -> s_T。对于一个视频来说,每一帧都可以看做一个状态s,但是某一时刻动作其实很难描述,我们很难用自然语言或者其他形式来描述相邻两帧之间发生了什么。但是我们可以用自然语言描述视频在做什么,也就是s_0到s_T发生了什么,也就是将动作序列 A={a_0, a_1, ..., a_T-1} 一起打包表示成一句话或者一段话。在 Sora中,text prompts 可以看做成这样的动作序列A。而 Sora 理解世界的过程也和一般的狭义世界模型不太一样,s_0 不再是第一帧,而是“混沌”状态(噪声),于是乎diffusion的过程可以理解为:s_0(噪声) -> A -> s_1 -> ... -> A -> s_T(清晰视频)。这其中,虽然 Sora 并没有显式建模世界的 dynamics,但其实在理解自然语言和视频内容之间的关系,算是一种广义上的世界模型。

3

Sora 成功的关键

  • 大规模训练:大力出奇迹,这点毋庸置疑。大模型、大数据量、使用大规模算力,OpenAI 基本操作。

  • 敢于突破常规、不屑于刷点:之前工作基本都采用 SD 预训练的 visual encoder,也知道该 encoder 多少有点不合理(比如只能处理固定size的输入),但没有人真的去重新训练一个更合理的 encoder(当然,更可能是算力不支持)。而 OpenA I发现问题,就用算力来解决问题(大概率重新训练visual encoder)。

  • 实事求是 + 绝对领先的 sense:自回归的建模方式在 LLM 中大获成功,GPT 系列也出自 OpenAI,但这不代表 “Autoregressive is everything”,Sora 告诉大家,生成视频无需采用自回归,直接 3D 建模+ transformer encoder 结构就ok。

  • AGI 理念从上至下传播:Sam Altman 绝对是一个有大格局的人物,其最终目标是实现 AGI,我想整个 OpenAI 应该都会贯彻这样的理念,不管是 ChatGPT 还是 Sora,都能看到 AGI 的影子。

4

领取《AI 大模型技术直播

我们梳理了下 AI 大模型应用开发的知识图谱,包括12项核心技能:大模型内核架构、大模型开发 API、开发框架、向量数据库、AI 编程、AI Agent、缓存、算力、RAG、大模型微调、大模型预训练、LLMOps 等。

e0d3111c7f1a5601fe2d279fbbe45a7b.png

为了帮助同学们掌握 AI 大模型应用开发技能,我们准备了一系列免费直播干货扫码全部领取

1dc8964e650f4edbb1dc5d1d99a2a264.png

参考链接:https://mp.weixin.qq.com/s/Efk-gP8iuau3crWB2wWizg

END

OpenAI划时代文本生成视频大模型Sora技术报告最全详细解读 计算机领域顶会论文,CCF,SCI,EI,专利竞赛软著等1v1论文辅导!👇【立即咨询】一站式服务,短期快速投稿💥个性化的指导和顶尖的科研团队支持,助您攀登科研高峰对于计算机专业的硕博生来说,拥有一篇人工智能科研论文及专利软著竞赛是保研考研留学深造以及找工作的关键门票!!!🏃无论您是想申请研究生、博士生,还是渴望赴海外留学,或是立志进入大厂的核心岗位,一篇高质量的SCI/CCF论文是关键所在!我们的团队充满热情和专业知识,致力于为您提供卓越的科研指导和论文辅导服务。 阅读详情

相关推荐

【最全详细解读Sora都有哪些不足与缺陷?

计算机领域顶会论文,CCF,SCI,EI,专利竞赛软著等1v1论文辅导!👇【立即咨询】一站式服务,短期快速投稿💥个性化的指导和顶尖的科研团队支持,助您攀登科研高峰对于计算机专业的硕博生来说,拥有一篇人工智能科研论文及专利软著竞赛是保研考研留学深造以及找工作的关键门票!!!🏃无论您是想申请研究生、博士生,还是渴望赴海外留学,或是立志进入大厂的核心岗位,一篇高质量的SCI/CCF论文是关键所在!我们的团队充满热情和专业知识,致力于为您提供卓越的科研指导和论文辅导服务。

DFCED的博客 1852

终极MPC Video Renderer配置指南:开启RTX HDR视觉革命

想象一下,你正观看一部最新的4K HDR电影,但画面色彩平淡、细节模糊,完全没有影院级的震撼体验。这不是你的显示设备不够好,而是缺少一个强大的视频渲染引擎。今天,我将为你介绍一款能够彻底改变你观影体验的开源神器——MPC Video Renderer,这款免费的DirectShow视频渲染器通过RTX技术深度整合HDR功能,让每一帧画面都焕发生机。 MPC Video Renderer不仅仅是一

gitblog_00072的博客 595

Open-Sora代码详细解读(1):解读DiT结构

目前开源的DiT视频生成模型不是很多,Open-Sora是开发者生态最好的一个,涵盖了DiT、时空DiT、3D VAE、Rectified Flow、因果卷积等Diffusion视频生成的经典知识点。本篇博客从Open-Sora的代码出发,深入解读背后的原理。

沉迷单车的追风少年 2129

通俗深入的理解Sora的架构原理

这篇文章是面向有一定理工科基础,能理解一些基本的工程逻辑或理工常识,但非数学或算法相关专业或职能的同学。他们可能对相关系统,架构感兴趣,想要从基本原理的角度去理解它的核心思想,进而希望做到能有自己的观点和判断,有理有据,不人云亦云。

colorant的专栏 4924

OpenAI-sora官方公开报告解读

本篇文章主要面向国内不熟悉英语又对sora感兴趣的同学,对OpenAI公开sora的文章(机翻基本不能看)做了翻译与解读。想要做进一步了解的同学,可以直接访问[官方原文](https://openai.com/sora)查阅。

weixin_45125466的博客 3026

一文带你了解 OpenAI Sora

最近AI圈最火的无疑是OpenAI在2月15日发布的SoraSora可以根据文本生成一分钟的高清视频,生成的视频画质、连续性、光影等都令人叹为观止,Sora无疑将视觉生成推到新的高度。本文将重点回答三个问题:(1)Sora的原理是什么?(2)Sora到底是不是世界模型?(3)Sora会影响哪些行业?

2201_75499313的博客 1261

OpenAI超级视频模型Sora技术报告解读,虚拟世界涌现了

昨天白天,「现实不存在了」开始全网刷屏。「我们这么快就步入下一个时代了?Sora简直太炸裂了」。「这就是电影制作的未来」!谷歌的Gemini Pro 1.5还没出几个小时的风头,天一亮,全世界的聚光灯就集中在了OpenAISora身上。Sora一出,众视频模型臣服。就在几小时后,OpenAI Sora的技术报告也发布了!其中,「里程碑」也成为报告中的关键词。

夕小瑶科技说 1797

OpenAI Sora视频模型技术原理报告解读

OpenAI Sora视频生成模型技术报告解读

周红伟讲AI 1982

OpenAI发布Sora技术报告深度解读!真的太强了!

OpenAI发布Sora技术报告深度解读,智能涌现......虚拟与现实的边界到底在哪里?

努力才是唯一的入场券。 2万+

解读OpenAI视频生成模型Sora背后的原理:Diffusion Transformer

OpenAI最近推出的视频生成模型Sora效果上实现了真正的遥遥领先,很多博主都介绍过Sora的效果,但是深入解读背后原理的博客却非常少。Sora的原理最主要的是核心模型主干《Scalable Diffusion Models with Transformers》和训练不同尺寸视频方法《Patch n' Pack: NaViT, a Vision Transformer for any Aspect Ratio and Resolution》。这篇博客详细解读Diffusion Transformer结构,

沉迷单车的追风少年 3973

OpenAISora技术详细解读

为了应对这一挑战,OpenAI推出了Sora技术,一种先进的分布式训练框架。更高效的资源调度策略:随着云计算和边缘计算的发展,Sora可能会引入更先进的资源调度策略,如基于强化学习的动态资源分配算法,以进一步提高资源利用率和训练效率。更智能的容错机制:未来,Sora可能会引入更智能的容错策略,如基于机器学习的故障预测和自动恢复机制,以进一步提高系统的稳定性和可靠性。更广泛的硬件支持:为了满足不同硬件平台的需求,Sora可能会扩展对更多类型CPU、GPU和TPU的支持,以实现更广泛的适用性和灵活性。

世岩清上 634

OpenAI 发布 Sora,可快速生成视频

大家好,我是苍何。今天看到 OpenAI 发布了 Sora,到处都在飞传,我去了解了下,好家伙,直接炸开,惊艳的无话可说!!!Sora 是一种的技术,从演示看,效果还是相当不错的,和真实世界拍出来的基本无区别。当然,你可能会说,这算啥,AI视频又不是什么新东西,但这次真的不一样,它的能力超过我们的想象,就连刘润、周鸿伟等大佬都纷纷坐不坐了,均来为这次的发布发声。我们可以用三个词来总结 Sora,那就是“”,“”,和“Sora 可以生成的视频,同时保持视觉质量并遵守用户的提示。

一个成长中的程序员,期待用技术的眼光生活 1198

Sora原理解读

本文将为你介绍Sora的原理

2401_83282017的博客 883

SORA技术报告快速解读——浅谈其AIGC积累的技术底蕴(待修订)

浅谈SORA技术方案

啥都会一点的小程的博客 1249

全面解读视频生成模型Sora

2024年2月15日,OpenAI在其官网发布了《Video generation models as world simulators》,提出了作为世界模拟器的视频生成模型Sora

聚集机器学习、信息安全 5597

这应该是全网第一篇全面解读OpenAI Sora报告的文章,精读报告:Video generation models as world simulators

今天是2024年2月16号,大年初七,年还没过完,早晨起来朋友圈就被Sora刷屏了。本来以为没啥,都是公众号或者视屏啥的,都没点开看,直到看到我导也发了Sora的文章,我就知道这个事情不简单了。先来看一段非常炸裂的效果,就是下面这个视频。真的,如果你不跟我说这是AI生成的,我还以为是哪个电影的镜头呢。这场景,这运镜,这清晰度,放大之后连脸上的斑都清晰可见,Oh my God,现实不存在了,现实真的不存在了。Tokyo walk。

Alex 3577

解读OpenAI关闭Sora

应用、API、sora.com、ChatGPT中的视频生成功能——全部消失。这篇博客文章涵盖了内容政策、水印、年龄限制等内容。这是一种精心准备的、面向未来的文档,通常用于计划长期运营一个产品的时候。OpenAI内部有人在为一个已经不复存在的未来做规划。三个月前,2025年12月,迪士尼,并签订了三年期的授权协议,在平台上提供超过200个迪士尼、漫威、皮克斯和星球大战角色。在关闭前,没有一分钱到账。表面上的故事很容易理解。Sora很昂贵。用户失去兴趣。OpenAI止损。合理。公司经常砍掉产品。

新缸中之脑 374
上一篇: K8S, AI 大模型推理优化的新选择!
下一篇: 一文搞懂 LangChain 新利器:LangGraph
musicml
博客等级 码龄20年 2756粉丝 739原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值