1.Sora概述
Sora是OpenAI于2024年2月发布的“文本到视频”生成式人工智能(AI)模型。
在视觉生成领域,Sora取得了技术上的突破。Sora模型独特之处在于,能够生成长达一分钟的符合用户文本指令的视频,同时保持较高的视觉质量和引人注目的视觉连贯性。与只能生成短视频片段的早期模型不同,Sora创作的一分钟长视频从第一帧到最后一帧都具有渐进感和视觉连贯性。

提示文本:一位时尚女性走在东京的街道上,街道上到处是温暖的霓虹灯和动画城市标志。她身穿黑色皮夹克、红色长裙和黑色靴子,手拿黑色钱包。她戴着太阳镜,涂着红色唇膏。她走起路来自信而随意。街道潮湿而反光,与五颜六色的灯光形成镜面效果。许多行人走来走去。
Sora的另一个特性是其对物理世界模拟的潜力。OpenAI声称通过教AI理解和模拟运动中的物理世界,训练出的Sora模型能根据“文本指令”生成逼真或富有想象力的场景视频,并展现出模拟物理世界的潜力。Sora能够生成包含多个角色、特定运动类型,以及主体和背景等准确细节的复杂场景。该模型不仅能理解用户在提示中提出的要求,还能理解这些事物在物理世界中是如何存在的。

提示文本:两艘海盗船在一杯咖啡中航行时的逼真特写视频。
Sora模型对语言有深刻理解,因此能准确解释提示,并生成能表达生动情感的引人注目的角色。Sora还能在单个生成的视频中创建多个镜头,准确地体现角色和视觉风格。这些进步显示了Sora作为世界模拟器的潜力,它可以提供对所描绘场景的物理和背景动态的细微洞察。

提示文本:几头巨大的长毛猛犸象在雪白的草地上漫步,它们长长的毛发随风轻扬,远处是白雪覆盖的树木和壮观的雪山,午后的光线伴着飘渺的云朵和远处高高挂起的太阳,营造出温暖的光晕,低机位拍摄的景色令人惊叹,捕捉到了大型毛茸茸的哺乳动物,摄影和景深都非常漂亮。
Sora还可以对视频编辑,我们还可以使用Sora在两个输入视频之间逐步插值,在主题和场景构成完全不同的视频之间创建无缝过渡。


在下面的示例中,将以上两个视频进行了视频插接。

作为一款模拟器,Sora目前还存在许多局限性。它可能难以准确模拟复杂场景中的物理现象,也可能无法理解具体的因果关系。如下面的示例中,玻璃碎裂并没有正确体现出来。

注:本章节中所有视频均来自于OpenAI官网
2.Sora技术报告摘要和统计
自从2019年OpenAI设立了“利润上限”部门并接受微软的投资后,OpenAI不再Open。虽然OpenAI产品力领先,但现在其核心模型(例如ChatGPT、GPT-4、Sora)不仅不再开源,论文也不再开放。因此我们只能基于OpenAI公开的技术报告,及一些相关的逆向工程,对Sora背后的相关技术进行探讨。
2.1 Sora技术报告摘要
以下摘自Sora技术报告原文,黑体加粗者特意使用英文原词,这些词汇明确说明了训练的细节和相关的技术。
我们在variable durations, resolutions and aspect ratios(不同时长、不同分辨率和不同长宽比)的视频和图像上联合训练text-conditional diffusion models。我们利用a tr

382




被折叠的 条评论
为什么被折叠?



