深度解读丨火爆全球的AI文生视频大模型Sora

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

1.Sora概述

Sora是OpenAI于2024年2月发布的“文本到视频”生成式人工智能(AI)模型。

在视觉生成领域,Sora取得了技术上的突破。Sora模型独特之处在于,能够生成长达一分钟的符合用户文本指令的视频,同时保持较高的视觉质量和引人注目的视觉连贯性。与只能生成短视频片段的早期模型不同,Sora创作的一分钟长视频从第一帧到最后一帧都具有渐进感和视觉连贯性。

提示文本:一位时尚女性走在东京的街道上,街道上到处是温暖的霓虹灯和动画城市标志。她身穿黑色皮夹克、红色长裙和黑色靴子,手拿黑色钱包。她戴着太阳镜,涂着红色唇膏。她走起路来自信而随意。街道潮湿而反光,与五颜六色的灯光形成镜面效果。许多行人走来走去。

Sora的另一个特性是其对物理世界模拟的潜力。OpenAI声称通过教AI理解和模拟运动中的物理世界,训练出的Sora模型能根据“文本指令”生成逼真或富有想象力的场景视频,并展现出模拟物理世界的潜力。Sora能够生成包含多个角色、特定运动类型,以及主体和背景等准确细节的复杂场景。该模型不仅能理解用户在提示中提出的要求,还能理解这些事物在物理世界中是如何存在的。

提示文本:两艘海盗船在一杯咖啡中航行时的逼真特写视频。

Sora模型对语言有深刻理解,因此能准确解释提示,并生成能表达生动情感的引人注目的角色。Sora还能在单个生成的视频中创建多个镜头,准确地体现角色和视觉风格。这些进步显示了Sora作为世界模拟器的潜力,它可以提供对所描绘场景的物理和背景动态的细微洞察。

提示文本:几头巨大的长毛猛犸象在雪白的草地上漫步,它们长长的毛发随风轻扬,远处是白雪覆盖的树木和壮观的雪山,午后的光线伴着飘渺的云朵和远处高高挂起的太阳,营造出温暖的光晕,低机位拍摄的景色令人惊叹,捕捉到了大型毛茸茸的哺乳动物,摄影和景深都非常漂亮。

Sora还可以对视频编辑,我们还可以使用Sora在两个输入视频之间逐步插值,在主题和场景构成完全不同的视频之间创建无缝过渡。

 

在下面的示例中,将以上两个视频进行了视频插接。

 

 作为一款模拟器,Sora目前还存在许多局限性。它可能难以准确模拟复杂场景中的物理现象,也可能无法理解具体的因果关系。如下面的示例中,玻璃碎裂并没有正确体现出来。

注:本章节中所有视频均来自于OpenAI官网

 

2.Sora技术报告摘要和统计

自从2019年OpenAI设立了“利润上限”部门并接受微软的投资后,OpenAI不再Open。虽然OpenAI产品力领先,但现在其核心模型(例如ChatGPT、GPT-4、Sora)不仅不再开源,论文也不再开放。因此我们只能基于OpenAI公开的技术报告,及一些相关的逆向工程,对Sora背后的相关技术进行探讨。

2.1 Sora技术报告摘要

以下摘自Sora技术报告原文,黑体加粗者特意使用英文原词,这些词汇明确说明了训练的细节和相关的技术。

我们在variable durations, resolutions and aspect ratios(不同时长、不同分辨率和不同长宽比)的视频和图像上联合训练text-conditional diffusion models。我们利用a tr

陈巍:Sora大模型技术精要万字详解——原理、关键技术、模型架构详解与应用 我们将Sora的技术特点划分为输入输出特征、功能特征、时空与角色一致性三类。以往的文生视频算法多数是采用公开训练数据,生成的视频多数不够美观,分辨率低,而且在生成视频的过程中,无法精准体现文本提示的内容,用户的文本提示难以转化为高清高质量视频。当然更大的难点是视频中主角运动不连贯或不自然,在镜头移动的时候,主体边缘容易畸变,特别是人物表情细节的畸变严重影响视频的表达效果。Sora技术特征图示(来源:Data Science Dojo) 阅读详情

相关推荐

别再到处找了!2024最新银河麒麟V10全版本(飞腾/龙芯/兆芯)官方下载与安装保姆级教程

本文提供2024年银河麒麟V10操作系统全版本(飞腾/龙芯/兆芯)的官方下载与安装保姆级教程,涵盖版本选择、镜像获取、启动盘制作及安装优化等关键步骤,助您高效部署国产操作系统。

weixin_26846533的博客 382

谷歌发布文生视频模型——Veo,可生成超过一分钟高质量1080p视频

Veo 是Google迄今为止最强大的视频生成模型。它可以生成超过一分钟的高质量 1080p 分辨率视频,具有多种电影和视觉风格。

人工智能研究所的博客 1449

51-28 Sora 文生视频背后的核心技术

本文沿着Transformer、ViT、CLIP、DALLE、DiT模型,介绍了Sora背后的核心技术,并延展性的介绍了视频理解、多模态大模型、论文复现和微调等内容。

AIgraphX 1678

视频扩散模型介绍 Video Diffusion Models Introduction

扩散过程和去噪过程 去噪器,预测出来噪声然后与原始图片相减,得到干净的图片 当然,去噪过程是逐步的,所以减去之后会重新加上“平均噪声” 跳步 DDIM和DDPM作对比:

m0_51371693的博客 4388

超实用!! 一文带你玩转所有类型的大模型(包含:文生文,文生图,文生视频,图生视频

在探索人工智能的无限可能中,文本和图像生成技术正逐渐成为创意表达的新领域。无论是通过文字激发想象的文生文技术,还是将静态图像转化为动态故事的文生图和图生视频技术,它们都为我们打开了一扇扇通往创意世界的大门。在这些技术的帮助下,我们可以将抽象的概念转化为具体的叙述,将平面的图像赋予生命力。以下是一些编写提示词的指导原则,它们将帮助你更好地掌握这些技术,创造出令人印象深刻的作品。

2401_85379281的博客 7139

Sora文生视频模型深度剖析:全网独家指南,洞悉98%关键信息,纯干货

Sora文生视频模型深度剖析:全网独家指南,洞悉98%关键信息,纯干货

丨汀、的博客 3091

如何从文本生成图像和视频?9个常用生成器一览!

近年来,深度学习和自然语言处理(NLP)技术的快速进步推动了AI文本到图像和AI文本到视频生成器的发展,这些生成器已成为一种先进而强大的工具,能够从文本描述中生成图像和视频。这些AI生成器利用先进而复杂的技术,如基于注意力的循环神经网络,生成对抗网络和变压器,来分析文本数据,从而生成相应的高质量图像或视频AI文本到图像和AI文本到视频生成器的动机在于推动内容创作过程的自动化,以更快、更有效的方式产生多样化的内容。这些系统在营销、教育和娱乐内容创作等不同领域都有潜在的应用。

AIGCer的博客 1799

Sora到底是什么?Sora详解:一文带你熟悉Sora

自2015年成立以来,OpenAI已经成为人工智能研究与推广的领军机构。这家机构在深度学习、自然语言处理等多个前沿领域不断取得重大突破,引领着行业的发展潮流。

2301_81940605的博客 6095

大模型文生视频现状

**性能特点**:总分82.02(SuperCLUE榜单第一),支持5-8秒视频生成(1080p),多比例适配(16:9、9:16等),采用DiT架构,画面一致性和细节处理优秀。- **性能特点**:对标Sora,采用U-ViT架构,生成时长4-8秒(1080p),画面连贯性较强,但商业化应用较晚。- **性能特点**:总分80.92,生成视频时长6-8秒,支持多镜头转场,在短视频领域应用广泛,但动作变形问题仍存在。- **性能特点**:可生成任意长度视频,但质量较差,真实性不足,尚未公测。

Gu_erye的博客 3707

AI视频制作一本通:文本生成视频、图片生成视频视频生成视频

随着人工智能AI)技术的飞速发展,视频制作领域也迎来了创新的浪潮。文本生成视频是其中的一项令人激动的进展,它利用自然语言处理技术将文本内容转化为视频。这项技术在广告、教育、娱乐等领域有着广泛的应用,可以快速生成吸引人的视频内容。感兴趣的小伙伴,赠送全套AIGC学习资料,包含AI绘画、AI人工智能等前沿科技教程和软件工具,具体看这里。​AIGC技术的未来发展前景广阔,随着人工智能技术的不断发展,AIGC技术也将不断提高。

bagell的博客 5017

【精华】AIGC之文生视频及实践应用

从 Stable Diffusion 到 Midjourney,再到 DALL·E-2,文生图模型已经变得非常流行,并被更广泛的受众使用。随着对多模态模型的不断拓展以及生成式 AI 的研究,业内近期的工作试图通过在视频领域重用文本到图像的扩散模型,将其成功扩展到文本到视频的生成和编辑任务中,使得用户能够仅仅给出提示便能得到想要的完整视频

一个内容严谨、方向前沿、极具实践价值的AI大模型技术分享站 7219

字节发布MagicVideo2文本生成视频模型,一句话便可生成动态视频

文生大模型已经火了很长一段时间了,而随着技术与模型算法的不断提升,文生视频模型也越来越多。今天就介绍一下字节跳动发布的MagicVideo-V2文生视频大模型

人工智能研究所的博客 2271

复刻大模型 Sora 有多难?一张图带你读懂 Sora 的技术路径

近日,OpenAI 发布了视频生成模型Sora,最大的Sora模型能够生成一分钟的高保真视频。同时OpenAI称,可扩展的视频生成模型,是构建物理世界通用模拟器的一条可能的路径。Sora 能够生成横屏1920*1080视频,竖屏1080*1920视频,以及之间的所有内容。这使得Sora可以兼容不同的视频播放设备,根据特定的纵横比来生成视频内容,这也会大大影响视频创作领域,包括电影制作,电视内容,自媒体等。

2301_78285120的博客 1971

大语言模型LLM的文生图、文生视频文生语音技术简介

传统的LLM在生成每个单词时只使用前面的上下文信息,而Llama通过引入前瞻结构,将后面的上下文也考虑在内,从而提高了生成文本的质量和连贯性。LLM的原理是通过大规模的数据集进行训练,通过学习数据中的语言模式和规律,来生成符合语法和语义的文本。同时,模型的优化和调整也可以进一步提升生成的质量。通过将训练好的大语言模型与TTS和ASR模型相结合,可以实现基于文本描述生成语音的功能,或者将语音转化为文本。需要注意的是,实现这些功能需要大量的数据和计算资源,并且可能涉及到一些复杂的技术,如生成模型、对齐算法等。

North_D的博客 4030

Sora关键词优化技巧(一):避免赘余和模糊表达

冗余的提示词会增加模型的处理负担,可能导致生成的视频内容臃肿、不紧凑;因此,为了获得高质量的视频生成效果,创作者需要精心选择和使用提示词,确保它们既具体、生动,又避免冗余和模糊。通过使用这些提示词,创作者可以为视频生成器提供清晰、明确的指导,使生成的视频内容更加紧凑、有趣且符合预期。这样做可以为模型提供更直观的信息,减少理解的模糊性,并增加生成内容的准确性。:“展示忙碌的上班族、悠闲的老人和嬉戏的孩童,捕捉他们各自的神态和动作。:“强调城市的快节奏与人们的多样生活,传达出对城市的热爱和对生活的向往。

七夜zippoe的博客 1316

开源通义万相本地部署方案,文生视频、图生视频视频生成大模型,支持消费级显卡!

本测试的硬件系统:Windows11专业版CPU: 英特尔I7-13700KF内存: 32G硬盘:1T nvme +4T 机械显卡:RTX 4070 Ti。

星哥玩云 6057

多模态大模型来了,Kimi 内测音乐视频功能,根据歌词直接生成MV

而Kimi的音乐视频生成功能正好满足了这一需求。与市场上现有的需要专业剪辑软件或复杂操作流程的产品相比,Kimi的工具对普通用户来说,几乎零门槛的操作体验将吸引大量创作者加入这一阵营。随着视频平台竞争的加剧,品牌和个人内容创作者都在寻找新的方式与观众互动,而Kimi的自动化创作工具无疑是一个重要的发展方向。在市场中,Kimi的这一新功能不仅增强了其在AI创作领域的竞争力,同时也让其在面对大型内容创作平台时具备了更强的优势。

shelly聊AI的博客 2572

Stable Diffusion能生成视频了!动画版上线!支持文本图像视频多种输入方式

Stable Diffusion也能生成视频了!你没听错,StabilityAI推出了一款新的文本生成动画工具包StableAnimation SDK,可支持文本、文本+初始图像、文本+视频多种输入方式。使用者可以调用包括Stable Diffusion 2.0、Stable Diffusion XL在内的所有StableDiffusion模型,来生成动画。Stable Animation SDK的强大功能一经展现,网友惊呼:哇哦,等不及想试试了!

2401_85116933的博客 1245

WAN2.2文生视频+SDXL_Prompt风格提示词库分享:20个已验证高成功率中文模板

本文介绍了如何在星图GPU平台上自动化部署WAN2.2-文生视频+SDXL_Prompt风格镜像,高效实现中文提示词驱动的AI视频生成。该方案支持开箱即用的动态内容创作,典型应用于国风短视频、电商产品演示及文旅宣传等场景,显著提升视频生成质量与中文语义准确性。

weixin_32389853的博客 307

Ut接口原理及 VoLTE 补充业务自管理信令流程(GBA 引导认证+业务访问认证+ VoLTE 补充业务自管理)

2. Ut 接口及 VoLTE 业务子管理概述 2.1 UT 接口 —— VoLTE 终端补充业务配置 2.2终端通过 Ut 接口完成 VoLTE 补充业务自管理举例 2.3什么是 GBA 和 GAA 架构 2.4为什么要引入 GBA 架构认证及 BSF 网元 2.5UE(终端) 接口相关网元及功能 2.6GBA 架构流程概述 3. Ut 接口业务自管理信令流程 3.1 补充业务自管理及本文主要参考以下规范 3.2 Ut 接口业务自管理信令流程:查询补充业务 3.2.1 UE获

原来45的博客 1207

基于MATLAB的水果识别的数字图像处理项目源码+答辩PPT文档资料(高分项目)

基于MATLAB的水果识别的数字图像处理项目源码+答辩PPT文档资料(高分项目),含有代码注释,新手也可看懂,个人手打98分项目,导师非常认可的高分项目,毕业设计、期末大作业和课程设计高分必看,下载下来,简单部署,就可以使用。该项目可以直接作为毕设、期末大作业使用,代码都在里面,系统功能完善、界面美观、操作简单、功能齐全、管理便捷,具有很高的实际应用价值,项目都经过严格调试,确保可以运行!基于MATLAB的水果识别的数字图像处理项目源码+答辩PPT文档资料(高分项目)基于MATLAB的水果识别的数字图像处理项目源码+答辩PPT文档资料(高分项目)基于MATLAB的水果识别的数字图像处理项目源码+答辩PPT文档资料(高分项目)基于MATLAB的水果识别的数字图像处理项目源码+答辩PPT文档资料(高分项目)基于MATLAB的水果识别的数字图像处理项目源码+答辩PPT文档资料(高分项目)基于MATLAB的水果识别的数字图像处理项目源码+答辩PPT文档资料(高分项目)基于MATLAB的水果识别的数字图像处理项目源码+答辩PPT文档资料(高分项目)基于MATLAB的水果识别的数字图像处理项目

上一篇: 2024 CHINASHOP丨悠络客AI应用亮点抢鲜看,还有价值百元门票免费送哦!
下一篇: 悠络客亮相 2024 CHINASHOP,AI赋能助力门店提升营收、降本增效
ulucu888
博客等级 码龄4年 148粉丝 · 56原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值