Meta 开源文本音频和音乐模型

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

继续其开源的生成式AI使命,Meta最新推出的产品是AudioCraft,这是一组文本到音频和音乐模型。

AudioCraft包括三个模型:MusicGen、AudioGen和EnCodec。这些模型的命名非常贴切——MusicGen从文本提示中生成Meta拥有和经过授权的音乐,AudioGen从公共音频中训练生成音效,而改进版的EnCodec解码器能够以较少的伪像生成“更高质量”的音乐,据公司称。

Meta表示,这使得AudioCraft成为“一站式代码库”满足生成音频需求:音乐、音效和压缩。

MusicGen模型有300万、15亿和33亿个参数。AudioGen有2.85亿和10亿个参数。

Meta在一篇博文中表示,使用AI生成音乐存在局限性,这是由于使用了符号表示法,如MIDI或钢琴卷帘。这些方法“无法完全把握音乐中的表现细微差别和风格元素。”虽然近年来已经取得了更多进展,但公司表示“在这个领域还可以做得更多”。

Meta表示,通过AudioCraft,“人们可以轻松地扩展我们的模型并根据他们的研究用例进行调整。”“一旦让人们能够访问模型并根据自己的需求进行调整,几乎有无限的可能性。而这正是我们想通过这组模型实现的:赋予人们扩展他们工作的能力。”

然而,该公司还承认这些数据集“缺乏多样性”,因为音乐数据中包含了“大部分”英语文本和元数据的西方风格音乐。Meta希望通过开源这些模型,更广泛的社区可以帮助限制或完全消除偏见。

这些模型及其权重和代码可根据MIT许可证供研究人员和从

Meta开源模型AudioCraft文本自动生成音乐 仅用文本就能生成鸟叫、汽车喇叭声、脚步等背景音频,或更复杂的音乐,适用于游戏开发、社交、视频配音等业务场景。Meta表示,ChatGPT掀起的大语言模型热潮受到了全球各行业的热烈追捧,相继开发出了很多自动生成文本、图片、视频的大模型。MusicGen是一个文本生成音乐的自回归语言模型,大约使用了40万份文本描述元数据的录音,总计2万小时的授权音乐进行训练。AudioGen是一个文本生成音频的自回归语言模型,具备分离音频功能,例如,可识别背景声、说话声物体发出的声音等。谐,微风,随,朴实的音乐 阅读详情

相关推荐

Meta发布AIGC生成式人工智能模型来生成音乐与音效——AudioCraft

近年来,包括语言模型在内的生成式人工智能模型取得了巨大进步,特别是ChatGPT的发布,让大家看到了大语言模型的魅力。模型下载完成后,我们就可以使用model.generate函数来生成音乐了,这里可以一次输入多个文本模型会自动根据输入的文本,生成多个音频文件,最后,我们可以display或者下载生成好的音乐文件。我们可以直接使用以上代码生成一个可视化的UI界面,我们只需要在输入框中,输入相应的文本,就可以利用模型生成音乐了。AudioGen 使用公共音效进行训练,根据用户输入的文本生成音频音效。

人工智能研究所的博客 617

Meta 发布开源 AI 工具 AudioCraft文本自动生成音乐

Meta 表示,这款人工智能工具将 AudioGen、EnCodec MusicGen 三种模型或技术融为一炉,可用文本内容生成高质量、逼真的音频音乐。比如用文本就能生成鸟叫、汽车喇叭声、脚步等背景音频,或更复杂的音乐,适用于游戏开发、社交、视频配音等业务场景。,MusicGen 接受过 Meta 拥有的特别授权的音乐训练,可以从文本提示生成音乐,而 AudioGen 接受过公共音效训练,可从文本提示生成音频,比如模拟狗叫或脚步声;Facebook 母公司 Meta

Jdjdjjdjdjdje的博客 296

开源 AudioCraft 模型:为视频制作者提供免费音乐

随着预先训练的 AudioGen 模型的推出,用户现在能够生成各种逼真的环境声音迷人的效果,例如狗的叫声、汽车喇叭声或木地板上的脚步声,所有这些都来自简单的文本 -基于输入。此公告的另一个值得称赞的方面是 Meta 愿意向那些想要使用独特数据集训练自己的模型的个人授予访问权限。这种包容性的方法促进了创新创造力,吸引了广泛的观点并开辟了新的探索途径。有了 AudioCraft音频生成的未来不再是遥远的梦想,而是切实的现实。总之,Meta 的最新产品是人工智能驱动的音频生成领域的一次飞跃。

iCloudEnd的博客 456

MusicGen vs AudioGen:深度对比两大AI音频生成模型性能差异

想要了解AI音频生成的最新进展吗?Audiocraft库中的MusicGenAudioGen是目前最先进的两个音频生成模型,它们在音乐生成声音生成方面各有特色。作为Meta AI开源的研究成果,这两个模型都基于EnCodec音频压缩技术,但在应用场景性能表现上存在明显差异。🎵 ## 🔍 核心功能对比 **MusicGen** 专门用于**文本音乐的生成**,支持旋律引导多种音乐

gitblog_01106的博客 596

Meta AI 重磅发布代码大模型 Code Llama

刚刚,Meta AI 如期而至发布了 Code Llama ,这是一个可以使用文本提示生成代码的大型语言模型 (LLM)。Code Llama 是针对代码任务的公开LLM的最先进技术,有可能使当前开发人员的工作流程更快、更高效,并降低学习编码人员的进入门槛。Code Llama有潜力用作生产力教育工具,帮助程序员编写更强大、文档更齐全的软件。值得让人兴奋的是,Code Llama 完全开源,现已公开供研究商业用途。

FrenzyTechAI的博客 1088

AudioGen实战:文本到声音生成的完整教程

AudioGen是Meta开源文本到声音生成AI模型,能够根据自然语言描述生成高质量的环境音效。作为Audiocraft音频处理框架的核心组件,AudioGen使用先进的深度学习技术,将文本提示转换为逼真的音频内容。本教程将带你从零开始掌握AudioGen的使用方法,让你轻松实现文本到声音的转换。 ## 快速入门:安装与环境配置 首先克隆AudioCraft项目并安装依赖: ```bash

gitblog_00120的博客 497

昇思25天学习打卡营第12天|基于MindNLP+MusicGen生成自己的个性化音乐

MusicGen是由Meta推出的一个开源人工智能音乐模型,该模型允许用户通过文本描述来生成音乐,详见。MusicGen采用基于Transformer的语言模型架构,可以同时处理多个压缩的离散音乐表示(即token),并通过一种有效的token交错模式提高了生成效率质量。它利用Meta公司开发的EnCodec神经音频压缩技术,将音乐从高采样率压缩到低采样率以减小计算量,同时保持高保真度重建。

Evrils的博客 482

Audiocraft多模态生成:结合文本旋律的音乐创作

Audiocraft是由Facebook AI Research开发的开源音频生成库,提供最先进的AI音乐生成功能。其核心模型MusicGen能够通过文本描述旋律输入,生成高质量的音乐内容,为音乐创作带来了革命性的多模态生成体验。 ## 📊 Audiocraft多模态音乐生成架构 Audiocraft采用先进的Transformer架构,结合文本音频两种模态的输入,实现精准的音乐生成控制

gitblog_01080的博客 458

终极AI音频生成指南:5分钟学会免费创作专业音乐

Audiocraft是一款由FAIR团队开发的开源AI音频处理与生成库,集成了EnCodec音频压缩技术MusicGen音乐生成模型,让任何人都能通过简单文本或旋律提示创作专业级音乐。本文将带你快速掌握这一强大工具的安装与使用,开启AI音乐创作之旅。 ## 🎵 为什么选择Audiocraft?三大核心优势解析 Audiocraft作为Meta AI推出的开源项目,凭借以下特性在同类工具中脱

gitblog_00452的博客 1107

文字转音乐黑科技:Meta开源模型本地化部署实录

本文介绍了如何在星图GPU平台上自动化部署🎵 Local AI MusicGen镜像,实现文字生成音乐的本地化应用。用户无需专业乐理知识,仅需输入英文提示词(如‘lo-fi hip hop beat’),即可快速生成高质量WAV音频,广泛适用于短视频配乐、播客开场、课件背景音等场景。

weixin_31486261的博客 157

Local AI MusicGen开源优势:可定制化音乐生成模型

本文介绍了如何在星图GPU平台自动化部署🎵 Local AI MusicGen镜像,实现本地化AI音乐生成。用户通过简单的文本描述即可快速创建定制背景音乐,广泛应用于视频制作、游戏开发等场景,提升创作效率并保障隐私安全。

weixin_36204513的博客 306

【限时免费】 下一个独角兽?基于musicgen-large的十大创业方向与二次开发构想...

下一个独角兽?基于musicgen-large的十大创业方向与二次开发构想 【免费下载链接】musicgen-large 项目地址: https://gitcode.com/mirrors/facebook/musicgen-l...

gitblog_02115的博客 508

NUS:冻结语义表征构建视频生成潜空间

当前视频自编码器的潜空间主要优化像素级重建,但重建最优的潜空间是否适合生成建模?论文提出V-RAE,在冻结的视觉基础模型表征之上构建紧凑的生成潜空间,实现更高质量、更快收敛的视频生成。

大模型任我行的博客 348

WebUI、API、CLI Agent Skill 如何共用一条视频生成流水线

bookcourse-ref: 5fcb0294f53276b6a16cb410383e6f4e6ee91c6a|book/大鹏 AI 视频生成技术实战/英文版/08 From Models to Systems.md|8. From Models to Systems|740e632d69c29ed6cc227ff0d189cc2dde45c6c25692f48b7e19e5ebd0027d63。

未来已来,AI时代,学AI编程,做AI量化,就来大鹏AI教育。 330

IT6622 技术解析:eARC音频回传与HDMI发射单芯片方案

芯片同时承载正向视频发射与反向eARC音频采集两套独立数据流:正向链路中,内置视频发生器生成视频流,外部音频经TX数字音频输入引脚送入音频编码器,两者合并为完整HDMI TMDS信号输出至显示终端;硬件内置音频解码流水线,回传音频可自动分流至四路独立I2S通道,支持TDM时分复用输出,兼容8声道无损高清音频。内置硬件音频多路切换单元,可自由切换eARC回传音频与外部I2S输入音频两路音源,混合后送入HDMI音频编码器封装至TMDS数据流。多路音频通道硬件独立缓存,切换过程无音频中断或卡顿。

2601_96679904的博客 199

电脑录屏软件内录无声?系统音频捕获技术全解析

电脑录屏时只录到环境噪音而丢失系统音频是常见问题,根源在于录屏工具未能正确捕获电脑内部音频流。Windows音频架构复杂,不同版本系统(如Win7/10/11)的音频设备命名规则差异大,导致兼容性问题。本文从WASAPI音频架构出发,介绍了四种技术解决方案(Python+sounddevice、FFmpeg+dshow、C#+NAudio、OBS Lua脚本),并分析了专业录屏软件的工程化实现。文章指出,虽然底层原理相通,但普通用户更推荐使用封装完善的录屏工具,以规避设备兼容性同步问题,实现一键高质录屏。

qingmiaozhuan的博客 340

多模态模型是什么?文本、图像、音频如何统一理解?

你有没有想过这个问题—— 你看到一张猫咪照片,能马上说出"这只猫在沙发上睡觉,阳光照在它的毛上真舒服"。这个过程对你来说再自然不过。 但如果让传统AI来做呢? 它要么只能识别"这是猫",要么只能处理"猫这个字怎么写"。

404 Not Found 765

金融AI Agent批量处理抖音视频实战

将抖音批量视频处理能力与金融AI Agent结合,本质是构建一个。

u010305527的博客 153
上一篇: Microsoft在Windows系统中停用Cortana,专注于下一代人工智能
下一篇: 微软的 Bing Chat 即将登陆第三方浏览器,包括移动设备
每日值得看
博客等级 码龄3年 364粉丝 35原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值