引言:全模态拼图的最后一块
谷歌 Gemini 的含金量,还在持续升值。
从最初的纯文字对话,到后来的多模态图片识别,再到视频生成,Gemini 正在一步步补齐它的全模态版图。今天,轮到了音频。
就在刚刚,谷歌正式在 Gemini 上线了最新的 AI 音乐生成模型 —— Lyria 3。这一次,谷歌不再满足于让 AI“说话”,而是要让它“唱歌”。
一、 三种玩法:让 AI 音乐从“小众工具”变“大众玩具”
目前 Gemini 的月活用户已达 7.5 亿,Lyria 3 的接入,意味着 AI 音乐创作门槛被彻底抹平。在网页端工具菜单中选择 「Create music 创作音乐」 即可体验:
- 文字提示词生成:描述一个风格、一种情绪、一段回忆,甚至是一个笑话,Gemini 就能产出一段带歌词、带唱腔、带封面的完整歌曲。
- 图片/视频转音乐(最惊艳):上传一张猫咪晒太阳的照片,它能生成一段慵懒的爵士;上传一段海浪视频,它能匹配一段清新的民谣。AI 会自动分析画面情绪进行“通感”创作。
- 模板创作:对于没有灵感的用户,谷歌提供了动态建议模板,修改几个关键词即可快速出片。
技术规格:
- 时长:统一 30 秒。
- 封面:由 Nano Banana Pro 自动生成。
- 音质:Lyria 3 相比前代显著提升,音轨更真实、结构更复杂。
二、 Lyria 3 的技术进化与产品定位
Lyria 3 不仅仅是简单的升级,它实现了从“辅助工具”到“自动化生产”的跨越。
- 全自动编词谱曲:上一代模型需要用户自备歌词,而 Lyria 3 只需要你丢入一个想法。
- 高自由度参数:风格、人声、速度均可手动微调。
- 定位精准:谷歌官方表示,Lyria 3 并非为了取代专业音乐人创作杰作,而是旨在为普通人的日常生活提供**“有趣的自定义配乐”**。
这种定位非常聪明——它瞄准的是短视频背景音乐、社交媒体分享和个人创意表达,这正是 7.5 亿普通用户最真实的高频需求。
三、 版权与安全:谷歌的“防身术”
在 Suno 和 Udio 频陷版权官司的当下,谷歌表现得求稳且克制:
- 拒绝模仿:如果在 Prompt 中输入特定歌手名字,系统会将其弱化为宽泛的风格参考,拒绝生成“AI 孙燕姿”。
- SynthID 水印:所有生成的音频都嵌入了不可见的数字水印。用户甚至可以上传一段音频让 Gemini 识别其是否为 AI 生成。
- 版权规避:定位“原创表达”,避开三大唱片公司的版权雷区。
四、 遗憾与期待:暂不支持中文
虽然功能强大,但对于国内开发者和用户来说,目前有一个明显的小遗憾:
Lyria 3 首批支持 8 种语言(英语、德语、西班牙语、法语、印地语、日语、韩语、葡萄牙语),暂不支持中文。
不过按照谷歌的迭代速度,中文支持应该只是时间问题。
五、 总结:AI 多模态战火升级
随着 YouTube 的 Dream Track 功能同步全球推送,自媒体人迎来了“原创配乐”时代。不再需要去公共版权库里找雷同的背景音乐,每一条短视频都可以拥有专属音轨。
Gemini 正在试图在一个 App 里,把文字、图片、视频、音频的所有 AI 能力拉满。
体验入口:
打开 Gemini 网页端 -> 点击工具栏 -> Create music。


1313

被折叠的 条评论
为什么被折叠?



