MusicLM

MusicLM

MusicLM 是谷歌研究团队开发的音频生成模型,能够根据文本描述以 24 kHz 采样率创作音乐。公开示例页面提供了多种提示的样本片段,如街机游戏原声、雷鬼与电子舞曲融合以及轻松的爵士乐,还有跨时段风格变化的长篇故事模式生成。谷歌在论文发布的同时,公开了包含 5,500 对音乐与文本的 MusicCaps 数据集。

不同于只提供单一提示框的消费级应用,MusicLM 作为研究演示发布,展示了预生成样本,而非登录使用的产品。其核心技术是文本与旋律的联合条件控制:用户可以哼唱或吹口哨一段旋律,模型会根据文本描述将其重新演绎成新的音乐风格。故事模式则通过串联多个文本提示,使音乐在不同段落中演变。

MusicLM 是谷歌后续 Lyria 音乐模型的研究基础,但本页面仅供试听已发布示例,不支持交互式创作新曲。研究人员和音乐人关注其在长篇一致性、绘画到音乐的条件控制以及旋律迁移方面的表现,这些成果已在 2023 年的论文中记录。

主要功能:
  1. 从丰富的文本字幕生成 24 kHz 音乐

  2. 故事模式在定时段内链结多个文本提示

  3. 文本与旋律条件化将哼唱或吹口哨的旋律转变为新风格

  4. 绘画字幕条件化将艺术作品描述与生成的音频配对

  5. 长时间生成示例涵盖旋律电子、摇摆和放松爵士

  6. MusicCaps 数据集包括 5500 对专家撰写的音乐-文本配对

Pros:
  1. 24 kHz 输出和多分钟一致性领先大多数 2023 年的文本到音乐系统。

  2. 旋律条件化让研究人员可以用文本字幕重新风格化哼唱的旋律。

  3. 故事模式展示了在提示序列中可控的长格式过渡。

  4. MusicCaps 数据集为研究社区提供了 5500 对带标签的音乐-文本配对。

Cons:
  1. 没有交互式生成界面;用户只能播放托管的研究样本。

  2. Google 的消费者音乐工具已转移到 Lyria 家族,而非此演示页面。

  3. 示例页面是静态的研究产物,不是有支持的维护产品。

常见问题:

什么是MusicLM?

MusicLM是谷歌研究开发的一个模型,可以根据文本描述生成高保真音乐。它采用分层序列到序列建模,生成24 kHz的音频,能够保持数分钟内的一致性。

我能在线用MusicLM创作新音乐吗?

MusicLM示例页面展示了谷歌研究预生成的音频样本。它是一个演示网站,而不是允许用户提交自己提示的互动音乐创作应用。

MusicLM支持旋律输入吗?

支持。MusicLM可以同时基于文本和旋律进行条件生成,将口哨或哼唱的旋律转换成爵士、歌剧或电子合成主音等新风格,正如说明中描述的那样。

MusicLM中的MusicCaps是什么?

MusicCaps是一个包含5500对音乐与文本的数据库,文本由人类专家撰写,内容丰富。谷歌研究与MusicLM一同发布了它,以支持未来的音频生成研究。

MusicLM免费使用吗?

MusicLM研究示例页面可免费浏览。谷歌没有将MusicLM作为付费消费产品推出;后续的音乐工具在Google Flow Music和Gemini中使用了Lyria模型系列。

MusicLM的故事模式如何工作?

MusicLM故事模式输入带时间戳的文本提示序列,如先冥想音乐再跑步音乐。每个说明都会影响模型如何从前一部分的语义标记继续生成。

定价:

免费

标签:

Text to Music
Google Research
Melody Conditioning
MusicCaps Dataset
Research Demo
Long-Form Audio
AI Music
AI Voice

使用的技术:

Bootstrap
jQuery
Google Cloud
Ruby
GitHub
Tailwind CSS

评论:

Give your opinion on MusicLM :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

最佳免费 MusicLM 替代方案(和付费)

By Rishit