MusicLM 对比 VALL-E

在 MusicLM 和 VALL-E 的对决中,哪个 AI Audio Generation 工具脱颖而出?我们比较评论、定价、替代品、赞成票、功能等等。

MusicLM 和 VALL-E,哪一个更优?

当我们比较MusicLM和VALL-E时,这两个都是AI驱动的audio generation工具, 赞成票数有利于MusicLM,使其成为明显的赢家。 MusicLM的赞成票数为 6,而 VALL-E 的赞成票数为 5。

认为我们错了?投票并向我们展示谁才是老大!

MusicLM

MusicLM

什么是 MusicLM?

MusicLM 是谷歌研究团队开发的音频生成模型,能够根据文本描述以 24 kHz 采样率创作音乐。公开示例页面提供了多种提示的样本片段,如街机游戏原声、雷鬼与电子舞曲融合以及轻松的爵士乐,还有跨时段风格变化的长篇故事模式生成。谷歌在论文发布的同时,公开了包含 5,500 对音乐与文本的 MusicCaps 数据集。

不同于只提供单一提示框的消费级应用,MusicLM 作为研究演示发布,展示了预生成样本,而非登录使用的产品。其核心技术是文本与旋律的联合条件控制:用户可以哼唱或吹口哨一段旋律,模型会根据文本描述将其重新演绎成新的音乐风格。故事模式则通过串联多个文本提示,使音乐在不同段落中演变。

MusicLM 是谷歌后续 Lyria 音乐模型的研究基础,但本页面仅供试听已发布示例,不支持交互式创作新曲。研究人员和音乐人关注其在长篇一致性、绘画到音乐的条件控制以及旋律迁移方面的表现,这些成果已在 2023 年的论文中记录。

VALL-E

VALL-E

什么是 VALL-E?

VALL-E 是微软研究院开发的文本转语音模型,能够从一段简短的音频片段克隆说话者的声音,并根据文本生成新的语音。它属于音频生成类别,因为它合成自然语音,而非编辑现有录音。项目页面提供了原始 VALL-E 模型及同一研究系列后续变体的示例音频。

大多数 TTS 系统直接回归连续波形或梅尔频谱图。VALL-E 则将语音视为基于神经音频编解码器离散编码的条件语言建模任务。微软使用约 60,000 小时的英语语音进行训练,远超典型 TTS 数据集。仅需一段 3 秒的未见说话者录音即可实现零样本合成,且模型能保持提示中存在的情感和环境音。

VALL-E 系列超越了首篇论文。VALL-E X 支持跨语言零样本 TTS,VALL-E R 增加了音素单调对齐以实现更稳定的语音生成,VALL-E 2 结合重复感知采样与分组编码建模,在 LibriSpeech 和 VCTK 基准测试中达到人类水平。相关系列如 MELLE、FELLE 和 PALLE 探索连续梅尔令牌及混合自回归加并行解码。

研究人员、语音工程师和好奇的听众使用 VALL-E 来体验大规模编解码器语言模型的能力,作为构建自身流程前的参考。公开示例为研究演示,不是可直接接入产品的托管 API,使用需另行许可和伦理审查。

MusicLM 赞同数

6🏆

VALL-E 赞同数

5

MusicLM 顶级功能

  • 从丰富的文本字幕生成 24 kHz 音乐

  • 故事模式在定时段内链结多个文本提示

  • 文本与旋律条件化将哼唱或吹口哨的旋律转变为新风格

  • 绘画字幕条件化将艺术作品描述与生成的音频配对

  • 长时间生成示例涵盖旋律电子、摇摆和放松爵士

  • MusicCaps 数据集包括 5500 对专家撰写的音乐-文本配对

VALL-E 顶级功能

  • 从3秒注册音频提示中克隆未见过的说话人

  • 预训练于约60000小时的英语语音数据

  • VALL-E 2在LibriSpeech和VCTK零样本基准测试中报告达到人类水平

  • 保持说话人的情感和声学环境

  • VALL-E X将零样本合成扩展到跨语言场景

  • 示例页面涵盖包括MELLE、FELLE和PALLE在内的七个模型系列

MusicLM 类别

    Audio Generation

VALL-E 类别

    Audio Generation

MusicLM 定价类型

    Free

VALL-E 定价类型

    Free

MusicLM 使用的技术

Bootstrap
jQuery
Google Cloud
Ruby
GitHub
Tailwind CSS

VALL-E 使用的技术

GitHub

MusicLM 标签

Text to Music
Google Research
Melody Conditioning
MusicCaps Dataset
Research Demo
Long-Form Audio
AI Music
AI Voice

VALL-E 标签

Zero-Shot TTS
Voice Cloning
Neural Codec
Text-to-Speech
Microsoft Research
Speech Synthesis
Cross-Lingual TTS
AI Music
By Rishit