VALL-E

VALL-E

VALL-E 是微软研究院开发的文本转语音模型,能够从一段简短的音频片段克隆说话者的声音,并根据文本生成新的语音。它属于音频生成类别,因为它合成自然语音,而非编辑现有录音。项目页面提供了原始 VALL-E 模型及同一研究系列后续变体的示例音频。

大多数 TTS 系统直接回归连续波形或梅尔频谱图。VALL-E 则将语音视为基于神经音频编解码器离散编码的条件语言建模任务。微软使用约 60,000 小时的英语语音进行训练,远超典型 TTS 数据集。仅需一段 3 秒的未见说话者录音即可实现零样本合成,且模型能保持提示中存在的情感和环境音。

VALL-E 系列超越了首篇论文。VALL-E X 支持跨语言零样本 TTS,VALL-E R 增加了音素单调对齐以实现更稳定的语音生成,VALL-E 2 结合重复感知采样与分组编码建模,在 LibriSpeech 和 VCTK 基准测试中达到人类水平。相关系列如 MELLE、FELLE 和 PALLE 探索连续梅尔令牌及混合自回归加并行解码。

研究人员、语音工程师和好奇的听众使用 VALL-E 来体验大规模编解码器语言模型的能力,作为构建自身流程前的参考。公开示例为研究演示,不是可直接接入产品的托管 API,使用需另行许可和伦理审查。

主要功能:
  1. 从3秒注册音频提示中克隆未见过的说话人

  2. 预训练于约60000小时的英语语音数据

  3. VALL-E 2在LibriSpeech和VCTK零样本基准测试中报告达到人类水平

  4. 保持说话人的情感和声学环境

  5. VALL-E X将零样本合成扩展到跨语言场景

  6. 示例页面涵盖包括MELLE、FELLE和PALLE在内的七个模型系列

Pros:
  1. 从3秒提示进行零样本克隆,无需在研究演示中进行每个说话人的微调

  2. 编码器语言模型扩展到60000小时的训练时间,对于TTS来说非常大规模

  3. 公共示例中心通过VALL-E、VALL-E 2以及MELLE、FELLE和PALLE变体连接VALL-E

  4. 发布的伦理指南涵盖语音欺骗和冒充等滥用风险

Cons:
  1. 原始的 valle-demo.github.io GitHub页面现在返回404错误页面

  2. 示例页面没有托管产品API,仅有研究音频演示

  3. 语音克隆滥用风险意味着实际部署需要同意协议和检测工具

常见问题:

什么是VALL-E?

VALL-E是微软研究院开发的神经编解码语言模型,用于文本转语音。它通过一个简短的音频提示加文本,使用离散音频编码进行语言建模,从而生成新说话者的声音。

VALL-E的语音提示需要多长?

VALL-E可以从大约3秒的未见说话者录音中合成语音。微软指出,相似度和自然度仍取决于提示长度、背景噪音和录音质量。

VALL-E可以免费使用吗?

微软网站上的VALL-E研究示例页面可以免费浏览和试听。演示页面没有公开的自助API,因此产品团队需要通过单独的研究或许可途径使用。

VALL-E使用了哪些数据集进行训练?

原始VALL-E论文描述了对约60,000小时的英语语音进行预训练,远超典型的TTS语料库。VALL-E 2的评估参考了LibriSpeech和VCTK零样本测试集。

VALL-E支持多语言吗?

基础VALL-E模型针对英语,但VALL-E X增加了跨语言零样本TTS功能,使得一种语言的说话者提示可以驱动另一种语言的语音。示例页面列出了VALL-E X的独立音频。

VALL-E能复制说话者的情感吗?

可以。微软报告称VALL-E能够保留提示录音中捕捉到的情感和声学环境,伦理页面警告说声音相似度取决于提示质量和噪音。

定价:

免费

标签:

Zero-Shot TTS
Voice Cloning
Neural Codec
Text-to-Speech
Microsoft Research
Speech Synthesis
Cross-Lingual TTS
AI Music

创建者:

使用的技术:

GitHub

评论:

Give your opinion on VALL-E :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

最佳免费 VALL-E 替代方案(和付费)

By Rishit