Deep Voice 3

Deep Voice 3

Deep Voice 3 是百度研究所基于 PyTorch 的开源实现,重现了 Deep Voice 3 文本转语音模型。它复现了卷积序列学习的可扩展神经 TTS,并提供预训练的 checkpoint 以及单 speaker 和多 speaker 的音频演示。

该项目包括在 LJSpeech 上训练的单 speaker 合成模型,以及在 VCTK 数据集上训练的 108 speaker 多 speaker 生成模型。演示页面托管了示例音频片段、注意力图以及预训练权重的 GitHub 链接。

该项目面向希望拥有 Deep Voice 3 参考实现的研究人员和开发者,而非托管语音 API。训练脚本、推理代码以及社区贡献均托管在公开的 GitHub 仓库中。

主要功能:
  1. Deep Voice 3 卷积序列 TTS 的 PyTorch 实现

  2. 在 LJSpeech 上训练的预训练单一说话人模型,附带公开音频样本

  3. 支持 108 位说话人的多说话人 VCTK 模型,含演示音频片段

  4. GitHub 上的开源代码和预训练检查点

  5. 带有注意力可视化和参考论文链接的演示页面

Pros:
  1. 忠实开源的 Deep Voice 3 论文 PyTorch 实现。

  2. 包含单说话人和多说话人预训练演示。

  3. 适合研究人员比较卷积 TTS 架构。

Cons:
  1. 不是托管的API;您需要自己训练和运行推理。

  2. 项目维护依赖于开源社区。

  3. 演示网站是一个研究示例页面,而非精致的产品界面。

常见问题:

Deep Voice 3 是免费的吗?

是的。Deep Voice 3 是一个开源项目,在 GitHub 上发布,提供免费的预训练模型和示范音频样本。

Deep Voice 3 支持哪些数据集?

已发布的示范包括基于 LJSpeech 训练的单说话人模型,以及基于包含108名说话人的 VCTK 数据集训练的多说话人模型。

这是百度官方发布的 Deep Voice 3 吗?

不是。这是基于 Deep Voice 3 论文的社区开源 PyTorch 实现,由 r9y9 在 GitHub 上维护。

我可以将 Deep Voice 3 用于商业用途吗?

该仓库是开源的,但在商业使用之前,请务必查看 GitHub 上的项目许可证。

我在哪里可以获取预训练模型?

预训练模型的链接在示范页面 r9y9.github.io/deepvoice3_pytorch 以及 GitHub 仓库的 README 中提供。

定价:

免费

标签:

text to speech
PyTorch
open source
neural TTS
speech synthesis

使用的技术:

Cloudflare
Google Cloud
Google Analytics
Google Fonts
GitHub
Emotion

评论:

Give your opinion on Deep Voice 3 :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

最佳免费 Deep Voice 3 替代方案(和付费)

By Rishit