Deep Voice 3
Deep Voice 3 是百度研究所基于 PyTorch 的开源实现,重现了 Deep Voice 3 文本转语音模型。它复现了卷积序列学习的可扩展神经 TTS,并提供预训练的 checkpoint 以及单 speaker 和多 speaker 的音频演示。
该项目包括在 LJSpeech 上训练的单 speaker 合成模型,以及在 VCTK 数据集上训练的 108 speaker 多 speaker 生成模型。演示页面托管了示例音频片段、注意力图以及预训练权重的 GitHub 链接。
该项目面向希望拥有 Deep Voice 3 参考实现的研究人员和开发者,而非托管语音 API。训练脚本、推理代码以及社区贡献均托管在公开的 GitHub 仓库中。
Deep Voice 3 卷积序列 TTS 的 PyTorch 实现
在 LJSpeech 上训练的预训练单一说话人模型,附带公开音频样本
支持 108 位说话人的多说话人 VCTK 模型,含演示音频片段
GitHub 上的开源代码和预训练检查点
带有注意力可视化和参考论文链接的演示页面
忠实开源的 Deep Voice 3 论文 PyTorch 实现。
包含单说话人和多说话人预训练演示。
适合研究人员比较卷积 TTS 架构。
不是托管的API;您需要自己训练和运行推理。
项目维护依赖于开源社区。
演示网站是一个研究示例页面,而非精致的产品界面。
Deep Voice 3 是免费的吗?
是的。Deep Voice 3 是一个开源项目,在 GitHub 上发布,提供免费的预训练模型和示范音频样本。
Deep Voice 3 支持哪些数据集?
已发布的示范包括基于 LJSpeech 训练的单说话人模型,以及基于包含108名说话人的 VCTK 数据集训练的多说话人模型。
这是百度官方发布的 Deep Voice 3 吗?
不是。这是基于 Deep Voice 3 论文的社区开源 PyTorch 实现,由 r9y9 在 GitHub 上维护。
我可以将 Deep Voice 3 用于商业用途吗?
该仓库是开源的,但在商业使用之前,请务必查看 GitHub 上的项目许可证。
我在哪里可以获取预训练模型?
预训练模型的链接在示范页面 r9y9.github.io/deepvoice3_pytorch 以及 GitHub 仓库的 README 中提供。

