Deep Voice 3
Deep Voice 3 é uma implementação de código aberto em PyTorch do modelo de síntese de fala Deep Voice 3, da Baidu Research. Ele reproduz o aprendizado de sequência convolucional para TTS neural escalável e fornece checkpoints pré-treinados com demonstrações de áudio para configurações de fala única e multi-fala.
O projeto inclui modelos treinados na LJSpeech para síntese de fala única e na VCTK para geração multi-fala com 108 falantes. A página de demonstração hospeda clipes de áudio de amostra, gráficos de atenção e links para pesos pré-treinados no GitHub.
Destina-se a pesquisadores e desenvolvedores que desejam uma implementação de referência do Deep Voice 3, ao invés de uma API de fala hospedada. Scripts de treinamento, código de inferência e contribuições da comunidade estão disponíveis no repositório público do GitHub.
Implementação em PyTorch do Deep Voice 3 para síntese de voz sequencial por convolução
Modelo pré-treinado para um único locutor treinado com LJSpeech, com amostras de áudio públicas
Modelo multi-locutor VCTK suportando 108 locutores com clipes de demonstração
Código open-source e checkpoints pré-treinados disponíveis no GitHub
Página de demonstração com visualizações de atenção e links para artigos de referência
Referência fiel de código aberto em PyTorch para o artigo Deep Voice 3.
Inclui demos pré-treinados para um único falante e múltiplos falantes.
Útil para pesquisadores que comparam arquiteturas convolucionais de TTS.
Não é uma API hospedada; você treina e executa a inferência por conta própria.
A manutenção do projeto depende da comunidade open-source.
O site de demonstração é uma página de amostra para pesquisa, não uma interface de produto refinada.
O Deep Voice 3 é gratuito?
Sim. O Deep Voice 3 é um projeto open-source distribuído no GitHub com modelos pré-treinados gratuitos e amostras de áudio de demonstração.
Quais conjuntos de dados o Deep Voice 3 suporta?
As demos publicadas incluem um modelo de locutor único treinado com LJSpeech e um modelo multi-locutor treinado com o conjunto de dados VCTK, que contém 108 locutores.
Esta é a versão oficial do Baidu Deep Voice 3?
Não. Esta é uma implementação comunitária open-source em PyTorch baseada no artigo Deep Voice 3, mantida no GitHub pelo usuário r9y9.
Posso usar o Deep Voice 3 comercialmente?
O repositório é open source, mas você deve revisar a licença do projeto no GitHub antes de usá-lo comercialmente.
Onde posso obter modelos pré-treinados?
Os links para modelos pré-treinados estão disponíveis na página de demonstração em r9y9.github.io/deepvoice3_pytorch e no README do repositório no GitHub.

