
Última actualización 07-25-2026
Categoría:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
Deep Voice 3
Deep Voice 3 es una implementación de código abierto en PyTorch del modelo de texto a voz Deep Voice 3 de Baidu Research. Reproduce el aprendizaje de secuencias convolucionales para TTS neuronal escalable y ofrece puntos de control preentrenados con demos de audio para configuraciones de un solo hablante y de múltiples hablantes.
El proyecto incluye modelos entrenados en LJSpeech para síntesis de un solo hablante y en VCTK para generación multihablante con 108 hablantes. La página de demostración aloja clips de audio de muestra, gráficos de atención y enlaces a pesos preentrenados en GitHub.
Está dirigido a investigadores y desarrolladores que desean una implementación de referencia de Deep Voice 3 en lugar de una API de voz alojada. Los scripts de entrenamiento, el código de inferencia y las contribuciones de la comunidad están en el repositorio público de GitHub.
Implementación en PyTorch de Deep Voice 3, TTS secuencial convolucional
Modelo preentrenado para un solo hablante entrenado con LJSpeech y muestras de audio públicas
Modelo VCTK multi-hablante que soporta 108 hablantes con clips de demostración
Código open-source y checkpoints preentrenados en GitHub
Página de demostración con visualizaciones de atención y enlaces al artículo de referencia
Referencia fiel de código abierto en PyTorch para el artículo Deep Voice 3.
Incluye demos preentrenados tanto para un solo hablante como para múltiples hablantes.
Útil para investigadores que comparan arquitecturas convolucionales de TTS.
No es una API hospedada; tú mismo entrenas y ejecutas la inferencia.
El mantenimiento del proyecto depende de la comunidad de código abierto.
El sitio de demostración es una página de muestra de investigación, no una interfaz de producto pulida.
¿Es Deep Voice 3 gratuito?
Sí. Deep Voice 3 es un proyecto de código abierto distribuido en GitHub con modelos preentrenados gratuitos y muestras de audio de demostración.
¿Qué conjuntos de datos soporta Deep Voice 3?
Las demos publicadas incluyen un modelo de un solo hablante entrenado con LJSpeech y un modelo multihablante entrenado con el conjunto de datos VCTK con 108 hablantes.
¿Esta es la versión oficial de Baidu Deep Voice 3?
No. Esta es una implementación comunitaria de código abierto en PyTorch basada en el artículo de Deep Voice 3, mantenida en GitHub por r9y9.
¿Puedo usar Deep Voice 3 comercialmente?
El repositorio es de código abierto, pero deberías revisar la licencia del proyecto en GitHub antes de usarlo comercialmente.
¿Dónde puedo obtener modelos preentrenados?
Los enlaces a los modelos preentrenados se proporcionan en la página de demostración en r9y9.github.io/deepvoice3_pytorch y en el README del repositorio en GitHub.
