VALL-E

VALL-E

VALL-E es un modelo de texto a voz de Microsoft Research que clona la voz de un hablante a partir de un breve clip de audio y genera nuevo discurso a partir de texto. Pertenece a la categoría de generación de audio porque sintetiza habla natural en lugar de editar grabaciones existentes. La página del proyecto aloja muestras de audio para el modelo original VALL-E y variantes posteriores de la misma familia de investigación.

La mayoría de los sistemas TTS regresan formas de onda continuas o mel-espectrogramas directamente. VALL-E, en cambio, trata el habla como una tarea de modelado de lenguaje condicional sobre códigos discretos de un códec de audio neuronal. Microsoft lo entrenó con aproximadamente 60,000 horas de habla en inglés, mucho más grande que los conjuntos de datos típicos de TTS. Una grabación inscrita de 3 segundos de un hablante no visto es suficiente para impulsar la síntesis zero-shot, y el modelo puede mantener la emoción y el tono ambiental presentes en ese estímulo.

La familia VALL-E creció más allá del primer artículo. VALL-E X maneja TTS zero-shot multilingüe, VALL-E R añade alineación monótona de fonemas para una generación de habla más estable, y VALL-E 2 combina muestreo consciente de repeticiones con modelado de códigos agrupados para alcanzar la paridad humana en los benchmarks LibriSpeech y VCTK. Líneas relacionadas como MELLE, FELLE y PALLE exploran tokens mel continuos y decodificación híbrida autoregresiva más paralela.

Investigadores, ingenieros de voz y oyentes curiosos usan VALL-E para escuchar lo que los modelos de lenguaje de códec a gran escala pueden hacer antes de construir sus propias cadenas. Las muestras públicas son demos de investigación, no una API alojada que se pueda integrar en un producto sin licencia y revisión ética separadas.

Funciones principales:
  1. Clona un altavoz no visto a partir de un prompt de audio de 3 segundos registrado

  2. Preentrenado en aproximadamente 60,000 horas de datos de voz en inglés

  3. VALL-E 2 reporta paridad humana en los benchmarks de LibriSpeech y VCTK sin entrenamiento previo

  4. Preserva la emoción del altavoz y el entorno acústico del clip de entrada

  5. VALL-E X extiende la síntesis sin entrenamiento previo a escenarios multilingües

  6. Las páginas de muestra cubren siete líneas de modelos incluyendo MELLE, FELLE y PALLE

Pros:
  1. Clonación sin entrenamiento previo a partir de un prompt de 3 segundos elimina la necesidad de ajuste fino por altavoz en demos de investigación

  2. El modelado de lenguaje del códec escala a 60,000 horas de entrenamiento, lo cual es inusualmente grande para TTS

  3. El centro de muestras públicas enlaza VALL-E a través de VALL-E 2 más variantes MELLE, FELLE y PALLE

  4. La guía ética publicada cubre riesgos de mal uso como suplantación de voz e impersonación

Cons:
  1. El sitio original valle-demo.github.io ahora devuelve una página de error 404

  2. No hay API de producto alojada en las páginas de muestra, solo demos de audio de investigación

  3. Los riesgos de mal uso de la clonación de voz significan que las implementaciones reales necesitan protocolos de consentimiento y herramientas de detección

Preguntas frecuentes:

¿Qué es VALL-E?

VALL-E es un modelo de lenguaje neural codec de Microsoft Research para texto a voz. Genera voz en la voz de un nuevo hablante usando un breve audio de referencia más texto, tratando la síntesis como modelado de lenguaje sobre códigos de audio discretos.

¿Cuánto debe durar el audio de referencia para VALL-E?

VALL-E puede sintetizar voz a partir de una grabación inscrita de aproximadamente 3 segundos de un hablante no visto. Microsoft señala que la similitud y naturalidad aún dependen de la duración del audio, el ruido de fondo y la calidad de la grabación.

¿VALL-E es gratis para usar?

Las páginas de muestra de investigación de VALL-E son gratuitas para explorar y escuchar en el sitio de Microsoft. No hay una API pública de autoservicio en la página demo, por lo que los equipos de producto necesitan vías separadas de investigación o licenciamiento.

¿En qué conjuntos de datos se entrenó VALL-E?

El artículo original de VALL-E describe un preentrenamiento con aproximadamente 60,000 horas de habla en inglés, mucho más que los corpus típicos de TTS. La evaluación de VALL-E 2 hace referencia a los conjuntos de prueba zero-shot LibriSpeech y VCTK.

¿VALL-E soporta varios idiomas?

El modelo base VALL-E está dirigido al inglés, pero VALL-E X añade TTS zero-shot multilingüe para que un audio de referencia en un idioma pueda generar voz en otro. Las páginas de muestra listan audio separado para VALL-E X.

¿VALL-E puede copiar la emoción de un hablante?

Sí. Microsoft informa que VALL-E puede preservar la emoción y el entorno acústico capturados en la grabación de referencia, y la página de ética advierte que la similitud de voz depende de la calidad del audio y el ruido.

Categoría:

Tarificación:

Gratis

Etiquetas:

Zero-Shot TTS
Voice Cloning
Neural Codec
Text-to-Speech
Microsoft Research
Speech Synthesis
Cross-Lingual TTS
AI Music

Creadores:

Tecnología utilizada:

GitHub

Reseñas:

Give your opinion on VALL-E :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Mejor Gratis VALL-E Alternativas (y Pagadas)

By Rishit