VALL-E

VALL-E

VALL-E est un modèle de synthèse vocale de Microsoft Research qui clone la voix d'un locuteur à partir d'un court extrait audio et génère un nouveau discours à partir de texte. Il appartient à la catégorie de la génération audio car il synthétise un discours naturel plutôt que d'éditer des enregistrements existants. La page du projet héberge des exemples audio pour le modèle original VALL-E et ses variantes ultérieures dans la même famille de recherche.

La plupart des systèmes de synthèse vocale régressent directement des formes d'onde continues ou des mél-spectrogrammes. VALL-E considère plutôt la parole comme une tâche de modélisation linguistique conditionnelle sur des codes discrets issus d'un codec audio neuronal. Microsoft l'a entraîné sur environ 60 000 heures de discours en anglais, bien plus que les ensembles de données TTS habituels. Un enregistrement de 3 secondes d'un locuteur inconnu suffit pour une synthèse zéro-shot, et le modèle peut conserver l'émotion et l'ambiance de la pièce présentes dans cet extrait.

La famille VALL-E s'est étendue au-delà du premier article. VALL-E X gère la synthèse vocale zéro-shot multilingue, VALL-E R ajoute un alignement monotone des phonèmes pour une génération de discours plus stable, et VALL-E 2 associe un échantillonnage conscient de la répétition à une modélisation groupée des codes pour atteindre la parité humaine sur les benchmarks LibriSpeech et VCTK. Des variantes comme MELLE, FELLE et PALLE explorent les tokens mél continus et un décodage hybride autoregressif plus parallèle.

Chercheurs, ingénieurs du son et auditeurs curieux utilisent VALL-E pour découvrir ce que les grands modèles linguistiques de codec peuvent faire avant de construire leurs propres chaînes. Les exemples publics sont des démonstrations de recherche, pas une API hébergée que l'on peut intégrer dans un produit sans licence et revue éthique séparées.

Fonctionnalités principales:
  1. Clone un locuteur invisible à partir d'une invite audio enregistrée de 3 secondes

  2. Pré-entraîné sur environ 60 000 heures de données de parole en anglais

  3. VALL-E 2 atteint la parité humaine sur les benchmarks LibriSpeech et VCTK en mode zéro-shot

  4. Conserve l'émotion du locuteur et l'environnement acoustique de la clip d'invite

  5. VALL-E X étend la synthèse zéro-shot aux scénarios cross-lingual

  6. Les pages d'échantillons couvrent sept lignes de modèles dont MELLE, FELLE, et PALLE

Pros:
  1. Clonage zéro-shot à partir d'une invite de 3 secondes éliminant le besoin de fine-tuning par locuteur dans les démos de recherche

  2. Le modèle de langage Codec s'étend à 60 000 heures de formation, ce qui est exceptionnellement grand pour TTS

  3. Le hub d'échantillons publics relie VALL-E via VALL-E 2 ainsi que les variantes MELLE, FELLE, et PALLE

  4. Les directives éthiques publiées couvrent les risques d'abus comme la falsification vocale et l'usurpation d'identité

Cons:
  1. Le site original valle-demo.github.io GitHub Pages affiche maintenant une page d'erreur 404

  2. Pas d'API de produit hébergée sur les pages d'échantillons, seulement des démos audio de recherche

  3. Les risques d'abus du clonage vocal nécessitent des protocoles de consentement et des outils de détection pour les déploiements réels

FAQ:

Qu'est-ce que VALL-E ?

VALL-E est un modèle de langage neural codec de Microsoft Research pour la synthèse vocale. Il génère la voix d'un nouveau locuteur à partir d'un court extrait audio et d'un texte, en traitant la synthèse comme une modélisation du langage sur des codes audio discrets.

Quelle doit être la durée d'un extrait vocal pour VALL-E ?

VALL-E peut synthétiser la parole à partir d'un enregistrement d'environ 3 secondes d'un locuteur inconnu. Microsoft précise que la similarité et la naturalité dépendent toujours de la longueur de l'extrait, du bruit de fond et de la qualité de l'enregistrement.

VALL-E est-il gratuit ?

Les pages d'exemples de recherche VALL-E sont gratuites à consulter et à écouter sur le site de Microsoft. Il n'existe pas d'API en libre-service publique sur la page de démonstration, donc les équipes produit doivent suivre des voies de recherche ou de licence séparées.

Sur quels ensembles de données VALL-E a-t-il été entraîné ?

L'article original sur VALL-E décrit un pré-entraînement sur environ 60 000 heures de discours en anglais, bien plus que les corpus TTS habituels. L'évaluation de VALL-E 2 fait référence aux ensembles de test zero-shot LibriSpeech et VCTK.

VALL-E supporte-t-il plusieurs langues ?

Le modèle de base VALL-E cible l'anglais, mais VALL-E X ajoute la synthèse vocale zero-shot cross-lingue, permettant à un extrait vocal dans une langue de générer la parole dans une autre. Les pages d'exemples listent des audios séparés pour VALL-E X.

VALL-E peut-il reproduire l'émotion d'un locuteur ?

Oui. Microsoft indique que VALL-E peut préserver l'émotion et l'environnement acoustique capturés dans l'extrait, et la page d'éthique avertit que la similarité vocale dépend de la qualité de l'extrait et du bruit.

Catégorie:

Tarification:

Gratuit

Tags:

Zero-Shot TTS
Voice Cloning
Neural Codec
Text-to-Speech
Microsoft Research
Speech Synthesis
Cross-Lingual TTS
AI Music

Créateurs:

Technologie utilisée:

GitHub

Commentaires:

Give your opinion on VALL-E :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Meilleur Gratuit VALL-E Alternatives (et Payées)

By Rishit