ChatTTS vs VALL-E

Dans la bataille de ChatTTS vs VALL-E, quel outil AI Audio Generation sort en tête? Nous comparons les avis, les prix, les alternatives, les votes positifs, les fonctionnalités, et plus encore.

Entre ChatTTS et VALL-E, lequel est supérieur?

En comparant ChatTTS avec VALL-E, qui sont tous deux des outils audio generation alimentés par l'IA, Les utilisateurs ont clairement exprimé leur préférence, ChatTTS mène en termes de votes positifs. ChatTTS a recueilli 6 votes positifs, et VALL-E a recueilli 5 votes positifs.

Vous pensez que nous avons tort? Votez et montrez-nous qui est le patron!

ChatTTS

ChatTTS

Qu'est-ce que ChatTTS?

ChatTTS est un modèle de synthèse vocale open-source conçu pour le dialogue. L'équipe 2Noise l'a entraîné sur plus de 100 000 heures de speech en chinois et en anglais, afin qu'il sonne de manière naturelle dans les conversations en échange, et pas seulement en narration scriptée.

Ce qui le distingue, c'est le contrôle de la prosodie à un niveau granulaire. Le modèle peut ajouter des rires, des pauses et des interjections, et il gère plusieurs locuteurs lors d'une même session. Cela en fait un outil adapté pour les assistants LLM, l'audio conversationnel et les médias interactifs riches en dialogue.

Les développeurs l'installent via pip ou en clonant le dépôt GitHub. La version open-source sur Hugging Face est un modèle de base de 40 000 heures sous licence AGPLv3+. L'équipe le présente comme étant destiné à la recherche et aux cas d'usage liés au dialogue, avec un contact à [email protected] pour toute question sur la feuille de route.

VALL-E

VALL-E

Qu'est-ce que VALL-E?

VALL-E est un modèle de synthèse vocale de Microsoft Research qui clone la voix d'un locuteur à partir d'un court extrait audio et génère un nouveau discours à partir de texte. Il appartient à la catégorie de la génération audio car il synthétise un discours naturel plutôt que d'éditer des enregistrements existants. La page du projet héberge des exemples audio pour le modèle original VALL-E et ses variantes ultérieures dans la même famille de recherche.

La plupart des systèmes de synthèse vocale régressent directement des formes d'onde continues ou des mél-spectrogrammes. VALL-E considère plutôt la parole comme une tâche de modélisation linguistique conditionnelle sur des codes discrets issus d'un codec audio neuronal. Microsoft l'a entraîné sur environ 60 000 heures de discours en anglais, bien plus que les ensembles de données TTS habituels. Un enregistrement de 3 secondes d'un locuteur inconnu suffit pour une synthèse zéro-shot, et le modèle peut conserver l'émotion et l'ambiance de la pièce présentes dans cet extrait.

La famille VALL-E s'est étendue au-delà du premier article. VALL-E X gère la synthèse vocale zéro-shot multilingue, VALL-E R ajoute un alignement monotone des phonèmes pour une génération de discours plus stable, et VALL-E 2 associe un échantillonnage conscient de la répétition à une modélisation groupée des codes pour atteindre la parité humaine sur les benchmarks LibriSpeech et VCTK. Des variantes comme MELLE, FELLE et PALLE explorent les tokens mél continus et un décodage hybride autoregressif plus parallèle.

Chercheurs, ingénieurs du son et auditeurs curieux utilisent VALL-E pour découvrir ce que les grands modèles linguistiques de codec peuvent faire avant de construire leurs propres chaînes. Les exemples publics sont des démonstrations de recherche, pas une API hébergée que l'on peut intégrer dans un produit sans licence et revue éthique séparées.

ChatTTS Votes positifs

6🏆

VALL-E Votes positifs

5

ChatTTS Fonctionnalités principales

  • Façonne les rires, les pauses et les interjections en discours synthétisé

  • Exécute un dialogue multi-interlocuteurs à partir d'un seul appel d'inférence

  • Entraîné sur plus de 100 000 heures d'audio en chinois et en anglais

  • Diffuse la sortie audio pour une lecture en temps réel

  • S'installe via pip ou récupère les poids depuis Hugging Face

VALL-E Fonctionnalités principales

  • Clone un locuteur invisible à partir d'une invite audio enregistrée de 3 secondes

  • Pré-entraîné sur environ 60 000 heures de données de parole en anglais

  • VALL-E 2 atteint la parité humaine sur les benchmarks LibriSpeech et VCTK en mode zéro-shot

  • Conserve l'émotion du locuteur et l'environnement acoustique de la clip d'invite

  • VALL-E X étend la synthèse zéro-shot aux scénarios cross-lingual

  • Les pages d'échantillons couvrent sept lignes de modèles dont MELLE, FELLE, et PALLE

ChatTTS Catégorie

    Audio Generation

VALL-E Catégorie

    Audio Generation

ChatTTS Type de tarification

    Free

VALL-E Type de tarification

    Free

ChatTTS Technologies utilisées

GitHub
Python
Hugging Face

VALL-E Technologies utilisées

GitHub

ChatTTS Tags

ChatTTS
Open-Source
Text-to-Speech
Conversational AI
Dialogue TTS
Chinese English TTS

VALL-E Tags

Zero-Shot TTS
Voice Cloning
Neural Codec
Text-to-Speech
Microsoft Research
Speech Synthesis
Cross-Lingual TTS
AI Music

Découvrez d'autres comparaisons

By Rishit