Play.ht vs VALL-E
Lors de la comparaison de Play.ht vs VALL-E, quel outil AI Audio Generation brille le plus? Nous examinons les prix, les alternatives, les votes positifs, les fonctionnalités, les avis, et bien plus.
Dans une comparaison entre Play.ht et VALL-E, lequel sort vainqueur?
Quand nous mettons Play.ht et VALL-E côte à côte, tous deux étant des outils audio generation alimentés par l'IA, Dans la course aux votes positifs, Play.ht remporte le trophée. Play.ht a 32 votes positifs, et VALL-E a 5 votes positifs.
Vous voulez renverser la situation? Votez pour votre outil préféré et changez la donne!
Play.ht

Qu'est-ce que Play.ht?
Générateur de voix AI avec plus de 600 voix AI. Générez du texte réaliste vers la parole en ligne avec l'IA. Convertissez le texte en audio et téléchargez comme fichiers MP3 et WAV.
VALL-E

Qu'est-ce que VALL-E?
VALL-E est un modèle de synthèse vocale de Microsoft Research qui clone la voix d'un locuteur à partir d'un court extrait audio et génère un nouveau discours à partir de texte. Il appartient à la catégorie de la génération audio car il synthétise un discours naturel plutôt que d'éditer des enregistrements existants. La page du projet héberge des exemples audio pour le modèle original VALL-E et ses variantes ultérieures dans la même famille de recherche.
La plupart des systèmes de synthèse vocale régressent directement des formes d'onde continues ou des mél-spectrogrammes. VALL-E considère plutôt la parole comme une tâche de modélisation linguistique conditionnelle sur des codes discrets issus d'un codec audio neuronal. Microsoft l'a entraîné sur environ 60 000 heures de discours en anglais, bien plus que les ensembles de données TTS habituels. Un enregistrement de 3 secondes d'un locuteur inconnu suffit pour une synthèse zéro-shot, et le modèle peut conserver l'émotion et l'ambiance de la pièce présentes dans cet extrait.
La famille VALL-E s'est étendue au-delà du premier article. VALL-E X gère la synthèse vocale zéro-shot multilingue, VALL-E R ajoute un alignement monotone des phonèmes pour une génération de discours plus stable, et VALL-E 2 associe un échantillonnage conscient de la répétition à une modélisation groupée des codes pour atteindre la parité humaine sur les benchmarks LibriSpeech et VCTK. Des variantes comme MELLE, FELLE et PALLE explorent les tokens mél continus et un décodage hybride autoregressif plus parallèle.
Chercheurs, ingénieurs du son et auditeurs curieux utilisent VALL-E pour découvrir ce que les grands modèles linguistiques de codec peuvent faire avant de construire leurs propres chaînes. Les exemples publics sont des démonstrations de recherche, pas une API hébergée que l'on peut intégrer dans un produit sans licence et revue éthique séparées.
Play.ht Votes positifs
VALL-E Votes positifs
Play.ht Fonctionnalités principales
Aucune fonctionnalité principale répertoriéeVALL-E Fonctionnalités principales
Clone un locuteur invisible à partir d'une invite audio enregistrée de 3 secondes
Pré-entraîné sur environ 60 000 heures de données de parole en anglais
VALL-E 2 atteint la parité humaine sur les benchmarks LibriSpeech et VCTK en mode zéro-shot
Conserve l'émotion du locuteur et l'environnement acoustique de la clip d'invite
VALL-E X étend la synthèse zéro-shot aux scénarios cross-lingual
Les pages d'échantillons couvrent sept lignes de modèles dont MELLE, FELLE, et PALLE
Play.ht Catégorie
- Audio Generation
VALL-E Catégorie
- Audio Generation
Play.ht Type de tarification
- Paid
VALL-E Type de tarification
- Free
