
Última atualização 08-15-2026
Categoria:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
VALL-E
VALL-E é um modelo de texto para fala da Microsoft Research que clona a voz de um locutor a partir de um curto clipe de áudio e gera nova fala a partir do texto. Pertence à categoria de geração de áudio porque sintetiza fala natural em vez de editar gravações existentes. A página do projeto hospeda áudios de exemplo para o modelo original VALL-E e variantes posteriores da mesma família de pesquisa.
A maioria dos sistemas TTS regredem formas de onda contínuas ou mel-espectrogramas diretamente. VALL-E, em vez disso, trata a fala como uma tarefa de modelagem condicional de linguagem sobre códigos discretos de um codec neural de áudio. A Microsoft o treinou com cerca de 60.000 horas de fala em inglês, muito maior que os conjuntos de dados típicos de TTS. Uma gravação de 3 segundos de um locutor não visto é suficiente para conduzir a síntese zero-shot, e o modelo pode manter a emoção e o tom ambiente presentes nesse prompt.
A família VALL-E cresceu além do primeiro artigo. VALL-E X lida com TTS zero-shot cross-lingual, VALL-E R adiciona alinhamento monotônico de fonemas para uma geração de fala mais estável, e VALL-E 2 combina amostragem consciente de repetição com modelagem de código agrupado para alcançar paridade humana nos benchmarks LibriSpeech e VCTK. Linhas relacionadas como MELLE, FELLE e PALLE exploram tokens mel contínuos e decodificação híbrida autoregressiva mais paralela.
Pesquisadores, engenheiros de fala e ouvintes curiosos usam VALL-E para ouvir o que modelos de linguagem de codec em larga escala podem fazer antes de construir seus próprios pipelines. As amostras públicas são demos de pesquisa, não uma API hospedada que você pode integrar a um produto sem licenciamento e revisão ética separada.
Clona um alto-falante não visto a partir de um prompt de áudio de 3 segundos registrado
Pré-treinado em cerca de 60.000 horas de dados de fala em inglês
VALL-E 2 relata paridade humana nos benchmarks zero-shot LibriSpeech e VCTK
Preserva a emoção do alto-falante e o ambiente acústico do trecho do prompt
VALL-E X estende a síntese zero-shot para cenários cross-lingua
As páginas de amostra cobrem sete linhas de modelos incluindo MELLE, FELLE e PALLE
Clonagem zero-shot a partir de um prompt de 3 segundos elimina a necessidade de ajuste fino por alto-falante em demonstrações de pesquisa
Modelagem de linguagem de codec escala para 60.000 horas de treinamento, o que é incomumente grande para TTS
O hub de amostras públicas conecta VALL-E através de VALL-E 2 mais variantes MELLE, FELLE e PALLE
Diretrizes de ética publicadas cobrem riscos de uso indevido como spoofing de voz e impersonificação
O site original valle-demo.github.io agora retorna uma página de erro 404
Sem API de produto hospedada nas páginas de amostra, apenas demos de áudio de pesquisa
Riscos de uso indevido de clonagem de voz significam que implantações reais precisam de protocolos de consentimento e ferramentas de detecção
O que é o VALL-E?
VALL-E é um modelo neural codec de linguagem para texto para fala da Microsoft Research. Ele gera fala na voz de um novo locutor usando um breve áudio de exemplo mais texto, tratando a síntese como modelagem de linguagem sobre códigos de áudio discretos.
Quanto tempo deve ter o áudio de exemplo para o VALL-E?
O VALL-E pode sintetizar fala a partir de uma gravação de cerca de 3 segundos de um locutor não conhecido. A Microsoft observa que similaridade e naturalidade ainda dependem do comprimento do áudio, ruído de fundo e qualidade da gravação.
O VALL-E é gratuito para usar?
As páginas de amostra de pesquisa do VALL-E são gratuitas para navegar e ouvir no site da Microsoft. Não há uma API pública de autoatendimento na página de demonstração, então equipes de produto precisam de caminhos separados de pesquisa ou licenciamento.
Em quais conjuntos de dados o VALL-E foi treinado?
O artigo original do VALL-E descreve pré-treinamento em cerca de 60.000 horas de fala em inglês, muito mais do que os corpora típicos de TTS. A avaliação do VALL-E 2 faz referência aos conjuntos de teste zero-shot LibriSpeech e VCTK.
O VALL-E suporta múltiplos idiomas?
O modelo base do VALL-E é focado em inglês, mas o VALL-E X adiciona TTS zero-shot cross-lingual para que um áudio de exemplo em um idioma possa gerar fala em outro. As páginas de amostra listam áudio separado para o VALL-E X.
O VALL-E pode copiar a emoção de um locutor?
Sim. A Microsoft relata que o VALL-E pode preservar a emoção e o ambiente acústico capturados na gravação de exemplo, e a página de ética alerta que a similaridade da voz depende da qualidade do áudio e do ruído.
