
Última atualização 07-26-2026
Categoria:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
Switch Transformers
Transformers Switch introduzem uma arquitetura de Mistura de Especialistas esparsa que direciona cada entrada para um único especialista, reduzindo a sobrecarga de comunicação enquanto escalonam modelos de linguagem com trilhões de parâmetros com custo computacional constante. O artigo dos pesquisadores do Google William Fedus, Barret Zoph e Noam Shazeer simplifica o roteamento MoE, melhora a estabilidade do treinamento e relata até 7 vezes mais rápido em pré-treinamento do que modelos T5 densos no mesmo orçamento de computação.
A abordagem baseia-se na arquitetura T5 e suporta treinamento multilíngue em 101 idiomas. Os Transformers Switch também permitem treinamento com precisão bfloat16 para execuções de grande escala mais rápidas e estáveis. O trabalho é direcionado a pesquisadores e engenheiros que precisam escalar modelos de NLP sem aumentos proporcionais no custo de hardware.
Publicado no arXiv como um artigo de pesquisa, os Transformers Switch documentam métodos para ativação esparsa eficiente, e não um produto SaaS comercial. O artigo e o PDF estão disponíveis para download e citação gratuitamente.
A ativação esparsa direciona cada entrada para um especialista, garantindo computação constante
O roteamento MoE simplificado reduz a comunicação entre as partes do modelo
Escala para modelos com trilhões de parâmetros na arquitetura T5
Suporta treinamento multilíngue em 101 idiomas
Permite pré-treinamento mais rápido com precisão bfloat16
Permite a escalabilidade de trilhões de parâmetros sem crescimento proporcional do poder computacional
Simplifica o roteamento MoE em comparação com modelos especialistas anteriores
Documenta ganhos multilíngues em 101 idiomas
Artigo de pesquisa e PDF disponíveis gratuitamente no arXiv
Artigo de pesquisa em vez de uma aplicação pronta para uso
Requer infraestrutura de ML em larga escala para reproduzir os resultados
Que problema os Switch Transformers resolvem?
Eles simplificam o roteamento do Mixture of Experts para que modelos de linguagem muito grandes possam ser treinados com ativação esparsa e custo computacional constante.
Quem são os autores do artigo sobre Switch Transformers?
William Fedus, Barret Zoph e Noam Shazeer publicaram o trabalho no arXiv em 2021.
O Switch Transformers é um produto comercial?
Não. É um artigo de pesquisa e uma arquitetura de modelo publicada no arXiv, não uma ferramenta SaaS hospedada.
Em que arquitetura o Switch Transformer é baseado?
O artigo estende a arquitetura T5 com um design simplificado de roteamento esparso de experts.
Quão mais rápido é o pré-treinamento comparado ao T5 denso?
O artigo relata um pré-treinamento até 7 vezes mais rápido com o mesmo orçamento computacional em comparação aos modelos densos.
