
Dernière mise à jour 07-26-2026
Catégorie:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
Switch Transformers
Les Switch Transformers introduisent une architecture de type Mixture of Experts (MoE) sparse qui dirige chaque entrée vers un seul expert, réduisant la surcharge de communication tout en permettant de faire évoluer des modèles linguistiques de billion de paramètres avec un coût de calcul constant. Le document de chercheurs de Google, William Fedus, Barret Zoph et Noam Shazeer, simplifie le routage MoE, améliore la stabilité de l'entraînement, et rapporte une pré-formation jusqu'à 7 fois plus rapide que les modèles T5 denses avec le même budget de calcul.
L'approche s'appuie sur l'architecture T5 et prend en charge la formation multilingue sur 101 langues. Les Switch Transformers permettent également une formation avec une précision bfloat16 pour des exécutions à grande échelle plus rapides et plus stables. Ce travail vise les chercheurs et ingénieurs qui ont besoin de faire évoluer les modèles NLP sans augmentation proportionnelle des coûts matériels.
Publié sur arXiv en tant que document de recherche, Switch Transformers documente des méthodes pour une activation parcimonieuse efficace, plutôt que comme un produit SaaS commercial. Le document et le PDF sont disponibles gratuitement en téléchargement et citation.
L'activation sparse oriente chaque entrée vers un expert pour un calcul constant
Le routage MoE simplifié réduit la communication entre les parties du modèle
S'adapte aux modèles à un trillion de paramètres sur l'architecture T5
Prend en charge l'entraînement multilingue sur 101 langues
Permet un pré-entraînement plus rapide avec une précision bfloat16
Permet une mise à l'échelle à l'échelle du trillion de paramètres sans croissance proportionnelle de la puissance de calcul
Simplifie le routage MoE par rapport aux modèles experts antérieurs
Documente les gains multilingues sur 101 langues
Article de recherche et PDF librement disponibles sur arXiv
Article de recherche plutôt qu'une application prête à l'emploi
Nécessite une infrastructure ML à grande échelle pour reproduire les résultats
Quel problème les Switch Transformers résolvent-ils ?
Ils simplifient le routage du Mixture of Experts afin que de très grands modèles de langage puissent être entraînés avec une activation parcimonieuse et un coût informatique constant.
Qui sont les auteurs de l'article sur les Switch Transformers ?
William Fedus, Barret Zoph et Noam Shazeer ont publié ce travail sur arXiv en 2021.
Les Switch Transformers sont-ils un produit commercial ?
Non. Il s'agit d'un article de recherche et d'une architecture de modèle publiés sur arXiv, ce n'est pas un outil SaaS hébergé.
Sur quelle architecture les Switch Transformers se basent-ils ?
L'article étend l'architecture T5 avec un design simplifié de routage sparse des experts.
À quel point le pré-entraînement est-il plus rapide comparé au T5 dense ?
L'article rapporte un pré-entraînement jusqu'à 7 fois plus rapide avec le même budget informatique par rapport aux modèles denses.
