Switch Transformers
Switch Transformers 引入了一种稀疏的 Mixture of Experts 架构,将每个输入路由到一个专家,从而减少通信开销,同时在计算成本保持不变的情况下实现万亿参数语言模型的扩展。谷歌研究员 William Fedus、Barret Zoph 和 Noam Shazeer 的这篇论文简化了 MoE 的路由方法,改善了训练的稳定性,并报告在相同计算预算下预训练速度比密集型 T5 模型快最多7倍。
这种方法建立在 T5 架构之上,支持跨 101 种语言的多语言训练。Switch Transformers 也支持使用 bfloat16 精度进行训练,以实现更快、更稳定的大规模运行。这项工作面向需要在不等比例增加硬件成本的情况下扩展 NLP 模型的研究人员和工程师。
作为一篇研究论文,Switch Transformers 已在 arXiv 上发布,旨在记录高效稀疏激活的方法,而非商业 SaaS 产品。论文和 PDF 可免费下载和引用。
稀疏激活将每个输入路由至一个专家,实现计算恒定
简化的 MoE 路由减少模型各部分之间的通信
可扩展至基于 T5 架构的万亿参数模型
支持涵盖101种语言的多语言训练
支持使用 bfloat16 精度加速预训练
实现万亿参数级别的扩展,而无需成比例增加计算资源
相比早期的专家模型,简化了MoE路由机制
记录了覆盖101种语言的多语言性能提升
在arXiv上免费提供研究论文及PDF
研究论文,而非现成可用的应用程序
需要大规模机器学习基础设施来复现结果
Switch Transformers解决了什么问题?
它们简化了专家混合路由(Mixture of Experts routing),使得非常大的语言模型能够在稀疏激活和恒定计算成本下进行训练。
谁是Switch Transformers论文的作者?
William Fedus、Barret Zoph 和 Noam Shazeer 于2021年在arXiv上发表了这项研究。
Switch Transformers是商业产品吗?
不是。它是一篇发表在arXiv上的研究论文和模型架构,而非托管的SaaS工具。
Switch Transformers基于什么架构?
论文在T5架构基础上,采用了简化的稀疏专家路由设计进行扩展。
与密集型T5相比,预训练速度快多少?
论文报告在相同计算预算下,预训练速度最高可快7倍。

