Galactica
五个从125M到120B参数的开放权重检查点,为研究人员提供了一个科学训练的语言模型,该模型基于1060亿个精心策划的标记,涵盖4800万篇论文、教科书、百科全书和知识库。Galactica在一个仅解码器的Transformer架构内存储、组合并推理多种模态,包括LaTeX、Python代码、SMILES公式和氨基酸序列。Meta的Papers with Code团队开源了权重,供希望研究语言模型如何组织科学知识的研究人员使用。
通用大型语言模型训练于广泛的网络爬取数据,其中社交聊天可能占据标记预算的主导。Galactica仅使用经过策划的开放获取科学资源,论文认为这使其能够进行多轮训练而不过拟合。Meta在2022年11月发布后三天内移除了公共网络演示,因为批评者展示了自信但伪造的引用和方程,因此今天你可以从Hugging Face下载检查点,而不是通过托管界面聊天。
机器学习研究人员可以复现arXiv论文中的基准数字,包括PubMedQA的77.6%和MedMCQA开发集的52.9%。计算生物学家和化学家可以通过Galactica专门为氨基酸序列和SMILES字符串设计的标记测试蛋白质注释和分子任务。研究生在探索科学问答、引用预测或数学文字题时,可以尝试高达1200亿参数的模型,而无需从零开始训练。
五个检查点涵盖125M、1.3B、6.7B、30B和120B参数
训练语料总计1060亿个标记,涵盖4800万篇科学论文
在LaTeX方程探测中得分68.2%,对比GPT-3的49.0%
在PubMedQA达到77.6%,在MedMCQA开发基准测试中达到52.9%
30B模型在MATH上达到20.4%,对比PaLM 540B的8.8%
特殊标记涵盖引用、SMILES公式和氨基酸序列
五种开源权重大小,从125M到120B参数,覆盖广泛硬件范围。
策划的1060亿标记科学语料,避免了普通网页爬取的噪声。
在PubMedQA、MedMCQA和数学推理基准测试中表现强劲。
特殊标记允许在一个模型中处理引用、SMILES和蛋白质序列。
公共网页演示已被移除;galactica.org不再解析。
CC BY-NC 4.0许可证阻止商业部署,除非另行协议。
模型卡警告Galactica可能在专业科学话题上产生自信但错误的幻觉答案。
Galactica是什么?
Galactica是Meta AI开发的大型语言模型,训练数据来自精选的科学文本和数据。它针对引用预测、数学推理、蛋白质注释和科学摘要等任务,提供五种开放权重大小。
Galactica可以免费使用吗?
可以,Galactica模型权重可在Hugging Face上根据CC BY-NC 4.0许可免费下载,用于非商业研究。没有付费托管产品;您需要在本地或自己的GPU基础设施上运行检查点。
Galactica有哪些尺寸?
Galactica提供五个检查点,分别标记为mini(125M)、base(1.3B)、standard(6.7B)、large(30B)和huge(120B)参数。每个尺寸均发布在Hugging Face的facebook/galactica模型系列下。
为什么Galactica演示被关闭?
Meta于2022年11月17日暂停了公共galactica.org演示,原因是用户报告了自信但错误的科学输出,包括伪造引用。论文和开放权重仍然可用;仅托管的聊天演示被移除。
Galactica使用了哪些训练数据?
Galactica训练使用了1060亿个标记,来源包括开放获取论文、教科书、百科全书、代码、知识库和科学网站。语料库包含约4800万篇论文及参考资料、SMILES字符串和蛋白质序列。
Galactica报告了哪些基准测试?
Galactica论文报告了PubMedQA得分77.6%,MedMCQA开发集52.9%,数学MMLU得分41.3%(Chinchilla为35.7%),以及LaTeX方程测试得分68.2%(GPT-3为49.0%)。
Galactica权重适用什么许可?
Galactica在Hugging Face上的检查点采用CC BY-NC 4.0许可,允许带署名的非商业研究使用。商业部署需另行许可,因为该许可禁止商业应用。

