GLM-130B
GLM-130B 将一个拥有1300亿参数的双语语言模型纳入了由THUDM基于通用语言模型(GLM)预训练方案构建的开放研究框架中。该模型权重针对英语和中文文本,GitHub仓库提供了推理代码、评估任务以及在ICLR 2023接受的检查点。您可以在单个多GPU服务器上运行从左到右的生成或使用[MASK]和[gMASK]标记的空白填充,而无需依赖专有API。
大多数超过1000亿参数的模型都保持封闭,GLM-130B则公开了模型权重、训练笔记和30多个基准测试的YAML配置。其INT4量化路径经过调优,使得四张RTX 3090(24GB)显卡几乎无精度损失地支持推理,这远低于用于完整FP16运行的八张A100(40GB)显卡配置。训练目标将95%的标记采用自回归空白填充,与来自T0++和DeepStruct的多任务指令数据混合,这与标准的因果GPT风格预训练有所不同。
研究双语零样本迁移、大模型量化或可复现的大型语言模型基准的研究人员将从GLM-130B中获益最多。该仓库侧重于评估和推理工具,而非托管聊天产品,尽管THUDM后来将对话工作拆分为ChatGLM。请准备好自备GPU、260GB检查点的存储空间以及下载权重时的耐心。
在400多亿个标记上训练的1300亿参数,平分英语和中文
在一台配备8个A100(40GB)或8个V100(32GB)GPU的服务器上实现完整FP16推理;INT4量化将需求降至4张RTX 3090(24GB)卡
NVIDIA FasterTransformer集成在A100硬件上实现比Megatron快2.5倍的解码速度
仓库提供30+ NLP任务的YAML评估配置和可复现的基准脚本
两种掩码标记支持工作流程:[MASK]用于短空白填充,[gMASK]用于从左到右的长文本生成
模型检查点作为一个260GB的存档,通过表单访问批准后拆分为60个可下载的块
开源权重、代码和评估脚本,允许研究人员复现30+已发表的基准测试。
INT4量化在四个RTX 3090 GPU上运行130B模型,未报告性能损失。
英语和中文预训练,在LAMBADA上优于GPT-3 175B,在CLUE上优于ERNIE Titan 3.0 260B。
FasterTransformer路径在A100硬件上将解码时间大约减半,相比Megatron基线。
完整FP16权重需要约260GB存储空间和多GPU服务器加载。
访问检查点需要通过Google表单请求,而非直接通过Hugging Face下载。
仓库主要关注评估和推理,不是像ChatGLM那样托管的聊天API。
GLM-130B是什么?
GLM-130B是THUDM推出的一个拥有1300亿参数的开放双语稠密语言模型,采用通用语言模型填空算法预训练,并被ICLR 2023接收。GitHub仓库提供推理脚本、评测任务和模型权重访问。
GLM-130B需要什么硬件?
GLM-130B推荐使用8块A100(40GB)或8块V100(32GB)GPU进行全FP16推理。通过INT4量化,GLM-130B可以在单台配备4块RTX 3090(24GB)显卡的服务器上运行,同时保持激活值为FP16。
GLM-130B免费使用吗?
是的。GLM-130B的仓库代码采用Apache-2.0开源许可,模型权重在完成THUDM的下载表单后公开可用。您只需支付自己的计算和存储费用。
GLM-130B支持哪些语言?
GLM-130B支持英语和中文。训练时每种语言使用了约2000亿个标记,模型在CLUE、FewCLUE、LAMBADA和MMLU基准测试中表现出强劲的零样本能力。
GLM-130B与GPT-3相比如何?
GLM-130B在THUDM发布的基准测试中,LAMBADA准确率优于GPT-3 175B,MMLU得分略高,同时公开了GPT-3未提供的权重和评测代码。在中文CLUE和FewCLUE任务中,GLM-130B以两位数优势击败ERNIE Titan 3.0 260B。
GLM-130B采用什么许可证?
GLM-130B的仓库代码采用Apache-2.0许可。GLM-130B模型权重的使用受THUDM在GitHub仓库链接的单独模型许可证约束。

