GLM-130B

GLM-130B

GLM-130B 将一个拥有1300亿参数的双语语言模型纳入了由THUDM基于通用语言模型(GLM)预训练方案构建的开放研究框架中。该模型权重针对英语和中文文本,GitHub仓库提供了推理代码、评估任务以及在ICLR 2023接受的检查点。您可以在单个多GPU服务器上运行从左到右的生成或使用[MASK]和[gMASK]标记的空白填充,而无需依赖专有API。

大多数超过1000亿参数的模型都保持封闭,GLM-130B则公开了模型权重、训练笔记和30多个基准测试的YAML配置。其INT4量化路径经过调优,使得四张RTX 3090(24GB)显卡几乎无精度损失地支持推理,这远低于用于完整FP16运行的八张A100(40GB)显卡配置。训练目标将95%的标记采用自回归空白填充,与来自T0++和DeepStruct的多任务指令数据混合,这与标准的因果GPT风格预训练有所不同。

研究双语零样本迁移、大模型量化或可复现的大型语言模型基准的研究人员将从GLM-130B中获益最多。该仓库侧重于评估和推理工具,而非托管聊天产品,尽管THUDM后来将对话工作拆分为ChatGLM。请准备好自备GPU、260GB检查点的存储空间以及下载权重时的耐心。

主要功能:
  1. 在400多亿个标记上训练的1300亿参数,平分英语和中文

  2. 在一台配备8个A100(40GB)或8个V100(32GB)GPU的服务器上实现完整FP16推理;INT4量化将需求降至4张RTX 3090(24GB)卡

  3. NVIDIA FasterTransformer集成在A100硬件上实现比Megatron快2.5倍的解码速度

  4. 仓库提供30+ NLP任务的YAML评估配置和可复现的基准脚本

  5. 两种掩码标记支持工作流程:[MASK]用于短空白填充,[gMASK]用于从左到右的长文本生成

  6. 模型检查点作为一个260GB的存档,通过表单访问批准后拆分为60个可下载的块

Pros:
  1. 开源权重、代码和评估脚本,允许研究人员复现30+已发表的基准测试。

  2. INT4量化在四个RTX 3090 GPU上运行130B模型,未报告性能损失。

  3. 英语和中文预训练,在LAMBADA上优于GPT-3 175B,在CLUE上优于ERNIE Titan 3.0 260B。

  4. FasterTransformer路径在A100硬件上将解码时间大约减半,相比Megatron基线。

Cons:
  1. 完整FP16权重需要约260GB存储空间和多GPU服务器加载。

  2. 访问检查点需要通过Google表单请求,而非直接通过Hugging Face下载。

  3. 仓库主要关注评估和推理,不是像ChatGLM那样托管的聊天API。

常见问题:

GLM-130B是什么?

GLM-130B是THUDM推出的一个拥有1300亿参数的开放双语稠密语言模型,采用通用语言模型填空算法预训练,并被ICLR 2023接收。GitHub仓库提供推理脚本、评测任务和模型权重访问。

GLM-130B需要什么硬件?

GLM-130B推荐使用8块A100(40GB)或8块V100(32GB)GPU进行全FP16推理。通过INT4量化,GLM-130B可以在单台配备4块RTX 3090(24GB)显卡的服务器上运行,同时保持激活值为FP16。

GLM-130B免费使用吗?

是的。GLM-130B的仓库代码采用Apache-2.0开源许可,模型权重在完成THUDM的下载表单后公开可用。您只需支付自己的计算和存储费用。

GLM-130B支持哪些语言?

GLM-130B支持英语和中文。训练时每种语言使用了约2000亿个标记,模型在CLUE、FewCLUE、LAMBADA和MMLU基准测试中表现出强劲的零样本能力。

GLM-130B与GPT-3相比如何?

GLM-130B在THUDM发布的基准测试中,LAMBADA准确率优于GPT-3 175B,MMLU得分略高,同时公开了GPT-3未提供的权重和评测代码。在中文CLUE和FewCLUE任务中,GLM-130B以两位数优势击败ERNIE Titan 3.0 260B。

GLM-130B采用什么许可证?

GLM-130B的仓库代码采用Apache-2.0许可。GLM-130B模型权重的使用受THUDM在GitHub仓库链接的单独模型许可证约束。

定价:

免费

标签:

Open Source
Bilingual LLM
Chinese NLP
Model Weights
Research Code
ICLR 2023
Zero-Shot Learning
Blank Infilling

使用的技术:

PyTorch
CUDA
DeepSpeed
Python
Docker
NVIDIA FasterTransformer
SwissArmyTransformer

评论:

Give your opinion on GLM-130B :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

最佳免费 GLM-130B 替代方案(和付费)

By Rishit