GLM-130B

GLM-130B

GLM-130B coloca um modelo bilíngue de linguagem com 130 bilhões de parâmetros na pilha de pesquisa aberta THUDM construída em torno da receita de pré-treinamento do General Language Model (GLM). Os pesos são direcionados para textos em inglês e chinês, e o repositório do GitHub disponibiliza código de inferência, tarefas de avaliação e checkpoints aceitos no ICLR 2023. Você pode executar geração da esquerda para a direita ou preenchimento em branco com tokens [MASK] e [gMASK] em hardware que caiba em um único servidor multi-GPU, em vez de uma API proprietária.

Enquanto a maioria dos modelos com mais de 100 bilhões de parâmetros permanece fechada, o GLM-130B publica pesos do modelo, notas de treinamento e configurações YAML para mais de 30 benchmarks. Seu caminho de quantização INT4 é ajustado para que quatro placas RTX 3090 (24GB) possam hospedar a inferência com quase nenhuma perda de precisão, um requisito muito menor do que a configuração com oito A100 (40GB) usada para execuções completas em FP16. O objetivo de treinamento mistura preenchimento em branco autorregressivo em 95% dos tokens com dados de instrução multitarefa do T0++ e DeepStruct, o que é uma aposta diferente do pré-treinamento causal padrão no estilo GPT.

Pesquisadores que estudam transferência zero-shot bilíngue, quantização de grandes modelos ou benchmarks reproduzíveis de LLMs obterão o máximo do GLM-130B. O repositório foca em ferramentas de avaliação e inferência em vez de um produto de chat hospedado, embora o THUDM tenha posteriormente desmembrado o trabalho de diálogo no ChatGLM. Espere trazer suas próprias GPUs, armazenamento para um checkpoint de 260GB e paciência para o formulário de download dos pesos.

Recursos Principais:
  1. 130 bilhões de parâmetros treinados em 400+ bilhões de tokens divididos igualmente entre inglês e chinês

  2. Inferência completa FP16 em um servidor com 8 A100 (40GB) ou 8 V100 (32GB) GPUs; quantização INT4 reduz os requisitos para 4 placas RTX 3090 (24GB)

  3. Integração NVIDIA FasterTransformer atinge até 2.5x mais rápido na decodificação do que Megatron em hardware A100

  4. Repositório fornece configurações de avaliação YAML para 30+ tarefas de PLN com scripts de benchmark reproduzíveis

  5. Dois tokens de máscara suportam fluxos de trabalho: [MASK] para preenchimento de lacunas curtas e [gMASK] para geração longa da esquerda para a direita

  6. Checkpoint do modelo enviado como um arquivo de 260GB dividido em 60 partes para download após aprovação via formulário

Pros:
  1. Pesos abertos, código e scripts de avaliação permitem que pesquisadores reproduzam mais de 30 benchmarks publicados.

  2. Quantização INT4 executa o modelo de 130B em quatro GPUs RTX 3090 sem perda de desempenho relatada.

  3. Pré-treinamento em inglês e chinês com ganhos relatados sobre GPT-3 175B em LAMBADA e ERNIE Titan 3.0 260B em CLUE.

  4. Caminho FasterTransformer reduz o tempo de decodificação aproximadamente pela metade em hardware A100 em relação às bases do Megatron.

Cons:
  1. Pesos FP16 completos precisam de cerca de 260GB de armazenamento e um servidor com múltiplas GPUs para carregar.

  2. Acesso ao checkpoint requer solicitação via Google Form, ao invés de download direto do Hugging Face.

  3. O repositório foca em avaliação e inferência, não em uma API de chat hospedada como ChatGLM.

Perguntas frequentes:

O que é o GLM-130B?

GLM-130B é um modelo de linguagem denso bilíngue aberto com 130 bilhões de parâmetros da THUDM, pré-treinado com o algoritmo General Language Model blank-infilling e aceito no ICLR 2023. O repositório do GitHub fornece scripts de inferência, tarefas de avaliação e acesso aos pesos do modelo.

Qual hardware o GLM-130B precisa?

GLM-130B recomenda 8 GPUs A100 (40GB) ou 8 V100 (32GB) para inferência completa em FP16. Com quantização INT4, o GLM-130B pode rodar em um único servidor com 4 placas RTX 3090 (24GB) mantendo as ativações em FP16.

O GLM-130B é gratuito para usar?

Sim. GLM-130B é open source sob a licença Apache-2.0 para o código do repositório, e os pesos do modelo são publicamente acessíveis após preencher o formulário de download da THUDM. Você paga apenas pelo seu próprio processamento e armazenamento.

Quais idiomas o GLM-130B suporta?

GLM-130B suporta inglês e chinês. O treinamento usou cerca de 200 bilhões de tokens em cada idioma, e o modelo apresenta fortes resultados zero-shot nos benchmarks CLUE, FewCLUE, LAMBADA e MMLU.

Como o GLM-130B se compara ao GPT-3?

GLM-130B apresenta melhor acurácia no LAMBADA que o GPT-3 175B e pontua ligeiramente mais alto no MMLU nos benchmarks publicados pela THUDM, além de disponibilizar pesos e código de avaliação que o GPT-3 não oferece. Nas tarefas chinesas CLUE e FewCLUE, o GLM-130B supera o ERNIE Titan 3.0 260B por margens de dois dígitos.

Qual licença cobre o GLM-130B?

O código do repositório GLM-130B é licenciado sob Apache-2.0. O uso dos pesos do modelo GLM-130B está sujeito à Licença de Modelo separada da THUDM, vinculada no repositório do GitHub.

Preços:

Gratuito

Tags:

Open Source
Bilingual LLM
Chinese NLP
Model Weights
Research Code
ICLR 2023
Zero-Shot Learning
Blank Infilling

Tecnologia utilizada:

PyTorch
CUDA
DeepSpeed
Python
Docker
NVIDIA FasterTransformer
SwissArmyTransformer

Avaliações:

Give your opinion on GLM-130B :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Melhor Gratuito GLM-130B Alternativas (e Pagas)

By Rishit