
Dernière mise à jour 07-30-2026
Catégorie:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
GLM-130B
GLM-130B propose un modèle de langage bilingue de 130 milliards de paramètres dans la pile de recherche ouverte THUDM construite autour de la recette de pré-entraînement General Language Model (GLM). Les poids ciblent les textes en anglais et en chinois, et le dépôt GitHub fournit le code d'inférence, les tâches d'évaluation et les points de contrôle acceptés à ICLR 2023. Vous pouvez exécuter une génération de gauche à droite ou un remplissage à blanc avec les tokens [MASK] et [gMASK] sur un matériel tenant sur un seul serveur multi-GPU plutôt que via une API propriétaire.
Alors que la plupart des modèles de plus de 100 milliards restent fermés, GLM-130B publie les poids du modèle, les notes d'entraînement et les configurations YAML pour plus de 30 benchmarks. Sa voie de quantification INT4 est optimisée pour que quatre cartes RTX 3090 (24GB) puissent héberger l'inférence avec presque aucune perte de précision, un seuil bien plus bas que la configuration de huit A100 (40GB) utilisée pour les exécutions FP16 complètes. L'objectif d'entraînement combine un remplissage à blanc autorégressif sur 95 % des tokens avec des données d'instruction multitâches issues de T0++ et DeepStruct, ce qui constitue un pari différent du pré-entraînement causal standard de type GPT.
Les chercheurs étudiant le transfert zéro-shot bilingue, la quantification de grands modèles ou les benchmarks reproductibles de LLM tireront le meilleur parti de GLM-130B. Le dépôt se concentre sur les outils d'évaluation et d'inférence plutôt que sur un produit de chat hébergé, bien que THUDM ait ensuite dérivé les travaux de dialogue dans ChatGLM. Prévoyez d'apporter vos propres GPU, un stockage pour un point de contrôle de 260GB et de la patience pour le formulaire de téléchargement des poids.
130 milliards de paramètres entraînés sur 400+ milliards de tokens répartis également entre l'anglais et le chinois
Inférence FP16 complète sur un serveur avec 8 A100 (40GB) ou 8 V100 (32GB) GPU ; la quantification INT4 réduit les besoins à 4 cartes RTX 3090 (24GB)
L'intégration NVIDIA FasterTransformer atteint jusqu'à 2,5x plus rapide en décodage que Megatron sur matériel A100
Le dépôt fournit des configurations d'évaluation YAML pour plus de 30 tâches NLP avec des scripts de benchmark reproductibles
Deux tokens de masque supportent les flux de travail : [MASK] pour le remplissage court et [gMASK] pour la génération longue de gauche à droite
Le point de contrôle du modèle est livré sous forme d'une archive de 260GB divisée en 60 morceaux téléchargeables après approbation via formulaire
Les poids, le code et les scripts d'évaluation ouverts permettent aux chercheurs de reproduire plus de 30 benchmarks publiés.
La quantification INT4 exécute le modèle 130B sur quatre GPU RTX 3090 sans perte de performance rapportée.
Pré-entraînement en anglais et chinois avec des gains rapportés par rapport à GPT-3 175B sur LAMBADA et ERNIE Titan 3.0 260B sur CLUE.
Le chemin FasterTransformer réduit le temps de décodage d'environ la moitié sur le matériel A100 par rapport aux baselines Megatron.
Les poids FP16 complets nécessitent environ 260GB de stockage et un serveur multi-GPU pour charger.
L'accès au point de contrôle requiert une demande via Google Form plutôt qu'un téléchargement direct depuis Hugging Face.
Le dépôt se concentre sur l'évaluation et l'inférence, pas sur une API de chat hébergée comme ChatGLM.
Qu'est-ce que GLM-130B ?
GLM-130B est un modèle de langage dense bilingue ouvert avec 130 milliards de paramètres de THUDM, pré-entraîné avec l'algorithme General Language Model blank-infilling et accepté à ICLR 2023. Le dépôt GitHub fournit des scripts d'inférence, des tâches d'évaluation et l'accès aux poids du modèle.
Quel matériel est nécessaire pour GLM-130B ?
GLM-130B recommande 8 GPU A100 (40GB) ou 8 GPU V100 (32GB) pour une inférence complète en FP16. Avec la quantification INT4, GLM-130B peut fonctionner sur un seul serveur avec 4 cartes RTX 3090 (24GB) tout en conservant les activations en FP16.
GLM-130B est-il gratuit ?
Oui. GLM-130B est open source sous licence Apache-2.0 pour le code du dépôt, et les poids du modèle sont accessibles publiquement après avoir rempli le formulaire de téléchargement de THUDM. Vous ne payez que pour votre propre calcul et stockage.
Quelles langues GLM-130B supporte-t-il ?
GLM-130B supporte l'anglais et le chinois. L'entraînement a utilisé environ 200 milliards de tokens dans chaque langue, et le modèle affiche de bons scores zero-shot sur les benchmarks CLUE, FewCLUE, LAMBADA et MMLU.
Comment GLM-130B se compare-t-il à GPT-3 ?
GLM-130B affiche une meilleure précision LAMBADA que GPT-3 175B et des scores MMLU légèrement supérieurs dans les benchmarks publiés par THUDM, tout en publiant des poids et du code d'évaluation que GPT-3 ne propose pas. Sur les tâches chinoises CLUE et FewCLUE, GLM-130B bat ERNIE Titan 3.0 260B avec des marges à deux chiffres.
Quelle licence couvre GLM-130B ?
Le code du dépôt GLM-130B est sous licence Apache-2.0. L'utilisation des poids du modèle GLM-130B est soumise à la licence modèle distincte de THUDM, liée depuis le dépôt GitHub.
