
Última actualización 07-30-2026
Categoría:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
GLM-130B
GLM-130B ofrece un modelo de lenguaje bilingüe de 130 mil millones de parámetros en la pila de investigación abierta THUDM, construida alrededor de la receta de preentrenamiento General Language Model (GLM). Los pesos están dirigidos a texto en inglés y chino, y el repositorio de GitHub incluye código de inferencia, tareas de evaluación y puntos de control aceptados en ICLR 2023. Puedes ejecutar generación de izquierda a derecha o relleno en blanco con los tokens [MASK] y [gMASK] en hardware que quepa en un solo servidor multi-GPU en lugar de una API propietaria.
Mientras que la mayoría de los modelos de más de 100 mil millones permanecen cerrados, GLM-130B publica pesos del modelo, notas de entrenamiento y configuraciones YAML para más de 30 benchmarks. Su ruta de cuantización INT4 está ajustada para que cuatro tarjetas RTX 3090 (24GB) puedan alojar la inferencia con casi ninguna pérdida de precisión, un umbral mucho más bajo que la configuración de ocho A100 (40GB) usada para ejecuciones completas en FP16. El objetivo de entrenamiento mezcla relleno en blanco autorregresivo en el 95% de los tokens con datos de instrucciones multitarea de T0++ y DeepStruct, lo cual es una apuesta diferente al preentrenamiento causal estándar estilo GPT.
Los investigadores que estudian transferencia cero disparo bilingüe, cuantización de modelos grandes o benchmarks reproducibles de LLM obtendrán el máximo provecho de GLM-130B. El repositorio se enfoca en herramientas de evaluación e inferencia más que en un producto de chat alojado, aunque THUDM luego derivó el trabajo de diálogo en ChatGLM. Se espera que traigas tus propias GPUs, almacenamiento para un punto de control de 260GB y paciencia para el formulario de descarga de pesos.
130 mil millones de parámetros entrenados en 400+ mil millones de tokens divididos equitativamente entre inglés y chino
Inferencia FP16 completa en un servidor con 8 A100 (40GB) o 8 V100 (32GB) GPUs; la cuantificación INT4 reduce los requisitos a 4 tarjetas RTX 3090 (24GB)
La integración de NVIDIA FasterTransformer alcanza hasta 2.5x más rápido en decodificación que Megatron en hardware A100
El repositorio incluye configuraciones de evaluación YAML para 30+ tareas de PLN con scripts de referencia reproducibles
Dos tokens de máscara soportan flujos de trabajo: [MASK] para rellenado corto y [gMASK] para generación larga de izquierda a derecha
El punto de control del modelo se distribuye como un archivo de 260GB dividido en 60 fragmentos descargables tras aprobación de acceso mediante formulario
Pesos abiertos, código y scripts de evaluación permiten a los investigadores reproducir más de 30 benchmarks publicados.
La cuantificación INT4 ejecuta el modelo de 130B en cuatro GPUs RTX 3090 sin pérdida de rendimiento reportada.
Preentrenamiento en inglés y chino con ganancias reportadas sobre GPT-3 175B en LAMBADA y ERNIE Titan 3.0 260B en CLUE.
El camino de FasterTransformer reduce aproximadamente a la mitad el tiempo de decodificación en hardware A100 frente a las líneas base de Megatron.
Los pesos FP16 completos requieren aproximadamente 260GB de almacenamiento y un servidor con múltiples GPUs para cargar.
El acceso al punto de control requiere una solicitud mediante Google Form en lugar de una descarga directa de Hugging Face.
El repositorio se centra en evaluación e inferencia, no en una API de chat alojada como ChatGLM.
¿Qué es GLM-130B?
GLM-130B es un modelo de lenguaje denso bilingüe abierto con 130 mil millones de parámetros de THUDM, preentrenado con el algoritmo General Language Model blank-infilling y aceptado en ICLR 2023. El repositorio de GitHub ofrece scripts de inferencia, tareas de evaluación y acceso a los pesos del modelo.
¿Qué hardware necesita GLM-130B?
GLM-130B recomienda 8 GPUs A100 (40GB) o 8 V100 (32GB) para inferencia completa en FP16. Con cuantización INT4, GLM-130B puede ejecutarse en un solo servidor con 4 tarjetas RTX 3090 (24GB) manteniendo las activaciones en FP16.
¿GLM-130B es gratis para usar?
Sí. GLM-130B es de código abierto bajo Apache-2.0 para el código del repositorio, y los pesos del modelo son accesibles públicamente tras completar el formulario de descarga de THUDM. Solo pagas por tu propio cómputo y almacenamiento.
¿Qué idiomas soporta GLM-130B?
GLM-130B soporta inglés y chino. El entrenamiento usó alrededor de 200 mil millones de tokens en cada idioma, y el modelo reporta fuertes puntuaciones zero-shot en los benchmarks CLUE, FewCLUE, LAMBADA y MMLU.
¿Cómo se compara GLM-130B con GPT-3?
GLM-130B reporta mejor precisión en LAMBADA que GPT-3 175B y puntuaciones ligeramente superiores en MMLU según los benchmarks publicados por THUDM, además de publicar pesos y código de evaluación que GPT-3 no ofrece. En tareas chinas CLUE y FewCLUE, GLM-130B supera a ERNIE Titan 3.0 260B por márgenes de dos dígitos.
¿Qué licencia cubre GLM-130B?
El código del repositorio GLM-130B está licenciado bajo Apache-2.0. El uso de los pesos del modelo GLM-130B está sujeto a la Licencia de Modelo separada de THUDM enlazada desde el repositorio de GitHub.
