GLM-130B vs Terracotta

En la confrontación entre GLM-130B vs Terracotta, ¿cuál herramienta AI Large Language Model (LLM) sale victoriosa? Evaluamos opiniones, precios, alternativas, características, votos positivos, y más.

Cuando ponemos a GLM-130B y Terracotta cara a cara, ¿cuál emerge como el vencedor?

Echemos un vistazo más de cerca a GLM-130B y Terracotta, ambas son herramientas impulsadas por inteligencia artificial en la categoría de large language model (llm), y veamos qué las distingue. GLM-130B es el claro ganador en términos de votos positivos. GLM-130B ha recibido 7 votos positivos de usuarios de aitools.fyi, mientras que Terracotta ha recibido 6 votos positivos.

¿No es lo tuyo? ¡Vota por tu herramienta preferida y agita las cosas!

GLM-130B

GLM-130B

¿Qué es GLM-130B?

GLM-130B ofrece un modelo de lenguaje bilingüe de 130 mil millones de parámetros en la pila de investigación abierta THUDM, construida alrededor de la receta de preentrenamiento General Language Model (GLM). Los pesos están dirigidos a texto en inglés y chino, y el repositorio de GitHub incluye código de inferencia, tareas de evaluación y puntos de control aceptados en ICLR 2023. Puedes ejecutar generación de izquierda a derecha o relleno en blanco con los tokens [MASK] y [gMASK] en hardware que quepa en un solo servidor multi-GPU en lugar de una API propietaria.

Mientras que la mayoría de los modelos de más de 100 mil millones permanecen cerrados, GLM-130B publica pesos del modelo, notas de entrenamiento y configuraciones YAML para más de 30 benchmarks. Su ruta de cuantización INT4 está ajustada para que cuatro tarjetas RTX 3090 (24GB) puedan alojar la inferencia con casi ninguna pérdida de precisión, un umbral mucho más bajo que la configuración de ocho A100 (40GB) usada para ejecuciones completas en FP16. El objetivo de entrenamiento mezcla relleno en blanco autorregresivo en el 95% de los tokens con datos de instrucciones multitarea de T0++ y DeepStruct, lo cual es una apuesta diferente al preentrenamiento causal estándar estilo GPT.

Los investigadores que estudian transferencia cero disparo bilingüe, cuantización de modelos grandes o benchmarks reproducibles de LLM obtendrán el máximo provecho de GLM-130B. El repositorio se enfoca en herramientas de evaluación e inferencia más que en un producto de chat alojado, aunque THUDM luego derivó el trabajo de diálogo en ChatGLM. Se espera que traigas tus propias GPUs, almacenamiento para un punto de control de 260GB y paciencia para el formulario de descarga de pesos.

Terracotta

Terracotta

¿Qué es Terracotta?

Terracotta es una plataforma de vanguardia diseñada para mejorar el flujo de trabajo de desarrolladores e investigadores que trabajan con modelos de lenguajes grandes (LLM). Esta plataforma intuitiva y fácil de usar le permite administrar, iterar y evaluar sus modelos ajustados con facilidad. Con Terracotta, puede cargar datos de forma segura, ajustar modelos para diversas tareas como clasificación y generación de texto, y crear evaluaciones integrales para comparar el rendimiento del modelo utilizando métricas tanto cualitativas como cuantitativas. Nuestra herramienta admite conexiones con proveedores importantes como OpenAI y Cohere, lo que garantiza que tenga acceso a una amplia gama de capacidades de LLM. Terracotta es la creación de Beri Kohen y Lucas Pauker, entusiastas de la IA y graduados de Stanford, que se dedican a promover el desarrollo de LLM. Únase a nuestra lista de correo electrónico para mantenerse informado sobre las últimas actualizaciones y características que Terracotta tiene para ofrecer.

GLM-130B Votos positivos

7🏆

Terracotta Votos positivos

6

GLM-130B Características principales

  • 130 mil millones de parámetros entrenados en 400+ mil millones de tokens divididos equitativamente entre inglés y chino

  • Inferencia FP16 completa en un servidor con 8 A100 (40GB) o 8 V100 (32GB) GPUs; la cuantificación INT4 reduce los requisitos a 4 tarjetas RTX 3090 (24GB)

  • La integración de NVIDIA FasterTransformer alcanza hasta 2.5x más rápido en decodificación que Megatron en hardware A100

  • El repositorio incluye configuraciones de evaluación YAML para 30+ tareas de PLN con scripts de referencia reproducibles

  • Dos tokens de máscara soportan flujos de trabajo: [MASK] para rellenado corto y [gMASK] para generación larga de izquierda a derecha

  • El punto de control del modelo se distribuye como un archivo de 260GB dividido en 60 fragmentos descargables tras aprobación de acceso mediante formulario

Terracotta Características principales

  • Administre muchos modelos: Maneje centralmente todos sus modelos ajustados en un lugar conveniente.

  • Itere rápidamente: Optimice el proceso de mejora del modelo con evaluaciones cualitativas y cuantitativas rápidas.

  • Múltiples proveedores: Integre perfectamente con los servicios de OpenAI y Cohere para potenciar su proceso de desarrollo.

  • Cargue sus datos: Cargue y almacene de forma segura sus conjuntos de datos para ajustar los modelos.

  • Crear evaluaciones: Realice evaluaciones comparativas en profundidad del rendimiento del modelo aprovechando métricas como la precisión BLEU y las matrices de confusión.

GLM-130B Categoría

    Large Language Model (LLM)

Terracotta Categoría

    Large Language Model (LLM)

GLM-130B Tipo de tarificación

    Free

Terracotta Tipo de tarificación

    Freemium

GLM-130B Tecnologías utilizadas

PyTorch
CUDA
DeepSpeed
Python
Docker
NVIDIA FasterTransformer
SwissArmyTransformer

Terracotta Tecnologías utilizadas

No se han especificado tecnologías

GLM-130B Etiquetas

Open Source
Bilingual LLM
Chinese NLP
Model Weights
Research Code
ICLR 2023
Zero-Shot Learning
Blank Infilling

Terracotta Etiquetas

Terracotta
Fine-Tuning
Large Language Models
LLM Development
Model Evaluation
Data Upload
OpenAI
Cohere
Stanford AI Graduates
By Rishit