
Última actualización 07-30-2026
Categoría:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
Galactica
Cinco puntos de control de pesos abiertos desde 125M hasta 120B de parámetros ofrecen a los investigadores un modelo de lenguaje entrenado en ciencia construido a partir de 106 mil millones de tokens seleccionados de 48 millones de artículos, libros de texto, enciclopedias y bases de conocimiento. Galactica almacena, combina y razona a través de modalidades que incluyen LaTeX, código Python, fórmulas SMILES y secuencias de aminoácidos dentro de una arquitectura Transformer solo con decodificador. El equipo Papers with Code de Meta liberó los pesos para investigadores que quieran estudiar cómo los modelos de lenguaje organizan el conocimiento científico.
Los LLMs de propósito general se entrenan con rastreos amplios de la web donde las conversaciones sociales pueden dominar el presupuesto de tokens. Galactica usó solo fuentes científicas de acceso abierto seleccionadas, lo que según el artículo permite entrenar durante múltiples épocas sin sobreajuste. Meta retiró la demostración pública en la web tres días después del lanzamiento en noviembre de 2022 cuando críticos mostraron citas y ecuaciones confiadas pero fabricadas, por lo que hoy se descargan los puntos de control desde Hugging Face en lugar de chatear mediante una interfaz alojada.
Los investigadores en aprendizaje automático pueden reproducir números de referencia del artículo en arXiv, incluyendo 77.6% en PubMedQA y 52.9% en MedMCQA dev. Los biólogos computacionales y químicos pueden probar tareas de anotación de proteínas y moléculas mediante los tokens especializados de Galactica para secuencias de aminoácidos y cadenas SMILES. Estudiantes de posgrado que exploran preguntas científicas, predicción de citas o problemas matemáticos pueden experimentar con tamaños de hasta 120 mil millones de parámetros sin entrenar desde cero.
Cinco puntos de control que abarcan 125M, 1.3B, 6.7B, 30B y 120B de parámetros
El corpus de entrenamiento totaliza 106 mil millones de tokens en 48 millones de artículos científicos
Obtiene un 68.2% en pruebas de ecuaciones LaTeX frente a GPT-3 en 49.0%
Alcanza un 77.6% en PubMedQA y un 52.9% en MedMCQA en pruebas de desarrollo
El modelo de 30B alcanza un 20.4% en MATH frente a PaLM 540B en 8.8%
Los tokens especiales cubren citas, fórmulas SMILES y secuencias de aminoácidos
Cinco tamaños de peso abierto desde 125M hasta 120B de parámetros cubren un amplio rango de hardware.
El corpus científico curado de 106 mil millones de tokens evita el ruido de rastreos web generales.
Fuertes números publicados en PubMedQA, MedMCQA y pruebas de razonamiento matemático.
Los tokens especiales permiten trabajar con citas, SMILES y secuencias de proteínas en un solo modelo.
La demostración pública en web fue eliminada; galactica.org ya no resuelve.
La licencia CC BY-NC 4.0 bloquea el despliegue comercial sin un acuerdo separado.
La tarjeta del modelo advierte que Galactica puede alucinar respuestas confiadas pero incorrectas en temas científicos específicos.
¿Qué es Galactica?
Galactica es un modelo de lenguaje grande de Meta AI entrenado con textos y datos científicos seleccionados. Está diseñado para tareas como predicción de citas, razonamiento matemático, anotación de proteínas y resumen científico en cinco tamaños de pesos abiertos.
¿Galactica es gratis para usar?
Sí, los pesos del modelo Galactica son gratuitos para descargar con fines de investigación no comercial bajo la licencia CC BY-NC 4.0 en Hugging Face. No existe un producto alojado de pago; debes ejecutar los puntos de control localmente o en tu propia infraestructura GPU.
¿Qué tamaños ofrece Galactica?
Galactica ofrece cinco puntos de control etiquetados como mini (125M), base (1.3B), estándar (6.7B), grande (30B) y enorme (120B) parámetros. Cada tamaño está publicado en Hugging Face bajo la familia de modelos facebook/galactica.
¿Por qué se cerró la demo de Galactica?
Meta pausó la demo pública galactica.org el 17 de noviembre de 2022 después de que usuarios reportaran resultados científicos confiados pero incorrectos, incluyendo citas fabricadas. El artículo y los pesos abiertos siguen disponibles; solo se eliminó la demo de chat alojada.
¿Qué datos usó Galactica para entrenar?
Galactica se entrenó con 106 mil millones de tokens de artículos de acceso abierto, libros de texto, enciclopedias, código, bases de conocimiento y sitios web científicos. El corpus incluye aproximadamente 48 millones de artículos más material de referencia, cadenas SMILES y secuencias de proteínas.
¿Qué benchmarks reporta Galactica?
El artículo de Galactica reporta 77.6% en PubMedQA, 52.9% en MedMCQA dev, 41.3% en MMLU matemático frente a Chinchilla con 35.7%, y 68.2% en pruebas de ecuaciones LaTeX frente a GPT-3 con 49.0%.
¿Qué licencia cubre los pesos de Galactica?
Los puntos de control de Galactica en Hugging Face se publican bajo CC BY-NC 4.0, que permite uso en investigación no comercial con atribución. El despliegue comercial requiere permiso separado porque la licencia bloquea aplicaciones comerciales.
