
Dernière mise à jour 07-30-2026
Catégorie:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
Galactica
Cinq points de contrôle open-weight allant de 125M à 120B de paramètres offrent aux chercheurs un modèle de langage formé à la science, construit à partir de 106 milliards de tokens sélectionnés parmi 48 millions d’articles, manuels, encyclopédies et bases de connaissances. Galactica stocke, combine et raisonne à travers des modalités incluant LaTeX, code Python, formules SMILES et séquences d’acides aminés au sein d’une architecture Transformer à décodeur unique. L’équipe Papers with Code de Meta a rendu open source les poids pour les chercheurs souhaitant étudier comment les modèles de langage organisent les connaissances scientifiques.
Les LLM à usage général s’entraînent sur de larges explorations du web où les discussions sociales peuvent dominer le budget de tokens. Galactica a utilisé uniquement des sources scientifiques en libre accès sélectionnées, ce que l’article soutient lui permet de s’entraîner sur plusieurs époques sans surapprentissage. Meta a retiré la démo web publique trois jours après son lancement en novembre 2022 lorsque des critiques ont montré des citations et équations confiantes mais fabriquées, ainsi aujourd’hui vous téléchargez les points de contrôle depuis Hugging Face plutôt que de discuter via une interface hébergée.
Les chercheurs en apprentissage automatique peuvent reproduire les chiffres de référence de l’article arXiv, incluant 77,6 % sur PubMedQA et 52,9 % sur MedMCQA dev. Les biologistes computationnels et chimistes peuvent tester des tâches d’annotation de protéines et de molécules grâce aux tokens spécialisés de Galactica pour les séquences d’acides aminés et chaînes SMILES. Les étudiants en master explorant les questions-réponses scientifiques, la prédiction de citations ou les problèmes mathématiques peuvent expérimenter avec des tailles allant jusqu’à 120 milliards de paramètres sans entraînement depuis zéro.
Cinq points de contrôle couvrent 125M, 1,3B, 6,7B, 30B et 120B paramètres
Le corpus d'entraînement totalise 106 milliards de tokens à travers 48 millions d'articles scientifiques
Atteint 68,2 % sur les tests d'équations LaTeX contre GPT-3 à 49,0 %
Réussit 77,6 % sur PubMedQA et 52,9 % sur MedMCQA en développement
Le modèle 30B atteint 20,4 % sur MATH contre PaLM 540B à 8,8 %
Les tokens spéciaux couvrent citations, formules SMILES et séquences d'acides aminés
Cinq tailles de poids ouverts de 125M à 120B paramètres couvrent une large gamme matérielle.
Corpus scientifique de 106 milliards de tokens soigneusement sélectionné évite le bruit des crawls web généraux.
Chiffres publiés solides sur PubMedQA, MedMCQA et benchmarks de raisonnement mathématique.
Les tokens spéciaux permettent de travailler avec citations, SMILES et séquences de protéines dans un seul modèle.
Démonstration web publique supprimée ; galactica.org ne résout plus.
La licence CC BY-NC 4.0 bloque le déploiement commercial sans accord séparé.
La fiche du modèle avertit que Galactica peut halluciner des réponses confiantes mais erronées sur des sujets scientifiques de niche.
Qu'est-ce que Galactica ?
Galactica est un grand modèle de langage de Meta AI entraîné sur des textes et données scientifiques sélectionnés. Il cible des tâches comme la prédiction de citations, le raisonnement mathématique, l'annotation de protéines et la synthèse scientifique sur cinq tailles de poids ouverts.
Galactica est-il gratuit ?
Oui, les poids du modèle Galactica sont téléchargeables gratuitement pour la recherche non commerciale sous licence CC BY-NC 4.0 sur Hugging Face. Il n'existe pas de produit hébergé payant ; vous exécutez les points de contrôle localement ou sur votre propre infrastructure GPU.
Quelles tailles propose Galactica ?
Galactica propose cinq points de contrôle nommés mini (125M), base (1,3B), standard (6,7B), large (30B) et huge (120B) paramètres. Chaque taille est publiée sur Hugging Face sous la famille de modèles facebook/galactica.
Pourquoi la démo Galactica a-t-elle été arrêtée ?
Meta a suspendu la démo publique galactica.org le 17 novembre 2022 après que des utilisateurs ont signalé des résultats scientifiques confiants mais incorrects, incluant des citations fabriquées. L'article et les poids ouverts restent disponibles ; seule la démo de chat hébergée a été retirée.
Quelles données ont servi à entraîner Galactica ?
Galactica a été entraîné sur 106 milliards de tokens issus d'articles en libre accès, manuels, encyclopédies, codes, bases de connaissances et sites scientifiques. Le corpus comprend environ 48 millions d'articles ainsi que du matériel de référence, des chaînes SMILES et des séquences de protéines.
Quels benchmarks Galactica affiche-t-il ?
L'article Galactica rapporte 77,6 % sur PubMedQA, 52,9 % sur MedMCQA dev, 41,3 % sur le MMLU mathématique contre 35,7 % pour Chinchilla, et 68,2 % sur les tests d'équations LaTeX contre 49,0 % pour GPT-3.
Quelle licence couvre les poids de Galactica ?
Les points de contrôle Galactica sur Hugging Face sont publiés sous licence CC BY-NC 4.0, qui autorise l'utilisation pour la recherche non commerciale avec attribution. Le déploiement commercial nécessite une permission distincte car la licence interdit les applications commerciales.
