
Última atualização 07-30-2026
Categoria:
Reviews:
Join thousands of AI enthusiasts in the World of AI!
Galactica
Cinco checkpoints de pesos abertos de 125M a 120B parâmetros oferecem aos pesquisadores um modelo de linguagem treinado em ciência, construído a partir de 106 bilhões de tokens selecionados em 48 milhões de artigos, livros didáticos, enciclopédias e bases de conhecimento. Galactica armazena, combina e raciocina através de modalidades incluindo LaTeX, código Python, fórmulas SMILES e sequências de aminoácidos dentro de uma arquitetura Transformer apenas com decodificador. A equipe Papers with Code da Meta disponibilizou os pesos para pesquisadores que desejam estudar como modelos de linguagem organizam o conhecimento científico.
Modelos de linguagem geral treinam em amplas varreduras da web onde conversas sociais podem dominar o orçamento de tokens. Galactica usou apenas fontes científicas de acesso aberto selecionadas, o que o artigo argumenta permitir treinar por múltiplas épocas sem overfitting. A Meta removeu a demonstração pública na web três dias após o lançamento em novembro de 2022, quando críticos mostraram citações e equações confiantes, porém fabricadas, então hoje você baixa checkpoints do Hugging Face em vez de conversar por uma interface hospedada.
Pesquisadores de aprendizado de máquina podem reproduzir números de benchmark do artigo do arXiv, incluindo 77,6% no PubMedQA e 52,9% no MedMCQA dev. Biólogos computacionais e químicos podem testar tarefas de anotação de proteínas e moléculas através dos tokens especializados do Galactica para sequências de aminoácidos e strings SMILES. Estudantes de pós-graduação explorando QA científico, predição de citações ou problemas matemáticos em texto podem experimentar tamanhos de até 120 bilhões de parâmetros sem treinar do zero.
Cinco pontos de verificação abrangem 125M, 1.3B, 6.7B, 30B e 120B parâmetros
Corpus de treinamento totaliza 106 bilhões de tokens em 48 milhões de artigos científicos
Pontua 68,2% em testes de equações LaTeX versus GPT-3 com 49,0%
Alcança 77,6% no PubMedQA e 52,9% no MedMCQA nos benchmarks de desenvolvimento
Modelo de 30B atinge 20,4% em MATH versus PaLM 540B com 8,8%
Tokens especiais cobrem citações, fórmulas SMILES e sequências de aminoácidos
Cinco tamanhos de peso aberto de 125M a 120B parâmetros cobrem uma ampla gama de hardware.
Corpus científico curado de 106 bilhões de tokens evita o ruído de rastreamentos web gerais.
Números publicados fortes em PubMedQA, MedMCQA e benchmarks de raciocínio matemático.
Tokens especiais permitem trabalhar com citações, SMILES e sequências de proteínas em um único modelo.
Demonstração pública na web foi removida; galactica.org não resolve mais.
Licença CC BY-NC 4.0 bloqueia implantação comercial sem acordo separado.
O cartão do modelo alerta que Galactica pode inventar respostas confiantes, mas incorretas, em tópicos científicos específicos.
O que é o Galactica?
Galactica é um grande modelo de linguagem da Meta AI treinado com textos e dados científicos selecionados. Ele é direcionado para tarefas como previsão de citações, raciocínio matemático, anotação de proteínas e sumarização científica em cinco tamanhos de pesos abertos.
O Galactica é gratuito para usar?
Sim, os pesos do modelo Galactica são gratuitos para download em pesquisas não comerciais sob a licença CC BY-NC 4.0 no Hugging Face. Não existe um produto hospedado pago; você executa os checkpoints localmente ou na sua própria infraestrutura de GPU.
Quais tamanhos o Galactica oferece?
O Galactica disponibiliza cinco checkpoints denominados mini (125M), base (1.3B), standard (6.7B), large (30B) e huge (120B) parâmetros. Cada tamanho está publicado no Hugging Face sob a família de modelos facebook/galactica.
Por que a demonstração do Galactica foi encerrada?
A Meta pausou a demonstração pública galactica.org em 17 de novembro de 2022 após usuários relatarem saídas científicas confiantes, porém incorretas, incluindo citações fabricadas. O artigo e os pesos abertos permanecem disponíveis; apenas a demonstração de chat hospedada foi removida.
Quais dados foram usados para treinar o Galactica?
O Galactica foi treinado com 106 bilhões de tokens de artigos de acesso aberto, livros didáticos, enciclopédias, códigos, bases de conhecimento e sites científicos. O corpus inclui cerca de 48 milhões de artigos, além de material de referência, cadeias SMILES e sequências de proteínas.
Quais benchmarks o Galactica apresenta?
O artigo do Galactica reporta 77,6% no PubMedQA, 52,9% no MedMCQA dev, 41,3% no MMLU matemático contra 35,7% do Chinchilla, e 68,2% em testes de equações LaTeX contra 49,0% do GPT-3.
Qual licença cobre os pesos do Galactica?
Os checkpoints do Galactica no Hugging Face são lançados sob a licença CC BY-NC 4.0, que permite uso em pesquisa não comercial com atribuição. A implantação comercial requer permissão separada porque a licença bloqueia aplicações comerciais.
