UniLM

UniLM

UniLM est un modèle linguistique pré-entraîné de Microsoft Research qui gère à la fois la compréhension du langage naturel et la génération de texte à partir d'un Transformer partagé. Vous fine-tunez un seul point de contrôle pour des tâches de lecture comme la réponse à des questions, et des tâches d'écriture comme le résumé ou le dialogue, sans avoir besoin de maintenir des modèles séparés uniquement pour l'encodeur ou le décodeur. Le code et les poids pré-entraînés sont distribués via le dépôt GitHub microsoft/unilm sous licence MIT.

Les modèles de style BERT excellent dans la lecture mais nécessitent une pile de décodeurs séparée pour la génération. UniLM entraîne un seul Transformer avec trois modes d’attention-masque : unidirectionnel, bidirectionnel, et séquence-à-séquence. Cette conception permet aux mêmes poids de rivaliser avec BERT sur GLUE et SQuAD tout en établissant des benchmarks pour le résumé et la génération de questions en 2019, une division que la plupart des contemporains considéraient comme deux problèmes distincts.

Les chercheurs en ML et les ingénieurs en NLP utilisent UniLM lorsqu'ils recherchent des benchmarks publiés, des scripts d’entraînement, et des fichiers de point de contrôle pour la compréhension et la génération dans une seule base de code. Le dépôt couvre maintenant des versions ultérieures comme UniLMv2 (Pseudo-Masked Language Model, ICML 2020), mais la version 1 reste la référence pour l'approche de masquage unifié décrite dans l'article NeurIPS 2019.

Fonctionnalités principales:
  1. Trois objectifs de pré-entraînement (unidirectionnel, bidirectionnel, séquence-à-séquence) partagent un même backbone Transformer

  2. Résumé abstrait CNN/DailyMail avec un ROUGE-L de 40,51, soit un gain de 2,04 points par rapport aux travaux antérieurs

  3. Score F1 de 82,5 pour la réponse aux questions génératives CoQA sur la référence publiée

  4. Génération de questions SQuAD avec un BLEU-4 de 22,12 utilisant un décodage par recherche à faisceau

  5. Points de contrôle pré-entraînés et scripts d'entraînement PyTorch dans le dépôt microsoft/unilm (22,2k étoiles GitHub)

  6. Licence MIT avec les versions UniLM v1 et UniLMv2 dans le même dépôt open source

Pros:
  1. Un modèle pré-entraîné couvre à la fois les tâches de compréhension et de génération après ajustement.

  2. Nombres de référence publiés sur GLUE, SQuAD, CNN/DailyMail et CoQA avec scripts reproductibles.

  3. Code sous licence MIT et téléchargements de points de contrôle via le dépôt GitHub microsoft/unilm.

  4. Le dépôt est devenu un hub plus large de modèles fondamentaux Microsoft avec UniLMv2 et les versions associées.

Cons:
  1. Nécessite PyTorch, des GPU CUDA et une configuration manuelle plutôt qu'une API hébergée.

  2. Les scripts d'entraînement originaux de UniLM v1 ciblent des dépendances older pytorch-transformers v0.4.0.

  3. Pas de service d'inférence géré ; vous exécutez l'affinage et le décodage sur votre propre matériel.

FAQ:

Qu'est-ce que UniLM ?

UniLM est un modèle de langage pré-entraîné unifié de Microsoft Research qui affine un seul Transformer pour la compréhension et la génération du langage naturel. Il a été présenté dans l'article NeurIPS 2019 et est disponible en code open-source sur GitHub.

UniLM est-il gratuit ?

Oui, UniLM est gratuit. Le dépôt microsoft/unilm est publié sous licence MIT, et vous pouvez télécharger les checkpoints pré-entraînés et les scripts d'entraînement sans payer.

Pour quelles tâches peut-on affiner UniLM ?

UniLM supporte l'affinage pour des tâches de NLU comme GLUE et le question-réponse SQuAD, ainsi que des tâches de NLG comme le résumé CNN/DailyMail, la génération de questions SQuAD, le QA génératif CoQA, et la génération de réponses dans DSTC7.

En quoi UniLM est-il différent de BERT ?

BERT utilise une attention bidirectionnelle uniquement pour la compréhension. UniLM ajoute des masques d'attention unidirectionnels et séquence-à-séquence, permettant aux mêmes poids pré-entraînés de gérer à la fois la lecture et la génération après affinage.

Où télécharger les modèles UniLM pré-entraînés ?

Les checkpoints UniLM v1 pré-entraînés et le code d'affinage se trouvent dans le dossier unilm-v1 du dépôt microsoft/unilm sur GitHub. Le README donne des liens vers des fichiers checkpoint sur Google Drive pour les modèles base et large.

Quelle licence couvre le code UniLM ?

Le code UniLM est publié sous licence MIT dans le dépôt microsoft/unilm. Certaines parties reposent sur pytorch-transformers v0.4.0, et le fichier LICENSE à la racine du dépôt définit les conditions d'utilisation.

Tarification:

Gratuit

Tags:

Large Language Model
NLP
Microsoft Research
Pre-training
Open Source
Transformer
NeurIPS

Technologie utilisée:

Chakra UI
Ant Design
Amazon Web Services
GraphQL
Python
Ruby
GitHub
Emotion
Tailwind CSS

Commentaires:

Give your opinion on UniLM :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Meilleur Gratuit UniLM Alternatives (et Payées)

By Rishit