Mixtral of experts - Mistral AI

Mixtral of experts - Mistral AI

Mixtral 8x7B est un grand modèle de langage à poids ouverts développé par Mistral AI, publié en tant que décodeur à mélange d'experts clairsemé sous licence Apache 2.0. Vous pouvez télécharger les poids pour une inférence auto-hébergée, les affiner sur vos données ou appeler le modèle via l'API hébergée de Mistral. Il est destiné à la génération de texte général, à l'écriture de code et au suivi d'instructions.

La plupart des modèles ouverts de cette catégorie de performance utilisent des architectures denses où chaque paramètre s'active à chaque jeton. Mixtral dirige chaque jeton à travers seulement deux des huit couches d'experts feedforward à chaque bloc de décodeur, combinant leurs sorties de manière additive. Ce routage clairsemé offre 46,7 milliards de paramètres au total tout en activant seulement 12,9 milliards par jeton, ce qui, selon Mistral, permet une inférence 6 fois plus rapide que Llama 2 70B sur la plupart des benchmarks.

Le modèle gère un contexte de 32k jetons et performe bien sur des tâches multilingues en anglais, français, italien, allemand et espagnol. La génération de code est une force documentée, et la variante distincte Mixtral 8x7B Instruct atteint 8,30 sur MT-Bench après un affinage supervisé et une optimisation directe des préférences.

Les ingénieurs ML, chercheurs et équipes produit utilisent Mixtral lorsqu'ils souhaitent des poids ouverts avec une licence permissive et des performances compétitives face à des modèles fermés comme GPT-3.5. Les auto-hébergeurs peuvent déployer via vLLM avec les noyaux Megablocks CUDA ou Skypilot sur des instances cloud, tandis que les utilisateurs de l'API paient 0,70 $ par million de jetons d'entrée et de sortie sur le point de terminaison open-mixtral-8x7b.

Fonctionnalités principales:
  1. Le routeur active 2 des 8 couches d'experts par jeton, utilisant 12,9B sur 46,7B paramètres totaux

  2. Fenêtre de contexte de 32k jetons pour documents longs et conversations multi-tours

  3. Licence open-weight Apache 2.0 pour la recherche et l'auto-hébergement commercial

  4. Supporte l'anglais, le français, l'italien, l'allemand et l'espagnol

  5. Point de terminaison API open-mixtral-8x7b à 0,70$ par million de jetons d'entrée et de sortie

  6. Mixtral 8x7B Instruct note 8,30 sur MT-Bench après fine-tuning DPO

  7. Déployable via vLLM avec les noyaux CUDA Megablocks ou les points de terminaison cloud Skypilot

Pros:
  1. Les poids open weights Apache 2.0 vous permettent de vous auto-héberger sans verrouillage fournisseur.

  2. Le routage sparse active 12,9B de 46,7B paramètres par jeton, réduisant le coût d'inférence par rapport aux modèles dense de 70B.

  3. La fenêtre de contexte de 32k jetons gère les longs documents et les sessions de chat étendues.

  4. Support multilingue pour l'anglais, le français, l'italien, l'allemand et l'espagnol.

  5. Chemins de déploiement documentés vLLM et Skypilot pour l'auto-hébergement en production.

Cons:
  1. La gamme de modèles actuelle de Mistral a dépassé Mixtral pour des versions plus récentes Small et Medium.

  2. L'accès API hébergé nécessite un compte Mistral Studio et une facturation à l'usage par jeton.

  3. L'auto-hébergement nécessite une infrastructure GPU avec support CUDA pour une inférence efficace.

FAQ:

Qu'est-ce que Mixtral 8x7B ?

Mixtral 8x7B est le modèle de langage à mélange d'experts clairsemé à poids ouverts de Mistral AI avec 46,7 milliards de paramètres au total et une licence Apache 2.0. À chaque couche, un routeur sélectionne deux des huit groupes d'experts feedforward pour traiter chaque jeton, activant 12,9 milliards de paramètres par jeton pour une inférence plus rapide que les modèles denses de qualité similaire.

Combien coûte Mixtral 8x7B sur l'API Mistral ?

Sur Mistral Studio, Mixtral 8x7B est disponible à l'endpoint open-mixtral-8x7b pour 0,70 $ par million de jetons d'entrée et 0,70 $ par million de jetons de sortie. Le traitement par lots bénéficie d'une remise de 50 %, et les jetons d'entrée mis en cache bénéficient d'une remise de 90 % sur les coûts d'entrée.

Peut-on héberger Mixtral 8x7B soi-même ?

Oui. Mixtral 8x7B est livré avec des poids ouverts sous licence Apache 2.0, vous pouvez donc le télécharger et l'exécuter sur votre propre infrastructure GPU. Mistral documente le déploiement via vLLM avec des noyaux Megablocks CUDA, et Skypilot prend en charge le lancement d'endpoints vLLM sur des instances cloud.

Quelles langues Mixtral 8x7B supporte-t-il ?

Mixtral 8x7B gère l'anglais, le français, l'italien, l'allemand et l'espagnol. Les notes de version de Mistral décrivent une forte performance multilingue sur les cinq langues, ce qui le rend utile pour la génération de texte et les flux de travail de traduction en langues européennes.

Comment Mixtral 8x7B se compare-t-il à Llama 2 70B ?

Mistral rapporte que Mixtral 8x7B égalise ou surpasse Llama 2 70B sur la plupart des benchmarks standards tout en étant 6 fois plus rapide à l'inférence. L'architecture clairsemée n'active que 12,9 milliards de ses 46,7 milliards de paramètres par jeton, ce qui réduit le coût de calcul par rapport aux modèles denses 70B.

Quelle licence utilise Mixtral 8x7B ?

Mixtral 8x7B est publié sous licence Apache 2.0 avec des poids ouverts disponibles au téléchargement. Mistral le décrit comme le modèle à poids ouverts le plus performant avec une licence permissive au lancement, adapté aux déploiements auto-hébergés à la fois pour la recherche et le commercial.

Tarification:

Freemium

Tags:

Mixture of Experts
Open Weights
Apache 2.0
Decoder Model
Multilingual
Sparse Model
vLLM
Sparse Mixture-of-Experts

Technologie utilisée:

Netlify
Google Tag Manager
Font Awesome
Discord
Tailwind CSS

Commentaires:

Give your opinion on Mixtral of experts - Mistral AI :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Meilleur Gratuit Mixtral of experts - Mistral AI Alternatives (et Payées)

By Rishit