Mixtral of experts - Mistral AI

Mixtral of experts - Mistral AI

Mixtral 8x7B é um modelo de linguagem grande de peso aberto da Mistral AI, lançado como um decodificador de mistura esparsa de especialistas com licença Apache 2.0. Você pode baixar os pesos para inferência auto-hospedada, ajustá-los com seus dados ou chamar o modelo através da API hospedada da Mistral. Ele é direcionado para geração geral de texto, escrita de código e seguimento de instruções.

A maioria dos modelos abertos nesse nível de desempenho utiliza arquiteturas densas onde cada parâmetro é ativado em cada token. Mixtral direciona cada token por apenas duas das oito camadas especializadas feedforward em cada bloco do decodificador, combinando suas saídas de forma aditiva. Esse roteamento esparso entrega 46,7 bilhões de parâmetros totais enquanto ativa apenas 12,9 bilhões por token, o que a Mistral relata resultar em inferência 6x mais rápida que Llama 2 70B na maioria dos benchmarks.

O modelo suporta um contexto de 32k tokens e apresenta bom desempenho em tarefas multilíngues em inglês, francês, italiano, alemão e espanhol. A geração de código é uma força documentada, e a variante separada Mixtral 8x7B Instruct alcança 8,30 no MT-Bench após ajuste supervisionado e otimização direta de preferência.

Engenheiros de ML, pesquisadores e equipes de produto usam Mixtral quando desejam pesos abertos com licença permissiva e desempenho competitivo contra modelos fechados como GPT-3.5. Usuários auto-hospedados podem implantar via vLLM com kernels Megablocks CUDA ou Skypilot em instâncias na nuvem, enquanto usuários da API pagam $0,70 por milhão de tokens de entrada e saída no endpoint open-mixtral-8x7b.

Recursos Principais:
  1. Router ativa 2 de 8 camadas de especialista por token, usando 12.9B de 46.7B parâmetros totais

  2. Janela de contexto de 32k tokens para documentos longos e conversas de múltiplas rodadas

  3. Licença de peso aberto Apache 2.0 para pesquisa e auto-hospedagem comercial

  4. Suporta Inglês, Francês, Italiano, Alemão e Espanhol

  5. Endpoint API open-mixtral-8x7b por $0.70 por milhão de tokens de entrada e saída

  6. Mixtral 8x7B Instruct pontua 8.30 no MT-Bench após ajuste fino DPO

  7. Deployável via vLLM com kernels CUDA Megablocks ou endpoints na nuvem Skypilot

Pros:
  1. Pesos abertos Apache 2.0 permitem auto-hospedagem sem dependência de fornecedor.

  2. Roteamento esparso ativa 12.9B de 46.7B parâmetros por token, reduzindo o custo de inferência em modelos densos de 70B.

  3. Janela de contexto de 32k tokens lida com documentos longos e sessões de chat estendidas.

  4. Suporte a cinco idiomas: Inglês, Francês, Italiano, Alemão e Espanhol.

  5. Caminhos documentados de implantação vLLM e Skypilot para auto-hospedagem em produção.

Cons:
  1. A linha de modelos atual da Mistral passou do Mixtral para versões menores e médias mais recentes.

  2. Acesso à API hospedada requer conta no Mistral Studio e cobrança por token.

  3. Auto-hospedagem necessita de infraestrutura GPU com suporte a CUDA para inferência eficiente.

Perguntas frequentes:

O que é o Mixtral 8x7B?

Mixtral 8x7B é o modelo de linguagem de mistura esparsa com pesos abertos da Mistral AI, com 46,7 bilhões de parâmetros totais e licença Apache 2.0. Em cada camada, um roteador seleciona dois dos oito grupos especialistas feedforward para processar cada token, ativando 12,9 bilhões de parâmetros por token para uma inferência mais rápida do que modelos densos de qualidade semelhante.

Quanto custa o Mixtral 8x7B na API da Mistral?

No Mistral Studio, o Mixtral 8x7B está disponível no endpoint open-mixtral-8x7b por $0,70 por milhão de tokens de entrada e $0,70 por milhão de tokens de saída. O processamento em lote recebe um desconto de 50%, e tokens de entrada em cache recebem um desconto de 90% nos custos de entrada.

Posso hospedar o Mixtral 8x7B por conta própria?

Sim. O Mixtral 8x7B é fornecido com pesos abertos sob a licença Apache 2.0, então você pode baixá-lo e executá-lo na sua própria infraestrutura GPU. A Mistral documenta a implantação via vLLM com kernels Megablocks CUDA, e o Skypilot suporta o lançamento de endpoints vLLM em instâncias na nuvem.

Quais idiomas o Mixtral 8x7B suporta?

O Mixtral 8x7B lida com inglês, francês, italiano, alemão e espanhol. As notas de lançamento da Mistral descrevem um forte desempenho multilíngue em benchmarks para todos os cinco idiomas, tornando-o útil para geração de texto e fluxos de trabalho de tradução em línguas europeias.

Como o Mixtral 8x7B se compara ao Llama 2 70B?

A Mistral informa que o Mixtral 8x7B iguala ou supera o Llama 2 70B na maioria dos benchmarks padrão enquanto roda 6 vezes mais rápido no tempo de inferência. A arquitetura esparsa ativa apenas 12,9 bilhões dos seus 46,7 bilhões de parâmetros por token, o que reduz o custo computacional em relação a modelos densos de 70B.

Qual licença o Mixtral 8x7B usa?

O Mixtral 8x7B é lançado sob a licença Apache 2.0 com pesos abertos disponíveis para download. A Mistral o descreve como o modelo com pesos abertos mais forte com uma licença permissiva no lançamento, adequado tanto para pesquisa quanto para implantações comerciais auto-hospedadas.

Preços:

Freemium

Tags:

Mixture of Experts
Open Weights
Apache 2.0
Decoder Model
Multilingual
Sparse Model
vLLM
Sparse Mixture-of-Experts

Tecnologia utilizada:

Netlify
Google Tag Manager
Font Awesome
Discord
Tailwind CSS

Avaliações:

Give your opinion on Mixtral of experts - Mistral AI :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Melhor Gratuito Mixtral of experts - Mistral AI Alternativas (e Pagas)

By Rishit