Omost

Omost

Transforme uma cena em linguagem simples em código de composição de imagem consciente de regiões, depois renderize-a por meio de difusão. Omost treina grandes modelos de linguagem para escrever Python que posiciona sujeitos em uma Tela virtual com indicações de localização, deslocamento, área, profundidade e cor HTML antes que um renderizador incluído pinte a imagem final.

A maioria das ferramentas de texto para imagem envia uma única string de prompt para um modelo de difusão. Omost divide o trabalho: um LLM gera código estruturado para a Tela com nove slots de localização, ajustes de deslocamento e tamanhos de caixa delimitadora que correspondem a 729 propostas de região. O renderizador básico do repositório usa manipulação de pontuação de atenção para que cada descrição regional receba difusão guiada, uma abordagem diferente de codificar tudo em uma única passagem CLIP.

Pesquisadores e engenheiros de ML que experimentam layouts com múltiplos sujeitos podem executar o aplicativo Gradio localmente ou testar o espaço oficial no HuggingFace. O README documenta a edição conversacional, permitindo trocar sujeitos durante a sessão antes de renderizar. Treinamento com anotações mistas do Open-Images, dados auto-rotulados, verificações de compilação DPO e um pequeno conjunto de ajuste GPT-4o em três famílias de modelos Llama 3 e Phi-3.

Recursos Principais:
  1. Três famílias de modelos HuggingFace: omost-llama-3-8b, omost-dolphin-2.9-llama3-8b e omost-phi-3-mini-128k

  2. Implantação local do Gradio requer cerca de 8GB de VRAM Nvidia com Python 3.10 e CUDA 12.1 PyTorch

  3. Mapas da API Canvas que associam assuntos a 729 propostas de regiões via nove locais, deslocamentos e tamanhos de área

  4. Edição conversacional troca elementos como mudar um dragão por um dinossauro antes da renderização

  5. Renderizador base usa manipulação de pontuação de atenção para difusão guiada por região

  6. Código aberto Apache 2.0 com demonstração oficial no HuggingFace Space vinculada ao README

Pros:
  1. Open source sob a licença Apache 2.0 com instruções completas para implantação local no GitHub.

  2. O código Canvas sensível à região oferece um controle mais detalhado de múltiplos assuntos do que um único prompt de texto.

  3. A edição conversacional permite refinar composições antes da renderização.

  4. As variantes de modelo quantizado cabem em 8GB de VRAM sem a necessidade de descarregamento.

Cons:
  1. Configuração local requer uma GPU Nvidia com pelo menos 8GB de VRAM.

  2. O último commit do ramo principal foi em junho de 2024, portanto a atividade do repositório diminuiu.

  3. A qualidade do omost-phi-3-mini-128k se degrada após cerca de 8 mil tokens apesar de um rótulo de contexto de 128k.

Perguntas frequentes:

O Omost é gratuito para usar?

Sim. O Omost é open source sob a licença Apache 2.0 no GitHub. Você pode clonar o repositório, executá-lo localmente ou usar o espaço oficial HuggingFace vinculado no README sem custo.

Qual hardware o Omost precisa para rodar localmente?

A implantação local do Omost requer cerca de 8GB de VRAM Nvidia. O README recomenda Python 3.10, PyTorch com CUDA 12.1 e as dependências fixadas em requirements.txt. Modelos quantizados de 4 bits cabem em 8GB sem descarregamento.

Quais modelos LLM o Omost suporta?

O Omost oferece três famílias de modelos pré-treinados no HuggingFace: omost-llama-3-8b, omost-dolphin-2.9-llama3-8b e omost-phi-3-mini-128k, cada um com variantes quantizadas. O README recomenda omost-llama-3-8b-4bits para a maioria dos usuários.

Posso editar uma cena após o prompt inicial no Omost?

Sim. O Omost suporta edição conversacional na interface Gradio: você pode pedir ao modelo para alterar elementos específicos do Canvas, como substituir um dragão por um dinossauro, e então renderizar a composição atualizada quando estiver satisfeito.

Como o Omost difere de um prompt padrão de texto para imagem?

Em vez de uma única string de prompt, o Omost gera código estruturado para Canvas com descrições globais e locais separadas, regiões espaciais e ordenação de profundidade. Um renderizador de difusão personalizado usa essas regiões para guiar a atenção durante a geração da imagem.

Onde posso experimentar o Omost sem instalá-lo?

O README do Omost no GitHub vincula a um espaço oficial HuggingFace para demos baseadas em navegador. A configuração local também está documentada com conda, pip e um ponto de entrada gradio_app.py.

Preços:

Gratuito

Tags:

Virtual Canvas
Region-Aware Diffusion
Text to Image
Open Source
Llama 3
Phi-3
Image Composition
Stable Diffusion

Tecnologia utilizada:

Python
PyTorch
Gradio
GitHub
Chakra UI
Ant Design
Webflow
Amazon Web Services
Ruby
Emotion
Styled Components
Tailwind CSS
Next.js
Node.js
GraphQL

Avaliações:

Give your opinion on Omost :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Melhor Gratuito Omost Alternativas (e Pagas)

By Rishit