Omost

Omost

Convierte una escena en lenguaje sencillo en código de composición de imágenes consciente de regiones, luego la renderiza mediante difusión. Omost entrena modelos de lenguaje grandes para escribir Python que coloca sujetos en un Canvas virtual con indicaciones de ubicación, desplazamiento, área, profundidad y color HTML antes de que un renderizador incluido pinte la imagen final.

La mayoría de las herramientas de texto a imagen envían una cadena de texto como único prompt a un modelo de difusión. Omost divide la tarea: un LLM genera código estructurado para Canvas con nueve espacios de ubicación, ajustes de desplazamiento y tamaños de cuadro delimitador que corresponden a 729 propuestas de región. El renderizador base del repositorio usa manipulación de puntuaciones de atención para que cada descripción regional reciba difusión guiada, un enfoque diferente a codificar todo en una sola pasada de CLIP.

Investigadores e ingenieros de ML que experimentan con diseños de múltiples sujetos pueden ejecutar la aplicación Gradio localmente o probar el espacio oficial en HuggingFace. El README documenta la edición conversacional, para que puedas intercambiar sujetos durante la sesión antes de renderizar. Entrena con anotaciones mixtas de Open-Images, datos autoetiquetados, verificaciones de compilación DPO y un pequeño conjunto de ajuste GPT-4o en tres familias de modelos Llama 3 y Phi-3.

Funciones principales:
  1. Tres familias de modelos HuggingFace: omost-llama-3-8b, omost-dolphin-2.9-llama3-8b y omost-phi-3-mini-128k

  2. La implementación local de Gradio requiere aproximadamente 8GB de VRAM Nvidia con Python 3.10 y CUDA 12.1 PyTorch

  3. El API Canvas mapea temas a 729 propuestas de regiones mediante nueve ubicaciones, desplazamientos y tamaños de área

  4. La edición conversacional intercambia elementos como cambiar un dragón por un dinosaurio antes de renderizar

  5. El renderizador base usa manipulación de puntuaciones de atención para difusión guiada por regiones

  6. Código abierto Apache 2.0 con una demo oficial en HuggingFace Space enlazada desde el README

Pros:
  1. Código abierto bajo Apache 2.0 con instrucciones completas de despliegue local en GitHub.

  2. El código Canvas consciente de la región ofrece un control más detallado sobre múltiples sujetos que un solo texto indicativo.

  3. La edición conversacional permite refinar composiciones antes de renderizar.

  4. Las variantes del modelo cuantizado caben en 8GB de VRAM sin necesidad de descarga.

Cons:
  1. La configuración local requiere una GPU Nvidia con al menos 8GB de VRAM.

  2. El último commit de la rama principal fue en junio de 2024, por lo que la actividad del repositorio ha disminuido.

  3. La calidad de omost-phi-3-mini-128k se degrada después de aproximadamente 8k tokens a pesar de tener una etiqueta de contexto de 128k.

Preguntas frecuentes:

¿Omost es gratis?

Sí. Omost es de código abierto bajo la licencia Apache 2.0 en GitHub. Puedes clonar el repositorio, ejecutarlo localmente o usar el espacio oficial de HuggingFace enlazado desde el README sin costo.

¿Qué hardware necesita Omost para ejecutarse localmente?

El despliegue local de Omost requiere aproximadamente 8GB de VRAM Nvidia. El README recomienda Python 3.10, PyTorch con CUDA 12.1 y las dependencias fijadas en requirements.txt. Los modelos cuantizados de 4 bits caben en 8GB sin descarga.

¿Qué modelos LLM soporta Omost?

Omost ofrece tres familias de modelos preentrenados en HuggingFace: omost-llama-3-8b, omost-dolphin-2.9-llama3-8b y omost-phi-3-mini-128k, cada uno con variantes cuantizadas. El README recomienda omost-llama-3-8b-4bits para la mayoría de usuarios.

¿Puedo editar una escena después del prompt inicial en Omost?

Sí. Omost soporta edición conversacional en la interfaz Gradio: puedes pedir al modelo que cambie elementos específicos del Canvas, como reemplazar un dragón por un dinosaurio, y luego renderizar la composición actualizada cuando estés satisfecho.

¿En qué se diferencia Omost de un prompt estándar de texto a imagen?

En lugar de una cadena de prompt, Omost genera código estructurado para Canvas con descripciones globales y locales separadas, regiones espaciales y orden de profundidad. Un renderizador de difusión personalizado usa esas regiones para guiar la atención durante la generación de imagen.

¿Dónde puedo probar Omost sin instalarlo?

El README de Omost en GitHub enlaza a un espacio oficial de HuggingFace para demos en navegador. También está documentada la instalación local con conda, pip y un punto de entrada gradio_app.py.

Categoría:

Tarificación:

Gratis

Etiquetas:

Virtual Canvas
Region-Aware Diffusion
Text to Image
Open Source
Llama 3
Phi-3
Image Composition
Stable Diffusion

Tecnología utilizada:

Python
PyTorch
Gradio
GitHub
Chakra UI
Ant Design
Webflow
Amazon Web Services
Ruby
Emotion
Styled Components
Tailwind CSS
Next.js
Node.js
GraphQL

Reseñas:

Give your opinion on Omost :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Mejor Gratis Omost Alternativas (y Pagadas)

By Rishit