Omost

Omost

Omost est un projet de recherche open-source qui transforme les compétences de codage des grands modèles de langage en composition d'images structurée. Vous décrivez une scène en langage clair, et un LLM finement ajusté écrit du Python qui répartit les éléments globaux et régionaux sur une toile virtuelle. Un rendu par diffusion convertit ensuite cette disposition en une image finie.

L'approche considère la construction de scène comme de la programmation : le modèle appelle des méthodes telles que set_global_description et add_local_description pour placer les sujets avec des indications de localisation, taille, profondeur et couleur. Cette structure offre aux modèles de diffusion une guidance région par région, plutôt que de s'appuyer sur une seule instruction plate.

Vous pouvez exécuter Omost localement avec une application Gradio ou essayer la démo hébergée liée au dépôt. Il s'adresse aux chercheurs, ingénieurs en apprentissage automatique et développeurs de génération d'images qui souhaitent un contrôle plus précis sur les compositions multi-sujets dans des pipelines de style Stable Diffusion.

Fonctionnalités principales:
  1. Les LLMs affinés génèrent du code Python Canvas à partir de votre invite textuelle

  2. Placez des sujets avec localisation, décalage, zone, profondeur et noms de couleurs HTML

  3. Échangez des éléments de manière conversationnelle, comme changer un dragon en dinosaure en plein milieu de la session

  4. Trois familles de modèles pré-entraînés basées sur les variantes Llama 3 et Phi-3

  5. Livré avec un moteur de diffusion sensible à la région de base utilisant la manipulation de l'attention

  6. Fonctionne localement via Gradio avec 8 Go de VRAM Nvidia, ou utilisez l'espace HuggingFace lié

Pros:
  1. Open source sous licence Apache 2.0 avec des instructions complètes de déploiement local sur GitHub.

  2. Le code Canvas sensible à la région offre un contrôle multi-sujets plus précis qu'une simple invite textuelle.

  3. L'édition conversationnelle permet d'affiner les compositions avant le rendu.

  4. Les variantes de modèles quantifiés tiennent dans 8 Go de VRAM sans déchargement.

Cons:
  1. La configuration locale nécessite un GPU Nvidia avec au moins 8 Go de VRAM.

  2. L'activité du dépôt a ralenti après la mi-2024 ; les derniers commits sur la branche principale datent d'environ deux ans.

  3. L'espace de démonstration HuggingFace lié peut ne pas se charger en raison de conflits de versions des dépendances.

FAQ:

Omost est-il gratuit à utiliser ?

Oui. Omost est open source sous licence Apache 2.0 sur GitHub. Vous pouvez cloner le dépôt, l'exécuter localement ou utiliser l'espace officiel HuggingFace lié depuis le README sans aucun coût.

Quel matériel Omost nécessite-t-il pour une exécution locale ?

Le déploiement local requiert environ 8 Go de VRAM Nvidia. Le README recommande Python 3.10, PyTorch avec CUDA 12.1, et les dépendances fixées dans requirements.txt. Des modèles quantifiés sont fournis pour les GPU avec une mémoire limitée.

Quels modèles LLM Omost supporte-t-il ?

Omost propose trois familles de modèles préentraînés sur HuggingFace : omost-llama-3-8b, omost-dolphin-2.9-llama3-8b, et omost-phi-3-mini-128k, chacune avec des variantes quantifiées. Le README recommande omost-llama-3-8b-4bits pour la majorité des utilisateurs.

Puis-je modifier une scène après la saisie initiale dans Omost ?

Oui. Omost supporte l'édition conversationnelle : vous pouvez demander au modèle de changer des éléments spécifiques dans le code Canvas, comme remplacer un sujet par un autre, puis rendre la composition mise à jour une fois satisfait.

En quoi Omost diffère-t-il d'une invite textuelle standard pour la génération d'images ?

Au lieu d'une seule chaîne d'invite, Omost génère un code Canvas structuré avec des descriptions globales et locales séparées, des régions spatiales et un ordre de profondeur. Un moteur de diffusion personnalisé utilise ces régions pour guider l'attention lors de la génération d'image.

Où puis-je essayer Omost sans l'installer ?

Le README GitHub d'Omost renvoie à un espace officiel HuggingFace pour des démonstrations via navigateur. L'installation locale est également documentée avec conda, pip et un point d'entrée gradio_app.py.

Catégorie:

Tarification:

Gratuit

Tags:

AI-Driven Image Generation
Large Language Models
Virtual Canvas
Image Composition
Omost
LLM Technology
Open Source
Region-Aware Diffusion
Text to Image
Stable Diffusion

Technologie utilisée:

Next.js
Node.js
Tailwind CSS
Chakra UI
Ant Design
Amazon Web Services
GraphQL
Python
Ruby
GitHub
Emotion

Commentaires:

Give your opinion on Omost :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Meilleur Gratuit Omost Alternatives (et Payées)

By Rishit