Omost

Omost

Transformez une scène en langage courant en un code de composition d'image conscient des régions, puis rendez-le via la diffusion. Omost entraîne de grands modèles de langage à écrire du Python qui place des sujets sur un Canvas virtuel avec des indications de localisation, décalage, surface, profondeur et couleur HTML avant qu'un moteur de rendu intégré ne peigne l'image finale.

La plupart des outils de texte en image envoient une chaîne de prompt unique à un modèle de diffusion. Omost divise la tâche : un LLM produit un code Canvas structuré avec neuf emplacements, ajustements de décalage et tailles de boîtes englobantes correspondant à 729 propositions de régions. Le moteur de rendu de base du dépôt utilise la manipulation des scores d'attention pour que chaque description régionale bénéficie d'une diffusion guidée, un compromis différent de l'encodage de tout en un seul passage CLIP.

Les chercheurs et ingénieurs ML expérimentant des mises en page multi-sujets peuvent exécuter l'application Gradio localement ou essayer l'espace officiel HuggingFace. Le README documente l'édition conversationnelle, permettant d'échanger les sujets en cours de session avant de lancer le rendu. Entraînement avec annotations mixtes Open-Images, données auto-étiquetées, vérifications de compilation DPO, et un petit ensemble de réglage GPT-4o sur trois familles de modèles Llama 3 et Phi-3.

Fonctionnalités principales:
  1. Trois familles de modèles HuggingFace : omost-llama-3-8b, omost-dolphin-2.9-llama3-8b, et omost-phi-3-mini-128k

  2. Déploiement local avec Gradio nécessite environ 8GB de VRAM Nvidia avec Python 3.10 et CUDA 12.1 PyTorch

  3. Les cartes API Canvas associent les sujets à 729 propositions de régions via neuf emplacements, décalages et tailles de zones

  4. L'édition conversationnelle échange des éléments comme changer un dragon en dinosaure avant le rendu

  5. Le moteur de rendu de base utilise la manipulation du score d'attention pour une diffusion guidée par région

  6. Open source Apache 2.0 avec une démo officielle HuggingFace Space liée depuis le README

Pros:
  1. Open source sous licence Apache 2.0 avec des instructions complètes de déploiement local sur GitHub.

  2. Le code Canvas sensible à la région offre un contrôle multi-sujets plus précis qu'une simple invite textuelle.

  3. L'édition conversationnelle permet d'affiner les compositions avant le rendu.

  4. Les variantes de modèles quantifiés tiennent dans 8 Go de VRAM sans déchargement.

Cons:
  1. La configuration locale nécessite un GPU Nvidia avec au moins 8GB de VRAM.

  2. Le dernier commit de la branche principale date de juin 2024, l'activité du dépôt a donc ralenti.

  3. La qualité de omost-phi-3-mini-128k se dégrade après environ 8k tokens malgré une étiquette de contexte de 128k.

FAQ:

Omost est-il gratuit ?

Oui. Omost est open source sous licence Apache 2.0 sur GitHub. Vous pouvez cloner le dépôt, l'exécuter localement ou utiliser l'espace officiel HuggingFace lié depuis le README sans frais.

Quel matériel Omost nécessite-t-il pour une utilisation locale ?

Le déploiement local d'Omost requiert environ 8 Go de VRAM Nvidia. Le README recommande Python 3.10, PyTorch avec CUDA 12.1, et les dépendances fixées dans requirements.txt. Les modèles quantifiés 4 bits tiennent dans 8 Go sans déchargement.

Quels modèles LLM Omost supporte-t-il ?

Omost propose trois familles de modèles préentraînés sur HuggingFace : omost-llama-3-8b, omost-dolphin-2.9-llama3-8b, et omost-phi-3-mini-128k, chacune avec des variantes quantifiées. Le README recommande omost-llama-3-8b-4bits pour la plupart des utilisateurs.

Puis-je modifier une scène après l'invite initiale dans Omost ?

Oui. Omost prend en charge l'édition conversationnelle dans l'interface Gradio : vous pouvez demander au modèle de changer des éléments spécifiques du Canvas, comme remplacer un dragon par un dinosaure, puis rendre la composition mise à jour lorsque vous êtes satisfait.

En quoi Omost diffère-t-il d'une invite texte-image standard ?

Au lieu d'une seule chaîne d'invite, Omost génère un code Canvas structuré avec des descriptions globales et locales séparées, des régions spatiales et un ordre de profondeur. Un moteur de diffusion personnalisé utilise ces régions pour guider l'attention lors de la génération d'image.

Où puis-je essayer Omost sans l'installer ?

Le README GitHub d'Omost renvoie à un espace officiel HuggingFace pour des démos accessibles depuis un navigateur. L'installation locale est aussi documentée avec conda, pip, et un point d'entrée gradio_app.py.

Catégorie:

Tarification:

Gratuit

Tags:

Virtual Canvas
Region-Aware Diffusion
Text to Image
Open Source
Llama 3
Phi-3
Image Composition
Stable Diffusion

Technologie utilisée:

Python
PyTorch
Gradio
GitHub
Chakra UI
Ant Design
Webflow
Amazon Web Services
Ruby
Emotion
Styled Components
Tailwind CSS
Next.js
Node.js
GraphQL

Commentaires:

Give your opinion on Omost :-

Overall rating

Join thousands of AI enthusiasts in the World of AI!

Meilleur Gratuit Omost Alternatives (et Payées)

By Rishit