Omost
将普通语言场景转换为区域感知的图像合成代码,然后通过扩散进行渲染。Omost 训练大型语言模型编写 Python 代码,在虚拟画布上根据位置、偏移、区域、深度和 HTML 颜色提示放置主体,随后由捆绑的渲染器绘制完成的图像。
大多数文本到图像工具将一个提示字符串发送给扩散模型。Omost 将任务拆分:一个大型语言模型输出结构化的画布代码,包含九个位置槽、偏移调整和映射到 729 个区域提议的边界框大小。该仓库的基线渲染器使用注意力分数操作,使每个区域描述获得引导扩散,这与在单次 CLIP 传递中编码所有内容的做法不同。
进行多主体布局实验的研究人员和机器学习工程师可以在本地运行 Gradio 应用,或尝试官方 HuggingFace 空间。README 文档记录了对话式编辑功能,允许你在会话中途交换主体后再进行渲染。训练数据包括混合的 Open-Images 注释、自动标注数据、DPO 编译检查,以及跨三个 Llama 3 和 Phi-3 模型系列的小型 GPT-4o 调优集。
三大HuggingFace模型系列:omost-llama-3-8b、omost-dolphin-2.9-llama3-8b和omost-phi-3-mini-128k
本地Gradio部署需要大约8GB Nvidia显存,配备Python 3.10和CUDA 12.1 PyTorch
Canvas API将主题映射到729个区域建议,通过九个位置、偏移和面积大小实现
对话编辑在渲染前交换元素,例如将龙改为恐龙
基础渲染器使用注意力分数操控进行区域引导扩散
Apache 2.0开源,README中链接官方HuggingFace Space演示
开源于 Apache 2.0,GitHub 上提供完整的本地部署说明。
支持区域感知的 Canvas 代码比单一文本提示提供更细致的多主题控制。
对话式编辑让您在渲染前细化创作内容。
量化模型版本可在 8GB 显存内运行,无需卸载。
本地设置需要至少8GB显存的Nvidia GPU。
最后一次主分支提交是在2024年6月,因此仓库活动已减缓。
omost-phi-3-mini-128k质量在大约8k标记后下降,尽管有128k的上下文标签。
Omost是免费使用的吗?
是的。Omost是开源的,遵循GitHub上的Apache 2.0许可证。您可以克隆仓库,在本地运行,或使用README中链接的官方HuggingFace空间,均无需费用。
Omost本地运行需要什么硬件?
Omost本地部署需要大约8GB的Nvidia显存。README推荐使用Python 3.10、带CUDA 12.1的PyTorch,以及requirements.txt中固定的依赖。量化的4位模型可在8GB显存内运行,无需卸载。
Omost支持哪些大型语言模型?
Omost在HuggingFace上提供三种预训练模型系列:omost-llama-3-8b、omost-dolphin-2.9-llama3-8b和omost-phi-3-mini-128k,每个都有量化版本。README推荐大多数用户使用omost-llama-3-8b-4bits。
我可以在Omost中初始提示后编辑场景吗?
可以。Omost支持在Gradio界面中进行对话式编辑:您可以让模型更改特定的Canvas元素,比如将龙替换为恐龙,满意后再渲染更新的组合。
Omost与标准的文本到图像提示有何不同?
Omost不是使用单一提示字符串,而是生成结构化的Canvas代码,包含全局和局部描述、空间区域及深度排序。自定义扩散渲染器利用这些区域在图像生成时引导注意力。
我在哪里可以不安装就试用Omost?
Omost的GitHub README链接了一个官方HuggingFace空间,支持浏览器演示。也有使用conda、pip和gradio_app.py入口点的本地安装文档。

