尧图精选

当 LLM 开始写代码画图:Omost 三步完成 AI 图像合成

🕒 发布时间:2026/9/20 18:27:26 📁 来源:尧图网络
当 LLM 开始写代码画图Omost 三步完成 AI 图像合成【免费下载链接】OmostYour image is almost there!项目地址: https://gitcode.com/GitHub_Trending/om/OmostOmost 是一个 LLM 图像生成项目不让模型输出一长串提示词而是让大语言模型写代码来描述图像再用 Stable Diffusion XL 把它渲染成真实图像。一句话概括它把 LLM 的编码能力转化为图像合成能力。为什么让 LLM 直接“产图”传统文生图工具的弱点在于一切都压在一句提示词上。写得越长越容易含糊模型只能从一堆文字里自行领会没法精确控制对象在哪、谁在背景、色调如何。修改更麻烦改一个细节常常要整句重写再跑一遍。问题其实不在图像模型而在表达媒介。文字是扁平的而画面是结构化的有前后、左右、区域大小。能不能让 LLM 用结构化的方式表达画面Omost 的答案是让它写代码——代码天然有明确的参数边界可修改、可重跑。Omost 是什么名字里的小巧思定位上Omost 是把 LLM 编码能力转成图像合成能力的工具集说“合成”比“生成”更准确每个元素都要被放到该去的位置。LLM 写代码驱动一个虚拟画布 Canvas画布再由生成模型渲染成真实图像。名字也值得玩味Omost 读作 almost几乎。第一层意思用完之后你的图“几乎”就做好了第二层O 取自 omni多模态most 表示要从多模态模型身上榨取最大价值。Omost 工作原理文字到图像的三步整条工作流可以拆成三步。第一步LLM 当设计。你用自然语言输入需求比如“画一张战士与巨龙对战的图”训练好的 LLM项目提供了基于 Llama3 和 Phi3 的三个模型会把它翻译成 Python 代码按顺序调用 Canvas 接口摆放元素全局描述写什么、哪个对象在画面中央、哪个在背景并带上标签与风格参数。第二步Canvas 是虚拟画布。代码执行后得到一个 Canvas 对象。它不含任何像素只保存一份结构化的“画面草稿”——每个对象的位置、面积、相对远近、颜色、文字描述。可以把它想成导演用的分镜脚本还没动笔但每个角色的站位都标好了。第三步SDXL 负责最终渲染。Stable Diffusion XLSDXL是流行的开源文生图底模在这里负责把草稿变成像素。lib_omost/pipeline.py 里的生成管道先把 Canvas 描述转成 SDXL 能理解的条件再调整注意力模型“看”各区域的方式分数让每段描述只管自己负责的区域最后输出成片。因为中间表示是代码这套流程天然支持对话式修改说一句“把龙换成恐龙”LLM 重新生成 Canvas 代码再点渲染即可。Omost 快速上手三条命令跑起来本地部署大约需要 8GB 显存步骤只有三步git clone https://gitcode.com/GitHub_Trending/om/Omost cd Omostpip install -r requirements.txtpython gradio_app.py启动后是一个网页聊天界面输入描述收到 LLM 写出的画布代码点渲染就能出图之后还能继续对话修改。Omost 适合谁、用在哪些场景想精确控制“图里每个元素在哪”而不只是控制整体氛围的人想反复微调某个对象、其余部分保持不变的人想把结构化图像描述接进自己 AIGC 流程的开发者——Canvas 草稿是可编程处理的结构化中间表示这一点很有价值。Omost 的局限与后续方向目前自带的渲染器是基于注意力操作的基线渲染器它直接在单次前向传播里改注意力分数没有任何可训练参数几乎不引入风格偏移或画质下降是一个相当标准的基线实现。优点是安全、无侵入代价是空间控制力存在天花板。团队也明确了下一步为 Omost 训练参数化方法用可学习模块替代纯公式把渲染上限再抬一抬。所以现在的基线版本应看作扎实的地基而不是终点。总之Omost 让 LLM 用“写代码”的方式描述图像全程可控、可改基线版本已经可用后续方向值得留意。【免费下载链接】OmostYour image is almost there!项目地址: https://gitcode.com/GitHub_Trending/om/Omost创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →