尧图精选

Omost 上手全解:让 LLM 编写代码驱动 Canvas 画布,再由 SDXL 渲染成图

🕒 发布时间:2026/9/20 9:34:03 📁 来源:尧图网络
Omost 上手全解让 LLM 编写代码驱动 Canvas 画布再由 SDXL 渲染成图【免费下载链接】OmostYour image is almost there!项目地址: https://gitcode.com/GitHub_Trending/om/OmostOmost 是一个 LLM 图像生成的开源项目大语言模型不直接出图而是先写代码操作一块虚拟 Canvas 画布再由 SDXL 渲染管道把画布内容变成真实图像。想把图像合成工作流从黑盒变成可读、可编辑的代码可以从这篇指南开始。30 秒看懂 Omost项目名里藏了个小彩蛋Omost 读作 almost。第一层意思是用过之后你的图像基本就成了第二层是 O 代表 omni多模态most 代表想把它的价值榨到最大。一句话定位Omost 让大语言模型当画面设计师——把画面写成代码再交给 SDXL 管道画出来。画图背后的三个角色LLM、Canvas、SDXLLLM——导演。就像导演把剧本拆成分镜LLM 把你的提示词拆成代码解决模糊想法缺少结构化表示的问题。它的产出不是文本而是一串 Python 函数调用调用签名定义在 lib_omost/canvas.py 开头。它还支持对话式编辑你说把龙换成恐龙它就整段重写画布。Canvas——分镜稿。Canvas ≈ 一块可以写代码的画布解决图像模型看不懂空间结构的问题。它记录全局描述外加每个局部元素的位置、深度、颜色、标签屏幕被分成 9×9 网格位置、偏移、尺寸三者组合出 729 种候选区域这比让 LLM 学像素坐标稳定得多。把 LLM 回复解析成画布实例的入口是同一文件里的Canvas.from_bot_response。SDXL——渲染引擎。就像打印机把设计稿变成实物StableDiffusionXLOmostPipelineSDXL 渲染管道把结构化描述变成真正的图像解决画布只是描述、还不是图的问题。实现位于 lib_omost/pipeline.py。一张图是如何被画出来的端到端共 5 步输入一句场景提示词让 LLM 产出带位置和描述的 Canvas 代码解析代码得到结构化画面描述从画布提取正向与负向条件用 SDXL 从噪声采样出图对应代码里第 3 步在canvas.py的解析逻辑完成第 4 步调用pipeline.all_conds_from_canvas第 5 步则是直接调用 pipeline 完成去噪。五分钟跑起来官方部署大约需要 8GB 英伟达显存最小可跑路径如下git clone https://gitcode.com/GitHub_Trending/om/Omost cd Omostpip install -r requirements.txtpython gradio_app.py启动后 Gradio 网页打开直接输入提示词即可出图。现状与下一步仓库目前提供一个基于注意力操作的基线渲染器。作者把这个无参数公式当作标准基线它几乎不会引入样式偏移或质量下降拿来即用后续团队计划训练参数化的渲染方法进一步提升区域跟随的精度。克隆仓库、输入提示词让 LLM 画出你的第一张画布。【免费下载链接】OmostYour image is almost there!项目地址: https://gitcode.com/GitHub_Trending/om/Omost创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →