AI视频生成实战:MiniMax H3与KREA2+Lora工作流全解
这次我们来看一套完整的 AI 图像视频生成方案MiniMax H3 负责视频生成KREA2 负责图像生成与 LoRA 风格控制配套 18694 条提示词包。项目名字叫“图图的嗨丝系列”核心资产是 200 段风格化视频、186 张参考图片和一份 18694 条的提示词库。严格来说这不是一个代码仓库而是一套“模型选择 风格 LoRA 提示词工程 批量生产”的完整工作流。很多人拿到提示词包之后不知道该配哪个模型、改哪些参数、从哪一步开始跑。这篇文章就把整套流程拆开讲MiniMax H3 怎么部署、KREA2 的 LoRA 怎么接、提示词包怎么清洗和调用、批量任务怎么做、常见问题怎么排查。先说结论。MiniMax H3 是视频生成线从社区资料看包含 33B 等参数版本有用户放出过 8G 显存可跑的一键整合包整体启动方式偏 ComfyUIKREA2 更依赖在线平台和 LoRA 训练适合做风格统一的画面底稿。这套组合适合做时尚摄影、服装展示、短剧分镜这类连续风格内容的批量生产。下面按实际部署顺序展开。1. 核心能力速览能力项说明项目类型AI 图像生成 视频生成 提示词工程资源包主要模型MiniMax H3视频生成、KREA2图像生成 / LoRA 风格素材规模200 段风格化视频、186 张参考图片、18694 条提示词显存要求MiniMax H3 社区整合包有 8G 显存可跑的说法确切占用按实际模型版本和推理参数为准部署方式ComfyUI 工作流加载 / 在线平台生成风格控制KREA2 LoRA MiniMax H3 Ref2VA 参考模式 提示词组合批量任务提示词列表批量提交ComfyUI API 可程序化调用接口能力ComfyUI 的/prompt接口可用于批量提交和联动适用人群内容创作者、AI 绘画玩家、短视频批量生产者、ComfyUI 用户合规要求生成人物、肖像、品牌素材必须获得授权发布前需人工复核从表格可见这套方案不是单一的模型权重而是一条内容生产线。MiniMax H3 负责把静态素材或文字描述变成视频KREA2 负责把提示词变成高质量图片LoRA 用来锁定风格提示词包用来批量喂给模型。四者拼起来就是一套可以反复出片的工作流。2. MiniMax H3 与 KREA2 项目拆解2.1 MiniMax H3 视频生成线MiniMax H3 是 MiniMax 系视频生成模型的新版本社区主要拿它在 ComfyUI 里做图生视频、文生视频。从已公开的工作流和教程内容看H3 重点强化了两个方向第一个是参考图模式社区常叫 Ref2VA 全能参考模式。你可以给一张参考图让它作为视频首帧或者角色一致性锚点再配合文字描述生成短视频。这对做系列内容很重要因为系列内容最怕人物形象“每帧都在变”参考模式能明显缓解这个问题。第二个是多镜头导演台。从教程关键词看H3 相关节点支持类似分镜控制、镜头运动描述的工作流结构适合短剧、广告片、视频号素材这类需要连续镜头的场景。实际使用中可以把“镜头从近景拉到全景”“人物缓慢转身”这类描述写进提示词再配合图生视频节点来控制运动幅度。2.2 KREA2 图像与 LoRA 风格线KREA2 是 Krea 平台的图像生成模型版本画面质感强对服装和材质的表现比较细腻。它和主流 AI 绘画工具一样支持正向提示词、负面提示词、调度器参数也支持 LoRA 风格模型。这套资源包里的“极光黑丝模型”就是针对特定服装材质与光影氛围训练的 LoRA。创作者用 OneTrainer 这类开源训练工具基于 200 段视频和 186 张图片提取风格特征再把训练结果导出成 LoRA 文件挂到 ComfyUI 或 KREA2 上使用。这里要注意视频和图片素材如果包含他人作品或真人肖像需要先确认授权不能直接拿来训练和商用。LoRA 的价值是把“风格”从提示词里解耦出来。纯靠提示词描述服装和光影很难稳定复现风格LoRA 一旦训练好就能在一个固定风格范围内批量出图换不同主体、不同动作都保持服装质感和色调统一。2.3 提示词包与素材包的价值18694 条提示词才是这套资源里最值钱的部分。很多人以为提示词就是“描述画面的一句话”实际批量生产时需要的是结构化组合主体库、服装库、环境库、镜头库、风格库、负面词库。18694 条提示词大概率不是 18694 句完全独立的话而是由多个维度组合出来的提示词矩阵。这种矩阵的好处是可以程序化调用。写一个循环脚本每次从主体库取一个主体、从服装库取一个服装、从环境库取一个场景拼成一条提示词就能自动生成大量风格统一、细节各异的图片或视频片段。后面我会写一个完整的 Python 清洗和批量调用示例。3. 适用场景与合规边界这套方案适合以下几类使用者需要统一视觉风格的时尚类内容创作者比如服装电商详情页、穿搭博主封面图。需要批量生产短视频素材的运营人员比如视频号、抖音、小红书的多图多视频内容。想研究提示词结构和 LoRA 风格控制的 AI 绘画玩家。想在本地显卡上验证视频生成模型性能的开发者。不适合的场景也要提前说清楚不适合直接商用未经授权的真人肖像和品牌素材。不适合制作误导性、低俗或违规内容。不适合在 4G 显存以下的轻薄本上跑 MiniMax H3 的完整视频生成流程。不适合把在线平台生成的素材当作完全免版权素材各平台授权规则不同商用前要逐个确认。合规边界这块我的建议是生成人物、明星脸、真人肖像前必须确认是否有肖像授权。训练数据里的图片和视频如果包含他人作品、人脸、Logo不能直接投喂 LoRA 训练。深度合成内容发布时要遵循所在平台的审核规则部分平台要求标注 AI 生成。批量生成的内容发布前至少要抽看 10% 的输出确认没有明显违规和低质内容。4. 环境准备与本地部署4.1 硬件与系统检查按社区整合包的使用经验MiniMax H3 本地部署的核心瓶颈在显卡显存和内存操作系统Windows 10/11 或 LinuxUbuntu 20.04 以上更稳。显卡NVIDIA 显卡为主8G 显存有可跑的说法建议 12G 以上更从容。内存建议 16G 以上视频生成任务会比纯图像生成更吃内存。磁盘模型文件、LoRA 文件、视频输出占空间较大建议预留 50G 以上。CUDA 环境需要 CUDA 11.8 或 12.x具体以整合包说明为准不要盲目装最新版。如果用的是 AMD 显卡或者纯 CPU理论上可以跑但性能会明显下降。社区里也有人问“MiniMax H3 能在 AMD 的 CPU 上本地部署吗”从模型体量看纯 CPU 跑 33B 级别参数会非常吃力不推荐作为主力方案。4.2 一键整合包启动方式社区流传的“8G 底显存一键整合包”通常是把 ComfyUI、Python 依赖、MiniMax H3 相关节点和模型文件打包在一起。启动方式一般是解压后双击start.bat脚本会自动拉起 ComfyUI 服务并在浏览器打开工作台页面。如果双击后没有反应优先看终端窗口里的报错信息。常见原因有三个Python 路径不对、模型文件没放在指定目录、CUDA 版本和 PyTorch 不匹配。整合包一般自带独立 Python 环境不要手动改环境变量不然容易把启动脚本搞坏。4.3 ComfyUI 工作流加载如果不用整合包也可以手动拉取 ComfyUI再安装 MiniMax H3 相关自定义节点。启动命令如下# 克隆 ComfyUI 仓库之后安装依赖并启动 cd ComfyUI pip install -r requirements.txt python main.py --listen 127.0.0.1 --port 8188启动后浏览器访问http://127.0.0.1:8188把下载到的工作流 JSON 文件直接拖进页面即可加载。加载后需要手动检查每个节点选中的模型文件是否存在比如 checkpoint、LoRA、视频生成模型都要对应到models目录下的实际文件。4.4 目录结构规划无论是整合包还是手动部署建议保持一套清晰的目录结构方便批量任务管理project/ ├── checkpoints/ # MiniMax H3 视频生成模型 ├── loras/ # KREA2 极光黑丝 LoRA ├── workflows/ # ComfyUI 工作流 JSON ├── prompts/ │ ├── prompts_raw.txt # 原始提示词 │ ├── prompts_positive.txt # 清洗后的正向提示词 │ └── prompts_negative.txt # 负面提示词 ├── inputs/ │ ├── images/ # 参考图和图生视频输入图 │ └── videos/ # 参考视频素材 └── outputs/ ├── images/ └── videos/这套结构的好处是模型、输入、输出、提示词完全分开跑批量任务时不会互相覆盖排查问题也方便。5. 提示词工程实战18694 条提示词包拆解5.1 提示词分类结构拿到 18694 条提示词之后第一步不是直接喂给模型而是先做分类。从批量生成的角度看提示词至少可以拆成这几类类别作用示例关键词主体库定义画面里的人物、动作、状态model, dancer, walking, sitting服装库定义服装材质、颜色、款式black silk stockings, high waist skirt环境库定义场景和光照studio, neon light, rainy street镜头库定义焦段、机位、景别85mm, close-up, full body, low angle风格库定义后期质感和色彩倾向cinematic, fashion editorial, film grain质量词提升画面整体质量highly detailed, sharp focus, 8k负面词排除常见错误low quality, bad hands, blurry把提示词按这种结构拆开之后你会发现 18694 条并不是“1 万多个完全不同的句子”而是几百个基础描述词互相组合出来的结果。了解这一点你就能自由增删组合而不是只会套用固定句子。5.2 提示词组合公式根据社区公开的提示词规范我整理了一个通用组合公式[主体动作] [服装材质/颜色] [环境与光照] [镜头焦段/机位] [后期风格] [质量约束]举个例子假设风格库是“极光黑丝”这套 LoRA 对应的时尚摄影风格那么一条正向提示词可以这样写fashion editorial photo, young woman, wearing black silk stockings, high waist skirt, standing in a minimalist studio, soft rim lighting, 85mm lens, full body shot, cinematic color grading, highly detailed skin texture, sharp focus对应的负面提示词low quality, bad anatomy, distorted hands, extra fingers, blurry, watermark, oversaturated, deformed face, duplicate limbs注意我不是在建议你照抄这句提示词而是想让你看到结构主体、服装、环境、镜头、风格、质量词每个维度都补全之后模型输出的稳定性会明显上升。很多新手提示词翻车问题不在描述不详细而是缺少“环境和镜头”信息。5.3 18694 条提示词包清洗与调用实际拿到的提示词包往往格式不统一。有的行带序号有的行有空行有的行是中文混英文。我习惯先用 Python 做一次清洗和去重import re with open(prompts_raw.txt, r, encodingutf-8) as f: lines f.readlines() cleaned [] seen set() for line in lines: line line.strip() # 去掉空行、注释行和形如 1. 的序号 if not line or line.startswith(#): continue line re.sub(r^\d[\.\、\s], , line) if line not in seen: seen.add(line) cleaned.append(line) print(fraw: {len(lines)} - cleaned: {len(cleaned)}) with open(prompts_positive.txt, w, encodingutf-8) as f: f.write(\n.join(cleaned) \n)清洗之后把负面提示词单独放一个文件正向提示词放另一个文件。批量调用脚本就能分别读取然后循环提交到 ComfyUI 或在线平台。5.4 模板化替换与批量改写如果你想从 18694 条提示词里扩展出更多变体不需要手写。用模板替换就可以subjects [young woman, model, dancer] outfits [black silk stockings, leather skirt, high heels] scenes [studio, neon street, rainy night] styles [cinematic, fashion editorial] prompts [] for subject in subjects: for outfit in outfits: for scene in scenes: for style in styles: prompts.append( ffashion photo, {subject}, {outfit}, {scene}, f{style}, full body shot, 85mm lens, high detail ) print(len(prompts))这种做法的好处是自动生成“指数级”的提示词组合并且每一条都在你控制的结构内不会跑偏。批量生产时配合随机采样就能在风格统一的前提下覆盖大量细节变化。6. 功能测试与效果验证6.1 MiniMax H3 文生视频测试测试目的验证 MiniMax H3 能否从纯文字直接生成一段可用的短视频素材。操作步骤在 ComfyUI 中加载 H3 文生视频工作流。选择视频生成模型节点填一段包含主体、动作、镜头运动的中等长度提示词。设置视频帧数和分辨率。第一次测试建议帧数少一点比如 16 到 24 帧分辨率控制在 512 或 768 级别。点击执行观察终端日志和显存变化。预期结果生成一段几秒到十几秒的短视频画面主体清晰动作连贯没有明显的闪烁和撕裂。判断标准可以先抽帧看关键帧再播放完整视频重点看主体有没有在几帧之内突然变形。常见失败原因是提示词太长、帧数设置过高导致显存溢出或模型路径没加载对。6.2 MiniMax H3 图生视频测试Ref2VA 参考模式测试目的验证参考图模式下生成视频能否保持人物和服装的一致性。操作步骤准备一张参考图建议用 KREA2 已经生成好的、风格统一的人物图。在工作流中把参考图接进图生视频节点开启 Ref2VA 或参考模式。提示词里写清楚运动方向比如“camera slowly zooms in”“she turns around slowly”。设置参考强度一般不要拉到最大否则画面会像静态图。预期结果参考图的主体特征被保留同时画面产生合理的动态变化。判断标准对比首帧、中间帧和末帧人物面部、服装、发型是否稳定。最容易出现的问题是参考强度太高导致画面几乎不动或者强度太低导致参考图特征丢失。这里需要多跑几次找到适合你素材的强度区间。6.3 KREA2 图像生成与 LoRA 测试测试目的确认极光黑丝 LoRA 是否正确加载以及提示词组合是否有效。操作步骤把 LoRA 文件放到 ComfyUI 的models/loras目录刷新节点列表。在提示词节点中调用 LoRA权重先给 0.8 到 1.0。输入 5.2 节里的正向提示词和负面提示词生成一张测试图。再换一条服装差异较大的提示词对比服装材质表现。预期结果生成图片的服装材质、光影氛围和整体色调保持一致LoRA 风格稳定作用于不同主体。判断标准重点看服装褶皱、丝袜反光、皮肤质感是否自然。如果 LoRA 完全没生效检查文件名是否写错、权重是否太低、LoRA 是否放进了正确目录。如果效果过浓画面很假就把权重降到 0.6 到 0.8。6.4 判断成功和失败的标准场景成功标准失败时优先排查文生视频主体清晰、动作连贯、无明显闪烁显存不足、提示词过长、模型未加载图生视频参考图特征保留、运动合理参考强度设置、首帧清晰度KREA2 出图服装材质细腻、色调统一LoRA 路径、权重、负面词缺失批量任务队列稳定、输出不互相覆盖节点 ID 写错、端口占用、单个任务卡死7. 批量任务与接口 API 调用7.1 批量任务目录设计批量任务最容易出现的问题是跑了几百张图之后输出目录里一片混乱。建议按批次建子目录outputs/images/ ├── batch_20250401/ │ ├── 001.png │ ├── 002.png │ └── ... ├── batch_20250402/ │ └── ... outputs/videos/ ├── batch_20250401/ │ ├── 001.mp4 │ └── ...每个批次的提示词文件、种子文件、日志也一并放到批次目录里方便复现。7.2 ComfyUI API 批量提交示例ComfyUI 自带 API 接口可以直接用 Python 批量提交任务。实际调用时需要先把工作流导出为 API 格式的 JSON再替换提示词节点。下面是一个通用模板import json import time import uuid import requests API_URL http://127.0.0.1:8188/prompt def load_prompts(path): with open(path, r, encodingutf-8) as f: return [line.strip() for line in f if line.strip() and not line.startswith(#)] def submit(workflow, client_id): payload { prompt: workflow, client_id: client_id } return requests.post(API_URL, jsonpayload, timeout300) def wait_finish(client_id, timeout600): # 轮询队列历史按 ComfyUI API 实际接口调整 start time.time() while time.time() - start timeout: history requests.get(http://127.0.0.1:8188/history, timeout10).json() if any(client_id in item for item in history.values()): return True time.sleep(3) return False if __name__ __main__: prompts load_prompts(prompts/prompts_positive.txt) workflow json.load(open(workflows/minimax_h3_workflow.json, r, encodingutf-8)) for index, prompt in enumerate(prompts[:10]): # 示例节点 ID需要按实际导出的工作流 JSON 修改 prompt_node workflow.get(6, {}) if prompt_node: prompt_node[inputs][text] prompt cid str(uuid.uuid4()) r submit(workflow, cid) print(f[{index}] submit{r.status_code} prompt{prompt[:60]}) if r.status_code 200: ok wait_finish(cid) print(f[{index}] finish{ok}) else: print(f[{index}] error{r.text[:200]})这段代码的意图很清楚读取提示词列表、替换工作流里的文本节点、循环提交、轮询完成状态。实际使用时你必须把workflow.get(6)改成你导出的工作流里真正的文本节点 ID否则提交的工作流不会正确替换提示词。如果不想写 Python也可以直接用 curl 测试接口是否通curl -X POST http://127.0.0.1:8188/prompt \ -H Content-Type: application/json \ -d batch_request.jsonbatch_request.json需要包含完整的 ComfyUI API 格式工作流。7.3 失败重试与日志记录批量任务跑久了单条失败很正常。我的建议是每提交一条任务就记录一行日志内容包括批次号、提示词前 60 个字符、提交时间、返回状态、结束时间。如果某条任务超时不要立刻全部重跑先确认是显存不足还是网络阻塞。显存不足时把分辨率降一档、把批量数改回 1再继续跑。加一个简单的失败重试逻辑会更稳for attempt in range(3): try: r submit(workflow, cid) if r.status_code 200: break except requests.exceptions.Timeout: print(f[{index}] timeout, retry {attempt 1}) time.sleep(5)8. 资源占用与性能观察本地跑 MiniMax H3 这类视频生成模型时重点看三个指标显存占用、内存占用、单任务耗时。显存占用可以用nvidia-smi实时查看nvidia-smi -l 2-l 2表示每两秒刷新一次可以看到显存使用率随时间的变化。如果模型首次加载需要几分钟显存会被持续占满这属于正常情况如果执行到一半显存突然暴涨然后报CUDA out of memory那就说明参数设置太高。从经验上看影响资源占用的主要因素按影响大小排序是视频帧数 分辨率 批量数 提示词长度。先降低帧数再降分辨率最后再考虑提示词精简这是最有效的排查顺序。CPU 推理和 GPU 推理的差异很大。视频生成模型在 CPU 上虽然能跑但单条任务耗时可能比 GPU 多几倍甚至几十倍。除非只是做接口连通性测试否则不建议 CPU 跑视频生成。降低显存占用的常用手段降低分辨率从 1024 降到 768 或 512。减少视频帧数先跑 16 帧验证效果再逐步加帧。使用量化版本模型比如社区常用的低显存整合包优化。开启缓存优化避免同一批重复计算。LoRA 训练完合并进主模型推理时不再单独加载 LoRA。9. 常见问题与排查方法问题现象可能原因排查方式解决方案启动后页面无法访问服务未启动 / 端口被占用看终端日志检查 8188 端口换端口重启例如--port 8189生成视频时报显存不足分辨率过高 / 帧数过多用 nvidia-smi 观察显存占用降低分辨率减少帧数换量化模型提示词不生效画面偏离预期提示词结构不完整缺环境和镜头信息逐词删减对比按“主体服装环境镜头风格”模板补全LoRA 没有效果LoRA 文件路径错误 / 权重太低检查节点文件名和权重值确认真实文件名权重从 0.8 开始调API 返回错误工作流 JSON 节点结构不对查看返回的错误信息从 ComfyUI 导出 API 格式 JSON 再修改批量任务卡住某条任务失败导致队列阻塞查看队列状态和日志清空队列加超时和重试逻辑输出视频闪烁严重帧间一致性差抽帧对比相邻帧用参考模式降低运动幅度减少帧数中文提示词效果差模型对中文的响应不稳定切换中英文测试改用英文提示词或中英混合描述10. 最佳实践与使用建议第一次上手这套工作流不要一上来就批量跑 100 个任务。先小参数测试跑
上一篇/下一篇内容由系统自动关联
返回资讯列表 →