ComfyUI 桌面版保姆级图文教程 · 第三节:H3 导演台 12 段分镜一次跑完,本地出「带原生音效的 60 秒动画成片」
本文是「ComfyUI 桌面版实战」系列第三课。第一课讲安装第二课讲手抄报和线稿这篇默认你已经装好 ComfyUI建议版本 v0.30.0 以上。MiniMax H3本地生成动画效果预览蚊子科普一、这节课做了什么在本地 ComfyUI 里跑通 MiniMax H3海螺开源的视频模型用第三方插件「H3 Director 导演台」把一整集 12 个分镜排在一条时间轴上挂好固定角色的参考图和音色一次生成一条带原生音效、约 60 秒的完整动画片。等片段都确认没问题再用 Refine 节点二采放大成高清版。示例是一个「蚊子科普」儿童 3D 动画两个固定角色机器人「科科」和男孩「小探」。一共 12 个素材组、61 秒、1522 帧、24fps横屏 16:9。流程分四步ComfyUI 升级到v0.30.0 或更新版本官方 MiniMax H3 节点需要显卡现实门槛12GB 显存RTX 3060 级别用 pruned int8 量化模型 动态显存搬运才能跑 480P 带音频8GB 只能靠 GGUF 低量化模型极限跑短片段容易爆显存不建议16–24GB 比较从容-系统内存 32GB 起步模型文件加起来 40 多 GB要在内存和显存之间来回搬16GB 基本加载不起来- 硬盘留 60GB 以上空间模型约 42GB本文截图来自本地 Windows 环境。**我这台电脑的实际配置上面说的速度就是这个配置跑出来的| 部件 | 配置 ||------|------|| 显卡 | NVIDIA RTX 409024GB || CPU | i9-13900K || 内存 | 32GB || 系统 | Windows 11 |这个配置下480P 一采约 5 秒一步单组 5 秒片段约 1 分钟出片整条 61 秒成片二采 720P 约 54 分钟。装两个自定义节点KJNodes 和 H3 Director 导演台下载模型、放对文件夹拖入工作流在导演台里配公共参数、素材组、参考图和提示词先用 480P 逐组跑一采12 组全部确认后接 Refine 二采高清约 720P。版权声明先看一眼网盘「用到的参考图」里的全部图片包括科科、小探两个角色形象以及场景图、道具图、蚊子图和「视频完整示例」里的成片只供个人学习和技术交流不能用于任何商业用途也不要二次分发、倒卖或者拿去做商单、带货、广告视频。工作流 json 和踩坑手册同样仅供学习。二、资源下载与目录结构所有资源打包在夸克网盘路径AI 相关 / Comfy桌面版 / comfy桌面第三节用到的素材。下载地址夸克网盘https://pan.quark.cn/s/268685c9d013图1夸克网盘里的第三节素材包红箭头标出了五个部分视频完整示例、用到的参考图、用到的模型、用到的自定义节点以及蚊子科普踩坑手册和完整工作流 json。文件夹结构comfy桌面第三节用到的素材/ ├── 视频完整示例/ # AI 生成的完整成片先看效果再决定要不要装 ├── 用到的参考图/ # 角色科科/小探、场景、蚊子、道具等参考图 │ ★ 仅供学习不得商用 ├── 用到的模型/ │ ├── diffusion_models/ # minimax_h3_fl2va、minimax_h3_ref2va 两个 UNET │ ├── loras/ # Turbo 加速 LoRA4 步 │ ├── text_encoders/ # qwen3vl 32b 文本编码器 │ └── vae/ # Video VAE Audio VAE ├── 用到的自定义节点/ │ └── custom_nodes/ # ComfyUI-KJNodes.tar、ComfyUI_MiniMaxH3_Director…tar ├── 蚊子科普12组完整…踩坑手册.md # 我自己记录的 H3 踩坑和提示词 └── 蚊子科普完整的工作流.json # 拖进 ComfyUI 即用的完整工作流再提醒一次参考图和人物形象只供学习使用不得商用。三、环境与插件安装3.1 环境要求ComfyUI 升级到v0.30.0 或更新版本官方 MiniMax H3 节点需要显卡现实门槛12GB 显存RTX 3060 级别用 pruned int8 量化模型 动态显存搬运才能跑 480P 带音频8GB 只能靠 GGUF 低量化模型极限跑短片段容易爆显存不建议16–24GB 比较从容系统内存 32GB 起步模型文件加起来 40 多 GB要在内存和显存之间来回搬16GB 基本加载不起来硬盘留 60GB 以上空间模型约 42GB本文截图来自本地 Windows 环境。我这台电脑的实际配置上面说的速度就是这个配置跑出来的| 部件 | 配置 ||------|------|| 显卡 | NVIDIA RTX 409024GB || CPU | i9-13900K || 内存 | 32GB || 系统 | Windows 11 |这个配置下480P 一采约 5 秒一步单组 5 秒片段约 1 分钟出片整条 61 秒成片二采 720P 约 54 分钟。3.2 装两个自定义节点这节课用到两个插件插件作用ComfyUI-KJNodes提供 Sage Attention 加速节点Patch Sage Attention KJ、H3 显存优化补丁提速、降显存占用ComfyUI_MiniMaxH3_DirectorH3 多段音视频「导演台」作者 AIMixerAI 搅拌手导演台插件的 GitHub 地址想自己翻 README 和示例工作流的可以去看https://github.com/AIMixer/ComfyUI_MiniMaxH3_Director新手按方式一网盘压缩包操作就行。会命令行的同学也可以git clone仓库或用 ComfyUI Manager 的「Install via Git URL」安装装完重启即可。方式一新手推荐用我网盘里的压缩包。打开用到的自定义节点/custom_nodes把ComfyUI-KJNodes.tar和ComfyUI_MiniMaxH3_Director…tar两个压缩包解压解压出来的两个文件夹放进 ComfyUI 安装目录下的custom_nodes文件夹。图2ComfyUI 根目录红圈标出custom_nodes文件夹——自定义节点统一装在这里。图3网盘里的两个插件压缩包解压后放进本地ComfyUI/custom_nodes红字提醒注意文件夹名字、别装错位置不要多套一层目录也不要放进别的文件夹。3.3 放置模型在 ComfyUI 安装目录下找到models文件夹。图4ComfyUI 根目录下的models文件夹红圈标出——模型统一放这里。网盘用到的模型里有 4 个文件夹diffusion_models、loras、text_encoders、vae按同名文件夹整个合并/替换进models就行直接替换文件夹也可以别放错层级。图5左本地models、右网盘用到的模型红箭头一一对应diffusion_models→diffusion_models、loras→loras、text_encoders→text_encoders、vae→vae。看好路径别放错地方。模型清单节点名加真实文件名照着对节点 / 用途文件名目录UNETt2v / i2v / fl2v工作流一采主模型minimax_h3_fl2va_pruned_int8_convrot.safetensorsmodels/diffusion_modelsUNETr2v 参考主体 / v2v 用二采链minimax_h3_ref2va_pruned_w4a8_mixed.safetensors网盘内同系列量化版均可models/diffusion_modelsTurbo LoRA4 步加速模型强度 1.00minimax_h3_fl2v_turbo_4step_….safetensorsmodels/lorasCLIP 文本编码器Qwen3-VL类型必须选minimaxqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsmodels/text_encodersVideo VAEminimax_h3_video_vae_fp16.safetensorsmodels/vaeAudio VAEminimax_h3_audio_vae_fp32.safetensorsmodels/vae二采 latent 放大模型Refine 用minimax_h3_latent_upscaler_3d_….safetensorsmodels/latent_upscale_models官方 README 的对应关系是「t2v / i2v / fl2v 用 fl2va UNETr2v / v2v / rv2v 用 ref2va UNET」。我分享的工作流 json 里每个节点选哪个模型都挂好了文件放对文件夹拖进去不用手动改节点报红再按上表核对文件名。3.4 拖入工作流模型放好后把网盘里的蚊子科普完整的工作流.json直接拖进 ComfyUI 画布节点会自动连好线展开。图6ComfyUI 空白画布把下载好的工作流 json 直接拽进界面即可加载不用手动连线。四、参数速查表可直接抄环节参数值一采画布输出分辨率 / 百万像素16:9 宽屏 /0.4864 × 480即 480P帧率fps24每组 5 秒 124 帧声音声音模式生成声音画面与原生立体声同次采样采样steps4与 4 步 Turbo LoRA 对应见第七节采样器samplerres_multistep调度器schedulersimpleSigma 移位shift_video / shift_audio12.00 / 3.00CFGcfg1.0段间引导上下文帧数 / 引导方式开 /22/ 引导仅同场景连续段使用默认应关闭素材组每组秒数 / 参考图尺寸5 秒 /match二采Refine mode / upscale_methodupscale/h3_latent二采目标megapixels1.01376 × 768约 720P输出CreateVideo / SaveVideobit_depth 8、sRGB、codec auto前缀video/MiniMaxH3_Director插件官方默认是 25 steps挂了 4 步 Turbo LoRA 后 steps 填 4出片快很多一采一分钟跑完靠的就是这个。五、工作流全景先认全五个区块拖入 json 后整条工作流长这样。我只讲自己平时在用的参数底层原理不展开。图7工作流五大区块红框标注——左上「模型加载」、其右「LoRA 加速提升生成视频速度不用可关」、中间最大的「最重要的导演台」、左下「二采区」、右侧「视频预览区创建视频 保存视频」。图8工作流全景放大。红箭头标出四个模型加载槽位UNET、CLIP、Video VAE、Audio VAE和 LoRA 加载器红字提示如果任何一个节点报错先检查模型有没有下载好、放到专属文件夹图中棕色便签写着导演台插件地址。① 模型加载MiniMax H3四个槽位图9模型加载节点特写。UNET minimax_h3_fl2va_pruned_int8_convrotCLIP qwen3vl_32b_minimax_h3_nvfp4_awq类型 minimaxVideo VAE minimax_h3_video_vae_fp16Audio VAE minimax_h3_audio_vae_fp32旁边 LoRA 加载器挂 4 步 turbo、模型强度 1.00。② 加速模块用就开不用可以关Patch Sage Attention KJMiniMax H3 Mem Eff Sage Attention两个 KJNodes 补丁省显存、提速。③ MiniMaxH3Director 导演台中间最大的节点第六节细讲。④ 二采区RefineMiniMax H3 Director Refine加基本调度器一采确认没问题后再接用来出高清。⑤ 视频预览区创建视频图像 音频 帧率合成→保存视频还有一路Director 运行报告输出分段信息。六、导演台MiniMaxH3Director怎么用导演台插件全名ComfyUI MiniMaxH3 Director作者 AIMixerGitHubhttps://github.com/AIMixer/ComfyUI_MiniMaxH3_Director它把分段分镜、参考图/参考音管理、采样解码、导出都收进一个节点里节点内部是一条可视化时间轴多段长视频不用再一段段单独跑。6.1 六种任务模式这节课用 r2v导演台支持 6 种任务类型task_type模式含义t2v文生视频i2v图生视频fl2v首尾帧生视频r2v参考主体生视频素材组——本课使用固定角色演一整集靠它v2v源视频编辑视频转视频rv2v参考素材改视频r2v 说白了就是给每个角色、场景、道具一张参考图并编号Picture 1、Picture 2……提示词里用Picture N标签引用模型在所有分镜里照着参考图保持角色和场景一致。音频同理用Audio N引用音色参考角色每段说话都是同一把嗓音。6.2 时间轴和素材组导演台节点上半部分是时间轴每张卡片是一个分镜片段素材组卡片上显示序号、帧范围如S1→S2 · −248和首帧缩略图卡片之间的小图标是段间引导Guide开关。本例一共 12 张卡片、61 秒、1522 帧。点时间轴上任意一张片段卡片比如第一张蚊子图下面就展开这段的「素材组」编辑面板面板顶部可以设参考图尺寸建议match和本组秒数本例 5 秒「添加素材组 / 上一组 / 下一组 / 复制当前分组 / 删除当前分组 / 单显模式」用来管理片段。图10上方时间轴里点击蚊子片段红箭头下方展开「素材组 1」左上「公共图片只读预览」是图片 1 科科、图片 2 小探「本组图片从图片 3 起」是图片 3 蚊子、图片 4 卧室右侧大红框是「写提示词的框框」红字提示点击图片空位就会添加参考图。6.3 公共参数所有素材组共享点时间轴下方的**「展开公共参数」**打开一块全片段共享的面板公共参考图片 / 参考视频 / 参考音频各组自动读取不用每组重复上传。本例两个主角放在公共槽位——图片 1 科科、图片 2 小探公共提示词GLOBAL PRODUCTION RULES会自动拼到每一组自己的提示词前面同槽位以组内素材优先。角色长相、服装、画风、「不许生成字幕文字」这类全片统一的规则写在这里写一遍管 12 组。图11红框是顶部时间轴红箭头指向「展开公共参数 / 禁用公共参数」按钮红字说明使用公共参数后这些公共参考图和提示词会影响所有片段比如统一添加角色提示词和参考图。面板里能看到 GLOBAL PRODUCTION RULES 已定义 Picture 1Keke、Picture 2Xiao Tan 的长相与服装。启用公共参数后每组自己的图片编号从图片 3 开始续编图片 1、2 被公共参数占用提示词里的Picture N必须和槽位编号一一对应这是最容易对错的地方。6.4 本组图片和提示词标签公共图片只读预览显示继承来的图片 1、2组内不能改本组图片从图片 3 起点空位添加本组独有的场景、道具、生物参考图。本例组 1图片 3 蚊子、图片 4 卧室参考视频 / 参考音频槽r2v 每组可挂图片 1–9、音频 1–3、视频 1–3音频槽还能直接选一段视频插件会自动提取首条音轨当音色参考提示词里引用素材的标签Picture N图片、Video K视频、Audio J音频也可以输入快速引用。6.5 六段式提示词r2v 的提示词结构导演台不替你写提示词。r2v 素材组的提示词推荐按官方「六段式」结构写英文中文台词原样保留。截图里蚊子科普组 1 能看到前三段subject_definitions: Subject 2 is Xiao Tan from Picture 2, preserving his original face, hairstyle, outfit, and childlike proportions. Subject 3 is the single mosquito from Picture 3, preserving its original body structure, wings, legs, antennae, and colors. Its reference image defines appearance, not its size in the scene. Subject 4 is the bedroom from Picture 4, preserving the same furniture, window, bed, lighting, and room layout. Audio 1 is Xiao Tans voice-timbre reference. summary: A five-second childrens 3D animated scene. Xiao Tan discovers a mosquito flying near his ear and tries to drive it away. Only Xiao Tan and one small mosquito appear in the shot. retention_analysis: …逐主体列出谁完整保留、谁只作音色参考六段分别是段落写什么subject_definitions逐一定义Subject N是谁/是什么、来自Picture N保留哪些外观特征summary概括这一段几秒、什么风格、谁在哪干什么、谁是唯一说话人retention_analysis逐主体声明保留方式fully_preserved / voice reference onlydetailed_description详细分镜开场构图 → 角色动作按时间顺序→ 台词落点 → 结尾状态中文台词用d[Chinese] ……/d包裹CAMERA 运镜单独写overall_soundscape环境声、动作音效、对白范围non_diegetic_music背景音乐如低音量、无人声的儿童器乐公共提示词GLOBAL PRODUCTION RULES管全片统一的角色定义和禁令本例开头是GLOBAL PRODUCTION RULES Picture 1 is the master character reference for Subject 1, Keke. Picture 2 is the master character reference for Subject 2, Xiao Tan. Subject 1 is Keke, a small white-and-blue science robot with a round body, glossy white material, black face screen, two glowing blue eyes, cyan chest light, short arms and legs, and a small blue glowing antenna… Subject 2 is Xiao Tan, an eight-year-old boy with tousled brown hair, large dark-brown eyes… blue zip-up hoodie, white T-shirt, khaki shorts, white socks, and blue-and-white sneakers.音频只定义音色不定义台词内容谁说话由该组 detailed_description 里的发言人决定写using the voice timbre from Audio N。不说话的组不要挂音频、不要写台词。12 组完整提示词和踩坑记录我整理在网盘的**「蚊子科普12组完整…踩坑手册.md」**里写不出来可以直接抄改。6.6 段间引导Guide时间轴卡片之间的小图标就是段间引导开关默认关闭。开启后会把上一段生成结果末尾的运动和音频「钉」进下一段只用于同一场景、同一机位、动作连续的相邻镜头换新场景、换出镜角色、片尾都要关掉做独立硬切上下文帧数可选 5 / 22 / 39 / 56官方推荐默认 22本例也是 22。6.7 输出参数和导演包时间轴下方一行是输出设置输出分辨率 16:9宽屏、百万像素 0.4、帧率 24、声音「生成声音」、输出修脸前可关、分段导出。工具栏还有两个实用按钮导入导演包 / 导出导演包把整条时间轴JSON 全部参考图/音视频打成一个*.mmxpack.zip换电脑、发给朋友直接导入还原不用重新一张张挂素材EN 按钮切英文界面导出导演包前建议切英文避免中文路径编码出问题。七、LoRA 步数与采样参数怎么对应这一条很关键Turbo LoRA 是几步的导演台 steps 就写几只能多不能少。我用的是minimax_h3_fl2v_turbo_4step4 步 LoRA所以导演台高级采样里steps 4换 8 步 LoRAsteps 就写 8。步数越大生成效果可能越好但速度越慢自己权衡。图12红圈从 LoRA 加载器文件名含 4step、模型强度 1.00拉到导演台高级采样区的 steps红圈数值 4红字看看这个 LoRA 是几步就写几步只能多不能少我这个是 4 步的 LoRA 就写 4数值越大可能生成效果越理想。同区可见 samplerres_multistep、schedulersimple、shift_video12.00、shift_audio3.00。八、一采先只跑一个片段试水不要 12 组一口气全跑。先只勾第一个片段确认环境、模型、参考图、提示词都正常再逐组推进。点时间轴左下方的**「选择运行」**进入勾选模式只勾第一个片段左上角的小勾其他全部不勾点画布右上角蓝色的**「运行」**按钮。图13红箭头依次指向「选择运行」按钮、12 个片段卡片左上角的勾选框红字点击选择运行后只生成勾选片段建议只勾选第一个其他不勾然后点运行看看能不能跑起来。图14全工作流视角红箭头从第一个被勾选的蚊子片段拉到右上角蓝色「运行」按钮红字只勾选这一个运行先试试。生成时看右上角任务队列和底部日志我这台电脑大约5 秒一步日志5.54s/it速度因显卡而异。图15右上任务队列显示 MiniMaxH3Director 正在运行、进度 50%底部终端日志可见模型加载Video VAE / Audio VAE / TEmodel / H3 权重与采样速度红字这是我电脑生成的速度5 秒左右一步。第一个片段跑通、画面声音都对再按同样方式逐组生成、逐组确认12 组都满意后一次性全选跑完整条或者直接看分段导出的拼接结果。九、二采Refine满意后再出高清一采默认 0.4 百万像素864 × 480只是 480P 普清好处是快适合反复调提示词、调分镜。等所有片段内容锁定、不再改了再接二采节点出高清找到左下角的MiniMax H3 Director Refine节点紫色表示节点被关闭/静音了选中节点按快捷键Ctrl M可以启用/停用启用后恢复正常颜色把 Refine 的refine输出接到导演台左侧的refine输入口BasicScheduler 的 sigmas 接 Refine 的 sigmas 口Refine 设置mode upscale、upscale_method h3_latent、sampler euler、passes 1、seed_mode inherit放大模型选minimax_h3_latent_upscaler_3d百万像素megapixels设1.0 → 1376 × 768约 720P导演台自身的分辨率还是一采的 480PRefine 目标才是放大后的尺寸。图16红箭头从导演台左侧 refine 口引到 Refine 节点红字连上这个节点主要是确认视频没问题之后进行二采也就是生成高清视频左下蓝框是节点激活之后的样子红字补充这个节点为啥是紫色因为我把它关闭了开启快捷键 CtrlM。图17右侧导演台百万像素 0.4红箭头对应尺寸表 864×480红字现在这个参数是 480P 普清画质左侧 Refine 节点 megapixels1.0红字如果连上它就变成了 720P 画质只有在最后确定片段没问题的时候才连它出个高清二采。二采只提升清晰度不改剧情内容。二采后发现动作、角色或内容有问题要回到一采改提示词或参考图重跑别指望放大修复构图。导演台的images口输出二采后成片images_pre_refine口输出一采放大前画面可以各接一个保存节点做对比。十、常见问题 FAQQ1节点报红 / 提示找不到模型怎么办九成是模型没放对位置。按第三节核对两个 UNET 在models/diffusion_models、Turbo LoRA 在models/loras、qwen3vl 在models/text_encoders、两个 VAE 在models/vae文件夹可以整个合并替换放完重启 ComfyUI 并刷新浏览器CtrlF5。Q2CLIP 节点报错或生成异常CLIP Loader 的类型type必须手动选成minimaxQwen3-VL默认类型不对必报错。Q3r2v 到底选哪个 UNET官方对应关系t2v/i2v/fl2v 用 fl2var2v/v2v/rv2v 用 ref2va。用我分享的 json 时节点已挂好不用改自己搭工作流按这个规则选。Q4角色每段长得不一样 / 串脸怎么办把固定角色放进公共参数的图片 1、图片 2并在公共提示词里用Picture N/Subject N写死角色定义每组提示词开头的 subject_definitions 再声明一次 preserving 原始长相、发型、服装。每组上传后逐张核对缩略图错图比没图更麻烦。Q5提示词里的图片编号怎么对公共参数占用图片 1、2 时本组图片从图片 3 开始编号提示词里Picture N和槽位必须一一对应。音频Audio N同理。Q6段与段之间画面跳变、角色突然变了段间引导Guide不是万能的只有同场景、同机位、动作连续的相邻段才开上下文帧数 22换新场景、换角色、片尾一律关闭做硬切。Q7想让角色说话音频怎么挂公共音频放角色音色参考约 10 秒干净人声就行组内用Audio N引用音色台词写在 detailed_description 里并用d[Chinese] 中文台词/d包裹不说话的组不挂音频、不写d。音频只克隆音色不会替你念指定台词之外的内容。Q8生成速度大概多少480P 加 4 步 LoRA本机约 5 秒/步12 组 61 秒成片一采约 1 分钟具体看显卡。调分镜阶段坚持用 480P 一采定稿后再二采能省不少时间。Q9工作流想换台电脑接着做怎么办用导演台工具栏「导出导演包」生成*.mmxpack.zip含时间轴 JSON 和全部素材新电脑「导入导演包」即可还原导出前建议把界面切到 EN避免中文路径问题。Q10参考图和成片可以拿去做商单吗不可以。网盘内全部参考图含科科、小探两个人物形象和示例视频仅供学习交流不得商用、不得二次分发。十一、小结整套流程走下来就是装 KJNodes 和导演台两个插件 → 放齐模型 → 拖入工作流 → 导演台里用公共参数锁角色、素材组写分镜、Picture N引图、Audio N配音色、六段式写提示词 → 480P 逐组一采确认 → Refine 二采 720P 出成片。我自己的体会是以前做视频是一段一段抽卡现在更像在表格里排分镜哪段是谁、在哪、说什么都摆在时间轴上改哪段点哪段。导演台插件地址再放一次觉得好用可以去给作者点个 Starhttps://github.com/AIMixer/ComfyUI_MiniMaxH3_Director这篇只覆盖了把流程跑通。六段式提示词逐句怎么写、角色怎么才能不串脸、段间引导具体什么时候开、二采参数怎么调、翻车画面怎么救这些我都还没展开。想深入了解的话在评论区留言想看的人多我后面再出一套导演台进阶教程。十二、效果预览全部跑完后的成片流程全部跑完后右上角任务队列里就是带声音的完整成片。这条蚊子科普示例片子就是这么跑出来的一采普清864 × 48016:90.4 百万像素24fps画面和声音同一次生成自带立体声音效速度每个 5 秒的片段一采约 1 分钟出片本机约 5 秒一步看显卡12 组逐组跑完拼成整条 61 秒 / 1522 帧二采高清接 Refine 放大节点后输出约 1376 × 768720P 档内容不变只提清晰度整条二采本机跑了约 54 分钟。图18单组一采跑完后的任务队列。右侧队列里正在出的是当前这个 5 秒片段的成片MiniMaxH3_Director_00407_.mp4本机 480P 一采约 1 分钟跑完约 5 秒一步左侧「Director 运行报告」显示整条共 12 segment(s)、1522 frames 24.00 fps保存视频节点里可以直接预览带声音的成片。整条 61 秒成片二采 720P本机跑了约 54 分钟。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →