尧图精选

24G 显卡能训自己的视频风格吗?CogVideoX LoRA 微调完整指南

🕒 发布时间:2026/9/13 19:35:12 📁 来源:尧图网络
24G 显卡能训自己的视频风格吗CogVideoX LoRA 微调完整指南【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo想在自家电脑上固定一种画风、或让某个角色动起来又不想租卡CogVideoX 支持 LoRA 微调把大模型的注意力层冻住只训练少量低秩矩阵一张消费级显卡就能出个性化风格。这篇带你从配环境、备数据到第一次跑通讲清 CogVideoX LoRA 训练步骤里真正影响结果的几个参数。️ 显卡够不够先定你要训哪一档LoRALow-Rank Adaptation可以理解为给冻结的大模型装一个可拆卸的小插件模型本体不动只学插件里的少量参数。所以显存的大头在冻结权重和缓存的视频 latent 上这决定了你能训到多大规模。官方给出的 LoRArank128、DDP门槛如下模型混合精度训练分辨率(帧x高x宽)最低显存CogVideoX-2B (t2v)fp1649x480x72016GBRTX 4080CogVideoX-5B (t2v/i2v)bf1649x480x72024GBRTX 4090CogVideoX1.5-5B (t2v/i2v)bf1681x768x136035GBA100选型很直接16G 的卡先上 2B 把流程跑通手里有 24GRTX 4090就训 5B 的 49 帧档这是消费级显卡能摸到的上限想要 81 帧 768x1360 的高清基本得 A100 起步。不先看这张表就开训最常见的结果就是显存溢出被迫重来。 从零到第一次跑通环境相关代码还没合进 diffusers 官方版本得基于源码装。先把 diffusers 主分支装成可编辑包pip install -e .再克隆本仓库git clone https://gitcode.com/GitHub_Trending/co/CogVideo数据按任务类型摆成这个目录结构即可路径用相对路径填进配置data/ ├── prompts.txt # 提示词 ├── videos/ videos.txt # mp4 视频及其路径列表 └── images/ images.txt # 可选I2V 的参考图及列表启动改好脚本里的--output_dir、--data_root、--caption_column、--video_column、--train_resolution这几个必填项然后bash train_ddp_t2v.sh图像到视频就换成bash train_ddp_i2v.sh。脚本内部用accelerate launch调train.pyLoRA 是默认的训练类型不用额外改。⚙️ 最容易踩坑的几个参数rank 别设太小。建议 rank 64 起步、默认 128。rank 是插件的粗细太小学不进细节太大吃显存、拖慢训练还未必更好盲目调高没意义。对应的lora_alpha官方实测取 rank 或rank // 2更稳原版默认的 1 在多组实验里效果偏差。帧数必须是 8N1。也就是 49、81 这种。这是模型时间压缩的硬约束不满足直接报错。官方推荐 25 帧以上的视频来学新概念和新风格2B 档用 49 帧就够了1.5 档上 81 帧。分辨率要跟模型匹配。CogVideoX 用 480x720CogVideoX1.5 用 768x1360。视频和这个对不上时代码会直接 resize可能拉变形、拖累效果最好提前用裁剪缩放保住长宽比。验证开关看显存。训练中的验证会把模型权重临时拉回显存峰值可能顶破 24GB。24G 以下的卡建议把--do_validation设false配了 zero-3 时验证很慢也建议关掉。留着验证对多卡充裕的机器才有价值。改数据记得删缓存。训练前视频会被编码并缓存成 latent 存到磁盘提速。如果你改了视频或提示词却不删 latent 目录训的还是旧数据结果对不上就很难排查。另外想让角色/风格更认人可以用--id_token加一个标识符 token思路和 DreamBooth 类似不用也能训只是效果稍弱。 训练完怎么用产物就是目录里的pytorch_lora_weights.safetensors。加载它和底座模型拼起来推理两行代码就够写法可参考仓库的 inference/cli_demo.pypipe.load_lora_weights(path, weight_namepytorch_lora_weights.safetensors) pipe.fuse_lora(components[transformer], lora_scale1.0)也可以直接用 tools/load_cogvideox_lora.py它用set_adapters配合lora_alpha / lora_r的比例来缩放。跑通后就能在网页 demo 里看到自己微调出来的画面收个尾三句话记住数据质量决定上限参数决定能不能跑通缓存和验证开关决定你会不会白等。24G 显卡完全能训出属于你的视频风格先跑 2B 通流程、再上 5B 抠细节就是最省心的路径。更多细节看 finetune/README.mdLoRA 实现可看 finetune/models/cogvideox_t2v/lora_trainer.py。【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →