10秒素材变会说话的数字人:Duix-Avatar AI数字人本地部署速通
10秒素材变会说话的数字人Duix-Avatar AI数字人本地部署速通【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar手里只有一段10秒的正面说话视频和一句产品文案想让它变成带口型、带表情的数字人讲解视频开源工具 Duix-Avatar 能帮你把整套 AI 数字人本地部署跑在自己电脑上。这份指南先花 5 分钟搭好环境再看怎么从传素材到导出成片。一、先跑起来5分钟完成AI数字人本地部署硬件先行检查所有算力都在本地 GPU 上跑靠的是 NVIDIA 的 CUDA 加速所以第一件要确认的事你有英伟达独立显卡且驱动装好了。AMD 或核显直接不行。项目最低要求推荐配置系统Windows 1019042.1526 及以上或 Ubuntu 22.04Windows 11显卡英伟达独显驱动正常RTX 4070 12G内存32G硬性要求32G 及以上磁盘数据盘空闲 30G 以上C 盘存镜像100G 以上200G SSD C 盘不足 100G 的话装完 Docker 后要把镜像存储位置挪到别的盘第三节有具体入口。一键拉取镜像并启动服务Windows 上先装好 WSL 和 Docker Desktop装 Docker 时按 CPU 架构选对应安装包然后在项目根目录依次执行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar docker pull guiji2025/fun-asr docker pull guiji2025/fish-speech-ziming docker pull guiji2025/duix.avatar cd deploy docker-compose up -d这是 Duix-Avatar 部署教程里最常见的流程三条 pull 对应三个服务语音识别、语音合成、视频生成。这条命令跑完你会看到 Docker Desktop 里多出三个容器首次拉镜像大约 70G 流量建议连 Wi-Fi等个半小时左右。三个服务都显示 Running后端就算就绪了。客户端初始化下载官方客户端安装包Windows 是 .exeUbuntu 是 .AppImage双击安装启动首次启动先接受用户协议右上角设置下拉里有用户协议、打开日志、语言切换按需设置中英文首页能正常打开看到我的作品和我的数字人两个区域说明前后端已经打通二、从素材到成片数字人视频生成三步走Step 1 素材准备拍一段好克隆的视频用手机拍一段对着镜头说话的视频注意这几点光线充足、正面打光不逆光、没有强烈阴影时长 10-30 秒带一点自然的头部转动和表情人物正面朝向镜头别用手挡脸背景干净单一避开花纹和复杂图案全程有清晰人声说话——这条最关键最后一点最容易翻车程序要从你的素材里抽出语音来做声音克隆全程没声音或者没人说话训练会直接失败。Step 2 模型训练上传素材生成数字人点首页右上Create Avatar选择 Step 1 的视频并起个名字。这一步后台会连续做三件事先把视频统一转成 H264 编码再从视频里分离出音频最后把音频送进语音服务训练你的克隆音色整条流水线在 src/main/service/model.js 里。数据默认落在D:\duix_avatar_dataWindows确认这个盘留了 30G 以上。4070 级别的显卡跑 10-30 秒素材一般几分钟到十几分钟出结果。第一次克隆偏慢因为识别服务还在预热报错的话等几分钟再试一次。完成后我的数字人列表里会出现一张带名字的数字人卡片。Step 3 内容生成输入文案产出视频点Create Video选中 Step 2 练好的数字人把产品文案粘进文本框提交生成。文字先被转成你克隆音色的语音再由视频服务驱动数字人把口型对上不想打字也可以直接传一段音频。生成任务是排队执行的作品列表里会显示队列位置比如 1/2耐心等状态变成成功视频就进了我的作品点一下即可导出到本地。三、效果差点意思参数怎么调、坑在哪⚠️ 四个高频坑按顺序自查拉镜像卡住或超时 → 换镜像源报错里出现registry-1.docker.io ... request canceled或context canceled基本就是官方源网络不通。打开 Docker Desktop 的 Docker Engine 设置在配置文件的registry-mirrors里加上国内镜像源保存并重启 Docker回到/deploy目录重新执行docker-compose up -d。C 盘不足 100G镜像装不下 → 挪存储位置C 盘空间不够、或者拉取中报磁盘满就改 Docker 的镜像存储目录设置 → Resources → Advanced把 Disk image location 指到一个空间充足的盘点 Apply restart。定制模特报 Connection Refused → 等服务预热识别ASR服务启动很慢服务端刚拉起来就点创建很容易撞Connection refused。启动后等 3-5 分钟再克隆内存小于 32G 的机器甚至可能起不来。仍失败的话从设置菜单点打开日志或在文件管理器里翻客户端日志文件定位模特创建失败素材里没有声音报错提到音频或文件不存在时先回查素材本身有没有音轨。克隆音色完全依赖素材里的原声静音片段、纯 BGM 视频都不行重拍一段带清晰口播的视频即可。按硬件调渲染分辨率和帧率由源素材决定下表可以当拍摄规划参考配置档位分辨率帧率批处理大小适合场景入门720p24fps1短口播视频主流1080p30fps2讲课与口播高端1080p60fps4专业级创作三个服务暴露的端口18180 语音、8383 视频合成和本地数据目录都集中在 src/main/config/config.js。二次开发一个 JSON 示例想在自己的脚本里直接调视频合成请求体长这样客户端内部逻辑可对照 src/main/service/video.js{ audio_url: {音频文件路径}, video_url: {模特视频路径}, code: {唯一uuid}, chaofen: 0, watermark_switch: 0, pn: 1 }POST 到http://127.0.0.1:8383/easy/submit再带code去/easy/query查进度。四、30秒搞懂AI数字人本地部署背后在干什么 你可以把它理解成给一段配音换脸声音、画面各归各位最后缝在一起。视觉建模——你上传的 10 秒视频系统从中学会了你五官的位置和动法之后无论说什么脸上每个点都知道该往哪走所以口型变化时脸还是那张脸。语音克隆——程序先把你素材里说的话转成文字再对照这段原声学会你的音色和语调之后合成任何文本都像你说话入口在 src/main/service/voice.js。多模态驱动——输入文案后文本先变成克隆音色的语音视频服务再按语音的节奏逐帧驱动口型与表情音画对齐后就是最终的成片。五、换个用法三类高频场景参数对照场景分辨率语速表情倾向典型用途在线授课1080p0.9x自然中性、偶尔微笑系列课程口播形象前后统一自媒体短视频720p-1080p1.1x情绪饱满、贴合内容每日资讯与产品快评走量出片企业宣传1080p1.0x正式稳重、克制微笑公司介绍与产品演示替代外拍回到开头那个场景10 秒素材加一句文案就是全部入场券。三个服务已经跑在本地现在打开客户端点Create Avatar把你第一条数字人视频做出来吧。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →