Duix.Avatar 数字人本地部署指南:10 秒视频克隆专属数字人与声音
Duix.Avatar 数字人本地部署指南10 秒视频克隆专属数字人与声音【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款开源数字人工具包全程本地运行提交一段 10 秒视频即可完成数字人形象与声音克隆输入文案即可生成口播视频。本文跑通 Windows 与 Ubuntu 的完整部署流程。项目速览Duix.Avatar 是一款支持本地部署与 API 调用的数字人工具包。客户端是桌面应用服务端由三个 Docker 容器承载算力全部跑在你自己的机器上素材不需要上传。能力项说明适用场景数字人形象克隆提交 10 秒左右视频训练出专属数字人模型个人 IP、短视频固定出镜角色声音克隆从视频音轨中提取说话人音色无需单独录音个人配音、口播播报文案生成视频输入文本即生成口型匹配的播报视频批量短视频制作音频驱动上传现成音频直接驱动数字人口型已有录制的旁白素材多语言支持文案支持中、英、日、韩、法、德、阿、西 8 种语言多语言内容产出开放 API本地暴露端口可接入自有系统业务二次开发环境准备与配置检查部署前先确认机器满足两个硬性条件NVIDIA 显卡且驱动装好、内存不低于 32GB。本项目所有算力都在本地没有显卡三个服务根本起不来。其余配置按下表对照项目最低配置推荐配置系统Windows 10 19042.1526 或更高Ubuntu 22.04 亦可同左CPU近几代桌面 CPU13 代 Intel i5-13400F内存32GB必要32GB 及以上显卡英伟达显卡 正确安装的驱动RTX 4070磁盘数据盘 30GB存镜像的盘 100GB同左 稳定的 Wi-Fi 或网线Windows 需要单独留一个 D 盘存放数字人和作品C 盘存放 Docker 镜像文件。Ubuntu 只要求磁盘空闲空间大于 100GB。三条命令自查环境nvidia-smi # 预期右侧显示显卡型号与显存 wsl --list --verbose # Windows预期显示发行版且 VERSION 为 2 free -h # Ubuntu预期 Mem 总量 32GiB 以上部署实操从一台空机器到第一条口播视频大约一小时其中大部分时间耗在拉取镜像上实际操作只有几条命令。配置 WSL 与 DockerWindows先看上一条自查命令的输出如果没有任何发行版先安装过程中会要求设置用户名和密码记住它wsl --install # 安装 WSL网络原因失败就多试几次 wsl --update # 更新 WSL 内核到最新版接着从 Docker 官网下载 Windows 版 Docker Desktop 安装包按 CPU 架构选择安装后启动接受协议并跳过登录。注意C 盘剩余空间不足 100G 时进入 Docker Desktop 的 Settings → Resources → Advanced通过 Disk image location 把镜像盘换到剩余空间大于 100G 的磁盘再 Apply restart。首次拉取约 70GB 镜像速度慢或超时的话进入 Settings → Docker Engine 添加 registry-mirrors 配置再 Apply restartUbuntu 用户跳过本节直接看本章末尾的方案。一键拉起服务集群git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d # 首次拉取约 70GB 镜像局域网环境约半小时三个服务各管一段流水线duix-avatar-asr语音识别把训练音频转成文本端口 10095duix-avatar-tts语音合成把文本变成克隆音色的音频端口 18180duix-avatar-gen-video视频合成产出最终口播视频端口 8383Windows 下作品与模型文件默认存放在D:\duix_avatar_data这就是 D 盘要求 30GB 以上的原因。成功标志docker-compose ps中三个容器均为 Running 状态。docker-compose ps # 预期3 个服务全部 Running内存紧张可改用 lite 版只保留视频合成服务docker-compose -f docker-compose-lite.yml up -d # 预期仅 1 个服务 duix-avatar-gen-videoRTX 50 系列显卡使用专门的 compose30/40 系列装了 CUDA 12.8 也可用它docker-compose -f docker-compose-5090.yml up -d # 预期3 个服务全部 Running四份 compose 文件都在 deploy/ 目录按硬件选一份即可。安装并启动客户端从官方发布页下载 Windows 版Duix.Avatar-x.x.x-setup.exe双击安装并启动。首页会列出三个服务的连接状态全部变绿即部署完成。Ubuntu 下载 Linux 版双击Duix.Avatar-x.x.x.AppImage即可启动无需安装root 桌面环境下需在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox。Ubuntu 22.04 方案sudo apt update sudo apt install -y docker.io docker-compose # 安装 Docker 与 docker-compose再按官方文档安装 NVIDIA 驱动装完执行nvidia-smi应显示显卡信息并按官方文档安装 nvidia-container-toolkit 让 Docker 能调用显卡然后sudo nvidia-ctk runtime configure --runtimedocker sudo systemctl restart docker # 预期重启后 docker --version 正常 cd deploy docker-compose -f docker-compose-linux.yml up -d # 预期3 个服务全部 Running镜像下载慢时在/etc/docker/daemon.json里加上 registry-mirrors 再重启 Docker。功能实测部署完成后第一件事是用自己的 10 秒视频训练数字人。创建数字人模特入口首页 → 蓝色 Create Avatar 卡片 → 上传视频。程序会把视频拆成静音视频 音频画面用于形象音频用于声音一次完成两项克隆。参数建议值说明视频时长10 秒左右不必刻意加长音频必须包含人在说话程序靠这段音频做声音克隆无声视频不行画面人脸清晰、镜头稳定降低训练失败概率成功标志模型出现在 My Avatars 列表中带名称和时间戳。注意若报 file not exists先检查视频里有没有可提取的人声音轨。生成口播视频入口首页 → Create Video 卡片 → 选择模特 → 输入文案或上传音频 → 等待合成。参数可选项说明输入方式文本输入文案用克隆音色合成语音再对口型输入方式音频上传现成旁白音频直接驱动口型文案语言8 种中、英、日、韩、法、德、阿拉伯、西班牙模特任一已训练模型可随时切换成功标志My Works 中多出一条作品可播放、可下载。调用 API可选Docker 启动后服务在本地暴露端口可以绕过客户端把数字人能力接进自己的系统。调用顺序先模特训练再音频合成最后视频合成前一步的返回值是后一步的入参。接口地址用途模特训练http://127.0.0.1:18180/v1/preprocess_and_tran预处理训练音频返回参考音频及其文本音频合成http://127.0.0.1:18180/v1/invoke文本 → 克隆音色音频视频合成http://127.0.0.1:8383/easy/submit音频 模型 → 口型匹配视频进度查询http://127.0.0.1:8383/easy/queryGETcode 取合成接口的唯一 key请求参数示例见 README_zh.md 的开放 API一节客户端调用实现可参考 src/main/service/。性能调优与进阶技巧默认的 docker-compose.yml 面向 i5 RTX 4070、32GB 内存这一档调优其他档位的机器按下面这张表选配置项推荐值适用硬件档位服务组合docker-compose-lite.yml仅视频合成服务内存或显存偏紧的机器5090 专用 composedocker-compose-5090.ymlRTX 50 系列CUDA 12.8 的 30/40 系列也可用PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:512已内置于配置8G 显存档【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →