10秒克隆你的AI数字人:Duix.Avatar离线部署指南
10秒克隆你的AI数字人Duix.Avatar离线部署指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar你每周要录一条 30 秒的产品口播每次对着镜头念稿都念到想吐Duix.Avatar 是一款免费开源数字人项目离线克隆你的形象和声音克隆完贴文案就出口播视频。它到底是什么一句话定义Duix.Avatar 是支持本地部署和 API 调用的数字人开源项目全程不需要联网。AI数字人数字人克隆离线部署和同类方案比它的差异点很直接商业数字人服务按字数或包月收费素材要上传云端它完全开源免费使用、不限量生成传统数字人制作要团队、要专业设备它只需要一段 10 秒左右的人说话视频所有算力都在你自己电脑上三个 Docker 服务本地跑素材和声音数据不出机器ASR、声音克隆、口型合成三件套打包好了不用自己找模型、拼管线支持多模型管理一次可以克隆多个形象在列表里按需切换客户端是个单窗口程序会点鼠标就能用不用读技术文档它能帮你做什么用 10 秒视频克隆自己的形象和声音原理系统先用 ffmpeg 把你提交的视频分离成静音视频和音频音频送去 TTS 服务完成声音克隆静音视频则留作口型驱动的素材。录一段 10 秒左右的视频清晰、有声音、人在说话这三样缺一不可主界面点「Create Avatar」选择本地视频文件客户端自动完成 H264 转码、音频提取和声音模型训练效果几分钟之后「My Avatars」列表里多了一个新数字人点开就能试听试看。贴一段文案就出口播视频原理TTS 服务把你的文字用克隆出来的声音合成语音口型合成服务再驱动静态素材生成最终成片。点「Create Video」选择刚训练好的数字人贴上文案也可以直接上传自己录好的音频走语音驱动提交后任务自动排队、逐条生成「My Works」里能看到进度效果口型和节奏衔接得很自然生成完直接预览、导出即可客户端会自动轮询任务状态完成后列表即时刷新。用 API 把数字人塞进自己的产品三个服务起来后端口直接暴露在本机TTS 是 18180口型合成是 8383。绕开客户端你可以直接调同一套接口具体请求参数写在 模型训练服务 和 视频合成服务 里客户端本质上就是这些接口的薄封装。从零到一落地路径环境检查先看硬件和系统项目WindowsUbuntu系统版本Windows 10 19042.1526 或更高Ubuntu 22.04 Desktop内核 6.8.0-52-generic 已验证磁盘D 盘空闲 30G 以上数据C 盘 100G 以上镜像空闲空间 100G 以上内存32G 及以上必要32G 及以上必要显卡英伟达显卡并正确安装驱动推荐 rtx-4070同 Windows前置条件WSL2 Docker DesktopDocker NVIDIA Container Toolkit所有算力都在本地没有英伟达显卡和驱动是启动不了的先跑一下nvidia-smi确认能看到 GPU。Ubuntu 用户要先装好 Docker 和 NVIDIA Container ToolkitREADME 里有完整命令装过就跳过。C 盘空间不够时可以在 Docker Desktop 里把 WSL 磁盘镜像位置改到其他磁盘。Docker 三步起服务端git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d你应看到大约半小时后镜像流量约 70GDocker 里出现三个容器 duix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video全部 Running 即部署成功。配置低就换轻量版只保留视频生成服务docker-compose -f docker-compose-lite.yml up -dUbuntu 上则用docker-compose -f docker-compose-linux.yml up -d。装客户端并产出第一个作品到项目 release 页面下载对应安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 双击 AppImage 即可启动Ubuntu 桌面如果是 root 用户登录双击可能起不来在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox加个参数就好进主界面创建数字人上传那 10 秒视频训练完点「Create Video」贴文案队列跑完预览并导出你的第一条口播视频就有了进阶玩法API 最小可运行示例部署完成后http://127.0.0.1就能直接调合成服务。这是产出片子的最短路径# 提交口型合成任务音视频为挂载进容器的路径 curl -X POST http://127.0.0.1:8383/easy/submit \ -d {audio_url:/data/a.wav,video_url:/data/v.mp4,code:uuid,chaofen:0,watermark_switch:0,pn:1} # 轮询进度code 就是上面传的 uuid curl http://127.0.0.1:8383/easy/query?codeuuid提交成功后返回任务队列轮询到 data.status 为 2 表示合成完成可拿到结果路径。调参数水印、超分与八种语言chaofen是超分开关、watermark_switch是水印开关客户端里两者固定为 0自己调 API 可以按需改TTS 服务支持八种语言中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语训练和合成接口用lang参数指定声音克隆接口会返回asr_format_audio_url和reference_audio_text后续合成语音时要把这两个值原样传回去这是音色克隆能生效的关键钥匙给你路自己走。请求和返回的完整字段都在 README 的「开放 API」章节对着抄一遍就能用。踩坑记录症状docker-compose up -d报错registry-1.docker.io ... request canceled原因Docker Hub 官方源连接不稳定拉镜像中途断了解法到 Docker Desktop 的 Docker Engine 页给registry-mirrors加国内镜像源Apply 后重启。这个坑我踩过加上之后拉取速度快了一个量级。症状新建数字人模特提交就报错原因素材视频没有声音或者里面没有人说话。程序要靠这段声音做声音克隆没声音自然失败解法重录一段确保全程是本人清晰说话10 秒左右足够症状定制模特报Connection refused原因ASR 服务Duix.Avatar-asr启动慢没就绪时训练请求会被拒绝机器内存 16G 以下的话它可能干脆起不来解法服务端启动后等几分钟再做克隆仍失败就先确认 ASR 容器是否 Running症状客户端行为异常看不出问题在哪原因日志分客户端和服务端两份只盯一边永远查不到解法客户端日志在AppData\Roaming\heygem.ai\logs\main.log服务端日志在容器日志页直接复制两份都附上再提问。延伸技术路线目前是「ASR TTS 口型合成」的本地三件套架构已适配 Ubuntu 22.04 和 RTX 50 系列显卡5090 测试通过。社区更新很勤问题基本每天都在被解决升级最新版能治好一半的病。社区项目开源、免费商用用户量超 10 万或年营收超 1000 万美元的企业需签署商业许可协议排查指南见 doc/常见问题.md。适用场景短视频口播与产品宣传课程讲解与培训视频自媒体批量内容制作企业宣传与内训素材把数字人功能塞进自有产品学习资源deploy/docker-compose.yml三个服务的端口、挂载目录和 GPU 配置全貌LICENSE商业授权条款与边界README 的「开放 API」章节训练、合成、视频合成三组接口的完整字段回到开头那条 30 秒产品口播以后不用对着镜头了把文案丢给 Duix.Avatar你自己的数字人会把录制完成。第一次看到生成视频时的反应你会明白它为什么这么火。打开终端跑起来。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →