HeyGem.ai 数字人本地部署全解:10秒克隆数字分身
HeyGem.ai 数字人本地部署全解10秒克隆数字分身【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想让人替你念口播又不想出镜HeyGem.aiDuix.Avatar是一个开源数字人项目录 10 秒视频它就能克隆你的形象和声音之后输入文案自动产出口型对得上的口播视频全程本地离线跑素材不出内网。#个人创作者 #课程制作 #数字营销能不能跑数字人硬件配置对照先给结论必须有 NVIDIA 显卡这是硬门槛。项目里语音克隆、语音识别、视频合成三个 AI 服务全部依赖 GPU 算力没有独显或驱动没装好服务根本起不来。集成显卡、纯 CPU 方案请绕行。配置项够用线舒适线作用显卡NVIDIA 8GB 显存RTX 4070 及以上三个 AI 服务全部跑在 GPU 上是速度瓶颈内存16GB32GB模型加载与容器运行CPU6 核13 代 i5 或更高客户端与容器调度磁盘数据区 30G 镜像区 100GSSD存放克隆视频和 Docker 镜像系统Win10 19042 / Ubuntu 22.04同上并开启 WSL2容器运行环境两条系统级建议装好 NVIDIA 驱动后在终端执行nvidia-smi。你应当看到显卡型号、显存大小和驱动版本号这是后面一切部署的前提。拉取镜像默认走 Docker Hub国内网络下很慢进阶档会教你配国内镜像源。它怎么做的从10秒视频到成片把数字人克隆理解成录模板你录的 10 秒视频就是教 AI 认脸和听声的样本。脸是面具声音是声纹之后给它任何文案它就照着模板开口说话。拆开看整条流水线是四个环节语音克隆TTS从你的音频样本里学音色、语调之后用这个声音朗读任意文本。语音识别ASR把你视频里说的话转成文字作为声音训练的参考文本。Face2Face 视频合成以原视频为模板按新音频的口型逐帧生成新的面部画面这是换口型的核心。音视频合成引擎把新画面和克隆语音按节奏对齐输出最终视频。客户端本身是个 Electron 桌面程序源码在 src/main/service/video.js 可见它如何调度所有重活都丢给本地三个 Docker 服务TTS 占 18180 端口、视频合成占 8383 端口。边界清单——这些它目前做不到只能克隆会说话的上半身复杂肢体动作、走动场景不在能力范围内。源视频必须有清晰人声且是说话状态静音视频会直接报错。源视频质量决定上限光线暗、侧脸、多人出镜效果都会打折。文案语言支持中文、英、日、韩、法、德、阿、西共 8 种超出范围不保证效果。怎么跑起来数字人本地部署最小路径快速档5 分钟跑通git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai你应当看到当前目录下出现HeyGem.ai文件夹里面有deploy部署配置等目录。cd HeyGem.ai/deploy docker-compose up -d首次执行会拉取约 70G 流量耗时半小时以上。完成后你应当看到docker ps里三个容器均为 Runningduix-avatar-tts、duix-avatar-asr、duix-avatar-gen-video。最后装客户端用官方构建的安装包Windows 双击 exe、Ubuntu 用 AppImage启动即可。打开后你应当看到主页两个大入口——创建视频和创建虚拟形象上传 10 秒视频完成克隆再输文案就能生成成片。如果卡住了先确认三个服务是否都在 Running再确认nvidia-smi有输出。哪个服务异常就点开该容器复制日志排查方式见 doc/常见问题.md 的截图说明。进阶档按机器对号入座显存 8GB 左右想省着用用 lite 配置只启动视频合成服务声音改用你自己录的音频cd HeyGem.ai/deploy docker-compose -f docker-compose-lite.yml up -d你应当看到只有一个容器Duix.Avatar-gen-video启动。RTX 50 系列5090 已验证30/40 系列 CUDA 12.8 用户也可用换专用编排文件docker-compose -f docker-compose-5090.yml up -d拉镜像慢就给 Docker 加国内镜像源在/etc/docker/daemon.json写入{ registry-mirrors: [ https://hub.fast360.xyz, https://hub.littlediary.cn ] }保存后重启 Docker。你应当看到镜像从新源拉取速度明显回升。⚠️ 首次拉镜像约 70G 流量且 Windows 需要 C 盘 100G 存镜像文件——连上 WiFi 再执行空间不足时在 Docker 设置里改Disk image location。⚠️ 所有算力都在本地装完驱动先跑一遍nvidia-smi再部署能省掉大量服务起不来的排查时间。如果卡住了镜像源随时间会失效遇到request canceled类报错直接翻 doc/常见问题.md 里的最新可用镜像列表替换即可。跑得更好资源分配与批量生成方向一把 Docker 的资源配额调大。WSL 版 Docker 默认只分到很少的内存和 CPU视频合成会明显变慢。打开 Docker Desktop → Settings → Resources → Advanced具体操作CPU 分配系统总核心的 50%内存给到 16GB 以上Disk image location 指到 SSD 分区提升镜像读写。你会看到合成一条 1 分钟视频的时间明显缩短多个任务排队也不卡顿。方向二用开放 API 做批量生成。服务启动后会在本地暴露接口写个脚本循环调用就能批量出片。以视频合成接口为例请求体最小配置{ audio_url: 音频文件路径, video_url: 源视频路径, code: 唯一任务编号, chaofen: 0, watermark_switch: 0, pn: 1 }POST 到http://127.0.0.1:8383/easy/submit再用code轮询easy/query查进度文案转语音则调用 18180 端口的 TTS 接口参数示例都写在 README 的开放 API一节里。你会得到一条不依赖客户端界面、可脚本化跑批的自动化流水线。目前它克隆的仍是会说话的上半身做不到舞蹈和复杂肢体语言随着模型迭代离线数字人离生产级只会越来越近。你打算让第一个 10 秒样本视频替你念出哪句话【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →