SadTalker:一张肖像照片,5 分钟做出会说话的 talking head 视频
SadTalker一张肖像照片5 分钟做出会说话的 talking head 视频【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker你录好了三十秒的配音配图里的头像却一动不动看着总差点意思。SadTalker 干的就是这件事给它一张肖像图和一段音频输出口型对得上的 talking head会说话的人脸视频。它到底能干什么SadTalker 出自 CVPR 2023思路不是逐帧去改脸而是先学出一套「3D 运动系数」描述头部怎么转动、表情怎么收缩的一组参数再由音频驱动这些系数去合成画面。先记住四件事一张肖像图 一段音频 一段说话视频。源图只需要一张静态照片音频可以是自录的也可以是现成的解说。口型不机械。嘴形和头部动作由同一套系数联动不容易出现嘴在动、脸是死的的割裂感。原图风格被保留。写实照片也好、风格化插画也好生成的 talking head 视频都保持原有质感给插画角色做虚拟主播不会显得突兀。能从参考视频借表情和头动。用--ref_eyeblink和--ref_pose从一段视频里提取自然的眨眼与头部动作叠加到数字人虚拟说话头像上结果不像定住的雕像。5 分钟跑通环境要求一句话说完建议 Python 3.8有 CUDA 显卡更好没有也能用 CPU 跑就是慢ffmpeg读写音视频的工具必须装。最短路径四步克隆源码把项目拿下来git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker安装 Python 依赖Linux/Mac 记得先跑 conda install ffmpeg 或 brew install ffmpeg 装好 ffmpegpip install -r requirements.txt一键下载全部模型权重脚本会自动放进 checkpoints/ 目录bash scripts/download_models.sh启动本地 WebUI基于 Gradio 搭建的网页界面浏览器打开 http://localhost:7860 上传图片与音频python app_sadtalker.pyWindows 用户直接双击 webui.bat 也行。想在 WebUI 里用文字转语音额外执行pip install tts。只想跑单个视频的话可以跳过 WebUI直接调 inference.py结果会按时间戳命名存在 results/ 里。效果怎么调所有旋钮都在 inference.py 的命令行上按你的目标挑着用想要的效果动的参数推荐取值预期效果表情更生动或更收敛--expression_scale0.5–1.5默认 1.0 自然调大更夸张小于 0.5 偏木讷全身图只动脸--preprocess full --still开full 让原图整体参与动画still 把头姿贴近原图证件照式整脸动--preprocess resizeresize整图缩放后生成整脸 talking head半身以上图片慎用脸更清晰--enhancer gfpgangfpgan 或 RestoreFormer用 GFPGAN人脸修复网络增强面部糊感明显减轻眨眼更自然--ref_eyeblink参考视频路径借视频的眨眼视频比音频短会自动循环更高分辨率--size256 或 512512 用高分辨率面部模型质量更好但更慢默认的 crop 模式最稳先裁出人脸区域再生成动画。换模式时下面这类证件照风格的输入配合 resize 效果最好。三种典型玩法最常见的是教学讲解或知识科普。输入一张半身像加一段一分钟的中文解说 wav在 WebUI 里保持默认 crop 模式点生成。产出是 results/ 里一段口型跟着解说走的半身 talking head 视频直接剪进网课就能用。除了半身像全身图也能动。输入一张全身照命令是python inference.py --driven_audio audio.wav --source_image 图片.png --preprocess full --still --enhancer gfpgan。产出是身体保持原姿态、只有脸部在动的全身说话视频适合做虚拟发言人。如果场景换成插画角色流程完全一样。输入风格化肖像和一段配乐或解说按默认参数跑即可。产出是保留画作风质的虚拟主播形象做主播头像或短视频出镜人都行。常见坑与解法ffmpeg not recognizedffmpeg 缺失或不在系统 PATH 里。用 conda install ffmpeg 或 brew install ffmpeg 安装Windows 下载官方版本后加入 PATH。加载模型报 unexpected EOF 或文件不存在权重没下载完整。重跑 bash scripts/download_models.sh脚本会自动跳过已下载的文件并核对 checkpoints/ 里的文件大小。CUDA out of memory渲染模型显存需求大。先执行 export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128 再重跑也可以把 --size 降到 256或加 --cpu 用 CPU 跑。口型对不上音频格式不支持或表情幅度调太高。模型只接受 wav 或 mp3必要时把 --expression_scale 降到 0.5–1.0 再试。图片生成失败或脸部崩坏模型只对真人或写实风人像生效。换成真实照片或写实风格肖像纯动漫二创角色目前不支持。想再深入一点想系统性调参完整的参数表和各模式对比案例在 docs/best_practice.md适合把效果抠到细节的人。想看 3D 运动系数长什么样加--face3dvis可输出三维脸与关键点额外配置步骤见 docs/face3d.md适合对 3DMM三维可变形人脸模型做研究的人。想读源码或改模型音频到系数的核心模块在 src/audio2exp_models/脸部渲染在 src/facerender/适合准备自己训权重的人。最快的上手方式就是跑起来从 examples/source_image/ 挑一张肖像从 examples/driven_audio/ 挑一段音频今天就能用默认参数生成你的第一条 talking head 视频。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →