开源项目 · Python · Apache-2.0 · 视频

在视频工作流中的位置
SadTalker 是 OpenTalker 团队的开源音频驱动人脸动画项目,2023 年 CVPR 收录论文,Apache-2.0 商业可用协议,GitHub 主语言 Python (PyTorch)。输入一张人像图 + 一段音频,生成与音频同步的说话视频(头部姿态自然、唇形对齐),支持多语言、多风格、参考图驱动。ComfyUI 节点 ComfyUI-SadTalker 在 AI 创作社区最广泛使用。
核心能力围绕「3D 运动系数 + 风格化驱动」展开。模型架构 通过 ExpNet(表情系数生成)+ PoseNet(头部姿态系数生成)+ Audio2Coeff(音频→系数映射)三阶段网络,学习 3DMM(3D Morphable Model)运动系数;再用 3D-aware face renderer 合成最终视频帧。相比 Wav2Lip(只动嘴)、First Order Motion(整体迁移),SadTalker 在「头部自然转动 + 嘴型对齐精度 + 表情风格化」三个维度取得平衡。输入 单张人像(任意角度,正脸效果最佳)+ 任意长度 WAV / MP3 音频;支持 reference image 风格迁移(动漫 / 油画 / 老照片);支持 still mode(只动嘴)/ full mode(头部+嘴)/ reference mode(参考图驱动)。输出 MP4 视频 25-30 FPS;可选 512x512 / 256x256 分辨率。生态 ComfyUI-SadTalker 节点(社区最广);Windows / Linux / macOS 全平台;Docker / Gradio Demo / 命令行三种形态。
适用场景:数字人口播视频生成(企业宣传 / 教育 / 营销)、有声书 / 播客可视化、AI 配音动画、虚拟形象 + TTS 工作流的最后一步。硬件门槛:CPU 可跑 demo(慢,5-10 秒生成 1 秒视频),推荐 GPU(NVIDIA 6GB+ VRAM);模型权重 ~2GB。上手路径:git clone → 下载预训练权重到 checkpoints/ → python inference.py --driven_audio <wav> --source_image <png> --result_dir <out>;ComfyUI 用户安装 ComfyUI-SadTalker 节点后可在工作流中拖拽使用。
License 为 Apache-2.0,商业可用 + 专利授权 + 商标免责;论文要求引用 SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio Driven Talking Face Animation (CVPR 2023)。VisLane 已收录的 lip-sync / digital-human 标签目前关联偏弱(2 + 1),SadTalker 入库后将帮助 lip-sync / digital-human tag 关联数提升至 3 + 2,达 Pills 门槛;SadTalker 也可与 VisLane 已收录的 HeyGen(商业数字人)对位开源替代。若需进一步提升质量(更自然头部姿态、更长视频),可结合 VisLane 待收录的 LivePortrait(肖像动画 SOTA)与待收录的 MuseTalk(腾讯实时口型)使用。
演示视频
效果展示

在视频工作流中的位置
快速开始
部署教程与文档以外链形式呈现,未做内嵌以保证时效性。