开源项目 · Python · Apache-2.0 · 视频

在视频工作流中的位置
MuseTalk 是腾讯 TMElyra 实验室 2024 年 3 月公开的开源实时口型对齐模型,GitHub ★3.5k+,Apache-2.0 商业可用协议,主语言 Python (PyTorch)。与 VisLane 已收录的 SadTalker(音频驱动全脸动画)定位互补 — MuseTalk 专注「嘴型」单一维度,不做头部姿态驱动,通过 latent space inpainting 实现参考人脸 + 音频 → 嘴型同步视频,推理速度 30+ FPS 单张 NVIDIA GPU,在实时直播 / 实时客服 / 视频会议换脸场景下是事实标准。
核心能力围绕「实时口型同步 + 跨身份泛化」展开。模型架构 基于 reference-based latent diffusion inpainting:输入参考人脸图像 + 目标音频 → 在参考人脸的嘴部区域做 inpainting,生成与音频同步的嘴型;不修改头部姿态 / 表情 / 眼睛 — 专注嘴部单点。推理速度 单张 NVIDIA RTX 3090/4090 可达 30+ FPS(512x512 分辨率),具备实时能力;支持 batch inference;FP16 半精度降低显存。训练数据 中文 + 英文多语种音频,跨身份泛化能力强(无需对每个目标人微调)。输入 单张参考人脸(任意角度)+ 任意长度 WAV/MP3 音频;输出 MP4 视频,25-30 FPS,512x512 / 768x768 分辨率可选。生态 集成 Whisper 转写 + MuseTalk 生成的端到端 pipeline;ComfyUI-MuseTalk 节点(社区版本);Windows / Linux / macOS 全平台。
适用场景:实时直播数字人(配合 LivePortrait 头部姿态)、实时视频会议换脸(配合 OBS 虚拟摄像头)、客服 AI 数字人口型对齐(配合 LLM 对话 + TTS)、短剧 / 短视频二次配音口型替换、教育课件角色化。硬件门槛:CPU 跑 demo(很慢,3-5 秒/帧),推荐 NVIDIA GPU(8GB+ VRAM,RTX 3090 起);若需实时流(30 FPS),推荐 RTX 4090 / A100。上手路径:git clone → 下载预训练权重到 checkpoints/ → python inference.py --reference_image <jpg> --audio_path <wav> --output_video <mp4>;ComfyUI 用户安装 ComfyUI-MuseTalk 节点。
License 为 Apache-2.0,商业可用 + 专利授权 + 商标免责。MuseTalk 与 VisLane 已收录的 SadTalker(音频驱动全脸动画)/ LivePortrait(肖像动画 SOTA)定位关系:SadTalker 是「全脸驱动」(音频 → 嘴型 + 头部姿态 + 表情),MuseTalk 是「嘴型专注」(音频 → 嘴型,不动头部),LivePortrait 是「视频驱动」(参考视频 → 全脸动画,非音频);三者结合可实现「音频 + 姿态协同」的高质量数字人:音频控制嘴型(MuseTalk)+ 视频控制头部姿态(LivePortrait)→ 完美对齐数字人;若需头部驱动且只用一个工具,选 SadTalker;若需实时流且只对口型,选 MuseTalk。
演示视频
效果展示


在视频工作流中的位置
快速开始
部署教程与文档以外链形式呈现,未做内嵌以保证时效性。