开源项目 · Python · MIT · 视频

在视频工作流中的位置
Whisper 是 OpenAI 2022 年 9 月公开的开源语音识别(ASR)模型,GitHub ★68k+,MIT 协议,主语言 Python(PyTorch)。基于 Transformer 编码器-解码器架构,训练数据 68 万小时多语种监督数据,99 种语言(中文/英文/日语/法语/德语/西班牙语/阿拉伯语等)。提供 tiny / base / small / medium / large / large-v2 / large-v3 五档尺寸(从 39M 到 1550M 参数),VRAM 占用从 ~1GB 到 ~10GB;支持语音转文字、语音翻译(任意语言→英文)、语言识别、时间戳对齐。
核心能力围绕「多语种 + 多尺寸 + 多任务」展开。任务:transcribe(原语种转写)+ translate(任意语种→英文翻译)+ detect language(语种识别)+ alignment(词级时间戳);模型:tiny(39M,1GB VRAM,英文 WER ~7.6%)、base(74M,1GB VRAM)、small(244M,2GB VRAM)、medium(769M,5GB VRAM)、large-v3(1550M,10GB VRAM,英文 WER ~2.7%);输入 WAV/MP3/M4A/OGG/FLAC 等几乎所有音频格式,支持长音频自动切片(默认 30s 段);输出 SRT/VTT 字幕 + TXT/JSON + 词级时间戳;生态 HuggingFace Transformers / faster-whisper(CTranslate2 加速 4-5x)/ whisper.cpp(C++ 移植,边缘设备)/ WhisperX(说话人分离 + 强制对齐)/ Insanely-fast-whisper(批量推理)。派生模型 Distil-Whisper(HuggingFace 出品,6x 加速,49% 体积)、Whisper-Medusa(投机解码)、Whisper-Streaming(流式)。
适用场景:视频自动字幕生成(配合 MoneyPrinterTurbo / ShortGPT / Auto-Editor)、播客转文字、会议纪要、语音搜索(配合 LLM)、语音翻译、教学课件转写、无障碍辅助。硬件门槛:tiny/base 可 CPU 实时;small/medium 推荐 CPU/GPU;large 需 NVIDIA GPU(10GB+ VRAM);Apple Silicon(MPS)支持 medium;faster-whisper 让 large 模型在 CPU 上达到 4-5x 实时速度。上手路径:pip install -U openai-whisper → whisper audio.mp3 --language Chinese --model large-v3 --output_format srt;CLI whisper audio.mp3 默认 base 模型;Python API whisper.load_model("base").transcribe("audio.mp3")。
License 为 MIT,允许商业闭源使用、修改、再分发 — 这是 OpenAI 罕见地以宽松协议公开的核心 AI 模型。Whisper 与 VisLane 已收录的 descript(商用转写 + 编辑)定位关系:Whisper 是「命令行级开源 ASR 内核」,descript 是「商用 SaaS」(转写只是其子功能之一,主功能是文字驱动剪辑);两者在转写场景高度重叠 — Whisper 准确率与 large-v3 + faster-whisper 已逼近人类水平,descript 在 UI / 编辑体验上更强。Whisper 也可与 VisLane 待收录的 SadTalker / LivePortrait 互补 — Whisper 转音频为文字 → LLM 处理 → TTS 重新合成 → SadTalker/LivePortrait 生成数字人视频,构成完整「AI 数字人内容流水线」。
演示视频
效果展示

在视频工作流中的位置
快速开始
部署教程与文档以外链形式呈现,未做内嵌以保证时效性。