
faster-whisper 完整指南Whisper 转写提速 4 倍13 分钟音频 17 秒跑完【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper晚上 8 点你桌上有份 40 分钟的会议录音想宵夜前拿到带时间戳的逐字稿。丢进 faster-whisper纯 CPU 转写 13 分钟音频也要 ≈1 分 42 秒。它是用 CTranslate2 重写 OpenAI Whisper 的转写引擎≈ 给模型换了台更省油的推理引擎同等精度下最高提速 4 倍、占的内存更少。先盘一下家底 先看有没有 N 卡—— 有卡devicecudacompute_typefloat16没卡devicecpucompute_typeint8。注意新版 ctranslate2 只认 CUDA 12 cuDNN 9CUDA 11 的老环境要么升级要么退回 ctranslate23.24.0CUDA 12 cuDNN 8 则用4.4.0。按延迟挑模型档位—— 档位从tiny/base到small/medium再到large-v3/turbo越小越快越省。草稿速览选 small正式交付再上 largeREADME 实测 CPU 上 small int8 转 13 分钟音频约 1 分 42 秒对没卡的机器完全够用。环境只要 Python 3.9—— 音频解码靠 PyAV它把 FFmpeg 的库直接打进了自己的 wheel 里你不需要在系统里再装一遍 FFmpeg。最短安装路径 装 GPU 运行库用 N 卡才需要—— ctranslate2 推理时要调 cuBLAS 和 cuDNN缺了它们模型根本起不来Linux 上可以直接 pip 装pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*如果加载时报cuDNN not found或 CUDA 版本不匹配说明库没进环境变量或版本对不上 CUDA 12回到上一步按 README 的 GPU 一节把库目录加进LD_LIBRARY_PATH核对路径。装本体—— 一行把 ctranslate2、tokenizers、PyAV 全部带齐这是整个 faster-whisper 安装教程里唯一的核心命令pip install faster-whisper如果import faster_whisper报 ctranslate2 版本冲突说明机器上已有旧版用pip install --force-reinstall ctranslate24.4.0锁版本即可。验证环境—— 一行确认解码库和本体都能导入、顺手看看版本号不用准备任何音频文件python3 -c import av, faster_whisper; print(faster_whisper.__version__, av.__version__)如果报av触发本地 C 编译错误说明 pip 拉到了源码包而不是 wheel换官方预编译包别在 Windows 上硬编译。第一次跑通8 行代码出带时间戳的转写 先看懂两个参数compute_typeint8是 CPU 上最省内存的精度速度还比 fp32 快约 1 倍README 实测 1 分 42 秒 vs 2 分 37 秒beam_size默认就是 5调大更准但更慢第一次跑不用动。vad_filter在当前版本默认开启VAD ≈ 先把没声音的段落剪掉模型不白算默认只剪掉超过 2 秒的静音。手头没有音频文件就先 clone 仓库拿自带的测试片段git clone https://gitcode.com/GitHub_Trending/fa/faster-whisper用 tests/data/jfk.flac 直接跑from faster_whisper import WhisperModel model WhisperModel(small, devicecpu, compute_typeint8) segments, info model.transcribe(tests/data/jfk.flac, beam_size5) print(f语言 {info.language}置信度 {info.language_probability:.2f}) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})最容易被忽略的坑segments是个生成器真正跑转写发生在你 for 循环遍历它的那一刻想立刻跑完或把结果存下来复用先segments list(segments)。另外首次加载模型会从 Hugging Face Hub 自动下载并缓存第一遍慢是正常的。再往上提一档批量推理把 1 分钟压到 17 秒BatchedInferencePipeline是WhisperModel.transcribe的平替把片段攒成批一次喂给模型比逐句解码快一个量级它对 VAD 默认开启长音频直接受益。注意batch_size是吃显存的8GB 卡上别贪心from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(large-v2, devicecuda, compute_typefloat16) pipeline BatchedInferencePipeline(modelmodel) segments, _ pipeline.transcribe(audio.mp3, batch_size8) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})README 基准13 分钟音频、RTX 3070 Tilarge-v2 fp16 逐批解码 1 分 03 秒、显存 4525MB换batch_size8压到 17 秒显存升到 6090MB改 int8 后 59 秒 / 2926MBint8 batch8 再压到 16 秒。CPU 侧 small 模型 int8 batch8 用 51 秒约为 fp322 分 37 秒的 1/3。选型对照模型档位与资源速查表档位或参数典型场景资源量级smallCPU int8草稿速览、笔记本离线转写内存 ≈1.5GB实测 1477MBmedium fp16速度与精度取中间档显存 ≈5GB估算large-v2 fp16N 卡日常交付显存 ≈4.5GB实测 4525MBlarge-v2 int8同模型再省一半显存显存 ≈2.9GB实测 2926MBlarge-v3 / turbo fp16高精度正式出稿显存 ≈10GB估算报错自查清单如果报cuDNN not found或 CUDA 版本不匹配 → 说明 CUDA 12 运行库没被找到 → 核对LD_LIBRARY_PATHCUDA 11 环境换 ctranslate23.24.0CUDA 12 cuDNN 8 换4.4.0。如果报ImportError或 ctranslate2 版本冲突 → 说明机器上残留旧版 ctranslate2 →pip install --force-reinstall ctranslate24.4.0锁版本。如果transcribe返回了却没打印任何内容 → 说明segments是生成器还没被遍历 → 包一层segments list(segments)或用 for 循环消费。如果报显存不足OOM→ 说明compute_type或batch_size太激进 → 换int8_float16砍显存或把batch_size调小。接下来往哪做3 个深挖方向想做字幕或卡拉 OK 的词级时间戳transcribe加word_timestampsTrue每个seg.words里都有起止时刻全部参数看 faster_whisper/transcribe.py。音频长、说话占比低时调 VAD 省算力传vad_parametersdict(min_silence_duration_ms500)收紧静音切分各参数默认值在 faster_whisper/vad.py。手上有自训练权重用ct2-transformers-converter转成 CTranslate2 格式再加载方法见 README.md 的 Model conversion 一节更多跑分脚本在 benchmark/。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考