faster-whisper:一条命令把一小时音频转成文字,比原版 Whisper 快 4 倍 faster-whisper一条命令把一小时音频转成文字比原版 Whisper 快 4 倍【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper一小时的会议录音手动整理要半天用原版开源 Whisper 转老笔记本上还得再等一个多小时。faster-whisper语音转文字把 OpenAI 的 Whisper 模型用 CTranslate2 推理引擎重写官方基准里 13 分钟音频最快 59 秒跑完比原实现最多快 4 倍显存占用还更低。不需要额外装 FFmpeg一条 pip 命令装完就能用。它凭什么快这么多CTranslate2 的加速原理Whisper 本身是一个 Transformer 架构的模型可以理解为用神经网络预测下一秒该输出什么词瓶颈在于推理引擎的算力和内存调度。faster-whisper 不改模型参数只把推理层换成 CTranslate2OpenNMT 团队维护的 Transformer 专用推理引擎它针对注意力计算和内存布局做了底层优化。在此基础上还能开启 8-bit 量化int8把权重从 16 位压到 8 位精度损失很小让 CPU 和 GPU 上再快一截、内存占用直接砍半。faster-whisper 安装方法一条命令 硬件要求环境门槛很低Python 3.9 及以上无需手动安装 FFmpeg——音频解码由 PyAV 库自带 FFmpeg 运行库的 Python 包完成装好即用普通 CPU 即可跑有 NVIDIA 显卡更快安装只需一条命令pip install faster-whisper想用 GPU 加速补装两个 NVIDIA 库即可pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*。注意最新的 ctranslate2 只支持 CUDA 12 cuDNN 9如果你的环境是 CUDA 11/cuDNN 8需要降级到ctranslate23.24.0CUDA 12 cuDNN 8 则用ctranslate24.4.0。5 行代码跑通转写第一段音频from faster_whisper import WhisperModel model WhisperModel(base, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})运行后每段话会带上起止时间戳和文本自动检测语言。注意segments是生成器真正开始转写是在 for 循环遍历时有 GPU 的话把device改成cuda、compute_type换成float16或int8_float16即可。实际能干什么三个高频场景视频字幕转录时打开word_timestampsTrue拿到词级时间戳逐词对齐后导出 SRT 字幕文件做字幕比手工打轴快得多。会议记录长录音先过一遍内置的 Silero VAD静音检测模型自动剪掉没有声音的片段vad_filterTrue开启减少无效计算产出的分段文本可直接交给摘要工具。内容创作与播客一次转写多段长音频配合BatchedInferencePipeline批量推理batch_size8时官方数据里 13 分钟音频只要 17 秒把视频素材批量转成文稿做选题、二创或检索。核心转录逻辑都在 transcribe.py 里想调参数可以直接看WhisperModel.transcribe的完整选项。性能参考faster-whisper 与原方案的实测对比以下数据来自仓库 README 的官方基准13 分钟音频8 线程 CPU / RTX 3070 Ti 8GB GPU不是营销话术GPU 上跑 large-v2 模型实现精度耗时显存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperbatch_size8fp1617s6090MBfaster-whisperint859s2926MBCPU 上跑 small 模型Intel i7-12700K实现精度耗时内存openai/whisperfp326m58s2335MBfaster-whisperint81m42s1477MBfaster-whisperbatch_size8int851s3608MB简单结论显存紧张或没有 GPU 时优先选 int8 量化内存和速度两头都赚批量处理长音频再考虑batch_size。常见问题 FAQ版本不匹配、显存不足、识别不准问GPU 报 cuDNN/cuBLAS 找不到或版本不兼容怎么办 答确认你的 CUDA 和 cuDNN 版本最新 ctranslate2 只认 CUDA 12 cuDNN 9。CUDA 11 环境用pip install --force-reinstall ctranslate23.24.0降级CUDA 12 但 cuDNN 8 则降到 4.4.0。也可以直接用官方 CUDA Docker 镜像nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu22.04避开手动装库的坑。问显存不够、报 OOM 怎么办 答先换低精度compute_typeint8_float16large-v2 的显存占用能从约 4.5GB 降到约 2.9GB再不行就换更小的模型small/base或减小batch_size。8GB 显存的卡跑 large-v2 开批量推理时占用约 6GB建议留点余量。问转出来有重复、漏字、专有名词错怎么改 答几个开关值得试vad_filterTrue过滤静音段能减少模型脑补明确的语种别让它猜直接传languagezh等参数对人名、术语多的内容用hotwords传入提示词想核对每个字的时间点可开word_timestampsTrue。如果你手头有大量音频要批量转文字或者受限于 CPU 和有限显存faster-whisper 值得直接作为首选方案只偶尔转一段短视频原版工具也够用。想参与开发可以查看 CONTRIBUTING.md项目采用 MIT 许可证见 LICENSE商用免费。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考