Buzz 本地转录上手指南:五步把音频变文字和字幕 Buzz 本地转录上手指南五步把音频变文字和字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款跑在你电脑上的本地音频转录工具基于 OpenAI 的 Whisper 模型离线工作把录音丢进去它负责吐出带时间戳的文字稿和字幕文件音频全程不出机器。先说说你手头那堆录音场景大概是这样的一周的会议录音、十几小时的课程视频还有客户发来的语音消息全都躺在硬盘里等你听。在线转写服务按分钟收费长音频算下来价格不难看把没定稿的商务对话传到别人服务器上心里也没底偶尔碰上出差断网服务直接停摆。Buzz 的思路恰好反着来识别在本地完成不上传、不排队装了就能一直用。它凭什么值得装数据流向只有一条你的硬盘。文件从不经过第三方服务器商务访谈、医疗访谈这类敏感素材也敢直接喂给它。离线可用。模型下载一次就缓存在本机断网环境下照常工作。硬件吃得好。NVIDIA 显卡有 CUDA 加速Mac 的 Apple Silicon 有专门优化没有独显也能靠 CPU 跑只是快慢之别。从安装到出字幕的完整路线第一步装好它。从项目发布渠道下载对应系统的安装包Windows 直接运行安装向导未签名提示选仍要运行即可macOS 拖进应用程序Linux 走 Flatpak 或 Snap各一行命令。第二步把文件送进去。点工具栏、按CtrlOmacOS 是CmdO或者直接把文件拖进窗口MP3、WAV、FLAC、MP4、AVI 都能收。还有一个省事入口粘贴 YouTube 链接它自己拉取音频进入队列。第三步给每个文件配参数。导入后每个文件占一行任务类型转写或把非英语内容翻译成英文文本、语言、模型档位、要导出的格式TXT、SRT、VTT 可多选。第四步点运行。任务进队列多个文件自动排队处理列表里随时能看到每个文件的进度。第五步打开结果。状态变成 Completed 后双击该行进入转录查看器逐句带时间戳支持搜索、调节倍速、循环播放某一段导出按钮在工具栏上格式随手切换。四个参数按影响大小排个序语言手动指定比自动检测稳默认自动检测只靠开头几秒猜语言中英混说或口音重时容易猜偏。只要你知道录音是什么语言就直接选它识别率立刻更稳。语言列表覆盖 99 种以上主流语种走 HuggingFace 后端时还能挂上 Meta 的 MMS 系列模型语种扩到上千种。模型档位与后端速度和精度的天平Tiny/Base 最快适合实时转录和大批量粗筛Small/Medium 是日常甜点区Large 系精度最高也最吃硬件重要材料值得单独用大模型重跑一遍。模型在偏好设置 → 模型页一键下载或删除后端选型跟着硬件走有 NVIDIA 显卡且显存不低于 6GB选 faster-whisper比原版 Whisper 快一个量级Mac 用户或只有集显的机器选 Whisper.cppC 实现、省内存量化版还能进一步提速需要特定语言定制模型时选 HuggingFace挂上各种微调过的 Whisper 变体。降噪与提示词两处小开关救回大片错字环境嘈杂时勾选提取语音Buzz 先把人声从背景里单独提出来再送识别会议室杂音、户外风声的改善肉眼可见。识别总把人名、项目名、专业术语写错时打开高级设置里的初始提示词框把这些易错词填进去模型会优先按这些词拼写——技术讲座、医疗访谈这类术语密集的场景尤其吃这一套。命令行给批量任务开一扇小门图形界面之外Buzz 还带了完整命令行入口适合挂定时任务和批量脚本# 用 Whisper.cpp 的 small 模型转录并同时导出 SRT 和 VTT buzz add --task transcribe --model-type whispercpp \ --model-size small --srt --vtt audio.mp3拉开差距的三个进阶功能字幕整形让字幕行宽听话转出来的字幕往往该断的没断该合的碎成渣。在转录界面点Resize设一个目标字幕长度Buzz 会按标点自动断行开了词级时间戳的任务还能按静音间隔合并过碎的片段、按最大长度强制分块。给不同平台配字幕基本就是改这几个数字的事。说话人识别多人对话自动分标签转录界面点Identify speakersBuzz 给不同发言者自动打标签每个标签还能试听十秒片段确认是谁然后改成真名。勾选合并同一人发言后连续讲话会被并成一段访谈整理能省一半手工。注意该功能在 Intel 芯片的 Mac 上不可用。实时转录边说边出字Live Recording 直接吃麦克风输入说话同时出字。想实时跟得上选 Whisper.cpp 配小模型。开启后会出现展示窗口选项把字幕放大投到会场大屏或第二块屏幕配合实时转录导出开关文字还能实时写进文本文件接进 OBS 推直播流也没问题。剩下的能力一句话带过文件夹监控把新丢进来的音频自动转录插件页帮助 → 插件提供 AI 摘要、导出 DOCX、DeepFilterNet 降噪、跳过已转录文件等开关转录查看器内置搜索和 0.5 到 2 倍速播放。这几种人最适合如果你是视频创作者Buzz 本地转录加字幕整形就是现成的字幕流水线转写、调行宽、导出 SRT导入剪辑软件收工。如果你是每天开会的职场人实时转录加说话人识别等于自带记录员纪要结构清楚而且对话内容从不离开公司电脑。如果你是学生或研究人员课程录音和访谈素材批量转写时间戳帮助直接跳到对应内容再导出文本进入分析环节。如果你对数据敏感律师、医生、记者的访谈素材走一次本地离线转录比任何上传方案都踏实。现在就能做的三步到 Buzz 的官方发布渠道下载对应系统的安装包Linux 一行flatpak install flathub io.github.chidiwilliams.Buzz即可。装好后导入一份录音手动选好语言、挑个模型档位点运行。等 Completed双击打开结果导出你要的格式。想继续深挖项目自带的文档目录docs/docs/和插件源码目录buzz/plugins/都是现成的延伸阅读。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考