TMSpeech Windows 离线实时语音转文字工具 5 分钟上手完整指南 TMSpeech Windows 离线实时语音转文字工具 5 分钟上手完整指南【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech核心价值本地离线语音识别与实时字幕TMSpeech 是一款 Windows 离线实时语音转文字工具通过捕获系统内录声音或麦克风输入把语音实时转换成歌词式字幕展示在屏幕上。识别完全在你本地电脑完成基于 sherpa-onnx 语音识别框架二次开发音频不上传云端识别功能不依赖网络官方在 AMD 5800u 笔记本上实测 CPU 占用不到 5%适合长时间挂在会议里运行。适用场景速览它主要面向以下四类使用者需要记录线上会议内容的人被点名时可以直接翻识别历史补上错过的内容这也是项目名字的由来。看网课、听讲座的学生课后靠识别记录回顾讲解要点。制作音视频内容、想快速得到字幕初稿的创作者。对隐私敏感、需要把对话转成文字留档、又不想把音频交给云端的用户。环境要求与准备TMSpeech 是免安装的 Windows 桌面程序解压即可运行。使用之前对照下表确认环境项目要求或说明操作系统Windows音频捕获基于 WASAPI录内音/麦克风硬件普通 CPU 即可有 GPU 时可换用 Vulkan 加速的识别器音频设备录内音无需设备录外部声音需要一个麦克风网络识别本身离线仅在设置里资源页下载额外模型时需要联网获取方式在项目 Release 页下载最新 release 压缩包解压到任意目录首次运行上手步骤从解压到第一条字幕第一次启动到看到第一条字幕最短路径是五步解压 release 包到非系统盘目录双击TMSpeech.exe启动可在桌面建一个快捷方式。启动后出现一个无边框、置顶的透明字幕窗口默认显示欢迎使用TMSpeech。默认配置为系统内录 SherpaOnnx 离线识别器CPU若未在运行把鼠标悬停到窗口上点击出现的播放按钮开始识别。悬停窗口时工具栏会浮现播放/停止、历史、锁定、设置按钮点设置图标进入设置页核对音频页的音源与识别页的模型。播放一段声音字幕窗口出现实时文字点历史图标可回看已完成的句子。识别结果会按日期自动保存到我的文档下的TMSpeechLogs文件夹。核心功能内录字幕、窗口穿透锁定与识别记录最能体现 TMSpeech 差异的功能有三个系统内录音源、字幕窗口的锁定模式、识别记录与敏感词通知。Windows 系统内录Loopback它是什么默认音源通过 WASAPI CaptureLoopback 捕获电脑正在播放的声音即你从扬声器听到的内容都会被转成文字。怎么操作设置页音频页选择Windows 系统内录即可无需额外配置若要录自己的声音上课、录音改选麦克风音源并在配置里选择设备。效果如何即使把系统声音完全静音内录依然有效适合会议里外放关小的场景音频统一转为 16kHz 单声道后送入识别器。字幕窗口与锁定模式它是什么无边框、置顶的独立字幕窗口可任意拖动、缩放窗口位置会被记住。怎么操作按住窗口空白处拖动可移动按住边缘拖动可改大小点工具栏的锁定图标后窗口进入穿透状态不响应任何点击右键托盘图标可解锁或重置窗口位置。效果如何字幕可以钉在任何位置且不打扰操作锁定后不会误触会议窗口或录屏软件适合投屏和录制。识别记录与敏感词通知它是什么每句识别完成都会进入历史列表并写入按日期命名的日志文件识别到指定词语时还会弹出系统通知。怎么操作点历史图标打开记录页鼠标拖选文字或直接 Ctrl-C 复制在设置页通知栏填写敏感词多个词逗号分隔。效果如何开会走神后不必回放音频翻记录即可写上自己的名字被点名时会第一时间收到通知。两个典型工作流实操下面按准备 → 执行 → 收尾走两个最有代表性的场景。场景一线上会议实时转录准备会前启动 TMSpeech音频页选Windows 系统内录确认模型为中文流式模型通知栏把自己的名字或项目代号填为敏感词。执行点播放开始识别把字幕窗拖到屏幕角落或锁定后直接压在其他窗口上。工具栏会显示已运行时长时:分:秒长会可随时确认进度漏听的内容立刻翻历史页核对。收尾会后点停止到我的文档\TMSpeechLogs找到当天的记录文件选中需要的段落复制进会议纪要。推荐参数音源选内录、识别器选 SherpaOnnxCPU断句由内置端点检测自动完成停顿约 1.2~2.4 秒或满 80 字即成句无需手动调整。场景二网课与讲座字幕记录准备音频页改选麦克风并选好设备课程是外语的话先到资源页下载对应语言的模型再在识别配置里选用。执行把字体大小调到 48~64、阴影大小保持 10字幕压在复杂画面上也清晰窗口放在课件下方跟随讲解滚动。收尾下课后打开识别记录回顾重点复制关键段落进笔记软件做二次整理。推荐参数默认日志目录不动按日期自动归档方便按课程回找。关键参数速查表常用参数与推荐值见下表均可在设置页修改参数作用推荐值/范围适用场景音频源决定转写系统声音还是外部声音默认系统内录录自己声音改麦克风会议内录 / 自讲录音识别模型决定识别语言与准确率中文流式模型资源页下载中文会议 / 外语课字体大小字幕可读性36~64默认 48远端屏幕阅读阴影大小增强字幕与背景对比默认 10范围 0~20叠在视频画面上识别日志文件夹识别记录存放位置默认我的文档\TMSpeechLogs会议纪要归档敏感词命中即弹系统通知填名字或关键术语会议被点名提醒启动开始识别程序启动后自动开始默认开启长时间待机监听常见坑与快速排查现象点播放弹出启动失败或窗口一直不出字幕。最可能原因识别模型未安装或文件路径缺失。处理动作到设置页资源页下载并安装中文流式模型重新开始识别。现象识别结果错词多、像乱码。最可能原因模型语言与语音不匹配或环境噪声大。处理动作切换对应语言的模型麦克风场景尽量靠近声源并调低环境音量。现象设置行为异常、改不回去。最可能原因配置文件损坏。处理动作运行 release 包内附带的重置配置bat 脚本删除现有配置文件再重启程序。进阶与参与插件体系与命令行识别器TMSpeech 采用插件架构音频源、识别器和翻译器都以插件形式加载源码位于src/Plugins目录内置的三个识别器各有分工识别器计算方式适用硬件SherpaOnnx 离线识别器CPU任何 Windows 电脑SherpaNcnn 离线识别器GPUVulkan有显卡的电脑命令行识别器外部子进程自定义识别流程命令行识别器允许你用自己的外部程序做识别它把子进程的标准输出解析为字幕单个换行表示临时结果、连续换行表示一句结束标准错误输出写日志示例识别脚本在external_recognizer目录。想写插件可以克隆源码后阅读 README 与 ROADMAP参考内置插件实现接口即可git clone https://gitcode.com/gh_mirrors/tm/TMSpeechTMSpeech 提供了一个低成本、可完全离线的把听到的声音变成文字方案解压即跑资源占用低。最快的验证方式就是找一段视频播放用默认内录配置看它转写的效果。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考