
Handy 快速上手免费离线语音转文本5 分钟让电脑听懂你说话【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy开会时想把关键结论直接口述进文档但录音文件一旦丢给云端服务合规风险立刻摆上台面。医院写病历、律所记庭审笔记很多场景对语音数据出网是有硬性限制的。还有一种更朴素的需求出差断网、飞行模式、内网隔离环境你只是想说话变成字。Handy 就是为这些场景做的一个桌面应用免费、开源、完全离线的语音转文本工具。它把 Whisper 和 Parakeet 这类本地语音识别模型跑在你自己的电脑上按住快捷键说话松开后文字直接粘贴进当前输入框。全程没有任何音频离开本机。️ 为什么本地语音识别比云端更适合这类场景说白了云和路的差别不在聪明不聪明而在边界条件维度云端方案Handy 本地方案隐私音频上传到服务商受其数据政策约束音频全程留在本机无网络请求延迟受网络波动影响弱网时明显取决于本机硬件网络无关成本通常按时长/次数计费或订阅制一次下载模型长期免费断网可用不可用完全可用这不是说云端方案一无是处——如果你要的是几十种小语种的高精度转录云端大模型确实有优势。但对数据不能出网有硬约束的场景本地方案不是妥协是唯一解。Handy 属于后者。 5 分钟跑起来各平台安装步骤Windowswinget install cjpais.Handy装完打开应用授予麦克风权限即可。macOSbrew install --cask handy首次启动会弹麦克风权限另外要在系统设置 隐私与安全性 辅助功能里勾选 Handy——它靠这个权限把文字粘贴回你正在用的应用。Linux去 releases 页面下载 AppImage / deb / rpm请以仓库最新 README 为准。Wayland 用户注意装一下文本输入工具sudo apt install wtype # WaylandX11 则装 xdotool首次配置选模型、定快捷键模型在设置 模型里下载。Whisper 各档位从 487 MBSmall到 1.6 GBTurbo不等Parakeet 系列约 478 MB。网络受限时可以手动下载模型文件丢进应用数据目录下的models文件夹再重启 HandymacOS 在~/Library/Application Support/com.pais.handy/modelsLinux 在~/.config/com.pais.handy/models。快捷键默认是按住说话、松开发送也可以在设置里改成点按切换模式上面三种行为里Hold 是按住才录音Toggle 是点一下开始、再点一下结束Auto 则是两种都支持。挑一个你手腕舒服的。⚡ 核心能力实战按场景用日常速记快捷键触发 → 转写 → 自动粘贴完整链路就三步触发快捷键 → 说话 → 松开。Handy 会先静音、再识别、然后把结果直接塞进当前焦点的输入框——邮件、备忘录、代码编辑器都算。它支持直接键入和剪贴板粘贴两种策略在设置 高级里可以切某些应用里一种粘不进去就换另一种试试。流式模式下你能在悬浮层里看到文字边说边出来顺便检查自己有没有口误专业领域提效用自定义词汇表校准术语识别错的通常是专名药名、法条编号、公司内部代号。Handy 的自定义词汇表就是干这个的——把词加进列表识别时会被优先匹配。对应界面在 自定义词汇设置每个词不超过 50 字符。医疗把阿托伐他汀CT 平扫这类加进去法律法条引用、当事人姓名IT产品代号、缩写词不加的话 Whisper 经常自由发挥多模型策略按硬件选模型一句话决策各档位的适用边界大致是Canary 180M Flash约 140 MB四国语言英德法西老机器、低内存首选Parakeet V3 / Parakeet Unified EN纯 CPU 跑中端硬件约 5 倍实时速度英文场景默认推荐要求 Skylake 或同代 CPUWhisper Small/Medium多语言、精度与速度的折中Whisper Turbo/Large精度最高吃 GPUTurbo 约 1.6 GB一句话没有独显选 Parakeet有 8 GB 以上显存选 Whisper Medium 起步要最高精度上 Turbo。注意 Parakeet 系列目前只支持英语多语言场景走 Whisper。LLM 后处理联动转写完顺手润色转录完可以自动把文本发给一个外部 LLM API做语法修正、去口头禅、格式化。在设置 后处理里配置 Provider、Base URL、模型名和 API Key然后触发录制时走带后处理的模式即可。踩坑提醒这一步会让文本出网。语音本身不出网但如果你连转写结果都不能出网就别开它。️ 让速度再快一点性能调优清单问题Whisper 在 CPU 上转得慢→ 去设置 高级的加速选项里挑设备。Whisper 推理走 CUDA / Metal / DirectML / ROCmONNX 部分VAD 等另有一个下拉框两个都建议先选 Auto 再手动对比。对应组件是 加速选择器。问题内存不够不想让模型一直占着→ 调模型卸载超时从立即卸载到 1 小时共 7 档。开着 5 分钟或 10 分钟是多数人的甜蜜点——第二次触发时不用重新加载机器压力又可控。内存紧张就选更短的。问题松开快捷键后要等一会儿才有文字→ 看录音缓冲区设置它决定转写时回看多少秒音频太小会截断开头。问题停顿也被当成说话内容→ 语音活动检测VAD用 Silero 模型做静音过滤平滑窗口可调窗口放宽容忍度变高适合边想边说的场景。问题换应用之间录音老丢→ 检查是否开了录制时静音以及蓝牙耳机macOS 上蓝牙麦克风会切换双向音频导致录音时音质变差建议输出留耳机、输入用内建麦克风。️ 三端差异速查Linux最容易踩坑全局快捷键不能在应用内配Wayland 下要在桌面环境/窗口管理器里绑定命令填handy --toggle-transcriptionSway/i3 配置长这样bindsym $modo exec handy --toggle-transcription录音覆盖层默认关闭Overlay Position: None因为部分合成器会抢焦点导致粘不回原应用启动报libgtk-layer-shell.so.0缺失就装发行版对应包顽固问题可用HANDY_NO_GTK_LAYER_SHELL1启动粘贴不生效先装wtypeWayland或xdotoolX11macOSGlobe 键可以当触发键但仅限 Apple 键盘——第三方键盘的 Fn 不上传系统事件这是硬件限制Apple Silicon 自动走 Metal 加速Intel 机型可用但建议中小模型麦克风 辅助功能两样权限都要给少一个就缺一条腿蓝牙耳机录音时音质下降属已知行为换输入设备可解Windows全局快捷键由后端rdev监听行为最正常的一端winget 安装后默认在系统托盘可设置开机自启、隐藏启动偶发 Whisper 模型崩溃与具体系统配置相关换个量化版本或模型通常能绕过调试菜单快捷键CtrlShiftD 给开发者的后门先讲分工界面是 React TypeScriptTailwind 写样式Zustand 管状态系统级的事——音频采集、VAD、模型加载、全局快捷键、粘贴——全部在 Rust 端用 Tauri command 暴露给前端。音频这条链路的代码集中在 音频处理模块从采集、重采样到 VAD 都能在那看到。想加一个新设置项最短路径两步在src/components/settings/下新建一个组件照抄ModelUnloadTimeout.tsx这种 Dropdown 写法就行状态读写走src/stores/settingsStore.ts如果设置涉及后端行为再在src-tauri/src/加一个 Tauri command前端通过src/bindings.ts生成物调用。排障时按CmdShiftDmacOS或CtrlShiftDWin/Linux开调试菜单里面有应用数据目录、实时日志查看、日志级别切换——模型加载卡住、粘贴失败这类问题先看日志再说。❓ 常见疑问 避坑Q按快捷键没声音/录不到东西先确认系统权限macOS 麦克风 辅助功能再确认 Linux 下装了对应的输入工具蓝牙耳机的用户把麦克风切到内建或外接的。还不行就开调试看 LiveLog会直接告诉你卡在哪一步。Q模型下载慢或下不动走代理或离线环境时用浏览器从发布页把模型文件下下来手动放进应用数据目录的models文件夹重启即识别。Whisper 放.bin/.gguf文件Parakeet 要解压成固定名字的目录。细节以仓库 README 的 Troubleshooting 为准。Q和系统默认输入法/语音输入冲突换个不常用的组合键避开WinH这类系统占用。macOS 上 Globe 键方案和第三方键盘有坑见上节直接改用标准修饰键组合最稳。QParakeet 和 Whisper 到底选哪个英文为主、机器一般甚至偏老Parakeet。要识别多语言、或者对长难句精度更敏感Whisper。两个都装了可以随时切不冲突。Q转写结果能留多久历史保留时长和条数上限都在设置里可调也可以直接清空。它和录音保留是两个独立开关按需配置。Q为什么 Linux 上粘贴进了错误的窗口大概率是录音覆盖层抢了焦点。把 Overlay Position 设为 None想有提示就开音频反馈用声音代替视觉。Handy 做的事不复杂快捷键一按话变成字贴回输入框。但它把完全离线这条路走通了——模型、推理、粘贴全在本机隐私边界由你自己控制。对合规敏感的团队来说这比任何功能列表都值钱。随着本地推理硬件NPU、统一内存的 Apple 芯片越来越普及语音这类高频、高隐私的交互桌面本地化几乎是必然方向而一个免费开源、好 fork 的实现会是这个方向上很值得盯着的项目。【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考