Umi-OCR 离线OCR实操指南:5个技巧搞定扫描件 Umi-OCR 离线OCR实操指南5个技巧搞定扫描件【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR扫描版合同的图片、身份证照片、还没公开的论文初稿这些你不敢传到在线识别网站的图里有字的文件偏偏在屏幕上选不中、复制不了。Umi-OCR 就是为这类场景准备的离线 OCR 软件识别全程在电脑本地完成图片不离开你的硬盘。一句话定位Umi-OCR 像一个住进你电脑的速记员——屏幕上的、图片里的、扫描件上的字它离线转写材料不出你的桌子。形态上它是绿色桌面程序解压即用、无需安装功能分组成可切换的标签页上手门槛很低从下载到第一次识别成功只要三分钟。三分钟离线安装下载、解压、双击启动下载从项目发布页取.7z压缩包电脑没装压缩软件就选.7z.exe自解压包。解压解压到纯英文路径例如D:/Tools/Umi-OCR路径里不要带中文和空格能省掉一堆莫名其妙的兼容问题。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。⚠️ 注意首次启动前把软件目录加入杀毒白名单——包里自带本地 OCR 引擎和运行库容易被部分杀软误报这是启动即闪退的头号原因。首次启动时界面会跟随系统语言自动切换想改随时去全局设置 → 语言简体中文、繁体中文、英文、日文、俄文等界面语言都内置社区译者还在持续添加。划重点界面语言只是壳引擎认什么字是识别语言库两样分开选——界面用中文、识别日文图书完全没问题。能力分三档从一张截图到整本PDF别看功能多按任务轻重分三档就好档位适合场景一句话操作第一档截图OCR一张图想随手取字快捷键截屏或粘贴别处复制的图第二档批量OCR一文件夹的图片拖图进窗口点开始任务第三档文档识别一整本扫描版PDF/电子书选中文档输出双层可搜索PDF第一档截图OCR日常最高频。打开该标签页用快捷键唤起截图框划出区域结果立刻出现在右侧记录栏。三个省事的细节别处复制的图比如聊天窗口里的可直接粘贴进来识别记录栏文字可直接改错还能划选多条记录一次复制横排、竖排文字由排版解析自动处理。顺带一提二维码、条形码的扫码和生成也内置在这类轻任务里。第二档批量OCR。几十上百张图片一张张截太亏整文件夹拖进来就行jpg、png、webp、bmp、tif等格式都认数量没有上限。任务跑完可按需导出txt、jsonl、md、csvExcel 直接打开还能设置任务完成后自动关机或待机睡前丢进去、醒来收结果v2.1.2 起支持中途暂停任务软件不退出唤醒后接着跑。这一档有个内置的降噪器忽略区域。图片角落的水印、LOGO、页眉页脚总会混进识别结果——在右栏设置里进入忽略区域编辑器按住右键画出多个矩形框识别时框内文字自动排除。 记住一个机制只有整个文本块完整落在框内才会被忽略而不是单个字符画框宁大勿小把水印可能出现的位置全包进去。第三档文档识别最重的一档整本扫描版 PDF。支持pdf、xps、epub、mobi、fb2、cbz六种格式。内部先把文档拆成已有文本层和扫描图片层文本层直接提取快且零误差扫描页才交给本地 OCR 逐页处理。最终输出的双层可搜索 PDF是底层原图、上层透明文字——外观和扫描件一样但文字能搜索、复制、划线历史合同归档、论文数字化直接顶得上。也可以整页强制 OCR或输出单层纯文本 PDF体积小、好编辑页眉页脚用忽略区域排除可按页码范围任务结束可设自动关机。识别之后文字怎么排座位由排版解析方案决定多栏-按自然段换行覆盖大多数两栏三栏的论文书籍识别代码截图切到单栏-保留缩进缩进和行中空格基本保住要引擎原始输出就选不做处理。划重点拿不准就先用多栏-按自然段换行遇到特殊排版再逐个对比切换。五个常见症状识别翻车先对号入座长图、大图识别缺胳膊少腿→ 默认的限制图像边长限了像素来平衡速度和内存去该标签页的文字识别设置把数值调高。别手动放大原图——放大只会加噪声、降准确率。忽略区域画了没效果→ 框不够大只有整块文本完全在框内才会被忽略把框画大包住水印所有可能位置并确认配置已保存。截图时界面闪烁、错位→ 显卡渲染兼容问题去全局设置 → 界面和外观 →渲染器换一种渲染方案或关闭硬件加速。命令行指令没反应→ 命令行依赖本地 HTTP 服务默认开启只监听本地环回不经过物理网卡数据不外泄先确认它开着并确认调用的是主程序Umi-OCR.exe备用启动器可能不支持指令。识别不准或报错→ 先换引擎内置Rapid-OCR兼容性好与PaddleOCR速度稍快全局设置里随时切换PaddleOCR 自 v2.1.4 起默认内存占用不超过系统内存的一半。划重点出问题时按引擎 → 参数 → 渲染器的顺序查八成用不着等新版本。超出图形界面用脚本调用 Umi-OCR日常用界面足够想嵌进自动化流程时有两条程序化通道命令行入口就是主程序本身指令支持简写--screenshot可写成--sc。比如截屏后把结果直接进剪贴板或识别整个文件夹、结果追加进文件umi-ocr --screenshot --clip umi-ocr --path D:/scans --output result.txt再配合快捷键工具能实现按一个键自动截取屏幕固定区域并识别。细节见命令行手册docs/README_CLI.md。HTTP 接口软件启动后本地服务提供 OCR、文档识别、二维码三组接口传图片、回 JSON几十行代码就能封装成局域网小工具。接口文档见docs/http/api_doc.md。项目还维护着独立插件库可以接入更多 OCR 引擎。各版本演进——v2.1.0 加入文档识别、v2.1.2 支持任务暂停、v2.1.3 登陆 Linux 并支持 Docker、v2.1.5 修复 PDF 页面旋转导致的文本错位——见更新日志CHANGE_LOG.md。划重点手上有旋转过方向的扫描件先升到最新版再识别。三句话记住日常够用Umi-OCR 免费、开源、完全离线解压即用三档能力由轻到重一张截图、一堆图片、整本PDF覆盖绝大多数日常场景识别结果不理想时查排版方案、查忽略区域、查渲染器。下次再收到扫描版合同的图片你不用再对着屏幕逐字敲也不用把它传到某个云端网站——解压、双击速记员已经开工材料始终没出你的桌子。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考