
本地离线 OCR 实战Umi-OCR 截图、批量、PDF 一次跑通【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是免费、开源的离线 OCR 工具截图取字、批量图片识别、PDF 变可搜索文档全程本地完成不联网、图片不上传。跟着下面的场景做每一步都有可核对的反馈。第一次打开截图框一块字复制走这一节带你完成从解压到复制出文字的最短流程。解压发布包。发布版是.7z压缩包或免装压缩软件的.7z.exe自解压包适用于 Windows 7 x64 和 Linux x64没有安装器。解压后你会看到一个完整目录里面就是全部文件。启动程序。Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。主窗口弹出界面语言跟随系统设置自动切换。打开截图 OCR标签页按该页设置里的快捷键屏幕变暗、出现选框你框选一块含文字的区域中途按Esc随时取消。识别完成右侧记录面板出现一段文本点一下记录即可复制左侧预览栏里的文字也能直接划选。截图 OCR 主界面左侧预览可直接划选文字右侧记录按时间保存每次识别结果验证把复制出的文字粘贴进记事本字数、换行和原图对得上流程就通了。注意——第一次觉得界面不对味去全局设置标签页切语言、主题或开桌面快捷方式、开机自启都能直接改。代码截图里的手动缩进别让它丢了你大概率会撞上这个情况视频里贴了一段代码截图识别后缩进被拍平、行内空格没了贴进 IDE 没法运行。OCR 引擎只负责认字拼回阅读顺序的是排版解析把散落的字块按阅读顺序整理成段落默认方案面向普通文档套在代码上就会不对味。最短解法在截图 OCR标签页框选代码区域。右侧设置面板里把排版解析改为单栏-保留缩进。识别完成后在记录里选中这条结果复制。排版解析方案决定识别结果的缩进与换行代码截图选单栏-保留缩进验证把结果贴进 IDE 或 Markdown 预览缩进层级与原图一致、没有多余空格就算过关。如果还不够往设置面板的排版解析选项里挑普通文档保持默认的多栏-按自然段换行每句都要换行的选多栏-总是换行。另外记录面板支持划选多条记录批量复制、也可以编辑后再复制右键菜单能删单条或清空全部。几百张扫描图一个文件夹丢进去一文件夹扫描文档或票据一张一张点不现实。切到批量 OCR标签页点选择图片或直接把文件夹拖进去几百张也能一次导入。输入格式支持jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff输出在右侧设置里勾选txt / jsonl / md / csv (Excel)。点开始任务。你会看到左侧列表逐张滚动每行显示耗时和置信度0~1。批量 OCR 页面左侧是待识别文件列表含耗时、置信度右侧是识别记录验证随机抽 3 张图对照左侧预览和右侧记录置信度低于0.8的几张重点人工核对。注意——两个高频翻车点每张图固定位置有水印或 LOGO在右侧设置进忽略区域编辑器按住右键画矩形框住它。只有完整落在框内的文本块才会被丢弃框画得稍微大一点更安全。像素超大的长图、小字多的大图到设置 → 文字识别 → 限制图像边长把数值调高默认960可选2880、4320否则大图先被压缩小字容易糊。PDF 扫描件走文档识别标签页v2.1.4 及以上支持拖入pdf / xps / epub / mobi / fb2 / cbz文件产物是双层可搜索 PDF——原图在底层识别出的文字嵌在上层能搜能选版面不损失同样可以设忽略区域排除页眉页脚。验证方法打开生成的 PDF用CtrlF搜一个只在正文出现的词能跳到对应页就说明文字层写对了。把识别挂进脚本一条命令或一个 HTTP 请求想把 OCR 放进定时任务、打包脚本或自己的服务里Umi-OCR 留了命令行和 HTTP 两个口子。在全局设置确认 HTTP 服务已开启默认开着主机保持仅本地默认端口1224。命令行入口就是主程序umi-ocr是Umi-OCR.exe的简写umi-ocr --screenshot --clip umi-ocr --path D:/docs --output 结果.txt umi-ocr --qrcode_read D:/code.pngHTTP 走法浏览器访问http://127.0.0.1:1224/api/ocr/get_options查参数定义再POST http://127.0.0.1:1224/api/ocr提交 base64 图片文档识别的上传、查询、下载接口也都有。全局设置页切换语言与主题确认 HTTP 服务开启后可接命令行和 HTTP 调用验证命令行跑完文本出现在剪贴板或你指定的文件里浏览器打开get_options能看到 JSON 参数定义。完整参数见 命令行手册接口细节见 HTTP 接口手册 和 图片识别接口。注意——命令行任务沿用截图 OCR标签页的参数设定。不希望跑任务时弹出主窗口就在那个标签页里关掉对应选项。参数速查真正要动的就这几项调哪里默认什么时候调为什么排版解析多栏-按自然段换行代码截图选单栏-保留缩进引擎只管认字缩进和阅读顺序全靠它限制图像边长960大图、小字多时调 2880 或 4320默认值会先压缩大图小字容易糊语言/模型库简体中文纯英文、纯代码换models/config_en.txt中文模型认纯英文容易出怪字符所有改动自动存进UmiOCR-data/.settingsini 格式也可以手动改这个文件然后执行umi-ocr --reload重新加载。结果不对时的速查表现象怎么修识别顺序错乱、读不通换排版解析方案代码类选单栏-保留缩进大图里的小字认错限制图像边长调到 2880 以上水印、LOGO 文字混进结果批量页忽略区域编辑器把水印整块框住命令行 / HTTP 没反应全局设置里确认 HTTP 服务开启主机选仅本地Umi-OCR 是个本地跑的离线 OCR 工具箱免费、不联网截图、批量、PDF 三条线一个进程全干。先在截图页把快捷键练成肌肉记忆再把文件夹丢进批量页跑一晚上想接自动化就翻 命令行手册 和 HTTP 接口手册。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考