OCRmyPDF 自动纠偏手把手:一条命令把歪斜扫描件扶正 OCRmyPDF 自动纠偏手把手一条命令把歪斜扫描件扶正【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF扫描的 PDF 歪了 3 度全文搜索就总漏行。OCRmyPDF 的--deskew参数能把整份文档自动扶正顺带嵌入可搜索的文本层。读完这篇文章你就能自己跑一次 OCRmyPDF 自动纠偏把手头的歪斜文档处理掉。 先跑起来一条命令完成纠偏用系统包管理器装好即可sudo apt install ocrmypdf然后执行ocrmypdf --deskew input.pdf output.pdf打开 output.pdf你能直接看到两处变化原本倾斜的文字行变得横平竖直像被重新平铺在扫描仪上用鼠标选中文字会发现多了一层可搜索的文本CtrlF 立刻能命中。原始图像没有被破坏——输出文件里同时保留了校正后的扫描图像和新加的文本层。图这种扫描的打字机文档是纠偏的典型对象文字行密、歪斜明显。 它在做什么--deskew 之后页面经历了什么只发生了三件事量出角度。先对页面图像跑一次 Tesseract 的页面分割让它估计这页文字行偏离水平多少度得到一个角度值。按量旋转。把整页图像按这个角度转回去——就像扶正一张拍歪的拍立得照片内容不会被裁掉只是回到正位。按固定顺序执行。OCRmyPDF 的图像管线顺序是页面定向、去背景、纠偏、清理。参数写在前还是后都一样管线自己排好遇到空白页或超时它会跳过不转。 谁在用它三个真实场景档案室的沈姐接手一批 200 页的老台账每页歪 1~2 度系统里搜文字经常漏条目。她跑了ocrmypdf --deskew ledger.pdf ledger_out.pdf再搜转账相关页面全部命中。读研的小周整理扫描的论文文献发现有的页横了 90 度有的只是轻微歪两种问题混在一起。他在命令里多写一个--rotate-pages定向和细纠偏一次跑完不用再逐页手动转。文书公司的老高只帮客户把彩色扫描件扶正归档不想要文本层。他把命令换成--ocr-engine none --deskew --output-type pdfa图像照样扶正输出直接是可长期保存的 PDF/A 格式。图彩色扫描件同样支持deskew 按整页统一校正不区分彩色或黑白。️ 怎么配参数两组常用的纠偏命令组合ocrmypdf --deskew --rotate-pages input.pdf output.pdf ocrmypdf --ocr-engine none --deskew --output-type pdfa input.pdf output.pdf第一组页面既转错方向又歪斜时使用先由 rotate-pages 纠正页面方向deskew 再微调角度一次覆盖两种问题。第二组只想要图像校正结果、不想跑 OCR 时使用--ocr-engine none跳过文字识别--output-type pdfa直接产出可归档文件。⚠️ 容易踩的坑纠偏后页面还是歪的页面还是横着 90 度。--deskew只修正小角度歪斜方向转错 90 度的页面不归它管。加上--rotate-pages先纠正方向再让 deskew 微调。️输出比预想发虚。校正会把页面转成图像再旋转清晰度受原扫描分辨率限制。扫描时用 300 DPI 以上处理后翻一遍输出文件确认。空白页、文字稀少的页没变化。Tesseract 需要足够的文字行才能估出角度空白页直接返回 0 度这是正常行为不是失败。⌨️纯数字 PDF 里已有的文字还是歪的。deskew 处理的是图像层不会改动 PDF 中已嵌入的文字。源头是数字 PDF 的话去源头修版式。 收尾纠偏能做到什么程度deskew 能修正几度以内的小角度歪斜也能和定向、清理等步骤随意组合但它转不了转错 90 度的页面也动不了数字 PDF 里已经排好的文字扫描本身低于 150 DPI 的话校正效果不会因此变清晰。完整选项见官方文档的图像处理一章。建议先抽 5 页试跑一遍效果满意再处理整份文件。小贴士试跑时加-v3可以看到每页被校正的角度值若大量页面都是 0 度先检查扫描是否太糊或内容太少。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考