OCRmyPDF 快速实战:给扫描PDF加可搜索文本层的完整路线
OCRmyPDF 快速实战给扫描PDF加可搜索文本层的完整路线【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF手头攒了一百多页扫描件想搜里面的关键词、复制几段文字结果每页都得靠肉眼找。OCRmyPDF 把这些 PDF 加上不可见的 OCR 文本层加完就能搜索和复制全程本地离线、可整批跑不碰网络也不上传。先跑通再理解一条命令给扫描PDF加文本层 Debian/Ubuntu 上两条命令就能出第一个可搜索文件# 安装自带 Tesseract 与 Ghostscript sudo apt install ocrmypdf # 给扫描件加英文文本层输出可搜索 PDF ocrmypdf -l eng input.pdf output.pdf跑完 output.pdf 里原始图片一字未动只是每页图下多了一层看不见、但能被选中的文字。它还能做这些歪斜与旋转校正--deskew扶正拍歪的页--rotate-pages纠正 90/180 度方向错适合手机翻拍的档案。多语言混排-l engchi_sim一次识别中英穿插底层 Tesseract 覆盖 100 种语言。图像清理--clean调 unpaper 去背景杂点与阴影低质量扫描件识别率明显上来。长期存档输出默认产出 PDF/A字体与色域全内嵌不依赖阅读环境。多核并行自动占满所有 CPU 核心上千页的文件也能稳着跑完。三种典型用法批量扫描PDF、多语言与存档配方三个配方按处理量从小到大排照着改参数就能直接用待处理对象长这样批量处理命令整目录扫描件一次跑完扫描件攒成一批、要统一加文本层时用这条mkdir output parallel --tag -j 2 ocrmypdf -l eng {} output/{} ::: *.pdf-j 2限制同时只开 2 个进程——ocrmypdf 自己会用满 CPU并行太多反而抢资源2 是吞吐和稳定的平衡点--tag给每条日志加文件名前缀出错能直接定位到具体文件。多语言参数怎么配中英混排一次识别合同、说明书里中英文穿插单一语言包会漏字时# 中英混排 ocrmypdf -l engchi_sim contract.pdf contract_ocr.pdf # 老德文 Fraktur 花体字 ocrmypdf -l deu_frak old_book.pdf old_book_ocr.pdf语言包用串起来列全了才不漏代码是 ISO 639-2 三字母码chi_sim简体、chi_tra繁体、deu_frak专治老德文。归档级输出配方PDF/A 加最高档压缩要送档案馆、法院或留十年以上的扫描件ocrmypdf -l eng \ --output-type pdfa \ --optimize 3 \ --title 2026年归档扫描件 \ scanned.pdf archived.pdf--output-type pdfa把字体和 ICC 色彩配置塞进文件本身多年后照样能打开--optimize 3走最高档压缩输出常常比输入还小--title写进元数据归档后好检索。环境适配与安装离线机、Docker、语言包路径和依赖版本一次说清离线安装Linux有网机apt-get download ocrmypdf ghostscript tesseract-ocr取 .deb拷到离线机dpkg -i *.deb。离线安装Windows离线机用 winget 装 64 位 Python、Tesseract、Ghostscript再py -m pip install ocrmypdf。Docker不想折腾依赖docker run --rm -i jbarlow83/ocrmypdf-alpine - - in.pdf out.pdf直接走。语言包路径Linux 在/usr/share/tesseract-ocr/4.00/tessdata/Windows 在C:\Program Files\Tesseract-OCR\tessdata\缺哪个补哪个 .traineddata。性能参数--jobs 8定并行页数--pages 1-50只处理指定页超大文件按页分批不爆内存。项目说明关键参数Python运行 ocrmypdf 本体≥3.10推荐 3.12GhostscriptPDF/A 转换的回退路径≥9.54TesseractOCR 引擎≥4.1.1语言包决定能识别哪些字-l指定的 .traineddata报错解法踩坑清单 ️跑起来报错基本就这四种对着改page already has text文件已带文本层加--force-ocr重扫、--skip-text跳过、或--redo-ocr清掉旧的再识别。not a valid PDF文件损坏或被截断用gs -o fixed.pdf -dSAFER -sDEVICEpdfwrite input.pdf重写后再跑。Tesseract couldnt find a language data file语言包没装全确认对应 .traineddata 在 tessdata 目录里。识别率偏低加--clean --deskew先做图像预处理再识别。参数与依赖的完整对照见 官方文档想看文本层是怎么拼进 PDF 的翻 核心源码。重要文档先拿 5 页试跑确认识别效果再全量处理。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →