OCRmyPDF完整教程:给扫描件添加可搜索文本层

📅 2026/8/24 1:53:56
OCRmyPDF完整教程:给扫描件添加可搜索文本层
OCRmyPDF完整教程给扫描件添加可搜索文本层【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF手机拍下来的合同打开后搜不到一个字因为它只是一叠图片。OCRmyPDF 是一个开源命令行工具能给扫描 PDF 添加可搜索的 OCR 文本层保留原始扫描图的同时让文字可以被搜索和复制。本文按安装、首条命令、常用参数展开所有命令可直接复制运行。 项目定位它解决什么问题OCRmyPDF 读取扫描 PDF输出一个双层文件上层是原始扫描图下层是 OCR 文本。它顺带处理倾斜校正、多语言识别和文件压缩默认输出适合长期保存的 PDF/A 格式。能力说明对应参数OCR 文本层在扫描图下方添加文字可搜索、可复制ocrmypdf in.pdf out.pdf倾斜校正检测页面角度并旋转自动摆正--deskew --rotate-pages多语言识别基于 Tesseract支持 100 语言-l chi_simeng长期归档默认输出 ISO 标准的 PDF/A--output-type pdfa文件优化重编码图像输出常比输入更小--optimize 1默认并行处理默认把工作分给全部 CPU 核心--jobs 4⚡ OCRmyPDF 如何安装按你的系统选一行执行即可都是一条命令。系统安装命令Debian / Ubuntuapt install ocrmypdfFedoradnf install ocrmypdf tesseract-osdmacOSHomebrewbrew install ocrmypdfWindowsWSLWSL 内执行apt install ocrmypdf源码最新修订版git clone https://gitcode.com/GitHub_Trending/oc/OCRmyPDF后构建发行版版本过旧时完整的分平台步骤见 docs/installation.md。⚡ 快速上手跑通第一条命令第一步装好软件见上表第二步执行ocrmypdf scanned.pdf searchable.pdf第三步看结果用任意 PDF 阅读器打开 searchable.pdf页面外观不变但文字已可选中、可搜索。终端会逐页打印进度结束后做输出校验。运行 OCRmyPDF 时终端逐页显示扫描件识别进度与最终输出类型⚙️ 核心能力详解倾斜校正摆正歪掉的扫描页--deskew检测页面倾斜角度--rotate-pages纠正横纵向方向都在识别前完成。适合扫描仪输出歪斜、手机拍摄角度随意的文件。ocrmypdf --deskew --rotate-pages crooked.pdf fixed.pdf校正前页面整体歪斜--deskew会检测角度并旋转回水平多语言识别中文文档一条命令识别语言默认是英语用-l指定语言码多种语言用连接。ocrmypdf -l chi_simeng mixed.pdf mixed_ocr.pdf中文对应语言码chi_sim需要先装语言包方法见进阶技巧一节。文本提取PDF 和 TXT 一次输出--sidecar会在生成 PDF 的同时写出纯文本文件适合把内容导入表格做关键词检索。ocrmypdf --sidecar out.txt in.pdf out.pdf图片直接输入照片变可搜索 PDFjpg、png 可以直接作为输入不需要先做成 PDF适合手机扫描稿。ocrmypdf scan.jpg document.pdf️ 进阶技巧真正影响效果的参数安装语言包默认只装英语包处理中文、法语等之前要补装 Tesseract 语言包apt-get install tesseract-ocr-chi-sim各系统的包名和全部语言码见 docs/languages.md。体积控制--optimize 参数详解--optimize 1是默认档位做适度压缩。旧文档线条多、体积下不来时改--optimize 3只追求速度用--optimize 0跳过优化。各档位定义见 docs/optimizer.md。有污点的旧扫描件可加--clean识别前先用 unpaper 算法清理背景。年代较久的打字机文档适合搭配--clean做背景清理后再识别批量处理一次跑完整个目录for f in *.pdf; do ocrmypdf --deskew $f ocr_$f done仓库内另有现成脚本 misc/batch.py 可参考。❓ 常见问题输出文件比输入还大怎么办默认只做适度优化。先试--optimize 3若文件以线条图为主且环境未安装 jbig2enc压缩空间也会受限。页面已有文字会被重复识别吗默认跳过已有文本的页面速度更快。需要强制重新识别时加--redo-ocr。为什么中文识别成乱码或英语两种原因语言包没装或没指定-l。装上tesseract-ocr-chi-sim并传-l chi_sim即可。能直接识别 jpg、png 图片吗可以。把图片路径当输入传进去输出就是一份可搜索 PDF。 选型与同类工具组合偶尔处理一两个文件且不想装环境在线 OCR 服务更方便但文件要上传到对方服务器OCRmyPDF 全程本地处理。只认单张图片出文本直接调用 Tesseract 即可不需要整套 PDF 流水线。已有识别引擎、缺做成 PDF这一步用 OCRmyPDF。它内置 Tesseract 做识别、ghostscript 做压缩缺哪个补哪个。验证输出有个快办法pdftotext把文本层导出来肉眼检查一遍识别质量。先从ocrmypdf --help过一遍全部选项开始。挑一份扫描件用本文的命令跑出第一个结果再按需要加--deskew和-l。参数说明都能在仓库 docs 目录里按参数名检索到。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考