离线OCR实战手记:一晚上把几百页扫描件变成可搜索文字

📅 2026/8/20 18:24:42
离线OCR实战手记:一晚上把几百页扫描件变成可搜索文字
离线OCR实战手记一晚上把几百页扫描件变成可搜索文字【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR上个周末我把手头二十多本扫描版书和几百张课件截图全部变成了能搜索、能复制的文字。工具是一款叫 Umi-OCR 的开源免费离线OCR软件——不联网、不注册解压即用截图文字提取、批量图片、PDF文字提取全都能干。这篇实战手记我按先看成果、再倒推做法的顺序讲每一步都能照做。先看成果扫描件一夜之间活了睡前把一堆扫描版 PDF 拖进文档识别页排队勾上完成后自动关机醒来发现输出目录里每本书都多出一份新 PDF。打开一页版面还是原来的扫描原图可光标划过时能选中文字、能全文搜索、能划词复制。这就是双层可搜索PDF——底层保留原图顶层覆盖一层透明文字层。倒推第一步解压即用离线OCR环境三分钟搭好整个过程我没装任何东西。下载 .7z 压缩包解压双击 Umi-OCR.exe 启动主界面是标签页式截图OCR、批量OCR、文档识别、二维码、全局设置。我第一件事是去全局设置过一遍语言、主题、字体、界面缩放都在这里调。如果你遇到截屏闪烁或界面错位把渲染器切换成别的方案或关闭硬件加速通常就能缓解。倒推第二步从截图文字提取热身先把截图OCR页的快捷键记住设置里能改。按下快捷键屏幕出现取景框框住想识别的区域、松开鼠标右侧面板瞬间吐出识别好的文字连缩进都保留着。这里有个我最初忽略的细节——文本后处理里的排版解析方案。识别代码截图时选单栏-保留缩进行首缩进和行中空格原样保留读多栏论文页面就选多栏-按自然段换行左右栏文字按阅读顺序输出不会串行。另外直接把剪贴板里的图片粘进这个页面也能识别这个入口很隐蔽但相当实用。倒推第三步成堆图片交给批量识别手机里几百张书页照片全拖进批量OCR页的任务列表点开始任务进度条逐张跳动每张图下方标注着耗时和状态。识别结果能导出成 txt、jsonl、md 或 csvExcel格式。我踩过的坑是照片里的水印和页角阴影会被误识别成正文——好在有忽略区域功能在忽略区域编辑器里按住右键把水印可能出现的位置框出来任务里这些区域整块跳过输出干净得多。倒推第四步扫描版PDF文字提取的关键设置最难啃的书是文档识别页搞定的。它支持 pdf、xps、epub、mobi、fb2、cbz 等格式本身带文字层的直接提取文本扫描件则走OCR并输出双层可搜索PDF。长文档一定要复用忽略区域把页眉页脚框掉否则页码和书名会混进正文。设置好、点开始剩下的交给夜晚第二天直接拿结果。彩蛋二维码、命令行与多语言界面顺手还捡到几个彩蛋。二维码页既能截图扫码支持一图多码也能输入文本生成二维码、调节纠错等级。想自动化的话项目带命令行和HTTP接口文档在 docs/README_CLI.md 和 docs/http/ 目录下可以把识别能力嵌进自己的小工具。界面支持简体中文、繁体中文、英文、日文等切换更新记录都写在 CHANGE_LOG.md 里。什么时候值得用我的建议如果你的资料里也压着大量扫描版书、课件截图和无法复制的旧 PDF又在意隐私、不想把内容传到在线服务这款免费离线的OCR工具几乎就是为你准备的。去项目仓库下载最新发行版即可想读源码或参与开发可以git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR。从一张截图开始试起多半用不了多久你就会和我一样把它设成默认工具。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考