免费离线OCR实战:一个下午,我把300页扫描件变成了可搜索PDF

📅 2026/8/20 22:00:30
免费离线OCR实战:一个下午,我把300页扫描件变成了可搜索PDF
免费离线OCR实战一个下午我把300页扫描件变成了可搜索PDF【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR上周五临下班同事丢来一摞扫描件300多页合同档案既不能复制也不能全文搜索核对个名字要翻半天。本想找在线工具应急可文件涉及隐私实在不敢往云端传。最后是开源免费的离线OCR软件Umi-OCR救了我——解压即用、断网可跑从下载到把整批PDF变成可搜索文档只花了一个下午。下面按时间线复盘这半天操作、参数和坑都写全了你照着走一遍就行。先算笔账为什么我弃用了在线OCR网站以前我也图省事用网页版识别工具直到那次上传了一份标着机密的文件心里越想越不安。OCR这件事本地跑和云端跑的差别用一张表就能说清对比项在线OCR网站Umi-OCR 本地离线OCR文件去向上传云端服务器全程留在本机网络依赖必须联网断网照常识别费用门槛免费额度有限、常要注册完全免费、开源批量能力单张处理、还限速几百张一次吃完输出格式大多是纯文本双层PDF等多种Umi-OCR 把识别引擎做成本地插件PaddleOCR 与 RapidOCR 两种可选内置简中、繁中、英、日、韩、俄等多国语言库。这意味着敏感资料永远不出你的电脑这一点对我来说就是决定性的。 下午 14:00下载解压三分钟开机从发布页拿 Umi-OCR_Rapid_v2.1.5.7z 压缩包解压后双击Umi-OCR.exe就能启动——没有安装向导、没有环境配置绿色免安装拷进U盘也能带走。第一次打开界面语言会自动跟随电脑系统设置简体中文环境基本零学习成本。 下午 14:15第一单活截个屏文字两秒到手我习惯先拿最顺手的功能试水打开截图OCR标签页按快捷键框选屏幕上的文字识别结果几乎同步出现在左侧右侧还能看到置信度。复制、编辑、划选多条记录都行甚至把别的程序里的图片复制一下、直接粘贴进来也能识别。处理聊天记录截图、网页报错弹窗这类随手一拍的场景从截图到拿到可复制文字用不了三秒钟。 下午 14:40批量处理一整包图片一口气吃完真正让我省下时间的是批量OCR页。我把攒了几周的几十张截图、照片全部拖进列表点击开始任务软件逐张识别顶部实时显示进度和每张的置信度任务结束可以把结果一次性导出成txt、jsonl、md、csv(Excel)任意格式接进别的流程都方便。没有数量上限一次塞几百张也没问题对超长任务还能设置完成后自动关机/待机挂机走人。 下午 15:10正题扫描PDF怎么变成能搜索的文档批量图片只是热身下午的重头戏是那300页扫描PDF。扫描件本质上是一堆图片的合订本文字都烙在像素里所以既不能复制也不能搜索。Umi-OCR 的文档识别给出了一条巧路——生成双层可搜索PDF底层原样保留扫描图像观感不变上层叠一层透明不可见的文字层。你看的仍是原图但电脑已经认识它了CtrlF 一按就能全文检索。照着下面五步走十分钟内能出第一份双层PDF打开文档识别标签页把PDF直接拖进左侧文件列表——pdf、epub、mobi、cbz 等格式都支持一次拖入整批也行右侧设置里把保存格式选成双层PDF只想要文字的话新版本也能输出单层纯文本PDF按文档语言切换识别语言中文资料选简体中文别让默认配置硬扛点开始任务右侧逐页显示进度单页通常一两秒。任务跑完后我随手抽了几页验证CtrlF 搜一个关键词能命中再放大看图像清晰度与原件一致。收工。小建议很多文档页顶有页眉、页脚有页码会混进正文。点忽略区域用鼠标把页眉页脚框起来还能指定页码范围导出的文本整洁度立马上一个台阶。 想让识别结果更漂亮4个参数值得动手上面是能用下面这4个开关能让你到好用识别语言中英混排的文档明确勾选含英文的配置准确率提升肉眼可见排版解析方案双栏论文、报纸一般能自动分栏遇到特殊情况可换单栏-保留缩进特别适合扫描版代码文档缩进能完整保留图像压缩对文件体积敏感时把压缩质量调到80%左右是个平衡点不敏感就保持默认画质还原最好OCR页数范围只想要中间某几页指定页数起始/结束就能跳过无用页面对超长文档还能分段精细处理。 文件多到要用批来算那就交给接口如果哪天你要处理的是整个文件夹甚至想把它写进自己的工具链Umi-OCR 还提供了HTTP接口上传文件 → 轮询任务状态 → 生成目标文件并获取下载链接 → 清理任务。接口文档在 docs/http/api_doc.md示例代码在 docs/http/api_doc_demo.py。下面这段Python脚本可直接改用import requests, time BASE http://127.0.0.1:1224 # 本地接口Umi-OCR需保持运行 # 1. 上传PDF可附带语言、忽略区域等参数 with open(scan.pdf, rb) as f: r requests.post(f{BASE}/api/doc/upload, files{file: f}) task_id r.json()[data][id] # 2. 轮询任务状态识别完成再继续 while True: r requests.post(f{BASE}/api/doc/result, json{id: task_id}) if r.json()[is_done]: break time.sleep(1) # 3. 指定输出为双层可搜索PDF r requests.post(f{BASE}/api/doc/download, json{id: task_id, file_types: [pdfLayered]}) url r.json()[data] # 4. 下载结果文件并清理任务释放资源 requests.get(f{BASE}{url}) requests.get(f{BASE}/api/doc/clear/{task_id})套上循环整个文件夹的扫描件批量转双层PDF只是几分钟的事。 翻车实录我踩过的4个坑以及怎么排雷PDF加密或损坏任务一直卡在等待。加密文件记得在参数里填密码实在排查不出来看软件日志——日志会写入UmiOCR-data/logs目录能帮你定位到具体是哪一页出的问题。语言没选对结果全是乱码。默认配置偏向简体中文遇到日文、韩文、俄文资料不换语言库出来的就是一堆天书。识别前先确认文档语言。低配机器跑大批量任务发烫卡顿。一次塞几百页大文件引擎压力不小可以在全局设置里调低引擎线程数、适当限制图像边长宁慢勿崩。以为双层PDF等于可编辑文档。它的文字层是不可见文本能搜索、能复制但双击不会有光标让你改字。要的是带样式的可编辑文件那是另一条路转换前先想清楚目标格式。 下班前还能再玩点什么这批文件处理完后我又顺手玩了两个彩蛋命令行调用umi-ocr --path D:/图片文件夹一条命令识别整个文件夹还能--qrcode_read识码、--qrcode_create生成二维码玩法详见 docs/README_CLI.md二维码工具内置扫码与生成支持19种码制日常给Wi-Fi、链接做张码够用。界面语言、主题、字体、开机自启这些杂项都在全局设置里多语言界面让不熟中文的朋友也能直接用。关于项目本身的说明在 README.md。想研究内部实现、做二次开发的可以clone源码回来看看git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR下次再有人发来复制不了的扫描件你就是那个三分钟给出解法的人。别拖了趁现在把第一批文件转起来转完你多半会问自己怎么没早点动手。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考