免费离线OCR软件完整指南:Umi-OCR如何搞定截图、批量与PDF识别

📅 2026/8/21 16:43:07
免费离线OCR软件完整指南:Umi-OCR如何搞定截图、批量与PDF识别
免费离线OCR软件完整指南Umi-OCR如何搞定截图、批量与PDF识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 软件装上就能把屏幕、图片和 PDF 扫描件里的文字抠出来全程不需要联网、不需要注册。它把识别引擎整个搬进你的电脑图片和文档都不离开本地硬盘识别多少张、什么尺寸、什么格式都由你自己说了算。先花 30 秒做个判断值不值得读下去它适合你如果——经常要复制扫描版 PDF、截图里的文字手动打字打到手酸手头有大量图片或合同要批量转文字又担心隐私文件上传云端想要一个免费、无次数限制、断网也能用的识别工具它不适合你如果——只偶尔识别一两张图且不介意上传在线服务换取零安装需要识别手写体、复杂表格结构或公式这些仍在开发路线图上接下来我按真实使用路径带你走先想清楚三个选择再用一个贯穿场景跑通全流程最后给出速查表和避坑清单。准备篇 · 动手前想清楚的三个选择Umi-OCR 是绿色软件解压即用不用安装。动手前只需想清楚三件事选择一你的系统平台。它面向 Windows 和 Linux 用户。Windows 双击Umi-OCR.exe启动Linux 在终端运行umi-ocr.sh。下载时看清平台对应的压缩包即可。选择二压缩包形式。项目发布页提供.7z和.7z.exe自解压包两种。电脑没装压缩软件就选自解压包双击自动解开装了 7-Zip 等工具则任选。选择三解压目录与杀毒软件。解压路径尽量不要带中文和空格能减少很多莫名奇妙的兼容问题。另外启动前建议把软件目录加入杀毒软件白名单——它内置了本地 OCR 引擎和运行库部分杀软会误报加白名单能省掉后续为什么闪退的烦恼。最小可行启动三步跑起来下载对应平台的压缩包 → 解压到如D:/Tools/Umi-OCR的干净目录 → 双击Umi-OCR.exe或运行umi-ocr.sh。第一次启动会自动按系统语言切换界面想手动改随时去全局设置里调。实战篇 · 用一份扫描版PDF走完从拖入到输出的全流程理论说再多不如跑一遍。挑一个最典型的场景把一叠扫描版 PDF 合同转成可搜索、可复制的文字。这条流程会带出软件三大主力功能全程大约几分钟。① 快速摘录遇到想复制的段落先按截图OCR开工之前先说个小技巧。日常遇到选不中、复制不了的文字不用打开文档识别——切到截图OCR标签页按下快捷键唤起截图框划出目标区域识别结果立刻出现在右侧记录栏。结果可以直接编辑改错、划选多条一起复制还能从聊天窗口复制一张图片回来直接粘贴识别。② 开始拖入 PDF让软件自己先读后认批量材料还是走正式流程。打开文档识别标签页把 PDF 直接拖进窗口。Umi-OCR 的底层逻辑是三步解析 → 识别 → 重组。它先拆开 PDF区分出本来就有的文本层和需要 OCR 的扫描图片层——有文本层的页面直接提取零识别误差、速度快只有纯扫描页才交给本地 OCR 引擎逐页识别。③ 中间框掉页眉页脚让输出更干净扫描件最烦人的是页眉页脚、水印每页都有混进结果里还得人工删。在忽略区域编辑器里按住右键绘制矩形框把这些位置全部框住。记住一个机制只有完全落在矩形框内的整个文本块才会被忽略所以画框宁可大一点把水印所有可能出现的位置都包住否则漏框一次输出里就多一行杂音。④ 产出选双层可搜索PDF原样外观、可搜可复制识别完成后选择输出格式。如果目标是归档强烈建议输出双层可搜索 PDF底层是原图、上层是透明文字外观跟扫描件一模一样但里面的文字可以搜索、复制、划线。想要体积小、好编辑的文件也可以选单层纯文本 PDF 或 txt、md、jsonl 等格式。深夜挂机党还能勾选任务完成后自动关机睡前扔进去几百页醒来直接拿结果。批量图片的流程几乎一样切到批量OCR标签页把图片拖进窗口支持jpg、png、webp、bmp、tif、tiff等常见格式一次几百张没有数量上限点开始任务右侧逐张显示耗时、置信度和结果输出为txt、jsonl、md、csvExcel 可直接打开。速查篇 · 想解决什么问题对着这张表找想解决的问题用哪个功能关键设置项屏幕上看到的文字随手复制截图OCR快捷键唤起截图框几十上百张图片一次处理批量OCR拖入图片 → 开始任务 → 选输出格式扫描版PDF转可搜索文字文档识别输出选双层可搜索PDF水印、页眉页脚混进结果忽略区域绘制矩形框框住整块文本位置代码截图排版乱套排版方案选单栏-保留缩进多栏论文输出顺序错乱排版方案选多栏-按自然段换行识别日文/英文书文字识别单独下载对应识别语言库界面想换成英文/日文全局设置语言/Language 切换排版方案是提升体验的第一旋钮。OCR 吐出的文字是散装的先后顺序全靠排版解析安排。默认选多栏-按自然段换行能覆盖大多数场景识别代码截图时务必切到单栏-保留缩进行首缩进和行中空格都能基本保住配合截图OCR简直是小程序员的福音。调优篇 · 准确率、速度、内存的三角取舍识别质量、速度、资源占用三者不可兼得但每个方向都有可操作的调节点想让识别更准长图或大图识别不完整时去文字识别设置里调高限制图像边长。注意是调这个参数而不是盲目放大原图——过度放大会增加噪声反而降低准确率。确认选对了识别语言库。界面语言和识别语言库是两回事前者管按钮菜单长什么样后者管 OCR 引擎认哪种文字。界面用中文、日常识别日文书二者完全可以搭配。想让速度更快在全局设置切换 OCR 引擎内置 Rapid-OCR 引擎兼容性好与 PaddleOCR 引擎速度更快。批量任务能并行跑线程数越多越快但会占用更多内存按机器配置取平衡。想让内存更省使用 PaddleOCR 插件时新版默认把内存占用限制在系统总内存的一半以内。在插件配置里调低线程数能进一步压低内存代价是速度略降。截图时界面闪烁或错位多半是显卡渲染兼容问题——去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速。避坑篇 · 三个高频现象的判别与修复遇到问题先判断是哪一类再对症下药忽略区域画了却没效果→ 原因多半是框太小文本块没有完全落入矩形框内或配置未保存 → 把框画大、包住水印全部可能出现的位置并确认保存。长图识别结果缺行少字→ 原因多半是图像边长超限被压缩 → 调高限制图像边长而不是放大原图。命令行指令没反应→ 原因很可能是本地 HTTP 服务未开启 → 确认全局设置里 HTTP 服务处于开启状态默认开启且仅监听本地环回、不经过物理网卡数据不会外泄。进阶篇 · 从会用到会扩展命令行、接口与插件图形界面已经够用但想把它嵌入自己的工作流还有两条程序化通道命令行模式入口就是主程序本身# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果输出到文件 umi-ocr --path D:/扫描件.png --output result.txt # 生成二维码 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256完整参数与简写规则见项目内docs/README_CLI.md命令行手册。HTTP 接口启动后本地服务提供 OCR、文档识别、二维码等接口接口文档在docs/http/api_doc.md。几十行代码就能封装成上传图片 → 返回 JSON 识别结果的小工具接入自己的自动化流程。想折腾的话项目还有独立插件库支持扩展更多 OCR 引擎。结尾 · 下一步Umi-OCR 解决的从来不只是识别文字这一个动作而是让本地材料重新变得可检索、可复制、可归档这件事。它免费、开源、离线运行截图、批量、PDF 识别覆盖了从日常摘抄到批量归档的绝大多数场景。下一步很简单去下载页拿到对应平台的压缩包解压双击然后随便找一张带文字的截图扔进去试试。五分钟后你会发现自己已经不太需要在线识别网站了。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考