Umi-OCR 从零到一保姆级教程:免费离线搞定截图、批量图片与 PDF 文字识别

📅 2026/8/15 11:25:52
Umi-OCR 从零到一保姆级教程:免费离线搞定截图、批量图片与 PDF 文字识别
Umi-OCR 从零到一保姆级教程免费离线搞定截图、批量图片与 PDF 文字识别【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR你有没有遇到过这样的尴尬时刻课件截图里的公式复制不出来只能对着屏幕一个字一个字敲同事发来一份扫描版合同想改个错别字都得重新打一遍图书馆下载的论文 PDF整篇都是图片连检索都做不到。别急着买那些动不动就收费的在线 OCR其实有一款免费、开源、完全离线的文字识别工具能把这些麻烦一次全解决——它就是Umi-OCR。Umi-OCR 是一款免费开源的离线 OCR 软件内置多国语言识别库支持截图识别、批量图片识别、PDF 文档识别、二维码扫描与生成解压即用、无需联网是个人办公和效率达人的文字搬运工。这篇教程不绕弯子我按自己这几年的使用心得从第一次打开软件讲到写代码自动调用接口帮你把它的潜力全部榨干。一、先看它到底能干什么一张表看懂核心功能在动手之前先花 30 秒了解 Umi-OCR 的能力边界。它不是一个只会截图出字的小工具而是一套完整的文字处理方案功能模块支持格式 / 能力典型使用场景截图识别快捷键唤出截屏框框选即出字网页、视频、软件界面里的文字批量识别jpg/png/webp/bmp/tiff 等 8 种图片格式几百张图片一次性转文本文档识别pdf/xps/epub/mobi/fb2/cbz 六种格式扫描版 PDF 提取文字、生成双层可搜索 PDF二维码扫码 生成支持 19 种码制协议批量解析码、生成码图片接口能力命令行、HTTP API对接自动化流程、程序调用看到没有从一张截图到一整本扫描书它都能处理。而这一切都发生在你的电脑本地不联网、不传云端、不泄露隐私。这一点对处理合同、论文、病历等敏感文档来说简直是刚需。二、最快上手路径从下载到出字只需 3 分钟Umi-OCR 是绿色软件不需要安装下载压缩包解压就能跑。完整流程只有三步下载发布包从项目发布页获取.7z或.7z.exe自解压包。自解压包适合没装解压软件的电脑双击自己解压。解压并启动解压后进入文件夹双击Umi-OCR.exeWindows或运行umi-ocr.shLinux。首次启动会自动按系统语言切换界面。按下快捷键截屏识别切到截图 OCR标签页按下默认截图快捷键框选屏幕上任意文字区域识别结果立刻出现在右侧。第一次打开软件你会看到类似这样的界面——标签页式的布局左侧是功能页右侧是设置与记录面板Umi-OCR 的批量识别页左侧文件列表、中间进度条、右侧设置与记录一次可塞入几百张图片。如果你只是想截个图、出个字到这一步已经够用了。但别急着关掉这篇文章——后面这些技巧才是让它从能用变成好用的关键。三、新手任务把截图识别调到最顺手截图识别是 Umi-OCR 使用频率最高的功能但它默认的排版输出未必符合你的习惯。这里分享三个我踩过坑之后总结的调整项。3.1 排版解析方案别让识别结果乱成一锅粥OCR 引擎吐出来的原始文字经常是零散的文本块顺序和换行都不符合阅读习惯。Umi-OCR 内置的排版解析功能专门解决这个问题在截图页右侧的设置 → 文本后处理里可以切换。用白话解释排版解析就是智能排版助手它负责判断哪些文字属于同一段落、哪些是标题、哪些需要换行。预设方案有 8 种新手先记住最常用的三个多栏-按自然段换行默认方案自动识别多栏布局比如报纸、论文双栏按自然段规则换行适合 90% 的场景单栏-保留缩进识别代码截图的神器保留行首缩进和行中空格代码粘贴出来还是整齐的不做处理OCR 引擎的原始输出每句话都换行适合你只需要裸文本的时候。这几个方案都能自动处理横排和竖排从右到左的文本前提是识别引擎本身支持对应语言。3.2 截图识别的两个隐藏效率点第一别处复制的图片也能识别。看到网上文章里一张没法复制的图直接复制图片在 Umi-OCR 窗口里CtrlV粘贴立刻识别。这招比截图更快。第二识别结果支持划选复制。右侧记录栏里可以鼠标划选多个记录一次性复制做笔记摘抄时非常顺手。截图页左侧的图片预览栏也能直接划选图片局部复制。来看看实际效果下面这张图是截图识别代码片段时的预览左侧红色框选的是原图里的 Python 代码右侧是识别出的文字逐行对齐、缩进完整识别预览左侧原始截图右侧识别结果代码类内容配合保留缩进方案还原度极高。3.3 图像边长限制一个小参数影响识别的准与快在文字识别设置里有一个限制图像边长参数limit_side_len默认 960。它的作用是把超长超大的图片压缩后再识别从而提速。但如果你的图片文字很小、放大后反而更清楚可以把数值调高到 2880 甚至更高。一句话原则文字密集、字体小就调高追求速度、图片普通就保持默认。调高会稍微增加内存占用和耗时但对识别精度有帮助。四、进阶任务批量图片与忽略区域的妙用如果你手头有几十张甚至几百张图片要转文字一张张截图显然不现实。这时候就该用批量 OCR标签页了。4.1 批量识别的基本操作把图片或整个文件夹拖进左侧列表支持 jpg/png/webp/bmp/tif 等格式没有数量上限。点击开始任务软件会并行处理进度条实时显示。任务完成后识别结果可以保存为txt、jsonl、md、csv(Excel)四种格式其中 csv 格式能直接丢进 Excel 做后续分析。批量页还支持一个实用功能任务完成后自动关机或休眠。晚上睡觉前丢几百张图进去第二天早上直接收成果省电又省心。4.2 忽略区域不只是去水印忽略区域是批量识别里一个容易被低估的功能。它的原理很简单在图片上画矩形框框内区域整块忽略。最常见的用法是去掉水印但它还有两个高价值场景去除页眉页脚批量处理扫描版论文时每页的期刊名、页码、日期都会混进识别结果用忽略区域框掉输出干净得多排除干扰元素比如图片角落的 LOGO、时间戳、拍摄参数信息。操作时在批量页右侧设置里进入忽略区域编辑器按住右键绘制矩形框即可。注意一个小细节忽略区域是按整个文本块生效的不是按单个字符所以框尽量画大一些确保完全包裹水印可能出现的位置。4.3 实战案例把 1000 页扫描合同变成可检索档案拿企业场景举个具体的例子。假设某律所需要把历史扫描版合同数字化这批合同的特点是每页左上角有律所 LOGO、页脚有页码、正文为单栏但夹杂手写批注。用 Umi-OCR 的处理方案是全部 PDF 先转成图片导入批量识别或者直接用后面的文档识别功能配置忽略区域框掉左上角 LOGO 和页脚页码排版方案选单栏-按自然段换行输出 csv txt 双格式csv 供 Excel 建索引txt 供全文检索。这样处理后原本无法检索的扫描件变成了可搜索的文本档案后续按关键词查案卷只需要几秒钟。这就是工具组合起来的力量。五、高级玩法PDF 文档识别与双层可搜索 PDF如果说截图和批量识别是开胃菜那PDF 文档识别就是 Umi-OCR 的主菜。它依托 PyMuPDF 解析引擎能直接处理 PDF、EPUB 等六种格式的文档并且内置四种内容提取模式提取模式工作原理适用场景混合模式一页里既有原生文本又有扫描图时各取所长大部分 PDF推荐首选整页强制 OCR整页当作图片重新识别扫描质量差、需要最高还原度的文档仅图片 OCR只识别页面里的图片区域图文混排、图片为主的文档仅文本拷贝不 OCR只提取 PDF 自带的文本层本来就是文字版 PDF快速拿文字对扫描版 PDF最推荐的功能是输出为双层可搜索 PDF。用大白话说这种 PDF 的底层是扫描图片保证排版原样上层叠加了一层看不见的识别文字。结果就是——眼睛看到的是原版扫描件但鼠标可以选中、搜索、复制文字。这在归档、论文管理场景里简直无敌。文档识别页还支持指定页数范围比如1-5,10-15、忽略区域排除页眉页脚和加密文档解密提供密码即可细节做得很到位。根据项目更新日志从 v2.1.0 加入 PDF 识别到 v2.1.5 修复页面旋转问题、补齐单层 PDF 文本写入这个模块一直在稳步打磨。六、疑难杂症 FAQ六个高频问题的解决思路Q1识别结果顺序乱了一段话被拆得七零八落调整排版解析方案多栏文档选多栏-按自然段换行代码截图选单栏-保留缩进。Q2水印文字总是混进结果里用忽略区域框掉水印位置记住框要大一些且只对整块文本生效。Q3超大长图识别特别慢在批量页设置里调高限制图像边长到 2880图片会先被压缩再识别速度立刻提升。Q4界面出现闪烁、错位进全局设置 → 界面和外观 → 渲染器切换到不同的渲染方案或直接关闭硬件加速。Q5想改界面语言/主题全局设置里选语言/Language支持繁中、英语、日语等主题有多个亮/暗方案可选。Q6任务中途想暂停/恢复v2.1.2 起批量任务支持暂停只要不退出软件待机/休眠后也能恢复任务。全局设置页长这样语言、主题、快捷键、开机自启都在这里配置全局设置页语言、主题、渲染器、开机自启等基础配置都集中在这里。七、效率进阶命令行与 HTTP 接口把 OCR 变成自动化流水线如果你只把 Umi-OCR 当图形工具用那它已经值回票价。但它的另一半价值藏在命令行和HTTP 接口里——这意味着你能把它塞进脚本、对接业务系统。7.1 命令行一键截图、批量出字命令行入口就是主程序Umi-OCR.exe在终端里调用即可。常用指令如下# 鼠标框选截屏识别 umi-ocr --screenshot # 指定屏幕和区域自动截图无需鼠标操作 umi-ocr --screenshot screen0 rect50,100,300,200 # 识别指定图片或整个文件夹支持多个路径 umi-ocr --path D:/img1.png D:/img2.png D:/image/test # 识别结果输出到文件覆盖/追加 umi-ocr --screenshot --output result.txt umi-ocr --screenshot --output_append result.txt # 识别并生成二维码 umi-ocr --qrcode_read D:/qrcode.png umi-ocr --qrcode_create https://example.com D:/out.png 256小技巧指令支持前几个字母简写比如--screenshot可写成--sc对大多数系统还能省略.exe后缀。命令行与图形界面的参数是联动的——OCR 语言、排版方案等沿用截图 OCR标签页的设置。7.2 HTTP 接口让程序替你干活软件默认在127.0.0.1:1224开放本地 HTTP 服务支持图片 OCR、PDF 文档识别、二维码三大类接口。图片识别最简单直接传 Base64 即可import requests, base64 with open(test.png, rb) as f: img_b64 base64.b64encode(f.read()).decode() resp requests.post(http://127.0.0.1:1224/api/ocr, json{ base64: img_b64, options: { ocr.language: models/config_chinese.txt, # 简体中文 tbpu.parser: multi_para, # 排版方案 ocr.cls: False # 方向纠正 } }) print(resp.json()[data])文档识别的流程稍长但更强大先上传文件拿任务 ID → 轮询任务状态 → 生成目标文件如双层 PDF→ 下载 → 清理任务。项目自带 Python 和 Web 的完整示例代码位置在 docs/http/ 目录下照着抄就能跑通。完整的接口参数说明见 api_doc.md 和 api_ocr.md命令行进阶玩法见 docs/README_CLI.md。提醒一句HTTP 接口对并发支持一般建议顺序调用大批量调用偶尔报ECONNREFUSED之类的错重新发一次请求即可不影响整体流程。7.3 多语言与本地化跨国团队也能用Umi-OCR 的界面和识别模型都支持多国语言。界面语言在全局设置里切换识别模型则在插件设置里选择。它的本地化工作通过 Weblate 平台协作完成已覆盖英语、日语、繁中、韩语、俄语、葡萄牙语、泰米尔语等多语言界面同一款软件可以切换中、日、英等多种界面语言识别模型也随插件提供多种语言库。八、性能调优速查按你的电脑配置选参数不同配置的电脑识别体验差异很大。我根据实测给出三档推荐配置直接抄作业即可硬件配置图像边长限制并行任务数方向纠正(cls)备注低配4GB 内存9601关闭优先保证不卡顿标准8GB 内存19202按需开启日常使用最均衡高性能16GB28804开启大批量任务的效率之选其中方向纠正ocr.cls是专门处理倾斜、倒置扫描件的开关开启后会牺牲一点速度换取识别准确率适合扫描质量参差不齐的文档。写在最后它凭什么值得留在你的工具箱里回看整个 Umi-OCR它的核心优势可以浓缩成三句话免费开源 完全离线隐私安全有保障个人与商用皆可不用看云服务脸色能力闭环截图、批量、PDF、二维码全覆盖从零散图片到整本扫描书一个工具搞定接口开放命令行与 HTTP API 让它从用户工具升级为系统组件自动化潜力巨大。如果你刚接触它我建议按这个顺序进阶先熟练截图识别和排版方案再上手批量 忽略区域然后攻克 PDF 双层输出最后尝试用命令行或 Python 脚本把它接进自己的工作流。每一步解锁的能力都会让你在处理文字时多一分从容。想更深入了解的话项目自带的文档都是干货更新日志 CHANGE_LOG.md 记录了每个版本的功能演进命令行手册 docs/README_CLI.md 和 HTTP 接口文档 docs/http/README.md 是开发者必读。此外插件机制支持切换不同的离线 OCR 引擎如 PaddleOCR、RapidOCR这又是另一个值得探索的深水区了。祝你把文字搬运这件事彻底交给机器。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考