Umi-OCR 离线 OCR 完整实操:从一张截图到一个文件夹的文档

📅 2026/8/26 16:10:27
Umi-OCR 离线 OCR 完整实操:从一张截图到一个文件夹的文档
Umi-OCR 离线 OCR 完整实操从一张截图到一个文件夹的文档【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR深夜十一点公司共享文件夹里被人丢进来一个目录三百张扫描的报销单——你明天要值班得把里面的金额和日期全填进表格。一张一张点开敲得敲到天亮。这种活正是 Umi-OCR 这类离线 OCR 识别工具的用武之地识别引擎装在本地图片不出电脑想识别多少张都行。一句话定性Umi-OCR 就像装在你电脑里的一台文字印刷机——截图、文档、一整文件夹的照片丢进去文字原样出来不注册、不联网、不限额。下文按任务大小推进先把软件跑起来再从最小的识别屏幕上的一段字开始做到把一份文档变成可搜索文本最后跑一个整文件夹的批量任务。末尾是参数调节对照和故障排查清单遇到问题直接翻。先跑起来解压、双击、开机下载从项目发布页拿.7z压缩包或.7z.exe自解压包。电脑没装压缩软件就选自解压包双击自动解开。解压放到任意目录比如D:/Tools/Umi-OCR。路径里别带中文和空格能省掉一堆兼容性杂症。启动Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。喜欢命令行的 Windows 用户也可以走 Scoopscoop install extras/umi-ocr。首次启动会按系统语言自动切好界面。主界面由一排标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置想用哪个点哪个右上角还能锁定常用标签防误关。⚠️ 注意第一次启动前把软件目录加进杀毒软件白名单。它内置本地 OCR 引擎和运行库部分杀软会误报加完白名单能省掉很多为什么闪退的折腾。截图识别把屏幕上的字按快捷键抓下来日常最高频的需求屏幕上有一段字想立刻拿走。打开截图OCR标签页按快捷键唤起截图框划出目标区域识别结果立刻出现在右侧记录栏。如果剪贴板里已经有一张图比如刚从聊天窗口复制的图直接在这里粘贴就能识别连截图都不用截。记录栏不是只读展示文字可以直接改错右键可以划选多条记录一起复制也可以直接删掉不要的。技巧竖排文字也认得。排版解析能自动处理横排和竖排从右到左的排版前提是识别语言库本身支持竖排文字。三步把扫描 PDF 变成可搜索文档截图识别管一张图两百页的扫描文档就得靠文档识别标签页了三步添加文档拖入或选择文件。支持pdf, xps, epub, mobi, fb2, cbz六种格式扫描版 PDF 是最典型的场景。选输出格式选双层可搜索PDF还是文本文件。双层 PDF 是底层原图、上层透明文字——外观和扫描件一模一样但里面的字能搜索、能复制、能划线归档历史资料时直接顶用。开始任务跑完可以顺手勾上任务完成后自动关机/待机过夜处理剩下的部分。底层的逻辑是解析 → 识别 → 重组解析器依赖 PyMuPDF先把文档拆成本来就有的文本层和需要识别的扫描图片层文本层页面直接提取速度快且零识别误差纯扫描页才交给本地 OCR 引擎逐页识别最后按阅读顺序拼装输出。你也可以选整页强制OCR无视文本层全部重新识别。⚠️ 注意文档里有固定页眉页脚、不想让它们进结果的话可以按页码范围设置忽略区域v2.1.1 起支持。想要体积小、好编辑的文件v2.1.2 起还能输出单层纯文本PDF。拖进一整文件夹图片挂机等结果回到开头那三百张报销单。切到批量OCR标签页把图片或整个文件夹直接拖进来支持jpg, png, webp, bmp, tif, tiff等常见格式没有数量上限一次拖几百张也没问题。点开始任务文件列表逐张显示每张图的耗时和置信度右侧实时输出识别结果。任务跑完可选txt, jsonl, md, csv四种格式保存csv 用 Excel 能直接打开。晚上跑批时勾上任务完成后自动关机/待机早上起来收结果就行。如果图片上有统一的水印、LOGO不想让它们混进结果在右侧设置进入忽略区域编辑器按住右键在图片上绘制多个矩形框框住水印可能出现的位置识别时这些区域内的文字会被自动排除。⚠️ 注意只有完全处于矩形框内部的整个文本块才会被忽略而不是单个字符。画框宁可大一点把水印所有可能出现的位置都包住——漏框一次结果里就多一行杂音。挂机场景还有个细节v2.1.2 起批量任务支持暂停任务只要不退出软件电脑待机/休眠唤醒后可以接着跑。 二维码既能扫也能造二维码标签页管两件事扫码截图/粘贴/拖入本地图片读取其中的二维码、条形码支持一图多码覆盖 QRCode、DataMatrix、PDF417、EAN13 等 19 种协议。生成输入文本生成二维码图片可调纠错等级等参数。⚙️ 调一调参数四个档位让它更顺手软件好不好用多半取决于会不会调参数。四个最常动的档位拧到位体验就上台阶了。档位一换引擎默认内置Rapid-OCR兼容性好和PaddleOCR速度稍快两套引擎全局设置里随时切换。识别不准、报错的时候先换引擎试试常常比调别的参数更有效。档位二选排版方案OCR 引擎吐出来的文字是散装的谁先谁后由排版解析决定。内置预设方案方案适用场景多栏-按自然段换行两栏/三栏排版的论文、书籍自动按段落断行最常用多栏-总是换行每句独立成行适合后续按行处理多栏-无换行强制全部合并成一行单栏-按自然段换行单栏文档段落自然换行另有总是换行/无换行变体单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理引擎原始输出不整理拿不准就选多栏-按自然段换行覆盖大多数场景代码截图切到单栏-保留缩进输出的缩进结构基本保持得住。档位三界面语言 ≠ 识别语言界面语言管按钮菜单长什么样识别语言库管 OCR 引擎认哪种文字两处分开放置界面语言全局设置 → 语言/Language支持中文、繁体中文、英文、日文、俄语、葡萄牙语、泰米尔语等首次启动按系统设置自动识别。识别语言库在各标签页的文字识别设置里单独选择或下载。比如界面用中文、识别语言库选日文读日文书籍时界面不用跟着变。档位四性能参数情况去哪里调长图/大图识别不完整页面设置 → 文字识别 → 调高限制图像边长别盲目放大原图放大会放大噪声准确率反而降内存占用偏高PaddleOCR 插件 v2.1.4 起默认内存不超过系统总内存一半想再压可在插件配置里调低线程数截屏闪烁、界面错位全局设置 → 界面和外观 → 渲染器切换渲染方案或关闭硬件加速进阶命令行和 HTTP 接口想把 Umi-OCR 嵌进自己的流程有两条程序化通道命令行入口就是主程序Umi-OCR.exe所有指令支持简写如--screenshot可写--sc。截图识别、批量处理、生成二维码都能一条指令完成umi-ocr --screenshot --clip umi-ocr --path D:/scans -- result.txt umi-ocr --qrcode_create 文本内容 D:/qr.png 256命令行靠本地 HTTP 服务通信默认开启只监听本地环回、不经过物理网卡没反应时先去全局设置确认没被关掉。参数和简写规则见项目里的docs/README_CLI.md。HTTP 接口启动后本地 HTTP 服务提供图片OCR、文档识别、二维码等接口开发者可以几十行代码封装成局域网内的小工具实现上传图片 → 返回 JSON 识别结果。翻车速查5 个常见坑忽略区域画了水印文字还是出现了→ 只有整个文本块完全在矩形框内才会被忽略把框画大包住所有水印位置并确认配置已保存。长图识别结果缺了尾巴→ 调高限制图像边长别盲目放大原图——放大会增加噪声准确率反而降。截图时界面闪烁、错位→ 到界面和外观 → 渲染器切换渲染方案或关闭硬件加速。命令行敲了没反应→ 确认全局设置里 HTTP 服务已开启入口必须是主程序Umi-OCR.exe备用启动器可能不支持命令行。几万张图片的文件夹打开很卡→ v2.1.5 起优化了异步加载预览界面会显示加载进度等加载完再操作即可。下次再在深夜打开那个装满扫描件共享文件夹不用手敲了——拖进 Umi-OCR让它跑。明早起来收结果就行。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考