Umi-OCR 完整上手指南:免费离线 OCR 软件快速解决截图、批量图片与 PDF 文字提取难题

📅 2026/8/17 18:24:50
Umi-OCR 完整上手指南:免费离线 OCR 软件快速解决截图、批量图片与 PDF 文字提取难题
Umi-OCR 完整上手指南免费离线 OCR 软件快速解决截图、批量图片与 PDF 文字提取难题【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR如果你正为图片里的文字搬不出来发愁那么今天的主角值得你花五分钟认识Umi-OCR 是一款开源免费、完全离线的 OCR 文字识别软件主打截图识别、批量图片处理、PDF 文档转文字与二维码扫描生成解压即用不联网也能稳定工作。先别急着看参数不妨回忆一个熟悉的画面一沓扫描版合同、一屏接一屏的课程截图要把里面的字搬进文档网页识别工具却要么要登录、要么限次数涉及隐私的资料更不敢随便上传。于是你只能对着图片手动抄写——而这正是 Umi-OCR 想要终结的苦差事。一个让人抓狂的场景扫描件、截图和不敢上传的隐私作为经常和文字打交道的人你一定经历过类似的时刻编辑软件不认图片只能靠肉眼一行行誊抄网课里的重点内容截图存了一堆真要引用时还得重新打字最要命的是隐私——涉及合同、身份信息、内部资料的图片谁都不敢丢给云端识别服务。这类痛点的解药恰恰是本地识别图片不出电脑识别全程在本地完成速度和安全感兼得。接下来的篇幅我会带你从第一次启动开始一路走到命令行、HTTP 接口这类进阶玩法全程照着做就能上手。主角的底气Umi-OCR 凭什么敢承诺离线可用在动手之前先快速看清它的三个底牌你后面用起来会更安心开源免费代码全部开放个人用、团队用都不花钱绿色免安装解压即运行不写注册表、不留系统垃圾本地引擎内置离线 OCR 引擎和多国语言识别库断网也能干活。换句话说从拿到它的那一刻起你就不欠任何一台服务器一次上传。这也是它和在线识别工具最本质的分水岭。起跑热身解压即用第一次启动只需三步项目发行版通常提供两种包普通压缩包.7z和自解压包.7z.exe。如果电脑里没装压缩软件选自解压版双击就能自动解压省心得很。拉取仓库git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR或者直接下载发行压缩包解压到任意文件夹Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh看到主界面出现就完成了——没有安装向导没有下一步按钮。 小提示软件首次启动会跟随系统语言自动切换界面文字。想手动调整后面调成顺手的样子一节会讲到。先把最高频的动作练熟框选屏幕文字一键复制走日常使用中截图识别是出现率最高的功能。无论是文章段落、报错信息、聊天记录还是别人发来的只读表格截图都能一键变成可复制的文本。操作路径只有三步打开「截图OCR」标签页按下软件默认的截图快捷键也可以进设置改成你习惯的组合键屏幕进入取景状态用鼠标框选目标区域松开后识别结果自动出现在右侧记录栏。识别完成后能做什么左侧预览栏支持鼠标划选直接复制右侧记录可以逐条编辑也能多选合并后一次性复制走。更妙的是就算没有截图从别处复制一张图片直接粘贴进软件同样能触发识别——是不是很省心 进阶小技巧遇到代码截图可以在「文本后处理」里选择单栏-保留缩进方案行首缩进和空格会被完整保留粘贴进编辑器后几乎不用二次整理。多栏杂志、竖排文章也各有对应的排版解析方案可选。正式开工前花两分钟把界面调成顺手的样子工欲善其事必先利其器。在进入大批量处理之前建议先去「全局设置」页做一轮轻定制后面用起来会顺手很多语言与主题界面支持简体中文、繁体中文、英文、日文等多语言亮色、暗色主题随时切换字体与比例觉得界面字太小可整体调大文字或界面缩放比例快捷方式一键创建桌面/开始菜单快捷方式还能设置开机自启窗口行为标签栏支持窗口置顶也能锁定标签页防止日常误触关闭。多语言这块值得多说一句软件不仅识别内容支持多国语言整个界面本身也做了完整本地化。下图展示了同一软件在简体中文、日文、英文下的界面表现团队还通过开放的翻译协作平台持续扩充语种这也是它能在全球社区流行的原因之一。批量流水线上百张图片拖进来水印页眉自动请出去如果说截图识别解决的是单张快取那批量识别解决的就是成堆的活。面对几百张商品图、资料截图或扫描件手动一张张来会让人崩溃而批量页能把这件事压缩成拖进去、点开始、等结果。在「批量OCR」页点击选择图片或直接把文件拖入列表区按需设置输出格式与输出目录点击「开始任务」进度条实时显示处理进度与单张耗时。支持 JPG、PNG、WebP、BMP、TIFF 等常见格式数量没有上限结果可以存为 TXT、JSONL、MD 或 CSV——其中 CSV 能直接用 Excel 打开归档整理特别方便。 别错过忽略区域如果图片角落固定有水印、LOGO 或页眉先在忽略区域编辑器里按住右键画出几个矩形框任务中这些位置的文字会被整体跳过识别结果会干净得多。这招对付带水印的批量资料尤其管用。扫描版 PDF 的救赎从逐页翻拍到全文可搜索扫描版 PDF 可能是比图片更令人头疼的存在内容明明都在却一个词都搜不了、复制不了。Umi-OCR 的「文档识别」正是为此准备的。在批量页点击「选择文件」导入 PDF也支持 XPS、EPUB、MOBI、FB2、CBZ 等电子书格式在输出设置中选择纯文本或双层可搜索 PDF启动任务软件自动逐页识别。选双层 PDF输出时生成的文件既保留原始扫描页面又内嵌了可选中、可复制的文本层——拿去检索、引用、归档都方便。和批量识别一样这里也能设置忽略区域来排除页眉页脚还能在任务完成后自动关机/休眠夜里挂机跑大文件第二天直接收结果。顺手的彩蛋二维码识别与生成一个页面全包你以为它只会认字其实二维码功能也是内置的识别与生成双向都支持扫码截图、粘贴或拖入一张含二维码/条形码的图片即可读出内容一张图里有多个码也能逐个识别生成码输入文本一键生成二维码图片可指定协议类型与纠错等级。兼容的编码协议多达 19 种包括常见的 QRCode、DataMatrix、PDF417 等应付日常办公绰绰有余。进阶玩法从图形工具升级成可编程组件如果你愿意多花十分钟Umi-OCR 还能变身开发者的好帮手命令行调用主程序支持--screenshot唤起截图、--path指定图片或文件夹批量识别、--show/--hide显示/隐藏窗口等指令写进脚本就能跑通一条识别流水线HTTP 接口在全局设置中开启本地 HTTP 服务后其他程序可通过接口调用图片 OCR、文档识别与二维码功能适合作为自建工具的底座插件体系通过UmiOCR-data/plugins目录可以扩展不同 OCR 引擎对识别速度或准确率不满意时换一个引擎试试也许会有惊喜。 命令行与接口的完整参数说明项目 docs 目录下的命令行手册和 HTTP 接口手册都有详细讲解按需翻阅即可。新手避坑速查表五个高频疑问一次说清现象常见原因快速解法识别速度偏慢当前引擎不适合你的机器全局设置里切换其他 OCR 引擎插件界面闪烁、UI 错位显卡加速渲染兼容问题全局设置→渲染器换一种方案或关闭硬件加速长图/大图识别不了图像边长超过限制批量页设置里调高限制图像边长数值竖排文字识别失败OCR 引擎不支持竖排换用支持竖排的引擎再选合适的排版解析方案想手动修改配置找不到入口配置文件在UmiOCR-data/.settings改完用--reload指令重新加载写在最后让文字提取从苦差事变成顺手的事回头看看开头那个场景一沓扫描件、一屏接一屏的截图、不敢上传的隐私——在 Umi-OCR 面前这些都变成了拖进去、点开始、等结果。从第一次框选截图到批量处理、PDF 转换再到命令行与 HTTP 接口的进阶玩法你会发现工具的价值不只是省时间更是把能做但懒得做变成了一键就有捷径。这款软件完全免费开源项目也一直在迭代。建议偶尔翻翻更新日志CHANGE_LOG.md新功能可能就在某次更新里悄悄上线。现在就动手下载体验吧——下一次需要搬运文字的时候希望你已经有了趁手的家伙。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考