如何快速搭好 Papermerge:扫描文档 OCR 与全文搜索实战

📅 2026/8/22 17:30:03
如何快速搭好 Papermerge:扫描文档 OCR 与全文搜索实战
如何快速搭好 Papermerge扫描文档 OCR 与全文搜索实战【免费下载链接】papermergeOpen Source Document Management System for Digital Archives (Scanned Documents)项目地址: https://gitcode.com/gh_mirrors/pa/papermerge一堆扫描件、发票、合同文件名 001.pdf 乱成一团想找根本找不到Papermerge 是一款开源文档管理系统会自动对扫描图做 OCR、建立索引并支持全文搜索。按下面两步用 Docker 拉起来读完本文你就能把第一份扫描件归档并搜到它。 开始前的 30 秒检查先确认这 4 样省得中途卡住。项目要求Docker20.10docker -v确认内存至少 2GB 空闲磁盘5GB 空闲端口8000 没被别的服务占用都满足就直接开干。⚙️ 两步拉起来从代码到运行第一步拉取项目代码进到放着 compose 配置的 docker 目录。git clone https://gitcode.com/gh_mirrors/pa/papermerge cd papermerge/docker这一步只下载代码容器镜像会在下次启动时自动拉取。第二步一条命令启动 web、数据库、Redis、后台 worker 四个容器。docker-compose up -d做完的标志docker-compose ps里四个容器都是 Up浏览器打开 http://localhost:8000 出现登录页。首次拉镜像可能要几分钟稍等一下。 第一次访问把初始化做完打开 http://localhost:8000 登录。启动脚本会自动建好管理员账号用户名admin密码admin登录后第一件事进用户设置把密码改掉顺手的事别省。然后做两个基础设置OCR 语言默认是德语deu。如果你主要归档中文文档先到设置里把默认语言换掉中文文档还需装对应的 tesseract 语言包否则识别结果会是乱码。文件夹骨架按年份或类型建几个顶层文件夹比如2025-发票、合同后面拖东西进去就行。界面是类似桌面文件管理器的双面板左边文件夹和文档列表右边文档预览支持拖拽整理。 上手实操用它完成第一个任务现在把完整流程走一遍上传扫描件 → 自动 OCR → 搜索 → 打标归档。上传把一份扫描发票支持 PDF、TIFF、JPEG、PNG拖到列表页。系统自动跑 OCR缩略图出现绿色对勾表示识别和索引完成。搜索在顶部搜索框输入只出现在扫描图里的词比如店名、单号。它能搜到图片里的文字不用靠记文件名。归档给文档打上标签——标签带颜色列表里一眼能分出来——再拖进目标文件夹。右边面板就是当前文档的 OCR 语言、标签和文档类型。这些元数据是全文搜索和按条件过滤的基础。两个小提醒单文件上传默认上限 20MBOCR 在后台跑文件多就全传上过会儿再回来。❓ 总被问到的 3 个问题OCR 没识别出文字或全是乱码基本是语言不匹配默认识别语言是德语。归档中文文档要装中文 tesseract 语言包并在设置里切换默认语言。管理员密码忘了怎么办执行docker-compose exec app python manage.py changepassword admin输入两次新密码即可。数据怎么备份两个卷media_root所有扫描原件和postgres_data7数据库。把这两个卷都备下来就是完整备份。 想再深入一点项目提供 OpenAPI 规范的 REST API想把文档管理接进自己的脚本或其他工具可以直接调接口。源码和部署脚本分别在papermerge/和docker/目录有空可以翻翻。整个部署就两条命令加几个设置你的文档档案库已经跑起来了。现在先把第一份扫描件传进去试试搜索出来的效果。【免费下载链接】papermergeOpen Source Document Management System for Digital Archives (Scanned Documents)项目地址: https://gitcode.com/gh_mirrors/pa/papermerge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考