Papermerge 文档管理系统部署教程:10 分钟把扫描文档变成可检索的数字档案

📅 2026/8/22 18:13:01
Papermerge 文档管理系统部署教程:10 分钟把扫描文档变成可检索的数字档案
Papermerge 文档管理系统部署教程10 分钟把扫描文档变成可检索的数字档案【免费下载链接】papermergeOpen Source Document Management System for Digital Archives (Scanned Documents)项目地址: https://gitcode.com/gh_mirrors/pa/papermergePapermerge 是一款开源文档管理系统干的事情很单一把散落在各处的扫描 PDF——发票、合同、银行账单——收进文件夹、标签和可搜索的文本索引里。如果你属于上个月签的合同现在找不到了这类人这篇教程带你从一台空 Linux 机器走到一套能用的数字档案全程约 10 分钟期间会完成第一份文档入库。 部署 Papermerge 前先确认三件事做完这步你手里有一台可以直接跑 Papermerge 的机器后面只剩执行命令。Papermerge 用 Docker 部署一共四个容器协同工作Web 应用、PostgreSQL 数据库存文档元数据和搜索索引、Redis 缓存以及一个 worker 后台节点——它是不占屏幕的后台进程专门接走 OCR 这类耗时任务保证你上传文档时界面不卡。Docker Compose 则是一条命令拉起整套服务的工具它读一份描述容器关系的配置文件一次性把全部容器启动起来。先在终端确认两件事分别执行docker version和docker compose version各输出一行版本号就说明容器环境就绪任一提示 command not found 就先装好 Docker 和 Docker Compose。再看硬件至少 2GB 内存、20GB 空闲磁盘镜像和 OCR 语言包会占掉其中一部分。 一条命令启动 Papermerge 的四个服务做完这步你手里有四个正在运行的容器浏览器打开 http://localhost:8000 就是登录页。先下载仓库compose 配置和 docker/config 下的三个配置文件都在里面git clone https://gitcode.com/gh_mirrors/pa/papermerge cd papermerge这一步拉取仓库源码体积几十 MB一般 1~3 分钟终端提示符正常返回且无报错即成功。再进入 docker 目录启动服务cd docker docker-compose up -d首次运行会自动下载四个镜像可能要几分钟。看到终端输出里四个容器依次就绪、没有 ERROR 字样就算成功如果长时间卡在某个镜像的拉取上往下看本节末尾的自查清单。先记住这张对照表后文多处会用到事项值 / 位置默认管理员账号admin / admin首次登录后请修改Web 访问端口8000在 docker/docker-compose.yml 的 ports 项主配置文件docker/config/papermerge.config.pyOCR 语言、媒体路径、数据库凭据应用设置docker/config/app.production.pyworker 节点设置docker/config/worker.production.py数据库卷postgres_data7媒体文件卷media_root起不来时症状 → 自查清单镜像拉取长时间无进展多为网络问题重跑一次docker-compose up -d会续传提示 8000 端口已被占用参考下文改访问端口一节浏览器打开是 502 或一直转圈在 docker 目录执行下面这条命令实时查看每个容器的输出按 CtrlC 退出找到带 ERROR 或 Traceback 的容器就是病灶用docker-compose restart重启它再刷新页面。docker-compose logs -f 用默认账号登录 Papermerge 并登记第一份文档做完这步你手里有一个能管理系统的账号以及一份已经入库、文字可被关键词命中的扫描文档。打开 http://localhost:8000输入 admin / admin见上文表格。登录后立刻从右上角账户菜单改掉密码——这台机器接下来存的都是重要文档默认密码不能留过夜。主界面左侧是文件夹和文档缩略图列表右侧是选中文档的预览预览区上方有 Run OCR 按钮点顶部上传按钮选一份本地扫描 PDF比如下面这种银行账单上传完成后文档缩略图出现在列表里。接下来 OCR光学字符识别会把扫描页上的印刷文字转成真正的文本价值在于上个月那 3 页合同现在在搜索框输入关键词几秒就能定位。注意当前默认 OCR 语言是德语中文或英文文档要在下一节调整。⚙️ 定制 Papermerge改端口、加 OCR 语言、开自动化规则做完这步你手里有一套符合自己习惯的配置端口、识别语言、自动归类都能自己控制且每项都有验证方法。改访问端口compose 文件里 ports 现在写的是 8000:8000即主机 8000 端口转发到容器内。想换 8080打开 docker-compose.yml 把那一行改成ports: - 8080:8000然后在 docker 目录重跑docker-compose up -d。成功判据http://localhost:8080 能打开登录页原 8000 端口不再响应。加 OCR 语言语言白名单在 papermerge.config.pyOCR_DEFAULT_LANGUAGE 决定默认识别语言当前镜像里是 deuOCR_LANGUAGES 是可选语言列表一行一种语言例如加一行 chi_sim 以支持简体中文。改完重新上传或对该文档重跑 OCR然后在搜索框输入文档正文里的一个词——能命中即配置生效。开自动化规则管理后台的 Automates 模块可以写规则例如文档类型匹配 Invoice → 自动移入 My Invoices 文件夹。建好规则后上传一份对应发票它不经过手动拖拽直接出现在目标文件夹里规则就算立住了。 备份数据库与媒体卷给数据留一条后路做完这步你手里有一份随时能还原整个档案库的备份换机器或误删都不慌。Papermerge 的数据只落在两个卷里名称见上文表格postgres_data7 存元数据和搜索索引media_root 存 PDF 原件、缩略图和 OCR 文本。在 docker 目录执行docker volume ls列表里能看到这两个名字位置就确认了。养成一个习惯每次动系统之前升级、批量改配置先用 Docker 的卷备份功能把这两个卷打包走还原时在新环境把两个卷挂回全新部署即可。验证方法还原后文档列表、标签、搜索结果应与改动前完全一致。✅ 部署后依次做这五件事每件都有验收标准做完这步你手里是一套经得起检查的 Papermerge 部署下面五条都能在 1 分钟内完成并自验。改 admin 密码登录 → 右上角账户菜单 → 修改再用旧密码试登一次应被拒绝。调 OCR 语言编辑 docker/config/papermerge.config.py在 OCR_LANGUAGES 加一种语言并同步改 OCR_DEFAULT_LANGUAGE上传一份该语言文档搜正文词能命中即生效。换端口编辑 docker/docker-compose.yml把 8000:8000 改为 8080:8000 并重启服务新端口能打开、旧端口无响应即成功。建一条自动化规则管理后台 Automates 里建自动打标签或自动归文件夹的规则上传一份匹配文档标签或位置自动变化、无需手动操作即成立。验证备份把 postgres_data7 和 media_root 两个卷打包备份恢复到一个新环境文档列表、标签、搜索结果与改动前完全一致即通过。【免费下载链接】papermergeOpen Source Document Management System for Digital Archives (Scanned Documents)项目地址: https://gitcode.com/gh_mirrors/pa/papermerge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考