3 步跑通 DeepSeek OCR:图片文字识别与 PDF 文字提取实操教程

📅 2026/8/24 4:33:52
3 步跑通 DeepSeek OCR:图片文字识别与 PDF 文字提取实操教程
3 步跑通 DeepSeek OCR图片文字识别与 PDF 文字提取实操教程【免费下载链接】deepseek_ocr_appA quick vibe coded app for deepseek OCR项目地址: https://gitcode.com/gh_mirrors/de/deepseek_ocr_appDeepSeek OCR 是一个轻量级的图片文字识别与 PDF 文字提取服务两个 OCR 接口把图片或 PDF 丢进去就能拿到纯文本、Markdown、CSV 或文档文件。你只需要一台装了 Docker 的机器不用手动装模型和配环境。这篇文章带你从启动服务一路讲到日常调用。 三步跑起来服务整个后端就一个服务图片与 PDF 两个接口都写在backend/main.py里。三步启动git clone https://gitcode.com/gh_mirrors/de/deepseek_ocr_app cd deepseek_ocr_app docker-compose up -d容器起来后后端占 8000 端口前端网页在 3000 端口。想确认服务可用打开http://localhost:8000/docs能看到自动生成的接口文档就对了端口不通或模型没加载时用docker logs deepseek-ocr-backend看日志。 图片转文本调用 /api/ocr上传一张图默认 mode 就是 plain_ocr返回的 text 字段是纯文字适合做全文索引或存档curl -X POST http://localhost:8000/api/ocr \ -F imagechart.png \ -F modeplain_ocr想把标题、列表这类结构保留下来就把参数改成modemarkdown其他不动拿到的 text 已经是排好版的 Markdown。遇到表格图片时改成modetables_csv表格里的数据会按行列转成 CSV 返回可以直接粘进 Excel 或导库。下图就是一张带数据表格的图表被识别后的效果 多页 PDF 文字提取调用 /api/process-pdfPDF 的处理链路是先把每页渲染成图片再逐页做 OCR最后把整份文档拼成你要的格式。请求示例curl -X POST http://localhost:8000/api/process-pdf \ -F pdf_filereport.pdf \ -F output_formatmarkdownoutput_format支持 markdown、html、docx、json 四个值默认是 markdown。PDF 里的图片默认会被一并提取出来extract_images默认为 true后面进阶部分再说怎么关掉。 定位图中某个词grounding 与 find_term想知道某个词在图里的哪个位置有两条路把grounding设为 true识别结果里会带上文字区域坐标方便你在图上画框用modefind_ref再配合find_term目标词模型会把这个词的所有出现位置都找出来逐个标记。下图是开启 grounding 后模型标出图中 helmet 一词位置的效果当 find_term 设为 all birds 时多个目标也会全部被标出 图片与 PDF OCR 参数速查图片接口POST /api/ocr参数默认值什么情况下要改它image必选要识别的图片文件modeplain_ocr要保留结构改 markdown表格图改 tables_csvprompt自由格式任务填一句指令groundingfalse需要文字区域坐标时打开include_captionfalse顺带要一段图片描述时打开find_termNonefind_ref 模式下填要查找的词schemaNone输出结构化 JSON 时附上字段定义base_size1024小字识别不准时调整处理尺寸image_size640同上控制送入模型的尺寸crop_modetrue边缘裁剪影响结果时切换test_compressfalse测试压缩链路时用PDF 接口POST /api/process-pdfmode、prompt、grounding、include_caption 含义与图片接口相同参数默认值什么情况下要改它pdf_file必选要处理的 PDF 文件output_formatmarkdown需要 html、docx、json 时切换extract_imagestrue只想要文字、不想要图时关掉dpi144小字读错就调高嫌慢就调低base_size / image_size / crop_mode1024 / 640 / true同图片接口 进阶prompt、dpi 与 extract_imagesprompt在自由格式模式下传一句指令比如让它描述这张图模型会在识别文字之外补上内容描述下图就是这种效果。dpiPDF 渲染精度。扫描件小字多时调高它速度要求高时调低。extract_images只关心文字就设为 false能省不少存储。include_caption打开后每段结果附带图片描述做素材库时省事。❓ 启动与识别效果常见问题服务起来后怎么确认可用打开http://localhost:8000/docs看接口文档或按上面的 curl 发一张测试图。起不来时先docker logs deepseek-ocr-backend通常是模型没下载完或 GPU 没分配。识别效果不理想先调哪个PDF 先看dpi图片先试base_size和image_size版面错乱时检查crop_mode或者换一种 mode 再跑一遍。写在最后如果你需要把图片或 PDF 里的文字批量抽出来落到文档、表格或数据库里这套接口就够用了启动服务、传文件、拿结果三步之间没有任何多余的东西。【免费下载链接】deepseek_ocr_appA quick vibe coded app for deepseek OCR项目地址: https://gitcode.com/gh_mirrors/de/deepseek_ocr_app创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考