把PDF、Word、Excel一键变成Markdown,我只用了一条命令

📅 2026/8/14 8:18:16
把PDF、Word、Excel一键变成Markdown,我只用了一条命令
把PDF、Word、Excel一键变成Markdown我只用了一条命令【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown你有没有过这样的经历客户发来 30 份 PDF 财报、12 个 Word 合同和几张 Excel 表要求整理成纯文本喂给大模型结果复制粘贴忙了三个小时表格还错位MarkItDown 就是为这种痛点而生的开源工具——它的核心工作只有一件事文件转Markdown把 PDF、Word、Excel 等格式变成结构清晰的文本一条命令搞定。手动整理不仅慢还极易丢格式标题层级、列表嵌套、表格列对齐全在复制粘贴中灰飞烟灭。为什么目标格式偏偏是 Markdown先解释一个反直觉的选择为什么输出不是 docx 或 html因为 Markdown 标记极简、token 消耗低而且主流大模型在训练时见过海量 Markdown 文本理解起来几乎零门槛。MarkItDown 的定位很明确它不是给人眼做高保真还原的排版工具而是给AI 读的结构化搬运工。它内部走一条识别文件类型 → 匹配转换器 → 输出 Markdown的流水线你不需要告诉它文件是 PDF 还是 Excel它会用 magika 依据文件内容自动判断再挑出最合适的转换器。传统手工搬运到底输在哪里对比维度手工复制粘贴MarkItDown 一条命令30 份 PDF 的耗时约 3 小时十几秒表格列对齐经常复制乱保留为 Markdown 表格标题层级逐段手动调整自动识别批量转换逐个打开处理for 循环搞定顺带说明它的业务范围远不止这几种。目前内置转换器覆盖了 Word、Excel、PPT、EPUB、HTML、CSV、ZIP 压缩包甚至 YouTube 链接和音频转写基本把日常办公碰得到的格式都包圆了。3 分钟完成环境搭建与安装MarkItDown 要求 Python 3.10 及以上。先建一个干净的虚拟环境避免依赖打架# 创建并激活虚拟环境 python -m venv .venv source .venv/bin/activate接着安装。想省事就装全家桶一步到位# [all] 会一并装好 PDF、Word、Excel、音频等全部依赖 pip install markitdown[all]从源码安装同样简单# 从 gitcode 克隆仓库后本地安装 git clone https://gitcode.com/GitHub_Trending/ma/markitdown cd markitdown pip install -e packages/markitdown[all]最后验证一下版本号装好即用markitdown --version首次运行一行命令把 PDF 变成 Markdown最基础的用法是把转换结果直接打到终端# 转换 PDF结果输出到屏幕 markitdown 报告.pdf想保存成文件加一个-o参数即可# 转换 PDF 并保存为 Markdown 文件 markitdown 报告.pdf -o 报告.md它还支持从标准输入读取方便与别的命令组合使用# 通过管道把文件内容喂给 markitdown cat 报告.pdf | markitdown批量处理同样很朴素一个循环就够# 批量转换当前目录下所有 PDF for f in *.pdf; do markitdown $f -o ${f%.pdf}.md donePython API3 行代码接入你的工作流CLI 适合手动操作写进自动化脚本时用 Python API 更顺手from markitdown import MarkItDown md MarkItDown() # 创建转换器实例 result md.convert(测试文档.docx) # 传入文件路径 print(result.markdown) # 输出转换后的 Markdown print(文档标题:, result.title) # 顺带拿到标题元数据批量转换也就是几行的量import glob md MarkItDown() for path in glob.glob(资料/*.pdf): result md.convert(path) # 逐个转换 with open(path .md, w, encodingutf-8) as f: f.write(result.markdown) # 结果落盘进阶玩法让 AI 看懂图片、看懂扫描件给图片配文字说明。如果文档里图片较多可以传入一个 OpenAI 兼容的客户端让大模型为图片生成描述文字from markitdown import MarkItDown from openai import OpenAI client OpenAI() md MarkItDown(llm_clientclient, llm_modelgpt-4o) result md.convert(产品截图.png) # 图片内容会被 LLM 转成文字 print(result.markdown)扫描版 PDF 走 OCR。内置转换器只能读取文本层纯扫描件需要额外装 OCR 插件# 安装 OCR 插件及对应的 LLM 客户端 pip install markitdown-ocr openai启用后PDF、Word、PPT 里嵌在图片中的文字也能被提取出来。云端服务加持。若追求更高的版面还原度可以接入 Azure Document Intelligence 或 Content Understanding后者甚至能把发票金额、合同条款这类结构化字段输出成 YAML 头信息。三个提醒以及适合谁用注意安全转换器会以当前进程的权限读写文件不要拿不明来源的文件直接喂给它项目 README 里有专门的 Security Considerations 说明。按需安装磁盘紧张时不必装全家桶pip install markitdown[pdf, docx]只装需要的部分即可。大文件分批处理几百 MB 的巨型文档建议拆分后再转换更稳也更快。它适合三类人要给大模型批量准备语料的开发者、想把历史文档统一成 Markdown 的团队、以及所有被文档搬运折磨过的普通用户。想深入了解每种格式的转换细节可以翻翻 packages/markitdown/src/markitdown/converters/ 源码目录一个文件对应一种转换器。现在就打开终端装上 markitdown把手头那份 PDF 丢给它试试。下次再有人问你这份文档什么时候能整理好你可以淡定地回一句一条命令三秒。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考