我给 AI 加了一套“证据优先”的精读流程:公众号、PDF 和整本书都能读

📅 2026/8/23 5:26:08
我给 AI 加了一套“证据优先”的精读流程:公众号、PDF 和整本书都能读
普通摘要解决的是“少看一点”我更想解决的是另一件事AI 给出的结论能不能回到原文核对我经常把长文章和 PDF 丢给 AI 总结。刚生成时看起来很省时间条理清楚、重点明确、语气笃定。可真要拿结果写方案、做分享或者继续研究问题就来了这句话是作者的原意还是模型顺手补出来的结论依据在哪一页文章给出的数据有没有时间范围和比较基准如果还得重新翻一遍原文那份摘要最多只能算“导读”算不上真正的阅读成果。为了解决这个问题我做了开源项目DeepRead。它可以读取公众号文章、Markdown、HTML、文本、PDF 和整本书把内容整理成一份能追溯、能质疑、还能继续复习的结构化报告。项目地址GitHub - xiehuan123/dsh-deepread最快的体验方式是把它作为 Agent Skill 装进 Codex、Claude Code 或其他兼容 Agent Skills 的工具npx skillslatestaddxiehuan123/dsh-deepread安装后直接对 AI 说用知识地图模式精读这篇文章。 每个重要观点都要给出原文证据和位置原文没有证据时请明确标出来。先说结论摘要和精读不是一回事摘要通常在回答这篇文章大概讲了什么但认真阅读还会继续追问作者真正想解决的问题是什么核心结论由哪些分论点支撑哪些内容是事实和数据哪些只是作者判断一组数据的单位、时间范围、样本和基准是否完整原文有没有回避反对意见和限制条件AI 有没有把合理推断说成已经证实的事实DeepRead 的核心结构因此不是“生成一段更长的摘要”而是把文章拆成观点 → 证据 → 数据 → 关系 → 置信度 → 原文位置我的核心判断是AI 阅读工具真正缺的不是更强的概括能力而是清晰的事实边界。没有证据位置和不确定性标记写得再顺也只是一个难以核查的二手叙述。知识地图每个重要观点都要和证据放在一起DeepRead 的map模式主要面向研究、事实核查、方案准备和资料引用。它会先提取核心问题与核心结论再把内容分成十类核心结论、分论点、机制、事实、数据、案例、隐含前提、反对意见、限制条件和可执行建议。重点不在分类数量而在两条约束重要观点需要配套原文证据。原文没有提供依据时直接标记“原文未提供证据”。报告还会区分四档置信度置信度含义作者原意作者在原文中明确表达的主张原文事实与数据原文明确给出的事实、案例或数据合理推断能从上下文推导但不是作者直接表达无法确认缺少足够信息或证据支持这样做是为了避免一个常见混淆“作者这样说了”和“这件事已经被证明了”并不是同一件事。如果原文包含数字DeepRead 会尽量保留数值与单位、时间范围、样本、比较基准、来源和位置而不是只摘出一个最吸引眼球的百分比。观点之间还可以标记支持、反驳、因果、解释、依赖、举例、对比和限制关系最后生成 Mermaid 思维导图、XMind 可导入的大纲以及主动回忆问题。仓库里放了一份真实生成的知识地图可以直接查看输出结构map模式文章事实核查知识地图五种模式不是所有内容都值得“重读一遍”一篇资讯、一份行业报告和一本教材需要投入的阅读成本完全不同。因此 DeepRead 没有把所有输入都塞进同一种模板而是提供五种模式。模式适合场景主要输出quick先判断值不值得继续读一句话总结、核心论点、主要论证、关键概念和批判性问题deep认真读懂一篇文章论点、论据、原文引文、论证脉络、章节要点和批判性思考map研究、核查、写引用前整理资料观点证据配对、数据表、关系、置信度、导图和回忆题feynman不只看懂还要能够讲明白提问、分章精读、闭卷复述、查漏修正和间隔复习book整本书或超长文档分部分处理、章节脉络和全书汇总选择其实很简单赶时间用 quick 读透一篇用 deep 核查证据用 map 真正学会用 feynman 处理整本书用 book其中费曼模式不是给文章套一个“费曼学习法”的标题。它包含一个完整的 11 步流程从目录和问题开始逐章整理观点、数据与证据然后合上原文复述自检理解缺口再回到原文修正最后重新讲一遍并生成第 1、3、7、14、30 天的复习安排。这也是我对 AI 学习工具的另一个判断一份看起来很完整的笔记不等于用户已经学会。真正的学习闭环必须包含主动回忆、暴露缺口和回原文纠错。公众号、PDF 和多篇资料怎么处理DeepRead 目前支持三类输入微信公众号稳定链接.txt、.md、.html、.pdf等工作区文件直接粘贴的正文。完整的 DeepSeek Harness 插件内置纯 JavaScript PDF 文本提取能够处理中文 ToUnicode 映射、页码标记以及 PDF 1.5 常见的对象流和交叉引用流。抽取时会保留【第 N 页】标记后续生成的论点、引文和引用表才能定位回原文。长 PDF 不会在前台无提示地一直等待。插件会先快速采样判断规模再转成后台任务逐页显示解析进度、逐段显示精读进度。开始前也可以只做预算预检估算不同模式所需的 token、模型调用次数和时间而不真正调用模型。如果要研究同一个主题还可以一次传入 210 篇材料。DeepRead 会先分别速览再生成跨篇对比矩阵整理一致观点、冲突点、互补关系和综合结论。这比“把三份摘要并排放在一起”更有用因为多来源研究真正需要看的往往就是它们在哪些地方互相支持又在哪些地方互相矛盾。Skill 和完整插件有什么区别DeepRead 同时提供两种形态但它们面向的使用方式不同。方式一便携 Agent Skill适合已经在使用 Codex、Claude Code 或其他兼容 Agent Skills 工具的人。npx skillslatestaddxiehuan123/dsh-deepreadSkill 本身没有运行时依赖。它提供的是一套“证据优先精读”的方法和输出约束由当前 Agent 使用自己的文件、网页和文档工具完成分析。你可以这样调用精读 docs/architecture.pdf重点分析技术选型和限制条件。用费曼法读这本书生成闭卷复述、自检问题和复习计划。对比这三篇材料列出它们的共识、冲突和各自证据。方式二完整 DeepSeek Harness 插件需要浏览器阅读面板、PDF 解析、后台任务、进度展示、缓存、批量对比、预算预检和 HTML/XMind 导出时可以安装完整插件dsh plugin--profilewebadddsh-deepread重启dsh web后输入区旁边会出现 阅读入口。也可以不打开面板直接在对话里调用deepread工具。两种形态的界面和执行者不同但输出结构保持一致Skill 是“方法论形态”DSH 插件是“工具形态”。导出的 Markdown、HTML 和思维导图也可以继续交给另一种宿主处理。我为什么没有把它做成一个普通聊天 Prompt只写一个 Prompt 确实更快但长文阅读不只是“一次调用写得好不好”。还会遇到一整串工程问题文档太长需要分段处理和全局汇总PDF 必须保留页码否则引用无法回溯不同阅读目标需要不同的处理预算长任务需要进度、取消和结果轮询同一链接换模式重读不应该每次重新抓取多篇材料需要先分别分析再做跨篇综合Web、headless、TUI 和 Agent Skill 的能力边界不同。因此完整插件把 Host 管线、可选存储、任务进度、预算估算、导出和浏览器 UI 分开实现Web 服务或持久化服务不存在时核心deepread工具仍然可以激活只是相应能力会降级。这部分看起来没有“生成一张漂亮知识图谱”那么显眼却决定了工具能不能稳定处理一本书或几十页 PDF。对长文本 AI 工具来说Prompt 决定单次输出的样子管线设计决定它能不能在真实材料上持续工作。目前的边界也说清楚DeepRead 不是自动事实裁判也不会替你完成最终判断。它能做的是把原文中的观点、证据和不确定性摆到桌面上减少“模型说得很像真的但找不到出处”的情况。输出质量仍然会受到原文质量、所用模型和上下文长度影响。另外还有几个明确限制公众号链接使用mp.weixin.qq.com的稳定链接遇到反爬验证时可能需要配置 HTTP provider或者直接粘贴正文。知乎、掘金等反爬站点建议粘贴正文。扫描版 PDF 没有文本层建议先做 OCR。完整插件需要 Node.js^22.19 || 24便携 Skill 没有这个运行时要求。deep、map、feynman和book的调用成本不同长材料建议先做预算预检。把边界写清楚很重要。证据优先不应该只约束阅读报告也应该约束工具对自己的介绍。你可以直接复现的三个例子仓库内提供了真实输出不是手写的占位截图deep模式Claude Code Token 优化文章map模式文章事实核查知识地图deep模式vivo Tauri 架构文章如果你已经安装 Skill最简单的第一次尝试不是找一本几百页的书而是拿收藏夹里一直没读完的一篇长文用 map 模式精读这篇文章。 请区分作者原意、原文事实与数据、合理推断和无法确认的内容 每个重要观点配原文证据没有证据就明确标注。看完报告后再回原文随机核对三处引用位置。这样最容易判断这套方法是否真的适合你。写在最后做 DeepRead 的过程中我越来越确定一件事AI 阅读的价值不应该是替我们更快地接受结论而是帮助我们更容易看清结论从哪里来、哪里还不确定。摘要帮你少看一点精读应该帮你多懂一点。如果你平时需要处理公众号长文、技术文档、行业报告、PDF 或整本书可以拿一份真实材料试试看。也欢迎在 GitHub 提 Issue告诉我哪类文档最难读、哪种输出最有用。项目地址GitHub - dsh-deepread安装命令npx skillslatestaddxiehuan123/dsh-deepread如果这篇文章对你有帮助欢迎点赞、收藏也欢迎给项目点一个 Star。后续我会继续分享中文 PDF 解析、长文分段精读、引用溯源和 Agent Skill 设计中的实现细节。