AI 公司批量抢购 2022 年前的旧书:互联网被 AI 污染后,干净语料成了最后的矿脉

📅 2026/8/1 21:37:15
AI 公司批量抢购 2022 年前的旧书:互联网被 AI 污染后,干净语料成了最后的矿脉
AI 公司批量抢购 2022 年前的旧书互联网被 AI 污染后干净语料成了最后的矿脉2026 年出现了一个反常信号多家海外 AI 公司正通过中间商批量收购2022 年之前出版的旧书扫描成数据之后把实体书直接销毁。收购方给出的理由惊人一致2022 年 11 月 ChatGPT 爆火之后互联网上新增的内容已经有超过一半出自 AI 之手继续用今天的网络数据训练下一代模型等于让模型吃自己吐出来的东西。这不是收藏癖也不是怀旧生意而是为了给下一代大模型找一块没有被 AI 污染过的训练语料。旧书是这场争夺的第一个显性战场接下来的候选人还有档案馆、论文预印本、专利文献和地方志——每一块尚未被 AI 生成内容侵蚀的土地都在被重新估值。这个判断正在被越来越多的研究和实测数据证实而且问题比数据质量差严重得多。它不是偶发的坏样本而是统计学意义上的系统性退化研究者给它起了个名字模型崩塌Model Collapse。先看一组公开研究的数字。2023 年Shumailov 等人在论文《The Curse of Recursion》里做了最直接的实验用模型自己生成的文本训练下一代模型再让下一代生成文本训练第三代几轮迭代之后模型输出的多样性断崖式下降错误被逐代放大并固化罕见知识和长尾内容最先消失。2024 年同一团队把结论发上 Nature并把实验推得更远即便每一代训练时混入10%的真实人类数据模型依然无法阻止退化只是退化的速度被拖慢了。换句话说污染不是有或无的问题而是比例的问题——只要训练数据里 AI 生成内容的占比够高退化就只是时间问题。要理解这件事先要理解模型崩塌的三个机制它们分别作用于分布、方差和错误传播。第一个机制是分布偏移。大模型学到的不是真实世界而是训练数据的概率分布。当训练数据里混入模型自己的输出原始分布中本来就高频的平均内容会被进一步放大而低频但重要的长尾知识——冷门历史事件、罕见病症、地方语言、小众技术细节——会被逐步稀释。第二代模型眼里的世界比第一代更单调第三代模型眼里的世界更单调。迭代十次之后模型记住的只剩最典型的平均值而平均值恰恰是最没有信息量的东西。第二个机制是方差收缩。模型生成文本时每个 token 的选择都带概率性可一旦生成结果反过来成为训练数据这种概率性就会被反馈回路抹平。输出越来越贴近众数越来越缺乏意外模型从会说话退化成只会说正确但无用的套话。一个被污染过的模型写代码可能给出语法完全正确、边界条件全部漏掉的实现因为它见过的标准写法被反复强化了。这不是风格偏好问题而是概率分布被压缩后的必然结果。第三个机制是错误固化。幻觉在单次生成里只是偶发噪声但一旦进入训练集它就从噪声变成事实。下一代模型会虔诚地重复这个错误并在重复中给错误补上更多细节让它看起来更可信。这也是为什么 AI 生成内容的检测难度逐年上升不是检测算法变差了而是污染语料里的伪事实越来越逼真了。把三个机制叠在一起模型崩塌就不是可能发生的风险而是必然发生的数学结果——除非训练数据里有足够比例的、来自真实世界的干净信号。旧书恰好提供了这个信号而且提供了两层保护。第一层是编辑质量。一本书从写作、编辑、校对到出版通常经历三到五轮人工审校错误率远低于任何网页内容更不用说 AI 生成内容。第二层是时间锚点2022 年之前的出版物在物理上就不可能与 AI 生成文本重叠用时间做锚点比任何质量过滤器都可靠。这也是为什么扫描后销毁实体书会变成行业潜规则——这些书是语料层面的稀缺资产持有方不希望它被竞争对手二次获取。数据战争已经打到了旧书市场。对比一下几类语料来源差距一目了然。维度2022 年前旧书2022 年后网络内容合成数据人类创作占比100%不足一半0%专业编辑校对3-5 轮无无AI 污染风险无时间锚点高本质即 AI 输出长尾知识密度高低极低获取成本高扫描清洗低极低对模型质量的贡献稳定正向逐年衰减双刃剑注意表格最后一行合成数据是双刃剑。不是说 AI 生成的数据一律不能用而是要看它被用在什么地方。代码、数学推理这类答案可验证的领域高质合成数据反而能显著提升模型能力因为错误可以被程序自动筛掉——DeepSeek R1 系列、OpenAI o 系列的后训练都大量使用合成推理数据效果是正面的。但在开放式文本领域合成数据没有天然的纠错机制错误会顺着概率分布悄悄渗透。同样是合成数据用在推理链路里是燃料用在语料池里是毒药。这个区分是 2026 年数据工程最重要的认知之一。还有一个容易被忽视的现实网页比书籍更容易被污染。2023 年以来大量内容农场和 SEO 站开始用生成式 AI 批量生产文章一篇 2000 字的深度分析几分钟就能炮制出来挂上广告位等流量。这些站点表面看是正常网页实则整页都是低质量 AI 输出爬虫分不清但语料工程师看一眼来源域名就知道该不该要。相比之下书籍的出版门槛天然过滤掉了这批内容——这就是时间锚点之外旧书的第二重保护。而 2026 年新出版的书籍已经开始混入 AI 辅助写作的内容时间锚点正在从2022 年前向更早滑动。污染不是停留在论文里的理论而是已经在真实语料里发生的趋势。Common Crawl 是目前公开可获取的最大网页语料库多个研究团队对它的历年快照做抽样检测结论一致AI 生成文本的占比在 2022 年之后逐年抬升到 2026 年已经成为快照里不可忽视的组成部分而这部分内容正是大多数开源模型训练数据的原料。更麻烦的是污染会自我加速。一篇 AI 生成的参考文章被爬虫收录下一篇 AI 文章会引用它作为事实来源两个错误的中间态被互相背书最终在语料里沉淀成看起来无懈可击的伪常识。检测这类伪常识比检测语法层面的 AI 痕迹难一个数量级。行业里已经出现了一系列对抗污染的公开动作。Reddit 在 2024 年就开始向 AI 公司收取 API 数据授权费把社区里的人类对话当成资产定价维基百科社区反复讨论如何限制 AI 生成内容的编辑权限Cloudflare 推出专门的对抗机制用伪造页面诱捕 AI 爬虫让它们把算力浪费在假内容上。这些动作的共同本质是同一件事内容平台开始意识到自己手里由人类生产的内容才是真正的护城河而允许 AI 公司免费抓取等于把护城河拆了卖给对手。内容授权从灰色地带走向正规市场只是时间问题。对大多数团队来说现实问题不是要不要用合成数据而是如何保护自己手里的干净数据以及如何判断外部语料干不干净。数据治理有四个可落地的抓手。第一是去重。MinHash 等近似去重算法能在亿级文档里找到重复内容网络爬取的语料经过 MinHash 去重后通常能减少30% 到 50%的冗余而去重掉的大多是搬运、转载、聚合类内容——它们恰恰是 AI 污染扩散最快的载体。第二是溯源标注。给每一份语料记录来源、采集时间、许可证形成数据血缘训练出问题时能快速定位是哪一批数据引入了偏移。C2PA 等内容凭证标准正在把是否 AI 生成变成元数据的一部分未来的语料审计会像今天的代码审计一样常规。第三是质量过滤。用困惑度perplexity分布、启发式规则、人工抽检三层漏斗清洗语料把疑似 AI 生成的平均文本挡在训练集之外。第四是保持人类信号的比例——Nature 那篇研究的结论很直接真实人类数据在训练集中的比例直接决定模型退化的速度这个比例不是可有可无的调参项而是生死线。实操层面给语料做污染体检并不需要多贵的工具。先用 datasketch 这类开源库跑一遍 MinHash 去重把重复率记下来再按困惑度从低到高排序人工抽查最低的那一批——它们往往是模板化的 AI 输出最后给来源域名建一张信誉表内容农场和 AI 聚合站直接降权。三步做完一份语料的质量画像就出来了。还要警惕一条隐蔽的污染路径蒸馏。用大模型生成数据去训练小模型如果大模型本身已被污染蒸馏会把错误原封不动地继承下来甚至因为小模型容量更小错误占比更高。蒸馏可以压缩规模但无法净化质量——数据源头不干净下游所有环节都会跟着脏。所以整个链条的结论收敛到一句话训练数据的干净程度是模型质量的最后一道物理底线。这道底线不靠模型架构解决不靠后训练解决只能靠数据工程解决。下面这个代码块用最小模型模拟自噬训练的退化过程你可以在本地直接运行亲眼看到方差是如何一代代收缩的。把代码里的常数换成真实世界的参数结论方向不会变只要每一代混入的 AI 输出比例超过阈值模型的表达能力就会一代代萎缩直到所有输出都收敛到同一个安全答案上——而安全答案通常意味着平庸。# 模拟模型崩塌每代用上一代输出重新训练观察方差收缩 import numpy as np rng np.random.default_rng(42) def sample_docs(mu, sigma, n2000): 从高斯分布采样文档向量模拟语料分布 return rng.normal(mu, sigma, size(n, 2)) def fit_and_sample(data, n2000): 用当前语料拟合新模型估计均值方差再采样下一代语料 mu data.mean(axis0) sigma data.std(axis0) * 0.9 # 模型输出比训练集更平均 return mu, sigma, sample_docs(mu, sigma, n) mu0 np.array([0.0, 0.0]) sigma0 np.array([1.0, 1.0]) data sample_docs(mu0, sigma0) print(第0代标准差:, np.round(data.std(axis0), 3)) for gen in range(1, 7): mu, sigma, data fit_and_sample(data) print(f第{gen}代标准差:, np.round(sigma, 3), 均值:, np.round(mu, 3))运行结果会看到每一代的标准差都在收缩第六代的标准差只剩初始值的四成左右分布越来越窄长尾被系统性吃掉。这个二维模拟当然远不如真实大模型复杂但它揭示了同一个数学方向反馈回路会把多样性磨平。理解了模型崩塌再看 2026 年的旧书抢购潮就不再是猎奇新闻而是一场关于语料主权的提前布局——谁手里的干净语料多谁的下一代模型就能少退一步。对普通开发者来说有三件现在就能做的事。第一把你自己的私有数据当成资产管理起来版本化、备份、标注来源别等训练时才想起来数据散落在各处。第二接外部语料时先跑一轮 MinHash 去重和困惑度过滤哪怕只是几百 MB 的微调集也能挡住大部分 AI 污染。第三关注数据血缘工具链把这份数据从哪来变成工程规范而不是某个人的责任心。对企业而言语料治理应该从成本项重新定位为模型质量杠杆。同样的模型架构、同样的算力预算语料干净程度不同最终效果可以差出几个百分点而这几个百分点在 benchmark 排行榜上就是名次的差距。AI 行业的军备竞赛已经打到第三层第一层拼模型架构第二层拼算力第三层拼数据质量。前两层拼的是钱第三层拼的是眼光和纪律。当互联网上过半的新内容都出自 AI 之手时找到人类原生的高质量数据本身就是一种核心竞争力。而 2022 年这个时间锚点会随着时间推移变得越来越珍贵因为每一年的新出版物都携带着更高比例的 AI 生成痕迹。沿着这个方向往下看人类数据正在变成一种可以定价的资产。新闻集团的档案库、图片库的授权照片、代码托管平台的优质仓库都已经出现在 AI 公司的采购清单上价格由稀缺度决定。未来三到五年AI 生成与人类生成的认证会成为数据基础设施的一部分就像今天的 HTTPS 证书一样普及。这对内容生产者的启示是反直觉的当机器能批量产出文本时人类原创内容不会贬值反而会升值。你写的每一篇深度文章、每一段真实经验、每一份独有数据都是模型训练需要的稀缺信号。这不是末日预言而是数据经济里最朴素的一条规律稀缺性决定价值。当干净语料成为稀缺品最先意识到这一点并建立数据治理体系的团队会在下一轮模型竞争中拿到别人拿不到的先手。现在动手整理你的数据资产就是在为三五年后的模型质量下注。