数据不是护城河,稀缺数据才是

📅 2026/7/21 6:34:16
数据不是护城河,稀缺数据才是
大模型训练数据供应链的价值重构与三种终局最近看了不少关于数据产业的资料但我感兴趣的是当高质量公开语料逼近枯竭数据从免费资源变成稀缺生产资料产业链上的钱和壁垒正在往哪去一个直观的信号来自资本。Meta以约143亿美元入股Scale AI零融资运营五年的Surge AI在首轮融资中被估值至约240亿美元成立不到三年的Mercor估值冲到约100亿美元。数据服务商的估值逻辑正在被重写而重写的核心是稀缺性。顺着这个问题本文回答三个方向数据竞争的主战场是否已经从预训练语料转向后训练数据合成数据能不能替代人工标注中国的数据产业与美国头部公司之间差的到底是几年时间还是一整套结构价值重构当数据从免费变成稀缺大模型训练数据供应链指从原始数据一路加工到模型可用数据的全流程。沿着这条链观察附加值一个清晰的结构浮现价值正在向两端集中。上游握有稀缺数据资产的持有者下游做专家数据和评测服务的高附加值玩家都在向上走夹在中间的通用标注环节正被自动化标注技术侵蚀同时承受被替代和价格战的双重挤压。当预训练语料的边际价值下降真正决定模型能力差异的已转移到后训练环节。这些数据的共同特征是稀缺且难以替代。监督微调SFT数据每个新版本都需要但大量取自ChatGPT、Claude的输出导致模型趋同、缺乏多样性。人类反馈强化学习RLHF数据需要专家对模型输出做偏好排序主观且依赖文化背景是目前最难规模化的瓶颈——中文场景还多一层张力国内标注者的价值观取向与模型出海需要的多元价值观并不一致。推理链CoT数据生产成本是普通SFT的2—5倍需要专家撰写或验证推理过程。多模态对齐数据单条成本可达纯文本的5—10倍是当前增速最快的方向。专家数据法律、医疗、金融、代码的壁垒不在技术而在专家网络的规模和一致性。合成数据的壁垒则是质量、多样性、可靠性的三重门槛且有明确的适用边界在隐私敏感和罕见场景中有效但在事实型知识、价值观对齐、前沿推理场景中难以替代真人。实验研究显示少量人工数据占比2.5%—10%带来的性能提升需要数量级更多的合成数据才能追平。因此合成数据是必要补充但核心场景仍离不开人工——尤其是在价值观对齐和专家推理环节。这个两端厚、中间薄的价值分布是理解后续竞争格局的坐标。蒸馏数据高信息密度的价值与合规行业常把蒸馏数据笼统归入合成数据但它是一个特殊类别——数据由更强的教师模型生成本质属于模型生成数据。按生产方式合成数据可分为三类规则/算法合成、模型生成蒸馏、对抗/增强合成。三者的合规风险不在一个量级但价值属性也不同。蒸馏数据的价值是真实的。用GPT-4或Claude的输出训练小模型信息密度远高于原始语料成本也远低于从头采集专家数据。对预算有限又想快速追赶的模型厂而言这是一条低成本获取高能力的捷径。DeepSeek-V3的部分能力就来自这种路径——用强模型的输出压缩知识再用自己的架构重新训练。但合规风险正在收紧。2026年初Anthropic公开指控DeepSeek和阿里通过批量虚假账号获取其模型输出用于训练竞争模型。OpenAI、Google、Meta等头部实验室已联手收紧服务条款明确禁止将模型输出用于训练竞争性产品。中国315晚会曝光的数据投毒案例、国家标准对蒸馏数据合规性的推进都指向同一个趋势蒸馏数据正从灰色地带变为合规红线。在数据分类与采购决策中宜将蒸馏数据单独列为一类或明确标注为合成数据模型生成以区分合规等级。它仍然可用但用之前要清楚自己站在灰色地带的哪一侧。竞争格局为什么中国出不了Surge AI三个案例可以把全球格局说清。Scale AI被Meta以143亿美元入股后OpenAI、Anthropic等核心客户出于数据机密性顾虑收缩合作转向Surge、Mercor。被单一大客户深度绑定的数据公司会失去其他客户信任。Surge AI零融资、仅百余名正式员工专注高端任务收费为Scale的2—5倍。2024年收入 reportedly 已超过Scale同期。数据服务的价值可以来自专业度而非人力规模。Appen曾是全球数据标注龙头市值一度超40亿澳元。但Google占其收入约30%在2023年终止合同后收入断崖式下跌股价回落逾九成。客户集中度是命门。三个案例呈现了一个事实全球数据公司正在分化为不同命运。而中国的问题更具体——为什么复制不了一个Surge AI从营收看美国头部8—14亿美元与中国头部约0.5亿美元相差约20倍。但比数字更本质的是生态位与商业模式的不同。原因有四个缺一不可。第一需求端缺少愿意为高端认知数据支付高溢价的客户。Surge能收取数倍溢价前提是OpenAI、Anthropic愿意为一条法律推理数据付出5—10美元而国内头部模型厂在采购时更看重规模交付与性价比。没有出得起价的甲方就难以支撑起这样的乙方。第二供给端的人力成本优势反而构成劣势。中国律师、医生、金融分析师的时薪明显低于美国同行这本应是成本优势却恰恰压缩了专家精标相对规模众包的溢价空间——当普通标注足够便宜甲方更倾向于多人众包加质检而非少数专家精标。第三合规与出海的双重挤压。国内数据公司既难以直接服务海外前沿实验室出口管制且这些实验室本就不服务中国又因监管导向偏保守中文对齐数据难以支撑模型出海。两端的高价值需求都难以触及。第四资本市场的估值逻辑不同。美元市场容得下高毛利、慢增长因而Surge能够零融资、不扩张、只做高端A股与新三板更奖励营收增速促使国内公司走上规模、压毛利的路线——海天瑞声营收增长59%、毛利率却下降18个百分点正是这一逻辑的产物。这个结构差异体现在中国头部公司的财报里。海天瑞声2025年营收3.77亿元、同比增长59%但综合毛利率同比下降约18个百分点前五大客户占比约46.2%暴露出定制化服务占比上升、行业竞争加剧的双重压力。数据堂2025年营收3.62亿元、同比增长约49%净利润同比增长约217%其以1500余个版权数据集为核心的授权模式在数据资源入表政策下具备资产重估空间。版权数据集授权收入稳定、边际成本低、毛利高项目制定制收入波动大、难以规模化平台与SaaS订阅技术壁垒高、依赖生态。三类的毛利差异决定了各自不同的估值逻辑。由此推断中国更可能的突破路径是放弃在全领域与海外头部正面竞争转而在某个高价值垂直领域具身智能、金融、医疗做深做透同时绑定一个愿意付高价的头部甲方。新的高价值方向具身智能与评测数据具身智能数据是当前增速最快的方向。全球市场从2024年约2.42亿美元同比增长约181%增长至2025年约5亿美元预计2030年达52.5亿美元年复合增速超过50%。目前全球高质量真实物理交互数据总量仅约50万小时供给缺口巨大。供应上分为两条路径光轮智能以仿真合成数据成为该领域首个独角兽成本约为真实数据的百分之一觅蜂科技、鹿明机器人等则主打真实场景采集。2026年6月工信部、国资委联合启动的人形机器人实景实训专项行动将进一步放大这一方向的数据需求。评测数据正从学术竞赛演变为独立业务评测基准本身成为产品。以Humanlaya联合多家机构构建的$OneMillion-Bench为例其以人类专家成本为任务定价、以经济价值衡量模型能力代表了评测数据商业化的一种新范式。与此同时AI预标注的渗透率持续走高基础标注的自动化程度从2020年的约20%升至2025年的约75%。但医疗、法律、推理链等复杂场景仍离不开人工。可预见的长期趋势是人机协同而非纯自动化替代。如何判断一家数据公司的数据质量这是采购方与投资人最关心的问题。综合行业实践可归纳为五个评估维度准确性、一致性、多样性、难度/价值、可溯源。验证手段从弱到强有三种人工抽检成本低但覆盖有限黄金标准集比对是行业通用做法模型验证驱动最强——直接以数据训练模型、观测能力提升幅度是唯一能验证数据是否真正有用的手段。中国2026年3月的高质量数据集国家标准征求意见稿提出的模型验证驱动迭代机制正是这一手段的标准化尝试。对采购方而言比标注准确率更可靠的判断依据是供应商在采购方自有模型上的验证结果以及其数据来源授权链的完整性。前者验证价值后者规避合规风险。三种终局在判断终局之前先看两条正在收紧的链条蒸馏数据的合规边界和数据倒卖的风险。前者是模型输出的二次使用争议后者是保密期内二次售卖、爬虫非法采集、暗网交易。海外实验室联手限制蒸馏、中国国家标准推进客观上都对合规数据公司构成利好。技术替代方面模型自标注能力五年内完全替代的概率不高市场方面头部模型厂自建团队、云厂商入局、价格战会挤压利润。但这些风险不改变终局判断只影响速度。拉长时间看数据公司大概率不会齐头做大而是分化为三种命运。第一种被内化。只服务单一大客户、又缺乏独立数据资产的纯外包公司最可能被模型厂自建团队取代或被压至微利。Scale AI被Meta收编可视为这种命运的预演。第二种被平台化。技术工具型公司会成为模型厂数据流水线上的一个SaaS环节天花板受限于工具本身的价值。第三种成为基础设施。只有握有稀缺认知数据资产专家网络或版权数据、且客户足够多元的公司才可能升级为不可替代的AI数据基础设施获得长期溢价。判断一家数据公司的价值本质是判断它会落在三种终局中的哪一种。以下四个变量会显著改变终局的落地节奏大模型的自监督能力有没有质变合成数据在推理、对齐场景能否达到人工质量头部模型厂继续外采还是全面内化中国是否出现愿意付高溢价的头部甲方及绑定的垂直玩家。需要说明的是本文基于公开信息整理部分数据未经审计宜用于判断趋势而非作为精确结论。科里Coralyx发表于「边界层」2026.07