真实数据不够用?从模拟环境到空间智能的AI训练新路径 📅 2026/8/27 3:53:24 李飞飞那条关于人类学习不必全靠现实数据的访谈在我看来是当前 AI 数据路线里最值得反复琢磨的一句话。很多人习惯把 AI 训练理解成“喂越多真实数据模型越强”但人类并不是这样学习的。我们会通过想象、推理、在环境里动作试错、把已有概念重新组合来获得能力。这句话真正指向的问题不是哲学问题而是工程问题当真实数据不够、太贵、太封闭时AI 怎么继续变聪明。我打算从三层展开先说明为什么现实数据不是唯一学习来源再讲模拟数据、合成数据和主动探索在工程里怎么落地最后给一个仿照这种思路做最小实验的流程。适合正在做大模型微调、具身智能、视觉导航、3D 感知或数据策略的人看。1. 这句话到底在说什么1.1 人类学习不只有“真实数据”一种输入如果把人类的学习过程拆开看真正驱动能力增长的输入远不止“亲眼见过的真实案例”这一种。第一种是亲身经历。这确实依赖现实世界但数量很有限。一个人一辈子不可能把所有跌倒方式都体验一遍也不会把所有对话场景都经历一遍但还是能在遇到新情况时做出大致正确的反应。第二种是观察和模仿。看别人操作、听别人讲解能获得大量间接经验。这类数据虽然是现实发生的但并不是学习者自己的真实体验而是被语言、影像或动作转述之后的信息。第三种是想象和假设。脑子里想做一件事可以先在内部模拟一遍伸手拿杯子抬高一点杯子会不会滑落绕过桌子走左边还是右边这个句子换一种说法会不会更容易理解。这些过程没有对应的外部真实数据模型却能从中推出结论。第四种是抽象和类比。人类会把不同场景里的共同结构抽出来比如“按住某个东西再推动”这个模式可以用在门把手、抽屉、儿童积木上不需要每种物品都专门教一遍。所以“人也不全靠现实数据学习”并不是反科学反而是对机器学习方法论的一个重要提醒。如果我们认可学习可以走多种路径那 AI 的训练方式也不应该被限制在“收集尽可能多真实标注数据”这一条路上。1.2 当前 AI 训练对真实数据的依赖为什么这么重现在的大模型和视觉模型为什么如此依赖真实数据原因很直接目前的神经网络还没有足够强的因果推理和想象能力主要靠海量数据里的统计规律来逼近目标函数。文本模型靠互联网上的网页、书籍、对话记录训练。图像模型靠图片和人工标注训练。人类评价偏好靠真实用户反馈训练。这些都属于“现实数据”。问题在于这种路线逐渐暴露出三个瓶颈。第一个是成本。高质量标注数据很贵。给一张复杂街景做实例分割比给一张简单物体打框贵很多给一段医疗对话做行为评分成本更高。很多团队不是不想用真实数据而是用不起。第二个是长尾覆盖不足。真实世界的分布非常不均匀。常见场景数据很多低频危险场景、极端光照、罕见对象、特殊交互方式都很难收集。模型如果只在头部数据上训练遇到尾部场景就很容易失效。第三个是更新慢。真实世界采集、清洗、标注、审核是一个长周期过程。当产品需求变化时数据管线往往跟不上。这也是很多团队开始尝试“用模型生成数据来训练模型”的直接原因。1.3 李飞飞把问题引向空间智能李飞飞的研究路线里空间智能是一个非常核心的概念。它并不只是“认出图片里有什么”而是要理解物体在三维空间中的位置、尺寸、朝向、遮挡关系以及物体与物体之间可能发生的物理运动。如果认同人类学习不靠全部现实数据那么空间智能就是一个特别好的验证场景。人类理解三维空间不是靠把所有家庭、所有街景、所有桌面都真实走一遍才学会的。只要搭过积木、推过玩具、走过几间不同的房子就能迁移到陌生环境里。但当前很多视觉模型只在二维图像上做分类、检测、分割没有真正建立三维空间模型。李飞飞在访谈里强调的方向本质上是在说下一步 AI 需要学会“在空间里推理”而这件事不能只靠堆二维真实图片。对工程师来说这个信号值得注意。空间智能需要的数据类型和训练目标会发生变化不再只有猫狗分类而是深度估计、姿态估计、3D 重建、空间关系预测、运动规划。这些任务如果完全靠真实数据标注成本极高。模拟环境生成的带标注三维数据几乎是绕不开的选择。2. 真实数据之外模拟、合成、探索2.1 合成数据不是“假数据”是“可控数据”很多人听到合成数据第一反应是“这数据是不是假的能用来训练吗”。我建议换个说法合成数据不是假数据而是可控数据。合成数据通常由程序自动生成来源很多。可以是计算机图形渲染可以是扩散模型生成图像也可以是大语言模型根据规则生成文本还可以是自己在代码里随机生成表格和业务日志。关键不在于“是否来自真实世界”而在于样本的生成过程是否可控、分布是否清晰、标注是否自动对齐。举个例子。训练一个工业零件检测模型时真实工厂里可能只有几百张缺陷样本而且缺陷种类很有限。但通过 3D 建模和渲染可以生成不同角度、不同光照、不同缺陷形态的上万张图片而且每一张的标注框都由渲染管线自动得到不需要人工标。这类数据对视觉模型特别有用原因在于视觉任务的底层规律是稳定可模拟的。比如一个螺丝在不同光照下投影成什么形状物理关系是确定的。只要渲染器足够接近真实光学过程模型就能从合成图里学到通用几何特征。2.2 模拟环境让模型在动作中学习比合成数据更进一步的是模拟环境。合成数据还是一批静态图片或文本而模拟环境允许模型作为主体在环境里行动并观察行动带来的结果。机器人领域用得最多。一个抓取任务如果用真实机械臂试错成本高、周期长还有安全隐患。但在仿真环境里可以创建大量虚拟桌面、虚拟物体、虚拟机械臂让策略随机尝试抓取位置根据是否抓取成功来调整参数。一晚上可以跑几万次真实环境根本做不到。这种“在动作中学习”的模式对应着人类通过身体经验来认识世界的过程。比如儿童学习推门不需要被真实门夹到很多次就能从几次推拉中建立“用力方向、门轴位置、开合角度”的关系。模拟环境就是给 AI 提供类似的高密度反馈。实际操作中学术界和工业界会用到 MuJoCo、Isaac Sim、Bullet 这类物理仿真工具。不同工具侧重不一样但共同点是能配置物体模型、物理规则、相机视角和任务奖励然后输出状态、图像和动作结果。对于做视觉导航、机械臂操作、无人机控制和游戏 AI 的团队这类环境是当前不可替代的训练场。2.3 主动探索和自我博弈人类学习还有一个特点不会被动等着数据被塞进来而是会主动选择看什么、试什么。这种机制在 AI 里对应的是主动探索和自我博弈。AlphaGo 是一个很典型的例子。它的能力并不只是来自学习人类棋谱而是在自我对弈中不断生成新棋局。这些棋局不是人类“真实数据”但对模型训练极其有效。大语言模型领域也有类似思路让模型自己生成多个推理步骤再筛选出正确结果重新作为训练数据。这就是一种自我探索式的数据生产。所以“不靠现实数据学习”在工程上的意思其实是数据和模型的迭代可以形成闭环。模型先出结果系统自动验证结果好坏把好的结果回收成训练样本再继续训练下一版。数据不再是静态资源而是动态生成物。这个闭环一旦跑通最大的收益是边际成本下降。真实数据每增加一批都要重新采集和标注而主动探索产生的数据是在已有模型能力上滚动生成的只要验证逻辑设计得好成本可以保持稳定。3. 不要急着全面转向合成数据3.1 真实数据仍然不可替代的场景说完合成数据和模拟环境的价值也得说清楚边界。至少有三类场景真实数据目前仍然不可替代。第一类是安全关键系统。医疗诊断、自动驾驶、工业安全控制这些场景里的风险极高合成数据可以用于预训练但最终验证和持续监控必须依赖真实环境数据。因为模拟环境再逼真也无法完全覆盖真实世界里的物理异常、人体复杂性和社会规则。第二类是人类偏好和主观判断。比如判断一句回复是否礼貌、一段翻译是否自然、一个推荐结果是否讨喜这类问题本质上是“人觉得好不好”很难通过图形渲染和程序规则生成。虽然可以用大模型模拟人工标注但最终仍需要真实用户反馈来校准。第三类是罕见但影响重大的长尾事件。真实场景里的极端事故发生概率低但一旦发生就是关键问题。模拟数据可以构造类似场景但真实样本仍然是检验模型是否真正泛化的金标准。可以把合成数据看成加速器但不能把它当成安全证书。3.2 合成数据常见的坑合成数据不是没有坑。我在项目里见过最多的问题有这么几类。分布偏移是最常见的。模拟环境里渲染出的物体太干净光照太均匀材质太标准。模型在合成测试集上分数很高一到真实环境就掉点。这背后是训练分布和实际分布没有对齐。第二个是重复模式。如果三维资产只有几个模型程序随机摆放再多模型也容易过拟合到这几个物体的纹理和形状。表面上数据量很大实际上有效多样性很低。第三个是标注捷径。程序自动标注确实省人力但有些标签可能不是从正确的物理关系推导出来的。比如相机外参没对齐导致 3D 框投影到 2D 时偏移模型学到的位置关系和真实空间不一致。第四个是目标泄漏。模拟场景里如果把“答案”暴露得太明显模型会走捷径。比如物体总是位于画面正中间检测网络就学会了只关注中心区域而不是真正理解语义。这些坑不是说合成的路走不通而是要求团队增加验证环节不能只看模拟测试集上的指标。3.3 判断是否适合使用模拟或合成数据判断一个任务适不适合用合成数据可以从三个角度交叉看真实数据成本、模拟可覆盖度、任务失败后的迭代成本。如果真实数据标注昂贵同时任务规律可以被程序模拟那合成数据非常有价值。典型代表是工业视觉、三维重建、机器人控制。如果真实数据本身已经充足只是有一点脏那更该做的是清洗和去重而不是生成假数据。生成数据只会把噪声模式放大。如果任务高度依赖用户主观反馈那合成数据最多只能作为辅助增强最终还是要靠真实反馈闭环。下面给一个简单的判断参考。任务类型真实数据成本模拟可覆盖程度建议路线工业缺陷检测高缺陷样本少较高可通过渲染生成大量缺陷形态合成预训练 少量真实微调三维物体位姿估计高人工标注难很高渲染可输出精确位姿以合成数据为主配合真实场景验证机械臂抓取非常高试错有风险较高物理仿真的动作空间丰富仿真预训练 真实环境在线微调对话系统高依赖用户偏好低模拟难以覆盖真实意图真实数据为主合成增强为辅内容安全审核高标注敏感低需要真实上下文尽量用真实样本合成数据只做扩充这个表格不是绝对标准但通常能把一个任务是否适合用模拟数据看得很清楚。4. 从观点到工程一个最小验证流程4.1 先定义任务和评估指标不管怎么理解观点落地的第一步永远是定义任务。不要一上来就生成十万张合成图也不要先选一个复杂的模型。先拿一张纸把任务写清楚。输入是什么是单张图片、多视角图片、深度图还是文本指令输出是什么是分类标签、目标框、三维坐标还是动作序列环境变量有哪些光照、角度、背景、物体种类有没有变化失败怎么定义如果模型输出接近目标但差了一两厘米算对还是算错评估指标也要提前定。做视觉检测可以用 mAP、F1做位姿估计可以用平均距离误差做机器人抓取可以用成功率。这些指标必须能在同一个测试集上重复计算否则后面没法判断合成数据方案是否有效。我建议先定义 10 条或者 20 条真实测试样本。样本数量不需要多但必须是完全独立、贴近实际使用的数据。后面所有模型对比都在这同一批样本上做。4.2 用一个最小模拟环境生成样例任务清晰之后就可以搭一个最小模拟环境。核心原则是“先让样本能生成再谈逼真度”。比如要在桌面场景里做物体位姿估计可以这样开始创建一个简单平面模拟桌面。放入一个或几个待检测物体。随机设置物体位置、旋转角度、不同相机高度和视角。给渲染环境增加随机光照和材质颜色变化。批量输出 RGB 图、深度图、实例分割图和位姿标注文件。这种流程只需要几百行代码甚至用现成的图形引擎和物理引擎几个小时就能搭起来。下面是一个示意流程不绑定具体框架# 伪代码示例生成合成训练样本 scene create_scene(groundTrue, lightsNone) cup load_asset(cup_model.ply) for i in range(1000): cup.set_pose(random_pose_on_table()) scene.set_random_lighting() scene.set_random_camera() rgb render_rgb(scene) depth render_depth(scene) label compute_pose_label(cup) save_sample(rgb, depth, label)这里的关键不是代码本身而是每一轮变化都必须是可控的。随机范围要记录下来比如相机高度在 0.8 米到 1.2 米之间变化光照强度在一定区间内变化物体旋转角度覆盖 -30 到 30 度。这样后续才能分析模型到底在什么变化下表现不好。先用小规模跑通比如 1000 张生成图。不要贪多。如果流程还没跑稳直接生成几百万张后面发现问题时返工成本会非常高。4.3 与真实数据基线对比合成样本生成之后不能只拿它训练一个模型自己看效果。正确做法是做一个对照组。建议同时训练三个模型模型 A只用 1000 张真实标注图。模型 B只用 1000 张合成图。模型 C900 张合成图 100 张真实图做微调。然后把三个模型放在同一批真实测试集上评估。比较的时候看几个层面。如果模型 B 比模型 A 差很多说明当前模拟环境和真实场景的分布差距太大。先检查渲染相关的材质、光照和背景也可以检查是否缺少关键真实噪声。如果模型 C 接近甚至超过模型 A说明合成数据已经能够提升数据多样性真实数据微调可以把模拟分布拉回真实分布。如果模型 B 在模拟测试集上很高在真实测试集上很低就是典型的分布偏移。这种情况不要急着换模型结构先把模拟环境里变化范围扩大。整个流程用一个小的数据量完成成本很低但能在这段观点和实际工程方案之间建立一条可验证的路径。5. 如果往深走空间智能、具身智能、世界模型5.1 空间智能为什么可能是下一阶段重点空间智能和普通视觉任务有一个本质区别普通视觉任务多数是从二维图像提取语义标签空间智能则要求模型在三维物理空间里理解物体之间的关系。比如一张照片里有一个杯子放在桌子上。普通分类模型会输出“杯子”“桌子”。空间智能模型则要回答杯子距离桌子边缘多远它可能往哪个方向掉落相机从另一侧看过来杯子的轮廓会变成什么样。这类能力不能通过给图片打上更多分类标签来获得需要模型接触三维结构。而三维结构数据从哪来纯靠人工标注非常低效模拟环境重建却是高效路径。在实际工程里空间智能直接关联很多产品方向增强现实里虚拟物体和真实场景的遮挡关系、机器人在家庭环境中的导航、自动驾驶里对动态障碍物的轨迹预测、三维内容生成中的物理合理性。这些方向的数据需求都和“想象空间”有关。李飞飞把接下来关注点放在空间智能上本质上是在推动 AI 从“二维识别”走向“三维理解”。这比单纯加大模型参数量更值得关注。5.2 具身智能需要重新设计学习目标具身智能可以理解成“AI 拥有身体并在真实或虚拟环境里行动”。它的训练目标和传统 CV/NLP 任务区别很大。传统视觉模型学习的是“它是什么”具身智能模型学习的是“下一步动作是什么”。同样看到一个杯子传统模型只需要输出类别和位置具身智能模型需要输出机械臂怎么移动、需要施加多大力度、抓取后往哪个方向走。这类模型不能只靠静态数据集训练。因为动作产生结果结果又影响下一步动作整个序列里天然存在反馈回路。真实环境里做强化学习试错成本太高所以仿真几乎成了必备条件。具身智能的工程落地通常会分成两个阶段。第一阶段是在丰富的仿真环境中预训练一个策略第二阶段用少量真实数据做微调和对齐。第一阶段依靠模拟数据第二阶段用真实数据校正偏差。这样做既能控制成本又能保留真实物理世界中的安全边界。5.3 世界模型给“想象”提供计算框架如果要在算法层面给“人类不靠现实数据学习”找到一个对应物世界模型是最接近的那个概念。世界模型试图让模型学习环境的状态转移规律。给定当前状态和动作模型预测下一个状态。它不需要真的执行动作也不需要从外部获取这条轨迹的真实样本而是在内部模拟可能发生的结果。举个例子。机器人想伸手抓取杯子世界模型可以预测左右偏移 1 厘米杯子可能会滑落向下多按 2 厘米夹爪会触碰桌面。这种预测不是来自一遍遍真实试错而是来自对物理规律的学习。世界模型的工程价值是可以大幅降低强化学习的采样成本。智能体先在世界模型里想象很多条轨迹筛选出有希望成功的路径再在真实环境里执行。这和人类下棋时先算几步、再落子的过程很像。但它也有明显挑战。短期预测很容易长期预测会产生漂移。模型在第 5 步可能还很准到第 30 步就开始偏离真实物理规律。所以现在很多方案会把世界模型和真实环境验证结合起来用世界模型加速搜索真实环境负责最终验证。6. 给工程师的几个实操建议和排查方向6.1 模型效果差时先排查数据分布不要急着换模型我有一个很深的体会很多合成数据项目跑完效果不好团队第一反应是换更大的模型或者调训练轮数。但在大多数情况下问题不在模型结构而在数据分布。如果模型在训练集和真实测试集上差距过大先做一个输入分布对比。统计两者在光照亮度、物体大小、目标数量、背景复杂度、遮挡比例上的差异。差异集中的地方就是模拟环境最需要加强随机化的地方。比如模拟图里杯子都在干净桌面上真实场景里杯子旁边可能放着纸巾、笔、盘子模型就没见过这种遮挡关系。这时加再大的模型也救不回来。先把模拟场景的物体数量、摆放范围、遮挡程度调丰富指标才会上升。6.2 合成数据效果不好按顺序排查模拟和标签如果你已经把合成数据跑进训练流程但效果还是不稳定我建议按下面的顺序排查。第一检查渲染是否太干净。固定地板、固定光照、固定相机角度是最常见的问题。把三样全部改成随机很多时候效果立刻改善。第二检查物体资产是否重复。如果三维模型只有三五个随机生成再多图像也只是在重复同样的几何和纹理。想办法扩资源或者用程序化建模生成变体。第三检查标签是否对齐。程序自动标注并不保证永远正确尤其要注意 3D 到 2D 投影时相机内外参是否能对齐。标签只要出现系统性偏移模型学到的映射关系就是错的。第四检查是否存在捷径特征。比如物体总在画面中心目标小样本永远只有一种颜色。可以把训练集做抽样可视化看模型更容易依靠哪类特征做判断。第五如果以上都没问题再考虑增加模拟复杂度比如加入真实相机噪声、运动模糊、传感器抖动等。6.3 优先级建议先小步验证再批量生产最后给一个项目排期建议。如果团队时间紧不要一上来就规划百万级合成数据。先花两到三天生成 1000 到 5000 张样本搭配少量真实数据微调在固定测试集上出一版指标。看到指标有正向趋势再扩大生成规模。扩大规模的时候优先提高多样性不是单纯增加数量。同一物体固定摆放生成一万张不如三百种物体随机组合生成一万张。多样性决定了模型能不能泛化数量只决定训练稳定性。同时要考虑管线成本。合成数据虽然减少标注成本但渲染需要 GPU、存储需要磁盘、标签校验需要人力。如果一个项目里合成数据和真实数据的成本已经接近说明生成策略需要调整而不是继续堆量。回到李飞飞那句话如果只能留一个结论我记的是AI 要接近人类就不能永远把自己绑在“爬取更多现实数据”这条路上。数据获取方式、模型学习目标、环境交互方式这三个环节必须一起变。真正落地时别急着否定合成数据也别无脑全量合成。先把模拟数据、真实数据、小规模验证的组合跑通再看成本和收益是否合得来。