21M小模型碾压百倍大模型,卫星影像理解迎来新时代 📅 2026/7/21 5:02:36 这项由剑桥大学、英伟达和dClimate Labs联合完成的研究以预印本形式发布于2026年7月4日论文编号为arXiv:2607.03949v1有兴趣深入了解的读者可以通过该编号查询完整论文。地球正面临着一个数据悖论我们从未像今天这样拥有如此海量的卫星观测数据但真正能用好这些数据的人却依然是少数掌握专业技能和昂贵算力的研究机构。每一张来自欧洲航天局哨兵卫星的图像在能被科学家使用之前都需要经过辐射校正、云层剔除、多传感器对齐等一系列繁琐处理这就像你买了一袋新鲜食材却发现它们全部混在一起、没有清洗、没有分类而且食谱还是用你看不懂的语言写的。绝大多数人只能望而却步。正是为了打破这个困局剑桥大学的研究团队发起了一项名为TESSERA v2的研究计划。他们的核心思路是把卫星数据预先消化成一种通用的营养素——也就是所谓的嵌入向量embedding让任何研究者、开发者甚至农业从业者都能直接取用这些营养素而无需从头处理原始的卫星影像。更重要的是这项研究通过史上最大规模的地球观测模型缩放实验揭示了一个令人意外的规律在训练这类模型时用来监控训练进度的损失值一个衡量模型表现的技术指标根本不能预测模型在真实任务中的好坏——这意味着过去大量的计算资源其实都被浪费在了错误的方向上。这项研究在1024块英伟达GH200超级芯片上运行了395次训练实验最终产出了一个仅有2100万参数的小模型却在涵盖29项任务的综合测试中击败了所有已知的开放和商业模型其中一些被它超越的模型参数量比它大了数百倍。这不是一次普通的模型发布而是一套从根基重塑地球观测AI开发逻辑的完整方法论。一、卫星数据的原材料困境为什么普通人用不上海量卫星影像地球每天都在被几十颗卫星不间断地扫描和记录。哨兵-2是一颗光学卫星专门拍摄地面的颜色和反射信息可以看到植被的绿度、水体的分布、城市的扩张哨兵-1则是一颗雷达卫星能穿透云层探测地表的物理结构不受天气影响。听起来这两颗卫星的组合简直是地球监测的完美搭档。然而现实远比想象复杂。光学卫星最大的敌人是云。在热带雨林地区一整年里有超过80%的时间被云层覆盖这意味着你想观测的那片土地大部分时候都被白茫茫的云遮住了就像你想拍一张朋友的照片却发现他大半年都戴着口罩。雷达卫星虽然能穿云但它的观测节奏和光学卫星并不同步两者的数据往往对不上时间。更麻烦的是不同轨道、不同时间拍摄的图像在亮度、角度、信号强度上都有细微差异直接拼在一起会产生明显的拼接痕迹就像把不同光线下拍的照片硬拼成全景图总会看出接缝。为了解决这些问题研究者通常会制作所谓的云无云合成图——把同一地区一段时间内所有无云的卫星影像叠加平均得到一张干净的图像。但这个操作有一个致命的代价它抹掉了时间信息。农作物的生长节律、植被的季节变化、洪水的消退过程这些随时间变化的动态信息在合成图中全部消失了。这就像你把一年365天的日记全部打散重排然后取平均值最终得到一段毫无意义的平均日记。而许多重要的下游任务比如识别农作物类型、监测森林砍伐时间点、预测植被生长态势恰恰依赖这些被抹掉的动态信息。TESSERA团队的解决方案是引入d像素的概念。所谓d像素就是把地球表面某个10米×10米小格子里一整年内所有有效的卫星观测记录包括光学和雷达打包成一个完整的时间序列并用一个二进制掩码标注哪些时间点是有效的晴天无云哪些是缺失的被云遮挡。这个d像素就像是地球某个角落一整年的完整日记包含了所有的高光时刻和阴暗日子而不是被人工抹平的平均值。这种处理方式保留了完整的物候动态同时也让模型学会了在信息残缺时依然做出合理判断——就像一个经验丰富的医生即便病历不完整也能根据现有线索做出诊断。二、营养素工厂什么是嵌入向量为什么它能改变一切理解TESSERA v2的核心需要先理解嵌入向量这个概念。简单说嵌入向量就是用一串数字来表示某个地点在某个时间段内的综合特征。以一个128维的嵌入向量为例这128个数字共同描述了该像素的植被状况、水分含量、季节节律、地表覆盖类型等综合信息——虽然这些数字本身没有直观意义但它们的组合方式却精确编码了这个地点的身份特征就像一个人的DNA序列每一段碱基对单独看毫无意义组合起来却唯一标识了一个人。TESSERA v2的核心商业逻辑可以用一家预制菜工厂来理解。工厂大型教师模型负责处理最原始的食材原始卫星时间序列经过复杂的加工流程生产出标准化的半成品嵌入向量。这些半成品随后被存储在数据库中向所有人开放。使用者无需自己购置厨房设备和食材只需取用对应地点和时间的半成品加上自己的调料轻量级任务头就能快速做出各自需要的成品菜各类地球观测应用。这套嵌入即数据的模式彻底改变了地球观测AI的使用门槛。以往一个农业机构想利用卫星数据预测作物产量需要招募遥感工程师、购买GPU服务器、处理海量原始数据、自己训练模型——整个流程可能耗费数月、数百万元。在TESSERA v2的模式下他们只需下载对应地区的预计算嵌入向量再用几千个标注样本训练一个简单的神经网络头整个过程可能只需要几天和几百元的算力成本。研究团队为这套产品制定了五个核心标准。第一是开箱即用用户拿到数据就能直接分析不需要任何预处理步骤。第二是跨任务通用同一套嵌入向量应该能适用于分类、分割、变化检测、回归等各种不同类型的任务而不是只针对某一个特定问题优化。第三是可复现所有的训练代码、模型权重、评估流程都应该公开让任何人都能验证和扩展。第四是经济实惠不论是标注成本、训练算力、推理算力还是存储开销都应该尽可能低廉。第五是灵活可调用户应该能根据自己的预算在精度和成本之间自由选择而不是被强制绑定在某一个固定的模型规格上。三、史上最大规模地球观测缩放实验395次训练揭开的惊天秘密现在来到这篇论文最核心、也最具颠覆性的部分。在人工智能领域缩放定律scaling laws是近年来最重要的发现之一。它的基本逻辑是模型越大、数据越多、算力越强训练损失就越低而训练损失越低模型在各种任务上的表现就越好。正是基于这个逻辑整个AI行业都把降低损失作为衡量模型优劣的核心指标并依据损失的变化规律来决定如何分配计算预算。但TESSERA团队在地球观测领域发现了一个令人不安的异常。他们在1024块GH200超级芯片每块芯片由一个Grace CPU和一个96GB显存的H100 GPU组成上系统性地训练了395个不同规模的模型并且每个模型都在15项真实下游任务上进行了评估。这15项任务涵盖了土地覆盖分类、农作物分割、变化检测、生物量回归等多个领域来自10个不同的数据集可以说是相当全面和真实的测试。测试结果让人大跌眼镜。当研究者把395个模型的训练损失和下游任务综合得分画在一张散点图上时他们发现这两个数值之间几乎没有任何关系——皮尔逊相关系数仅为-0.18斯皮尔曼相关系数为-0.16都非常接近于零完全随机的关系。换句话说一个损失值很低的模型在真实任务上的表现完全可能比一个损失值更高的模型差。为什么会这样研究团队给出了清晰的解释。在卫星数据中样本之间的差异很大一部分来自于云层覆盖和卫星轨道的随机性——这些差异和地面的真实物理状态毫无关系。模型在降低损失的过程中很可能学会了对云层和轨道变化保持不变而不是识别对人类有用的地表特征。前者能有效降低损失但对任何实际任务毫无帮助就像一个学生学会了在考试中猜测老师的出题偏好而不是真正理解了知识——他的训练损失做题错误率可能很低但在真实生活中运用知识的能力下游任务表现并没有提升。这个发现有着非常具体的经济代价。研究团队计算发现如果按照传统的以损失为导向方式来选择最佳模型你需要多花费大约254%的计算资源才能达到和以真实任务表现为导向选择方式同等的效果。也就是说过去依赖损失值来做模型选择大约有三分之二的计算预算是在做无用功。四、找到正确的烹饪配方编码器、数据和投影器谁才是真正的关键发现损失值不可信之后研究团队面临的下一个问题是那么计算预算到底应该怎么分配一个地球观测模型的训练主要涉及三个可以调节的维度编码器的大小负责把卫星时间序列转化为嵌入向量的核心神经网络参数越多越大、投影器的大小训练过程中辅助编码器学习的附属网络在推理时不使用、以及训练数据的量。为了找到最优的分配方案研究团队把395次训练实验按照计算量分成了九个等级区间在每个区间内分别测试了16种不同编码器规模从700万到2.78亿参数和四种不同投影器规模同时训练数据量从3000万d像素到99.84亿d像素不等。对于每个计算量级别他们找到了使下游任务得分最高的最优组合然后观察这些最优组合随计算量增加如何变化。结果呈现出一幅非常清晰的图景。当计算预算增加时最优的编码器大小确实随之增长符合幂律关系计算量每增加10倍最优编码器参数量增长约2.29倍对应的幂指数约为0.36。与此同时训练数据量也需要随之扩大计算量每增加10倍最优数据量增长约4.27倍对应幂指数约为0.63。两个指数相加恰好约等于1.0精确值为0.99这与自然语言处理领域著名的Chinchilla定律即训练一个计算最优模型数据量和参数量应该等比例增长高度吻合这是一个来自不同数据域的独立印证增加了研究结论的可信度。然而最关键的发现是关于投影器的。研究者发现投影器的最优大小对应的幂指数约为0.00——这意味着无论计算预算怎么增长最优的投影器大小几乎保持不变。投影器在训练过程中虽然有用但它的贡献上限早就饱和了再给它增加参数对最终的下游任务表现没有任何提升。它就像烹饪时用来搅拌的锅铲——无论你要做多大一锅菜锅铲的大小都不需要按比例增大一把标准尺寸的锅铲就够用了。这三个幂指数的稳健性经过了严格的统计验证包括1000次自举bootstrap重采样和排除一个计算量桶的交叉验证结果都非常一致说明这不是偶然现象而是该模型家族真实的统计规律。这套规律给出了一个非常具体的生产配方把钱花在更大的编码器和更多的数据上投影器保持最小有效规格即可多出的那部分算力全部是浪费。五、1B参数教师模型的内部构造如何阅读地球一整年的日记基于上述缩放定律的指引研究团队构建了TESSERA v2的核心——一个拥有约10亿参数的大型教师模型。这个模型的设计颇具匠心每一个细节都针对卫星数据的特殊性量身定制。这个教师模型采用双分支架构哨兵-2光学数据和哨兵-1雷达数据分别由独立的处理通道处理。每个通道首先用一个线性层把各自的观测值转化为向量然后加入年内第几天的位置编码——这就像给每条日记加上日期标签让模型知道这条观测记录发生在一年中的什么时候比如冬天、开春还是秋收季节。加上日期标签后每个通道的序列分别进入一个4层的Transformer网络一种专门处理序列数据的神经网络结构进行处理然后通过注意力池化一种自动给重要时刻加权、给不重要时刻降权的汇总方式把整个时间序列压缩成一个向量。最后两个通道的向量被送入一个双层融合Transformer将光学和雷达的信息融合成一个768维的统一嵌入向量。在训练方式上研究团队使用了一种叫做BARLOW TWINS的自监督学习方法。自监督学习的核心思路是不需要人工标注而是通过让模型学会同一个地点的不同观测结果应该产生相似的嵌入来训练自己。具体来说对同一个d像素从一整年的观测记录中随机抽取两个子集作为两个视角让模型把这两个视角的嵌入向量对齐同时防止所有向量都坍缩成同一个值这就是BARLOW TWINS中冗余减少机制的作用。TESSERA v2相比v1的一个重要改进是在训练时随机使用不同长度的观测子集每个视角随机抽取8个或16个观测时刻而在推理即实际使用时则提供全部有效观测。这种设计的逻辑是训练时用残缺信息逼迫模型从少量观测中推断完整的年度物候规律推理时给足所有信息模型能利用更丰富的证据做出更准确的判断。这就像培养一名厨师平时有意只给他一半的食材练手上战场时才给他全套设备结果他反而更擅长利用有限资源。此外为了解决不同地点观测数量差异巨大的问题有些热带地区全年有效观测可能只有几次而干旱地区可能有上百次v2采用了自适应桶采样策略根据每个像素的有效观测数量k选取能容纳所有k个观测的最小固定长度从16、32、48……的阶梯中选取剩余的空位用全年的等间隔重采样填充。这样既不丢弃任何有效观测又保持了批量计算所需的固定输入长度就像打包行李时根据物品多少选择合适尺寸的箱子而不是固执地塞进同一个箱子或者空着大半的空间浪费资源。整个教师模型在512块GPU上用全球约42亿个d像素进行了完整训练全局批次大小为131072。这是一次规模宏大的全球阅读——模型通过学习地球上42亿个地点的一整年卫星日记建立起对全球地表状态的深度理解。六、知识传承的艺术如何把巨人的智慧装进袖珍版容器10亿参数的教师模型虽然强大但它有一个致命的弱点太贵了。研究团队计算用这个教师模型对全球所有陆地表面进行一次完整的年度嵌入计算大约需要50个H100-GPU运行一整年的算力约50 H100-年。这种规模的计算普通研究机构和企业根本无法承受更别说每年重复运行。解决方案是知识蒸馏distillation。这个概念的直觉是一个大专家教师模型已经把世界看得很透彻了我们不需要让每个人都成为同等规模的专家而是让大专家把自己的世界观传授给一个更紧凑的学生让学生在更小的体积内尽可能还原大专家的视角。研究团队从教师模型蒸馏出四个不同规模的学生模型分别命名为N、S、M、L对应参数量约为100万、700万、2100万和4400万。蒸馏的方式是固定冻结教师模型让它停止学习、只提供输出然后让学生模型学习产生与教师模型尽可能相似的嵌入向量。为了节省蒸馏成本研究团队先对约2亿个d像素运行一次教师模型把结果缓存下来作为固定的目标答案学生模型的训练只需要和这些缓存结果对比即可不需要每次都重新运行巨大的教师模型。这个蒸馏过程只需要64块H100 GPU完成相比教师模型的训练轻量得多。最终四个学生模型的推理成本在0.04到2个H100-年之间比教师模型低了整整两个数量级。按最大的L号学生4400万参数计算它比教师模型便宜约25倍最小的N号学生100万参数则比教师模型便宜超过1000倍。这套成本结构意味着全球年度嵌入更新变成了一件可负担的常规任务而不是一次性的奢侈壮举。七、俄罗斯套娃式嵌入为什么128维能缩水到16维还保留九成功力TESSERA v2还解决了另一个实际问题存储和传输成本。一个128维的全球嵌入产品对于拥有强大基础设施的大型机构来说可能没问题但对于网络带宽有限的发展中国家研究者、或者需要在手机端运行的应用开发者来说每个像素存储128个浮点数的开销依然是个负担。TESSERA v2的解决方案是俄罗斯套娃式表示MATRYOSHKA representations——这个名字来自于俄罗斯著名的套娃玩具大娃套着小娃每个小娃都是大娃的完整缩小版。具体来说研究团队训练学生模型使其128维嵌入向量的前16位就能独立代表最重要的信息前32位包含更多细节前64位再进一步完整的128位则提供最全面的表示。用户可以根据自己的存储和带宽预算直接截取嵌入向量的前k位来使用而不需要重新训练或转换任何模型。实验结果显示仅使用前16维的嵌入在29项综合测试任务上能保留约92%的完整128维性能使用前32维达到约97%使用前64维达到约99%。换句话说如果用户只愿意付出八分之一的存储成本他们依然能获得九成以上的性能——这是一个非常实用的权衡曲线。然而实现这种可截断的嵌入并不简单。研究团队发现一个看似自然的方法——在自监督预训练时直接对不同前缀长度施加损失约束——根本行不通。根本原因在于BARLOW TWINS等自监督方法的数学性质这类方法训练出的嵌入只能保证整体子空间的结构无法保证哪个坐标轴比哪个更重要。对不同前缀施加独立的损失反而会通过梯度不平衡破坏已经学到的坐标结构就像你试图同时用两把锁锁住同一扇门结果反而让门失去了正常的铰链功能。正确的方法是通过蒸馏来实现。蒸馏提供了一个固定的外部参考点教师模型的嵌入让学生模型的每个前缀都去学习尽可能还原完整的教师嵌入而不是自己给自己评分。这种有外部参照的监督学习天然地迫使学生把最重要的信息压缩进最短的前缀把次要信息依次填入后续维度。这一发现揭示了嵌入维度排序的本质它不是自监督学习能自发产生的属性而是一种需要通过有监督压缩来显式习得的结构。八、29项任务的大比武小学生打败大先生所有的设计和训练最终都需要接受现实检验。研究团队构建了一套两阶段评估体系第一阶段是15项来自AlphaEarth基准套件的标准任务涵盖了土地覆盖分类、作物分割、变化检测和生物量回归等常见地球观测应用第二阶段则是14项完全独立的保留数据集在整个研究开发过程中从未被用于任何决策分为植被组树种识别、作物地块分割、生物量和城市组土地利用、道路密度、人口、GDP、夜间灯光、污染、地表温度、人口统计。评估时所有模型都使用相同的轻量级任务头像素级任务用一个两层MLP图像块级任务用一个不超过200万参数的简单卷积网络。这种统一的评估头确保了比较的公平性——模型之间的差异完全来自嵌入向量的质量而不是任务头的能力差异。在15项AlphaEarth套件任务上TESSERA v2-1B-L4400万参数的L号学生以综合得分0.584排名第一M号、S号、N号学生分别为0.581、0.570和0.558全部超过AlphaEarth谷歌发布的全球嵌入产品得分0.560和TESSERA v1得分0.541。在完整29项任务的综合测试中结果更加突出TESSERA v2-1B-M2100万参数的M号学生以0.611的总分领先所有系统而TESSERA v1得分0.576AlphaEarth为0.574OlmoEarth-L来自微软的另一个系统为0.562。值得注意的是这个2100万参数的M号学生比它超越的所有对手都小得多——有些被它超越的模型参数量是它的数十倍乃至数百倍。在标签效率测试中模拟只有1%、30%或100%训练标注数据的场景TESSERA v2在绝大多数保留数据集上都超过了最强的非v2基准而且差距在标注数据最少的时候最为显著。这意味着TESSERA v2的嵌入包含了更丰富的、可以用极少量标注激活的潜在信息对于标注数据稀缺的发展中国家和小型研究机构尤其有价值。除了性能数字v2在嵌入的视觉质量上也有明显改进。v1的嵌入图像中经常出现沿卫星轨道方向的条纹状伪影和图块拼接边界这些伪影与哨兵卫星的观测几何直接相关会干扰下游的地理空间分析。v2的嵌入基本消除了这些伪影地理结构更加平滑自然。在时间稳定性方面对于土地覆盖未发生变化的像素v2在相邻年份之间的余弦距离嵌入相似度的度量显著低于v1说明v2更能稳定代表地点的长期身份而当发生临时扰动如临时砍伐后v2的嵌入能在扰动消失后恢复到之前的基线水平而v1则会持续漂移无法自动恢复。说到底TESSERA v2这项研究做了几件在地球观测领域看似平凡但实则意义深远的事情。它用395次精心控制的实验第一次系统性地证明了训练损失这个大家习以为常的指路明灯在地球观测领域其实是个假向导——跟着它走你可能费了三倍的力气结果却发现自己走偏了。它还发现了一套清晰的资源分配法则钱要花在更大的编码器和更多的数据上辅助用的投影器不需要跟着增长。这两个发现合在一起给整个领域的研究者提供了一张更准确的地图。更重要的是这项研究把一个供精英使用的大型教师模型通过蒸馏变成了一套供所有人使用的轻量产品家族并且通过俄罗斯套娃式的嵌入设计让存储成本也变成了用户可以自由调节的旋钮。一个只有2100万参数的小模型在29项任务上击败了所有已知的开放和商业模型——这说明在合理的设计框架下规模不是决定性的架构的正确性和知识的精炼程度才是。对于普通人来说这项研究意味着未来那些依赖卫星数据的应用——农业保险定损、森林碳汇核查、城市热岛监测、灾害应急响应——将变得更快、更便宜、更准确而且更多地可以在小型机构甚至个人设备上运行而不再是只有财力雄厚的大机构才能玩得起的游戏。一个更民主化的地球观测时代正在这些数字背后悄然开启。研究团队表示将在训练完成后发布覆盖2017至2025年的全球嵌入数据同时开放所有训练代码、缩放实验结果、蒸馏学生模型权重和评估框架感兴趣的读者可通过arXiv:2607.03949v1查阅完整论文或访问https://github.com/ucam-eo/tessera获取代码。QAQ1TESSERA v2的嵌入向量和普通卫星图像有什么区别A普通卫星图像是原始的像素颜色或反射率数值需要专业人员进行大量预处理才能使用。TESSERA v2的嵌入向量是一串经过深度学习模型消化后的数字128维或更少它已经把某个地点一整年的卫星时间序列压缩成了携带语义信息的紧凑表示用户可以直接拿来训练分类或回归模型无需任何遥感预处理知识和GPU推理环境。Q2为什么TESSERA v2用21M参数的小模型能超过更大的模型A这得益于两个关键设计。首先21M的学生模型通过知识蒸馏从10亿参数的教师模型那里继承了高质量的世界观等于站在巨人的肩膀上其次训练过程遵循了从395次实验中提炼出的最优资源分配规律把算力集中在真正有效的地方。大模型如果训练方向有误参数多了也是浪费而小模型若有高质量的知识传承反而能以更低的推理成本实现更好的任务表现。Q3TESSERA v2的俄罗斯套娃嵌入MATRYOSHKA实际使用时怎么操作A用户在下载某地区的TESSERA v2嵌入数据后会得到每个像素128维的浮点数向量。如果存储或带宽有限直接截取每个向量的前16位使用即可这16位已经能保留约92%的完整性能存储成本只有完整版的八分之一。不需要重新下载特殊版本的嵌入也不需要重新训练任何模型截取操作本身就足够因为这种维度间的信息层次是在训练时通过蒸馏显式学到的。