以色列理工联合哈佛医学院发表多模态模型,从病理切片直接解码复发风险与化疗获益

📅 2026/7/24 23:14:24
以色列理工联合哈佛医学院发表多模态模型,从病理切片直接解码复发风险与化疗获益
小罗碎碎念本文核心内容参考自Gil Shamai, et al. Deep learning on histopathological images to predict breast cancer recurrence risk and chemotherapy benefit: a multicentre, model development and validation study.Lancet Oncol, 2026, 27: 512-526.研究由以色列理工学院领衔联合哈佛大学医学院、以色列多家医疗中心、美国芝加哥大学等机构共同完成。对早期激素受体阳性、HER2阴性乳腺癌患者来说要不要做辅助化疗始终是一道艰难的选择题。传统临床评估看肿瘤大小、组织分级、淋巴结状态就像人工查验证件只能筛出特征明显的高危人群却会漏掉一部分潜在风险者也会让很多低危患者白白承受化疗的毒副作用。而行业金标准Oncotype DX 21基因复发评分检测就像高精度全身扫描能精准判断复发风险和化疗获益但一次检测高达约3500美元的成本、漫长的周转周期让它成了很多患者用不起的“奢侈品”——文献数据显示在中低收入国家能用上这类基因检测的患者不足5%。作为占全部乳腺癌约70%的主流亚型激素受体阳性、HER2阴性早期乳腺癌的治疗决策长期困在“精准但昂贵”与“廉价但粗糙”的两难里。常规的苏木精-伊红HE染色病理切片虽然全球普及、成本低廉却只能提供形态学诊断无法直接给出基因组层面的复发风险。过去十几年里研究者一直在尝试用人工智能从HE切片中预测Oncotype DX评分但所有研究都卡在了同一个瓶颈只能回顾性地和基因检测结果做相关性验证却无法证明AI的风险分层真能指导化疗获益——而这恰恰是Oncotype DX检测最核心的临床价值。来自以色列理工学院、哈佛大学医学院等机构的研究团队基于大规模病理预训练基础模型开发出一套多模态深度学习系统仅需常规HE全切片图像加上雌激素受体ER、孕激素受体PR状态就能准确估算Oncotype DX复发评分。更重要的是该研究首次利用TAILORx随机对照临床试验的数据验证了AI分层能够准确预测患者的化疗获益为病理AI真正走入临床决策提供了关键证据。模型完整工作流这是模型从病理切片输入到输出风险评分的端到端流程核心是“预训练基础模型多实例学习多模态融合”的架构输入与预处理输入常规HE染色的全切片病理图像先进行自动组织分割再切割为标准化的小图块tiles剔除空白与伪影区域。特征提取使用在17万张HE病理切片上预训练的GigaPath基础模型对每一张图块提取高维特征向量。这是模型泛化能力强的核心来源——无需人工标注肿瘤区域就能自动捕捉形态学特征。特征聚合与融合通过Transformer编码器对所有图块特征做聚合多实例学习MIL同时融入ER、PR、年龄等临床变量形成多模态特征。输出与评估经切片级微调后输出连续的AI复发评分最终用于生存分析如无复发生存RFI等性能评估。TAILORx临床试验分组设计该图还原了TAILORx随机对照试验RCT的患者分层逻辑这是本研究能验证“化疗获益”的核心基础共10273名患者按Oncotype DX 21基因复发评分分为三层11分低危1629人仅接受内分泌治疗Group A11-25分中危6907人随机分组3449人接受内分泌安慰剂Group B3458人接受内分泌化疗Group C≥26分高危1737人接受内分泌化疗Group D关键价值中危人群的随机化设计排除了治疗选择偏倚让研究者能真正验证“AI划分的风险组是否真的对应化疗获益差异”。全球研究队列分布与样本规模展示了研究覆盖的7个独立队列的地理分布与样本量体现研究的多中心泛化验证设计核心训练测试队列TAILORx8284名患者全球多中心外部验证队列覆盖以色列Carmel、Haemek、Sheba医疗中心、美国芝加哥大学UCMC、TCGA数据库、澳大利亚ABCTB乳腺组织库同时设置了专门的校准队列。整体规模共收集17812名患者、25436张切片经质控后最终纳入分析13781名患者、16885张切片。地理范围跨北美、欧洲、中东、大洋洲、南美覆盖不同人种、染色方案与扫描设备用于验证模型的跨中心泛化能力。医学AI交流群目前小罗全平台关注量120,000交流群总成员4000大部分来自国内外顶尖院校/医院期待您的加入由于近期入群推销人员较多已开启入群验证扫码添加我的联系方式备注姓名-单位-科室/专业即可邀您入群。一、从形态图像到基因组评分和传统“先做基因检测、再指导治疗”的路径不同这项研究的核心逻辑是让AI直接从病理切片的形态特征中解码出与21基因表达谱对应的复发风险信息。它没有走“人工标注特征→训练模型”的老路而是依托在17万余张病理切片上预训练的GigaPath基础模型结合多实例学习架构实现了从图像到风险评分的端到端预测。整个流程可以拆解为三个核心步骤外加一套适配不同场景的校准方案。预处理一张数字化的全切片图像WSI通常有数十亿像素相当于上万张普通照片的大小无法直接输入模型。研究团队首先通过算法自动识别切片上的有效肿瘤组织区域剔除空白背景和扫描伪影再将组织区域切割成一块块1.6平方毫米的标准图块只有图块数量不少于100张的切片才会进入后续分析。这套自动质控流程仅剔除了不到0.1%的不合格样本从源头保证了输入数据的可靠性。特征提取研究团队没有用普通的卷积神经网络从零开始训练而是采用了预训练的GigaPath病理基础模型——这个模型已经通过自监督学习在171189张不同来源的HE病理切片上完成了“预学习”掌握了病理图像的通用形态特征。基于Transformer架构的它还擅长捕捉组织内的长距离空间关联比传统模型更能理解肿瘤微环境的整体格局。整合打分所有图块提取出的特征向量会通过Transformer编码器进行聚合生成整张切片的全局特征与此同时模型会融入患者的ER、PR状态这两个临床变量最终输出一个连续的AI复发评分。有意思的是研究团队通过特征重要性分析发现当加入图像特征后组织学分级、患者年龄、肿瘤大小这些传统临床指标都不再提供额外信息——也就是说AI从图像里已经学到了比人工分级更丰富、更精准的风险相关特征。最终的多模态模型只保留了ER、PR两项最核心的临床指标大部分预测能力都来自图像本身这也大大降低了模型的使用门槛。极简校准为了让模型能适配不同医院的染色差异、扫描仪型号和人群特征研究团队还设计了一套极简的单参数线性校准方法只需要估算出目标队列的平均Oncotype DX评分甚至可以通过临床特征粗略推算就能通过一次线性缩放完成校准不需要在当地重新收集基因检测数据做训练。实验证实仅需100例样本就能完成稳定的校准这为模型在资源有限地区的落地扫清了关键障碍。二、从随机临床试验到全球多中心真实世界一项医学AI技术能不能真正用于临床光靠原理创新远远不够必须经得起严格的验证。这项研究的验证体系堪称同类研究的标杆既在TAILORx随机临床试验中完成了“金标准级”的化疗获益验证又在六大独立外部队列中检验了真实世界泛化能力。TAILORx试验首次在随机对照数据中验证化疗获益TAILORx是奠定Oncotype DX临床地位的经典III期随机对照试验入组了上万名激素受体阳性、HER2阴性、淋巴结阴性的早期乳腺癌患者。其中复发评分在11-25分的中间风险患者被随机分配接受单纯内分泌治疗或内分泌联合化疗这为验证AI能否预测化疗获益提供了独一无二的数据基础。研究纳入了其中8284例符合质控的患者按7:3的比例拆分为训练集和测试集所有拆分都以患者为单位避免了数据泄露。首先看最直观的准确性在2407人的测试集中AI评分与真实Oncotype DX评分的Pearson相关系数达到0.728。对于临床最关心的“识别高危患者复发评分≥26分”这一任务模型的曲线下面积AUC达到了0.898——相比之下仅用临床特征的模型AUC只有0.780仅用图像的模型也能达到0.886可见图像特征贡献了绝大部分预测能力。研究团队选择16分和26分作为高低危的划分阈值最终有45.6%的患者被归为AI低危12.0%被归为AI高危剩余42.4%为中危。在AI判定的低危患者中仅有1.8%是真正的基因高危阴性预测值高达98.2%而AI判定的高危患者中特异性达到95.9%。这意味着被AI划分为低危的患者几乎可以放心排除高危风险。在预后分层上AI高危患者的无远处复发生存风险是低危患者的2.88倍无复发生存风险是2.61倍和真实基因检测的分层效果没有统计学差异。但真正的突破还是化疗获益的验证。过去所有同类研究都只能证明AI和基因检测结果像却无法证明AI指导的治疗决策对不对——因为回顾性数据里高危患者几乎都接受了化疗无法区分是预后差还是化疗没效。而TAILORx的随机分组设计让研究者可以直接回答AI说高危的患者化疗到底有没有用结果非常明确对于绝经前的AI高危患者化疗能显著改善无病生存风险比HR0.63也就是化疗能降低37%的疾病进展风险而对于绝经后的AI低危患者化疗完全没有带来生存获益HR0.94无统计学差异。更有临床价值的是重新分类分析按照传统的MINDACT临床风险标准被判定为高危的绝经后患者里有31.3%被AI重新划分为低危。这部分患者按照传统标准可能会接受化疗但实际上她们并没有化疗获益AI可以帮她们避免过度治疗。跨人群跨中心的稳定表现如果说TAILORx验证了模型的“绝对实力”六大独立外部队列则检验了模型的“适应能力”这六个队列分别来自以色列三家医疗中心、美国芝加哥大学、澳大利亚乳腺组织库和TCGA数据库共涵盖5497名患者覆盖了不同的人种、染色方案、扫描设备甚至包含了训练集中没有的淋巴结阳性患者。经过单参数校准后模型在各个队列中识别高危复发评分≥26的AUC稳定在0.858到0.903之间和TAILORx测试集的表现几乎没有差距。哪怕是训练时从未见过的淋巴结阳性患者模型的AUC也能达到0.874和淋巴结阴性患者的0.861相当——这说明模型捕捉的是肿瘤本身的生物学风险特征而不是依赖淋巴结状态这类间接指标。在有长期随访数据的队列中AI风险分层同样能显著区分患者的预后效果与真实基因检测没有统计学差异。比如在澳大利亚队列中AI高危患者的乳腺癌特异性死亡风险是低危患者的4.17倍展现了极强的预后价值。基础模型带来的代际优势研究还和已有的两类主流方法做了基准对比一类是传统的全监督多实例学习模型另一类是当时唯一公开的复发评分预测模型DLRS。结果显示无论是在TAILORx测试集还是外部队列中基于基础模型的新方法都显著优于前两者尤其是在跨中心的外部验证中优势更加明显——这正是大规模预训练基础模型的核心价值更强的泛化能力更少的域偏移。三、不止于替代检测病理AI正在改写精准医疗的边界这项研究的意义远不止于“用AI替代昂贵的基因检测”这么简单。它真正打开了常规病理切片的“分子信息宝藏”让每一张医院里随处可见的HE切片都能发挥接近基因组检测的临床价值。最直接的影响是精准医疗的可及性革命。Oncotype DX检测一次约3500美元还需要样本寄送、专业实验室检测周转时间长而数字病理切片的扫描成本不到1美元AI分析可以在数天内完成几乎没有边际成本。对于中低收入国家的患者来说这意味着不用再在“盲目化疗”和“天价检测”之间二选一仅凭常规病理检查就能获得接近精准医疗的风险分层大幅减少不必要的化疗及其带来的毒副作用与经济负担。其次它补充了传统临床决策的盲区。一方面约5%临床判断为低危的绝经前患者会被AI升级为高危从而避免治疗不足另一方面30%-40%临床判断为高危的绝经后患者会被AI降级为低危从而避免过度治疗。一升一降之间是治疗决策的整体优化。更值得深思的是AI对瘤内异质性的捕捉能力。研究中AI评分与基因检测不一致的病例大多存在明显的瘤内异质性——同一份肿瘤的不同切片AI评分差异很大而基因检测的结果往往只匹配其中一张切片的AI评分。这意味着只取少量组织的基因检测可能会因为取样偏差漏掉高危区域而分析多张切片的AI反而能给出更全面的风险评估。当然这项研究也有其边界。目前模型的化疗获益直接验证主要基于淋巴结阴性人群未来还需要在淋巴结阳性的RxPONDER等试验中进一步确认也需要更多前瞻性、来自中低收入国家的真实世界数据支持。但方向已经清晰未来这类病理基础模型还可以继续拓展从预测单一的复发评分到同时预测多种分子特征、药物响应实现“一张切片、全套分子评估”从乳腺癌拓展到更多癌种。从“奢侈品”到“普惠品”精准医疗的门槛正在被AI一点点拉低。而这正是技术最动人的价值让最前沿的医学成果最终惠及每一个需要的人。加入团队我们是一支由国内外顶尖高校硕博组成的前沿交叉团队多名成员以第一作者身份在Nature、Nature Communications、Advanced Science以及Radiology等顶级期刊发表过论文。团队正在招聘实习生/分析师/讲师欢迎医工交叉方向的优秀硕博投递个人简历到团队邮箱lxltx2025163.com