引言罕见疾病影响着全球超3亿人却长期深陷诊断困境——患者平均要经历长达5年以上的诊断奥德赛反复转诊、误诊和治疗延误是常态。这背后是疾病的高度异质性、病例稀缺以及临床医生认知有限等多重挑战。近日一项发表于Nature的研究带来了突破性解决方案。由上海交通大学、新华医院等团队联合开发的DeepRare系统构建了一个基于大语言模型的多智能体诊断决策支持框架。它不仅能处理自由文本、标准化表型术语和基因检测结果等多模态临床输入更可生成带排名、且推理过程透明可追溯的诊断假设在涵盖14个专科的2919种罕见病评估中展现出卓越性能其诊断准确率甚至超越了资深临床专家。基本信息文章标题An agentic system for rare disease diagnosis with traceable reasoning期刊Nature影响因子64.8发表时间2026年2月18日研究单位上海交通大学上海交通大学医学院附属新华医院上海人工智能实验室哈佛医学院中南大学湘雅医学院附属儿童医院Github地址https://github.com/MAGIC-AI4Med/DeepRare论文地址https://doi.org/10.1038/s41586-025-10097-9研究内容与方法一、数据集构建与预处理数据集来源公开数据集RareBench含MME、HMS、LIRICAL、RAMEDIS子集、MyGene2、DDD、MIMIC-IV内部临床数据集新华医院数据集、湖南医院数据集预处理流程罕见病过滤通过大语言模型LLM判断病例是否属于罕见病代码片段deffilter_rare_disease(case,llm_model):promptf判断以下病例是否为罕见病{case[text]}仅返回是或否responsellm_model.invoke(prompt)returnresponse.strip()是信息完整性过滤移除无法提取有效HPO术语或无明确诊断的病例数据集划分按时间顺序划分为测试集和相似案例库代码片段defsplit_dataset(dataset,test_ratio0.2):sorted_datasetsorted(dataset,keylambdax:x[record_time])split_idxint(len(sorted_dataset)*(1-test_ratio))train_libsorted_dataset[:split_idx]test_setsorted_dataset[split_idx:]returntrain_lib,test_set二、系统整体架构设计DeepRare系统三层架构示意图系统采用三层模块化架构参考Model Context ProtocolMCP设计中央主机层搭载记忆库的LLM核心负责协调整个诊断流程、整合多源证据并生成最终诊断结果Agent服务器层多个专业化功能Agent负责执行特定子任务如表型提取、知识检索并与外部环境交互外部数据源层包含医学文献库、罕见病知识库、临床病例库、基因变异数据库等为诊断提供权威证据支撑三、核心诊断工作流程系统诊断分为两个核心阶段主流程代码片段defdeeprare_diagnosis(patient_input,central_host,agents,data_sources):# 阶段1多源信息收集collected_evidencecollect_information(patient_input,central_host,agents,data_sources)# 阶段2自反式诊断推理final_diagnosis,reasoning_chainself_reflective_diagnosis(collected_evidence,central_host)returnfinal_diagnosis,reasoning_chain1. 信息收集阶段并行处理表型与基因型输入实现多模态证据整合表型信息收集子流程HPO标准化将自由文本临床描述转换为标准化HPO术语知识与案例检索调用知识搜索器、案例搜索器获取相关医学证据专业表型分析调用第三方工具生成初步诊断建议基因型信息收集子流程VCF文件注释对原始基因变异文件进行功能、频率、致病性注释变异优先级排序基于群体频率、致病性预测、功能影响等指标排序变异表型-基因型关联LLM解释变异结果并关联表型特征证据整合与记忆更新将所有收集到的证据存入中央主机记忆库代码片段defcollect_information(patient_input,central_host,agents,data_sources):evidence{}# 表型信息处理ifphenotypeinpatient_input:hpo_termsagents[phenotype_extractor].extract(patient_input[phenotype])evidence[hpo]hpo_terms evidence[knowledge]agents[knowledge_searcher].search(hpo_terms)evidence[similar_cases]agents[case_searcher].search(hpo_terms)evidence[pheno_analysis]agents[phenotype_analyser].analyse(hpo_terms)# 基因型信息处理ifgenotypeinpatient_input:annotated_variantsagents[genotype_analyser].annotate(patient_input[genotype])evidence[genomics]annotated_variants# 更新中央主机记忆库central_host.memory.update(evidence)returnevidence2. 自反诊断阶段基于记忆库证据生成诊断并进行自我验证公式与代码结合初步诊断生成中央主机基于记忆库证据生成初步诊断列表公式D′Ahost(P^,M∣prompt5)D A_{host}(\hat{P}, M | prompt_5)D′Ahost(P^,M∣prompt5)其中P^\hat{P}P^为标准化表型集合MMM为记忆库证据prompt5prompt_5prompt5为诊断生成提示词自反验证与迭代LLM对初步诊断进行合理性验证若诊断不合理则重新收集证据代码片段defself_reflective_diagnosis(evidence,central_host):# 生成初步诊断initial_diagcentral_host.generate_initial_diagnosis(evidence)# 自反验证诊断合理性reflection_promptf验证以下诊断是否合理若不合理请说明证据缺口{initial_diag}\n证据{evidence}reflection_resultcentral_host.invoke(reflection_prompt)ifreflection_result[is_valid]:final_diaginitial_diagelse:# 针对证据缺口补充收集信息new_evidencecentral_host.collect_more_evidence(evidence,reflection_result[gap])final_diagcentral_host.generate_initial_diagnosis(new_evidence)# 生成带可追溯参考的推理链reasoning_chaincentral_host.generate_reasoning(final_diag,evidence)returnfinal_diag,reasoning_chain推理链后处理验证推理链中参考链接的有效性移除无效链接以减少幻觉四、各Agent服务器的实现细节1. 表型提取器Phenotype Extractor核心功能将自由文本临床描述转换为标准化HPO术语实现步骤LLM提取候选表型实体从文本中提取未归一化的症状/表型BioLORD归一化映射将候选实体映射到HPO术语库代码片段defnormalize_hpo(candidate_terms,biolord_model,hpo_vocab):normalized_terms[]fortermincandidate_terms:term_embbiolord_model.encode(term,convert_to_tensorTrue)# 计算与HPO词汇的余弦相似度sim_scorestorch.cosine_similarity(term_emb,hpo_vocab[embeddings],dim1)top_idxtorch.argmax(sim_scores).item()ifsim_scores[top_idx]0.8:normalized_terms.append(hpo_vocab[terms][top_idx])returnnormalized_terms2. 疾病归一化器Disease Normalizer核心功能将自由文本疾病名称映射到Orphanet/OMIM标准化疾病ID实现逻辑通过BioLORD计算疾病名称与标准化词汇的余弦相似度阈值0.8以上保留映射结果3. 知识搜索器Knowledge Searcher核心功能检索医学文献、知识库中的权威诊断证据实现流程多源检索依次调用通用搜索引擎Bing/Google、专业医学数据库PubMed/Orphanet/OMIM结果过滤与摘要用轻量LLM提取关键信息并过滤非医学内容代码片段defsummarize_knowledge(web_pages,llm_model):summarized_evidence[]forpageinweb_pages:promptf提取以下网页中与罕见病诊断相关的关键信息非医学内容返回无效{page[content]}summaryllm_model.invoke(prompt)ifsummary!无效:summarized_evidence.append({content:summary,url:page[url]})returnsummarized_evidence4. 案例搜索器Case Searcher核心功能从病例库中检索与输入表型相似的临床案例实现流程初始检索用OpenAI text-embedding-3-small编码HPO术语基于余弦相似度取Top50候选病例MedCPT重排用MedCPT-Cross-Encoder重新排序候选病例代码片段defrerank_cases(query_hpo,candidate_cases,medcpt_model):query_embmedcpt_model.encode(query_hpo,convert_to_tensorTrue)scored_cases[]forcaseincandidate_cases:case_embmedcpt_model.encode(case[hpo_terms],convert_to_tensorTrue)sim_scoretorch.cosine_similarity(query_emb,case_emb,dim0).item()scored_cases.append((case,sim_score))# 按相似度降序排序取Top10scored_cases.sort(keylambdax:x[1],reverseTrue)return[caseforcase,_inscored_cases[:10]]相关性验证用LLM验证候选病例与输入的临床相关性5. 表型分析器Phenotype Analyser核心功能集成专业表型分析工具生成诊断建议集成工具实现PhenoBrain通过API调用输入HPO术语返回Top5罕见病诊断建议PubCaseFinder通过API调用匹配PubMed病例库返回Top5诊断结果Zero-shot LLM推理用LLM基于HPO术语生成零样本诊断建议代码片段defzero_shot_pheno_diagnosis(hpo_terms,llm_model):promptf基于以下HPO术语给出Top5罕见病诊断建议{hpo_terms}responsellm_model.invoke(prompt)returnparse_diagnosis_response(response)6. 基因型分析器Genotype Analyser核心功能处理VCF文件完成基因变异注释与优先级排序实现流程调用Exomiser框架集成gnomAD、PolyPhen-2、SIFT等数据源完成变异注释变异优先级排序基于群体频率、致病性预测、功能影响等指标排序代码片段defrun_exomiser(hpo_terms,vcf_path,exomiser_config):# 调用Exomiser命令行工具执行分析cmdfexomiser-cli --analysis FULL --hpo{hpo_terms}--vcf{vcf_path}--config{exomiser_config}resultsubprocess.run(cmd,shellTrue,capture_outputTrue,textTrue)# 解析Exomiser输出的排序后变异结果ranked_variantsparse_exomiser_output(result.stdout)returnranked_variants五、关键技术模块实现1. 参考链接验证模块核心功能验证推理链中参考链接的有效性减少幻觉代码片段defvalidate_references(references):valid_refs[]forrefinreferences:try:responserequests.head(ref[url],timeout5)ifresponse.status_code200:valid_refs.append(ref)exceptrequests.exceptions.RequestException:continuereturnvalid_refs2. 可追溯推理链生成核心逻辑为每个诊断结果生成包含证据来源、推理步骤的结构化推理链公式{D,R}Ahost(D,I^,M∣prompt8)\{D, R\} A_{host}(D, \hat{I}, M | prompt_8){D,R}Ahost(D,I^,M∣prompt8)其中RRR为可追溯推理链I^\hat{I}I^为标准化多模态输入prompt8prompt_8prompt8为推理链生成提示词实验结果分析DeepRare在基于HPO表型的诊断任务中全面超越现有方法【性能基准测试在诊断API、通用LLM、推理增强型LLM、医学调优LLM和智能体系统之间的比较评估。】DeepRare在基于人类表型本体HPO的罕见病诊断任务中展现出卓越性能。在涵盖多个公共数据集的综合评估中DeepRare的平均Recall1达到57.18%显著优于所有基线方法。智能体架构优势显著DeepRare的智能体系统设计使其性能远超单一模型方法证明了在复杂诊断推理中协调多个专业智能体的价值。推理能力是关键具备显式推理链的推理增强型LLM如Claude-3.7-Sonnet-thinking普遍优于其通用版本表明透明的推理过程有助于提升诊断准确性。规模与泛化性通用大语言模型如GPT-4o, DeepSeek-V3的表现意外地超过了专门针对医学领域调优的较小模型如Baichuan-M1这可能反映了参数规模和更广泛训练数据带来的优势。跨数据集稳健性如图所示DeepRare在来自文献、病例报告和真实临床中心的所有八个测试数据集上均保持领先特别是在RareBench-MME和RareBench-RAMEDIS数据集上Recall1分别达到78%和71%优势明显。【 基于HPO的跨数据集评估及DeepRare的比较性能。a 在七个公共罕见病登记库上的诊断准确性b 在新华医院队列上的优异性能一致性。】DeepRare在跨专科和长尾疾病诊断中表现优异【跨14个人体系统的诊断准确性比较。】DeepRare的诊断能力覆盖广泛的医学专科。根据MedlinePlus分类法对病例按14个专科系统进行分析结果显示DeepRare在几乎所有专科中都大幅领先于基线模型。专科优势在内分泌系统准确率60% vs 第二名的32%和消化系统准确率49% vs 34%等类别中DeepRare表现出显著优势。其在肾脏和泌尿系统诊断中表现最佳准确率66%而在呼吸系统相对较低31%反映了其临床应用的边界。攻克长尾难题针对数据稀疏的“长尾”疾病病例数≤10DeepRare展现出强大的泛化能力。对于31.8%的此类疾病其Recall1超过0.8显著优于DeepSeek-V323.5%和DeepSeek-R126.6%。而专门的医学LLMBaichuan-M1在此设定下表现不佳仅对2.5%的尾部疾病达到高召回率。【病例数超过10的疾病级别的召回性能比较显示DeepRare的持续优越性。】DeepRare整合基因数据提升诊断精度其推理链获临床专家高度认可【使用HPO和基因数据输入的诊断性能与基线方法及仅HPO输入的比较。】当输入结合HPO表型和全外显子组测序WES基因数据时DeepRare的诊断性能得到大幅提升。多模态输入增益在新华医院数据集上Recall1从仅使用HPO时的39.9%跃升至69.1%在湖南医院数据集上从33.3%提升至63.6%。超越专业工具在与同样处理HPO和基因数据的生物信息学工具Exomiser的直接比较中DeepRare在新华医院数据集上以69.1%的Recall1显著优于Exomiser的55.9%在湖南医院数据集上也以63.6%优于58.0%。DeepRare的核心优势之一是生成透明、可追溯的推理链。由10位罕见病副主任医师对180个病例的评估显示高证据准确性在病例层面参考文献的平均准确率达到95.4%表明系统提供的诊断证据高度可靠且与决策直接相关。失败模式分析对200个诊断失败案例的分析揭示了主要挑战。最常见的失败模式是“推理权重错误”41.0%即逻辑正确但对特定表型的权重分配欠佳其次是“表型模拟诊断”38.5%体现了高表型重叠疾病区分的固有难度。而核心推理事实错误2.5%或证据链接错误2.5%则很少见证明了系统核心知识和检索能力的稳健性。优势与局限优势•诊断性能卓越在涵盖2,919种罕见病的多中心评估中DeepRare的Recall1平均达57.18%显著超越现有最佳方法并在与专家对比中展现出更高的诊断准确率。•推理过程透明可追溯系统生成诊断假设的同时提供基于可验证医学证据如文献、指南、病例的推理链专家评审显示其证据事实性同意率高达95.4%增强了临床可信度。•多模态输入与强泛化能力系统能灵活处理自由文本、结构化HPO术语及基因组数据VCF文件并在来自亚欧美不同临床中心的真实世界数据上表现稳定具备良好的跨人群与跨场景泛化能力。局限•知识检索机制有待优化当前系统对表型信息进行聚合检索未来可探索更精细、自适应的检索策略以进一步提升诊断精度尤其在处理高度相似的表型时存在误判可能。•功能覆盖尚不全面系统主要服务于已怀疑罕见病但未确诊的场景在非专科场景下的初步“筛查”能力尚未充分验证和评估限制了其在更早期诊断环节的应用。•系统复杂性与部署成本多智能体架构整合了超过40种专业工具与知识源并依赖大语言模型进行协调与推理增加了系统的训练与部署复杂度对计算资源要求较高。参考文献RareBench: Can LLMs Serve as Rare Diseases Specialists?Chen et al., 2024该论文构建了包含多个公开数据源的罕见病诊断基准是本研究进行跨数据集评估和性能比较的核心基准之一。DeepRare系统在RareBench的多个子集上进行了全面测试其评估框架为本研究提供了重要的性能衡量标准。Exomiser: Next-generation diagnostics and disease-gene discoverySmedley et al., 2015本文介绍了Exomiser工具用于整合表型HPO和基因型数据进行变异优先级排序和疾病诊断。本研究将Exomiser作为基因分析模块集成到DeepRare系统中并在多模态输入场景下将其作为关键基线进行比较证明了DeepRare的优越性能。MDAgents: An adaptive collaboration of LLMs for medical decision-makingKim et al., 2024该论文提出了一个用于医疗决策的多智能体LLM协作框架。本研究将MDAgents作为现有智能体系统的代表进行对比凸显了DeepRare在罕见病诊断这一特定任务上设计的专有架构和性能优势。DeepSeek-V3 Technical ReportDeepSeek-AI et al., 2024该技术报告详细介绍了DeepSeek-V3大型语言模型的架构与能力。本研究采用DeepSeek-V3作为DeepRare系统默认的中央宿主Central Host模型其强大的推理和指令遵循能力是支撑整个智能体系统高效运行的基础。Model Context Protocol (MCP)Anthropic, 2025该协议提出了一种用于构建LLM智能体系统的模块化架构标准。DeepRare的三层系统架构设计灵感来源于MCP其“中央宿主-智能体服务器-外部数据源”的分层模式确保了系统的模块化、可扩展性和工具集成的灵活性。