A Specialized Large Language Model for Clinical Reasoning and Diagnosis in Rare Diseases

📅 2026/8/7 12:34:52
A Specialized Large Language Model for Clinical Reasoning and Diagnosis in Rare Diseases
文章主要内容总结该研究针对罕见病诊断周期长(平均4-8年)、现有方法存在证据提取与诊断推理脱节、大语言模型(LLM)面临数据稀缺、知识陈旧和幻觉等问题,开发了一款专注于罕见病临床推理与诊断的领域专用大语言模型RareSeek-R1。核心数据资源构建:构建了三大罕见病专用资源:包含约5亿tokens的大规模临床语料库(RareMed-Corpus,涵盖去标识化电子健康记录、医学文献、病例报告和合成病例)、临床医生验证的推理数据集(RareMed-CoT,含17,477条高质量推理链)、图基检索资源(RareMed-RAG,整合ClinVar、HPO等权威数据库的变异-基因-表型-疾病关联)。搭建了五大评估基准(含内部/外部EHR、RareBench、基因组数据关联病例等),覆盖11,429个罕见病病例,为模型评估提供全面支撑。模型训练框架:采用渐进式参数高效迁移学习三阶段策略:阶段1:基于RareMed-Corpus的领域专用指令微调,注入罕见病知识并保留通用语言能力;阶段2:基于RareMed-CoT的思维链(CoT)微调,强化多步骤临床推理与异质证据整合;阶段3:图基检索增强生成(GraphRAG),结合罕见病知识图谱减少幻觉,对齐最新生物医学知识。