ICLR 2026 | MMedAgent-RL:面向多模态医学推理的多智能体协作优化

📅 2026/7/27 22:29:24
ICLR 2026 | MMedAgent-RL:面向多模态医学推理的多智能体协作优化
一句话总结这篇论文真正有价值的地方是把多智能体协作训练成一种“按可靠性利用外部意见”的策略并在专家一致答错时展示了有限但明确的纠错能力标题中的“动态协作”不应被理解为自由演化的智能体网络因为运行拓扑仍固定最佳系统也高度依赖三个闭源o3专家。创新点把“多智能体协作”从提示词流程变成可训练对象。既有医学多智能体系统多半固定“全科医生→专科医生→全科医生”的交互方式本文分别优化前端分诊和后端聚合使系统能从数据中更新而不是只依赖角色设定。用专家可靠性定义课程难度。作者不按题目表面难度分层而是依据三位专家答案与真值的一致性将样本分为Easy、Medium、Hard。这直接把“何时相信专家、何时反驳专家”转成训练日程。把探索强度与专家可靠性绑定。主诊智能体在可靠专家样本上使用很小的熵奖励在冲突和错误共识样本上逐步增大熵奖励以避免机械复制专家答案。专门构造“全体专家均错”的纠错评估。该子集排除了“只要路由到某个正确专家即可得分”的解释更直接地测试聚合器是否能超越专家的最终选项。原文摘要翻译医学大视觉语言模型在多模态诊断任务中展现出很强的潜力。然而现有单智能体模型难以跨越不同医学专科进行泛化因而性能受到限制。近期研究引入了受临床工作流启发的多智能体协作框架由全科医生与专科医生按照固定顺序交互。尽管这些方法有所改进静态流水线仍缺乏推理上的灵活性和适应性。为解决这一问题作者提出 MMedAgent-RL一个基于强化学习的多智能体框架使医学智能体之间能够形成动态且经过优化的协作。具体而言作者基于 Qwen2.5-VL通过强化学习训练两个全科医生智能体分诊医生学习将患者分配到合适的专科主诊医生则综合多位专科医生的判断与自身知识做出最终决策。针对专科医生输出不一致的问题作者提出由课程学习引导、带动态熵调节的强化学习策略逐步教会主诊医生在模仿专科意见和纠正其错误之间取得平衡。五个医学视觉问答基准上的实验表明MMedAgent-RL 优于开源和闭源医学大视觉语言模型论文报告其相对强基线的平均性能增益达到 23.6%。研究问题技术痛点单一医学视觉语言模型很难同时覆盖放射、病理、眼科、皮肤科等专科知识。静态多智能体方法虽然能调用多个专家却通常有两个缺陷其一路由和聚合规则不能通过下游结果更新其二系统没有学习“专家何时可信”因此多数票可能压制唯一正确的少数意见错误共识还会把聚合器带偏。本文重构的不是“是否使用多个智能体”而是如何训练协作策略前端学习选择专科后端学习在专家一致、冲突或一致错误时采取不同的信息利用方式。与已有路线的差异• 相比MedAgents、MDAgents和AFlowMMedAgent-RL 的关键差异是两个全科医生角色可被训练尤其是主诊智能体会根据专家可靠性学习聚合。• 相比监督微调结果奖励不要求为每个样本准备高质量完整推理轨迹更适合推理标注稀缺的医学场景。• 相比多数投票或自洽采样系统把外部专科模型的理由也交给主诊智能体代价是推理调用次数、闭源模型能力和成本都不再与单模型基线等价。数据与任务定义数据来源与划分训练只使用三个分布内数据集另外两个数据集只用于分布外测试。论文把所有评测问题统一为多项选择题并以准确率作为唯一指标。数据集角色论文使用规模主要内容VQA-RAD分布内训练与测试训练940测试251放射影像问答SLAKE分布内训练与测试训练1,681测试416双语放射影像与知识增强问答PathVQA分布内训练与测试训练9,555测试3,362病理图像问答OmniMedVQA分布外测试测试11,124多模态、多解剖区域医学问答MMMU Health Medicine分布外测试测试150医学知识与多模态推理训练集共12,176条其中Easy、Medium、Hard分别为8,321、1,409、2,626。需要注意原文表 3 把测试总数写为15,153但五个分项相加得到15,303这是一处应在复现前向作者确认的统计不一致。论文原图编号Table 3。训练、课程分层与测试样本量总测试数与分项求和存在150条差异。三个相互关联的任务分诊任务输入医学图像、问题与七个候选科室输出一个科室。监督标签主要由数据集或图像模态映射得到例如病理切片对应病理科。专科意见生成被调用的三位专科模型独立读取图像和问题生成理由与最终选项专家之间不进行辩论。主诊决策输入原始图像、问题、选项和三份专家意见输出think中的理由及answer中的最终选项。训练阶段再依据三位专家最终答案的正确性构造课程标签全对为Easy部分正确为Medium全错为Hard。这些标签依赖真值只用于离线训练推理时模型看不到难度标签或真值。任务没有测量什么该协议测量的是医学多模态选择题的最终选项准确率不是开放式诊断、治疗建议、风险分层或真实患者分诊。论文也没有评估概率校准、拒答、安全性、群体偏差、理由忠实性和临床医生认可度。方法主线机制流程输入与分诊输入图像 、问题及选项 。分诊智能体用GRPO在七个科室中选择 结果送往专家调用阶段。离线生成专家知识按科室调用三位外部视觉语言模型分别生成理由和最终选项 。训练数据中的专家轨迹被预先缓存随后交给主诊训练。课程式主诊训练按专家正确率把样本排成Easy→Medium→Hard主诊智能体为每题采样八个回答用格式奖励、答案准确率奖励和分层熵奖励更新策略。推理与输出推理时仍执行“分诊→三位专家→主诊”的固定链路。主诊看不到难度标签只根据图像、问题和专家文本生成最终选项可选的测试时扩展再采样三次并多数投票。论文原图编号Figure 2。完整执行链包括强化学习分诊、独立专家咨询以及带课程和熵调节的主诊决策。分诊智能体分诊策略可写为训练时格式正确可得0.5分否则为0科室选择正确可得1分否则为0两项直接相加。工程上这一阶段更接近“基于图像模态和数据集特征的七分类”而不是开放世界临床分诊附录也承认原模型已经达到80%以上微调后接近99%。主诊训练目标对同一输入采样 个回答后GRPO用组内标准化奖励构造优势本文在标准目标上加入按难度变化的逐词熵奖励实现含义很直接专家全对时令 鼓励模型稳定利用意见专家冲突时令 专家全错时令 让策略保留更多候选推理路径。这里没有单独的“专家可信度预测器”可靠性只通过离线课程顺序和熵系数进入训练。Algorithm 1 — C-MARL 训练伪代码建议位置方法主线 / 主诊训练目标放置原因原始伪代码串联了难度分层、组采样、优势计算、熵计算和策略更新。当前状态自动视觉质量门槛拒绝了独立裁图未插入真实图片正文已依据第 5 页完整重建算法顺序。关键实现细节• 底座为Qwen2.5-VL-7B专家数为3最佳实验使用三个OpenAI o3。• 采样批量和训练批量均为128每个样本生成8个回答温度为1.0学习率为1×10^{-6}。• 三阶段 KL 系数写为1×10^{-3}、4×10^{-3}、1×10^{-2}。• 训练基于OpenRLHF推理基于vLLM硬件为8×NVIDIA A100 80GB。• 两个全科医生默认独立更新先训练分诊再离线调用专家生成轨迹最后训练主诊。这样能避开外部接口延迟和失败并使专家轨迹可缓存。推理成本与可扩展性每个样本至少需要一次分诊、三次专家调用和一次主诊生成若使用多数投票主诊还要额外采样。文中缺少令牌数、延迟、接口费用和同预算比较因此“优于单模型”不宜直接解释为更高的计算效率。关键结果主结果与强基线系统分布内平均准确率分布外平均准确率解释Qwen2.5-VL-7B62.358.7同底座单智能体GPT-4o68.669.1最强单智能体之一AFlow67.556.6静态多智能体强基线SFT 聚合器带推理轨迹67.060.7监督微调路线MMedAgent-RL73.372.6三位专家与课程强化学习MMedAgent-RL加多数投票76.176.6额外测试时采样相对同底座完整方法在分布内和分布外分别提高11.0与13.9个百分点相对GPT-4o则提高4.7与3.5个百分点。论文反复引用的23.6%没有始终明确是相对增幅还是百分点差也没有在各处绑定同一个 SFT 基线因此长期引用时应优先使用表格中的绝对数值。Table 1 — 医学 VQA 主结果建议位置关键结果 / 主结果与强基线放置原因该表是论文最核心的分布内与分布外比较。当前状态人工视觉复核发现候选裁图在多智能体行之前截断缺少 MMedAgent-RL 主结果故保留占位并在上方重排关键数值。论文原图编号Table 8。多数投票和自洽采样能够改善单模型但完整多智能体框架仍有更高准确率。消融到底说明了什么设置VQA-RADSLAKEOmniMedVQAMMMU完整模型71.576.273.371.9去掉专门分诊66.369.966.259.3去掉专家65.867.864.454.2去掉 C-MARL63.565.557.950.2只训练Easy64.769.368.258.0再加入Medium69.476.970.868.8再加入Hard71.576.273.371.9最强的证据不是“每个组件都有用”而是完整课程相对去掉 C-MARL 的差距最大且加入Hard阶段主要改善分布外数据。不过SLAKE在加入Medium时达到76.9高于最终的76.2说明更难阶段并非对每个数据集单调有益。Table 2 — 分布内与分布外消融建议位置关键结果 / 消融到底说明了什么放置原因该表直接区分分诊、专家和课程强化学习的贡献。当前状态自动裁图未通过视觉质量门槛表体无法作为干净独立图片插入关键行已在上方重排。论文原图编号Figure 6。三个课程阶段对 KL 系数的响应方向不同Hard 曲线随系数增大而上升。原文图 6 与正文解释并不完全一致图中Hard阶段随KL系数增大而改善但文字又强调过大的KL约束会阻碍探索。由于标准GRPO中更大的KL惩罚通常意味着更强的参考策略约束复现时必须确认目标函数符号、图中横轴含义和最终系数选择。全体专家均错时能否纠错作者从PathVQA和OmniMedVQA各筛出200个“三位专家最终答案全错”的样本。此时单纯路由或多数票理论上为零MMedAgent-RL 仍达到26.5%和23.0%明显高于 SFT 的10.0%和7.5%。论文原图编号Table 9。全体专家均错的定向子集是支持“主诊能纠错而非只路由”的最直接证据。这个结果证明聚合器可以超越专家的最终选项但论文把收益归因于“专家理由中仍含局部真信息”只是合理推断。没有理由遮蔽、理由打乱或只保留最终选项的因果消融因此尚不能确定模型究竟利用了哪些专家信息。路由、训练策略与迁移论文原图编号Table 10。微调分诊优于随机路由、零样本路由和无路由多数投票。分诊确实提高了下游准确率但它主要根据数据集模态映射七个科室三个分布内数据集上的分诊准确率接近99%更像一个容易利用数据集线索的分类任务。这个结果不能直接支持真实临床场景中的开放科室分诊。论文原图编号Table 14。独立更新与同时更新的总体表现几乎相同支持用离线专家轨迹降低训练耦合。更换为InternVL2.5-8B后完整框架仍在五个数据集上提高准确率其中PathVQA从42.3升至68.4说明方法并非只对Qwen2.5-VL有效。不过只测试一个额外底座仍不足以证明完全“模型无关”。细粒度分布外结果论文原图编号Table 18。MMMU 医学轨道的五个子领域结果完整方法在基础医学、临床医学、检验诊断、药学和公共卫生上都领先所列基线。该表说明提升不只来自某一个医学子域但MMMU医学测试集仅有150题细分到五类后的样本更少文中缺少置信区间和显著性检验子领域差异不宜过度解释。定性案例答案对不等于理由对论文原图编号Figure 5。正文选择的两个案例展示主诊如何引用医学线索并反驳专家意见。正文案例看起来支持“主诊会审查专家”的叙述但附录暴露了明显反例原文图 8 的超声题最终选择胰腺理由却把图像描述成足底筋膜病变原文图 9 的组织学题也混入足底筋膜表述。也就是说选项可以碰巧正确而解释与图像并不一致。论文只按最终答案给奖励也没有理由正确性指标因此“类似人类医生的高质量推理”是证据最薄弱的主张之一。深度分析真正贡献是什么论文的核心贡献不是新的角色拓扑而是一种可靠性条件化的聚合器训练协议。它把多智能体系统中最棘手的外部知识问题——“意见有用但不总正确”——改写成一个课程强化学习问题先学会利用可靠意见再逐步暴露冲突和错误共识同时提高探索强度。这个抽象不局限于医疗也可迁移到检索增强生成、工具调用或模型集成。为什么结果可能成立课程提供了更平滑的优化路径。先在专家全对样本上学会解析格式和利用理由再进入冲突与全错样本可能比从一开始混合所有噪声更稳定。高熵奖励抑制机械模仿。在错误共识样本上提高熵能保留与专家结论不同的候选选项使基于结果奖励的采样更可能发现可学习的正确轨迹。专家理由比最终选项信息更丰富。即使最终选项错理由中仍可能包含正确的局部观察原文表 9 与这一解释相容但还没有因果验证。分诊减少无关专家噪声。在预设七科室和数据集模态清晰的条件下路由可以让外部建议更集中从而降低后端聚合难度。“动态协作”容易被误读推理拓扑始终是固定的“分诊→三个独立专家→主诊”专家之间没有讨论两个全科医生也默认分阶段独立训练。所谓动态主要是学到的科室选择与意见聚合策略而不是智能体数量、通信图或工具链在运行时自由重构。与能动态生成工作流的AFlow相比这是一种更窄但更容易训练和复现的动态性。强专家与额外算力是重要混杂专家配置从一个Qwen2.5-VL-7B换成三个o3后总体平均准确率从60.7提高到73.04。这说明框架确实能利用更强专家也说明最终成绩高度依赖闭源模型。论文与单模型的比较同时改变了专家质量、调用次数、推理令牌和训练方式因而不能把全部差距解释成 C-MARL 的算法收益。一个更严格的比较应固定总令牌或总费用至少加入“同一强模型的更多采样”“三个通用强模型加普通聚合器”“三个开源专科模型加 C-MARL”等等算力对照。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】