医疗AI智能体真比裸大模型更会看病吗?协和肿瘤医院×德累斯顿工大npj基准评测OpenManus/Manus:准确率仅提升0.5%~8.9%且多数不显著,token却多烧10~100倍

📅 2026/8/18 1:42:39
医疗AI智能体真比裸大模型更会看病吗?协和肿瘤医院×德累斯顿工大npj基准评测OpenManus/Manus:准确率仅提升0.5%~8.9%且多数不显著,token却多烧10~100倍
一、研究背景“智能体Agent“是当下医疗 AI 最热的关键词之一。它的卖点很诱人大模型不再只是一问一答”而是能自己拆解任务、调用工具联网检索、跑代码、读文件、分步规划、验证再迭代像一位会主动干活的小团队。厂商的宣传里这几乎成了AI 真正能进临床的入场券。但一个更基本的问题很少有人系统回答加上工具和规划临床决策能力到底提升了多少软件工程里编码智能体能跑测试、读报错、改代码确实比一次性生成强。可医学不同——临床任务在决策过程中往往缺少测试通过/不通过那样干净的验证信号。2026 年 2 月中国医学科学院/北京协和医学院肿瘤医院联合德国德累斯顿工业大学 Else Kroener Fresenius 数字健康中心、海德堡大学医院国家肿瘤疾病中心等团队在npj Digital Medicine发表了这篇题为《Benchmarking large language model-based agent systems for clinical decision tasks》的基准评测 DOI: 10.1038/s41746-026-02443-6。它用一套严格、可复现的评估把智能体到底值不值这个问题摆上了台面。二、研究创新点这篇工作的价值不在提出新模型而在于第一次系统、公开地把智能体 vs 裸大模型的性价比做成可量化的对照实验。它有三个鲜明的设计1. 同时覆盖开源与闭源两条技术路线。既测了开源的 OpenManus基于 Meta Llama-4MIT 许可并做了三档医学定制加医师助手提示词、鼓励工具调用、配备医学视觉工具也测了闭源商用智能体 Manus 的多步 planner-executor-verifier 架构避免了只测自家系统的偏颇。2. 用三大基准覆盖不同临床认知层次。从逐步对话式诊断模拟AgentClinic、知识密集型医学问答MedAgentsBench到最难的通用能力考试Humanity’s Last Exam既有文本也有多模态梯度分明。3. 把性能与成本同时纳入账本。不只报准确率还统计了 token 消耗、响应延迟、幻觉拦截率与工作流复杂度回答了临床落地最关心的效率问题。三、技术原理评测的两类系统代表了当前医疗智能体的主流构造思路OpenManus 系列开源Llama-4 为骨干。研究者在其上叠加了逐步强化的定制OpenManus_MedAssist注入医师助手提示词与 few-shot 示例以抑制幻觉OpenManus_MedAssist_Tool进一步鼓励工具调用vOpenManus再配备医学视觉工具用于多模态任务。这一设计恰好能回答提示工程和工具到底能救多少”。Manus闭源商用。采用多步 planner-executor-verifier 架构——先规划、再执行、后验证是当下多智能体协作思路的代表实现。评估基准则分三档AgentClinic 模拟真实问诊对话MedQA 214 例、MIMIC-IV 200 例、NEJM 120 例多模态MedAgentsBench 的 HARD 子集 862 道知识密集选择题以及 Humanity’s Last Exam 的 222 道文本题与 58 道多模态题。智能体被允许使用联网浏览、代码编写与执行、文本文件编辑等高级工具。四、实验结果结果相当克制甚至有些泼冷水在诊断模拟上智能体在 AgentClinic MedQA 最高达 60.3%、MIMIC-IV 最高 28.0%知识问答MedAgentsBench 最高 30.3%对比 GPT-4.1 的 28.8%最难的 HLE文本题仅 8.6%、多模态 15.5%AgentClinic NEJM 多模态 29.2%。多模态任务上智能体并未一致优于基线原因是医学图像分析工具尚不成熟、且存在工具间竞争。把这些数字放进对照里结论更清晰相比最佳基线 LLM智能体的准确率优势只有 0.5%–8.9%且大部分提升未达到统计学显著。诊断对话场景里绝对提升约 7.0%–8.9%已是最亮眼的一档。而代价是扎眼的token 消耗是骨干模型的10 倍以上在 MedAgentsBench 上甚至接近 100 倍响应延迟至少翻倍常见 2–3 倍。幻觉方面内置安全机制拦截了 89.9%但仍有约30% 的临床场景受幻觉影响——不过研究也发现有无幻觉影响的场景之间诊断准确率并无显著差异。一个值得注意的细节GPT-4.1 在 AgentClinic 任务上表现极差准确率仅 1.4%–3.3%空答案率超 93%主因是内部安全限制。五、应用前景对医疗 AI 从业者这篇论文的启示不是智能体没用而是不能只看能力、不看账本。它至少划出了三条清晰的工程边界其一先量化再上马——在把智能体写进产品路线图之前应像本文一样跑一套标准基准量出真实增量而不是凭加工具总比不加强的直觉其二任务定制能降复杂度——MedAssist 系列提示工程确实降低了内部工作流的图复杂度节点度、圈复杂度显著下降并提升了工具使用一致性说明精调提示比堆工具更划算其三多模态是当前的软肋——影像工具不成熟、工具间互相干扰是智能体最需要补齐的短板。研究也坦诚了局限基准与现实临床仍有距离缺少更大规模真实世界数据验证闭源 Manus 的内部细节不透明结论的外推需谨慎。但恰恰因为它是诚实阴性结果在满屏智能体即将取代医生的叙事里显得尤为珍贵。六、结论当医疗 AI 的聚光灯都打在自主智能体上时这项基准评测提醒我们当前智能体架构在临床决策上的性能收益温和且多数不显著却要付出 10–100 倍 token 与 2 倍以上延迟的代价幻觉也远未根除 DOI: 10.1038/s41746-026-02443-6。它的结论不是否定而是校准在准确性、效率、幻觉控制与医学知识基础取得实质性突破之前医疗智能体还不适合在常规临床场景可靠部署。对团队而言把值不值算清楚可能比再刷一个 SOTA 更重要。本文基于 2026 年最新论文/开源项目的独立解读立场与原作者无关仅作技术交流。论文原文信息链接医疗AI智能体真比裸大模型更会看病吗OpenManus 与 Manus 临床决策基准评测的审慎结论参考文献Liu Y, Carrero ZI, Jiang X, et al. Benchmarking large language model-based agent systems for clinical decision tasks.npj Digital Medicine, 2026, 9(1). DOI: 10.1038/s41746-026-02443-6