AI安全评估新范式:uncertain_ground_truth如何应对医疗AI中的标注分歧

📅 2026/8/7 22:01:21
AI安全评估新范式:uncertain_ground_truth如何应对医疗AI中的标注分歧
AI安全评估新范式uncertain_ground_truth如何应对医疗AI中的标注分歧【免费下载链接】uncertain_ground_truthDermatology ddx dataset, Jax implementations of Monte Carlo conformal prediction, plausibility regions and statistical annotation aggregation from our recent work on uncertain ground truth (TMLR23 and ArXiv pre-print).项目地址: https://gitcode.com/gh_mirrors/un/uncertain_ground_truth在医疗AI领域准确的诊断依赖于可靠的标注数据但专家之间的意见分歧常常导致标注不确定性这成为AI系统安全评估的重大挑战。uncertain_ground_truth项目通过创新的统计聚合模型和蒙特卡洛 conformal prediction 方法为解决医疗AI中的标注分歧提供了完整解决方案确保AI系统在模糊标注环境下仍能保持可靠的性能和校准效果。医疗AI的隐藏风险当专家标注不再一致传统AI评估假设标注数据是确定的黄金标准但在皮肤病诊断等复杂领域多位专家对同一病例的判断可能存在显著差异。这种标注分歧会导致模型评估失真——使用简单多数投票的标注结果可能掩盖关键不确定性使AI系统看似性能优异实则在真实临床环境中面临高风险。图uncertain_ground_truth项目的皮肤病鉴别诊断数据集dermatology ddx dataset展示了专家标注的复杂结构包含1947个病例的部分排序标注核心创新从确定性标注到概率化评估统计聚合模型捕捉标注者不确定性项目提出的Plackett-Luce Gibbs采样器pl_samplers.py和概率化逆秩归一化IRNirn.py解决了传统方法的局限性将专家标注视为部分排序而非确定标签通过贝叶斯推理生成类别 plausibility分布自动学习标注者可靠性超参数这种统计聚合方法将原始标注转化为概率化的似然分数既保留了专家意见的多样性又为AI评估提供了量化的不确定性基础。蒙特卡洛Conformal Prediction实现鲁棒校准面对不确定标注传统Conformal PredictionCP方法会失效。项目创新的蒙特卡洛CPmonte_carlo.py通过以下步骤实现可靠校准从plausibility分布中采样多个伪标签在校准集上构建覆盖保证生成包含真实标签概率的预测集合实验表明与基于多数投票标签的标准CP相比蒙特卡洛CP在皮肤病数据集上的覆盖率提升了23%同时保持了相似的预测集大小。实战应用三步上手医疗AI不确定性评估1. 准备专业数据集项目开源的dermatology ddx dataset包含完整的专家标注和模型预测data/dermatology_selectors.json专家部分排序标注data/dermatology_conditions.txt419种皮肤病名称映射data/dermatology_predictions0.txt预训练模型输出2. 快速安装环境git clone https://gitcode.com/gh_mirrors/un/uncertain_ground_truth cd uncertain_ground_truth conda env create -f environment.yml conda activate uncertain_ground_truth3. 运行关键实验标注聚合使用colab_pl_sampler.ipynb生成plausibility分布模型校准通过colab_mccp.ipynb对比传统CP与蒙特卡洛CP性能评估运行colab_ua_accuracy.ipynb获取不确定性调整后的准确率图蒙特卡洛CP右相比传统CP左在不确定标注下提供更可靠的覆盖保证为什么选择uncertain_ground_truth✅医疗级可靠性在1947例真实皮肤病病例上验证覆盖419种临床情况✅即插即用工具提供conformal_prediction.py、p_value_combination.py等模块化实现✅完整评估框架包含classification_metrics.py和ranking_metrics.py等不确定性调整指标未来展望让AI在模糊世界中更安全随着医疗AI向临床部署加速标注不确定性将成为不可回避的关键问题。uncertain_ground_truth项目不仅提供了当前最先进的解决方案更为行业树立了新的评估标准——在追求高性能的同时必须优先考虑AI系统在真实世界模糊性面前的可靠性与安全性。通过将统计聚合与蒙特卡洛方法相结合我们正逐步实现医疗AI的安全范式转移从依赖确定性标注的脆弱评估走向拥抱不确定性的鲁棒校准。这一转变或许正是AI真正值得临床信任的开始。【免费下载链接】uncertain_ground_truthDermatology ddx dataset, Jax implementations of Monte Carlo conformal prediction, plausibility regions and statistical annotation aggregation from our recent work on uncertain ground truth (TMLR23 and ArXiv pre-print).项目地址: https://gitcode.com/gh_mirrors/un/uncertain_ground_truth创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考