agent各指标定义

📅 2026/8/2 7:41:03
agent各指标定义
先更新一下今天的记录先明确一点定稿版项目介绍里出现的 XX% 一共 4 处对应 4 个指标。逐个拆解指标总览介绍原文位置指标名称本质评估方“问答相关性与处置方案可执行性达到 XX%”① 答案相关性 ② 方案可执行性RAG 问答质量LLM 打分 人工抽检“高危病害识别准确率 XX%”③ 高危病害识别准确率风险分级能力人工复核工务专家为基准“问答准确率环比提升 XX%”④ 问答准确率环比知识回流优化效果固定评测集回归功能表里“病害检出率”⑤ 病害检出率检测模型能力标注测试集指标 ① 答案相关性Answer Relevance含义Agent 的回复是否答在了点子上有没有答非所问。定义答案相关性 判定为相关的问答对数 / 抽检问答对总数测算方法从线上日志随机抽样问答对如每周抽 100 条真实对话用强模型如 GPT-4做 Judge按 0-5 分打分≥4 分算相关关键点抽取 20% 样本由人工复核校准——防止 LLM 自评偏置它可能自己答的题自己给高分面试话术“相关性指标我采用 LLM-as-judge 人工抽检校准线上抽样 100 条GPT-4 按 0-5 打分阈值 4 分以上算相关再抽 20% 人工复核防止自评偏置。”指标 ② 方案可执行性Plan Executability含义生成的处置方案是不是真能落地——处置等级是否符合规范、是否匹配对应检修工艺、有没有幻觉性建议比如编造一个不存在的操作规程。定义三档人工评级可执行性 评完全可执行的方案数 / 抽检方案总数测算方法抽检生成的处置方案如 50 条由工务工程师人工评估这是专业判断LLM 不能当裁判三档完全可执行 / 部分可执行缺工艺细节/ 不可执行违反规范或幻觉重点记录不可执行的原因用于定位问题检索没召回规范还是模型编造面试话术“方案可执行性必须人工评估——LLM 无法判断’这工艺对不对’。我按三档人工评级同时记录不可执行原因反推是检索缺失还是模型幻觉。”指标 ③ 高危病害识别准确率含义风险研判 Agent 把真正需要立即处理的高危病害正确标出来的能力。注意坑项目介绍里写识别准确率是笼统说法面试时建议主动拆成精确率Precision和召回率Recall——尤其在这个场景召回率比精确率重要漏报高危 安全事故宁可多报转人工。定义精确率 Precision 正确标记的高危数 / 标记为高危的总数 报得准不准 召回率 Recall 正确标记的高危数 / 实际高危总数 漏没漏 F1 2×P×R / (PR)测算方法以人工复核结果为 ground truth专家确认这处病害是否高危统计混淆矩阵TP / FP / FN / TN用一段历史巡检数据跑全量回放面试话术“高危识别我重点看召回率——漏报会出安全事故宁可误报转人工。具体用人工复核做基准算 Precision/Recall/F1上线时把召回率阈值定在 95% 以上。”指标 ④ 问答准确率环比提升知识回流的效果含义专家复核意见回流成知识后问答质量比上一周期好了多少。定义环比提升 (本期准确率 − 上期准确率) / 上期准确率测算方法建一个固定评测集golden set100 条标准问答对 参考答案不随版本变每次知识库更新后用同一套题跑一遍得到准确率对比两个版本周期的准确率为什么必须固定评测集只有同一套题对比才有意义否则每次抽的题不一样数字波动没法说明是优化带来的。面试话术“回流效果我用固定 golden set 做回归——100 条标准题每次知识更新后全量重跑环比差值就是回流收益避免抽样波动干扰判断。”指标 ⑤ 病害检出率检测模型侧含义YOLOv11 有没有把真实病害找出来漏检率反着看。定义检出率Recall TP / (TP FN) # 找出来的真实病害 / 全部真实病害 误报率 FP / (FP TN) # 报错的 / 全部负样本测算方法标注测试集工务人员标注图里哪里有病害、是什么病害模型跑一遍与标注对比算 TP/FP/FN和你原有项目的漏检与误报反馈模块直接衔接——人工确认结果回流为标注数据面试话术“检出率就是检测模型的召回我用标注测试集算 TP/FN人工复核的漏检反馈会回流成新标注持续迭代 YOLOv11。”共同底座评测基础设施必须主动讲这是加分项所有 RAG 指标都依赖同一套评测设施面试时主动说出这三件套直接拉开和只会背概念的人的差距组件作用Golden Set固定评测集标准题 参考答案不随版本变保证可复现对比LLM-as-Judge强模型自动打分覆盖大样本量几百上千条人工抽检校准20% 样本人工复核防 LLM 自评偏置、补专业判断一句话总结“大样本走 LLM 打分专业判断和结果校准走人工所有版本对比用固定评测集。”