向量检索 Benchmark:先固定标注,再调召回和延迟

📅 2026/8/12 19:01:36
向量检索 Benchmark:先固定标注,再调召回和延迟
向量检索 Benchmark先固定标注再调召回和延迟只展示 Top-K 命中率或一组延迟数字无法说明检索质量。Benchmark 要先固定数据集、标注、过滤条件和索引版本再分别看召回、尾延迟与失败样本。先界定问题先定义什么算相关、一个查询可能有多少正确文档以及元数据过滤是否属于检索条件。标注口径没固定时调top_k或索引参数得出的提升没有可比性。处理与验证用可复现的样本判断效果。固定数据集版本、标注规则和检索参数再分别记录召回、延迟、失败样本和资源使用情况。查询集要包含有明确相关文档的请求、没有相关结果的请求以及会触发元数据过滤的请求。标注、语料、向量模型、索引和参数分别版本化调参时只改一项失败查询保留原始排名便于判断问题来自标注、过滤还是索引。发布召回或延迟结论时附查询集与标注版本、索引构建参数、过滤条件、并发方式和预热规则。延迟统计把超时与失败请求算进去换了语料或向量模型就重新建立基线不把两组不同条件的数据直接比较。