XRAG: eXamining the Core - Benchmarking Foundational Components in Advanced Retrieval-Augmented Gene

📅 2026/8/14 14:17:26
XRAG: eXamining the Core - Benchmarking Foundational Components in Advanced Retrieval-Augmented Gene
一、研究背景与问题RAG技术通过结合外部知识检索与LLM生成能力提升问答等任务的准确性和时效性。现有工具与局限LangChain、LlamaIndex等框架灵活但复杂难以适配新数据FastRAG、AutoRAG等虽支持模块化但组件选择有限复现和创新困难FlashRAG、RAGLAB等评估框架缺乏统一的实验设置如随机种子、检索器、指令等导致结果难以比较核心缺失缺乏对RAG各核心模块预检索、检索、后检索、生成在统一条件下的系统性评估和对比分析。二、XRAG框架的提出XRAG是一个开源、模块化的代码库旨在全面评估高级RAG系统中基础组件的性能。其主要贡献包括四方面1. 模块化RAG架构与细粒度评估覆盖RAG四个核心阶段预检索、检索、后检索、生成组件多样化3种查询重写策略、6种检索单元、3种后处理技术、多种LLM生成器OpenAI、Meta、DeepSeek等对每个组件的独立和组合性能进行系统实验。2. 代理式RAG流程与多编排器设计支持五种编排器顺序、条件、迭代、并行、混合可灵活组合组件适应不同复杂度和数据类型的应用场景实验比较了不同编排器在多跳HotpotQA和单跳NaturalQA任务上的效果和效率。3. 统一基准数据集与双重评估将四个常用数据集HotpotQA、DropQA、NaturalQA、FinanceBench预处理为统一格式同时支持检索和生成的标准化评估便于跨模块、跨编排器的公平比较。4. 多维评估体系常规检索评估ConRF1、MRR、Hit1/10、NDCG等常规生成评估ConGChrF、METEOR、ROUGE、WER/CER等认知LLM评估CogL基于语义理解的指标如事实准确性、忠实度、幻觉检测等弥补了传统规则指标的局限。三、主要实验发现检索性能DQA需数值推理和FQA金融文档难度最大重排序reranking等后检索模块能显著提升检索效果Hit1更适用于单目标任务而多目标场景如HotpotQA需结合NDCG等综合判断。生成性能直接提供“黄金上下文”并不总是最优检索到的补充上下文有时更有助于推理模型选择比单纯增加参数更重要GPT-4o-mini、Llama-3.1-70B在维基百科类数据上表现好但在数值/逻辑任务上优势更明显DeepSeek-R1系列在RAG场景中幻觉率偏高。编排器效果迭代编排如SIM-RAG在多跳问题上效果最好但耗时最长顺序编排在简单任务上效率最高条件/混合编排如Self-RAG、Adapt-RAG引入额外分类器或反思机制开销较大但对动态任务有一定优势。影响因素分析更长的查询有利于提升检索和生成效果增加检索数量对性能提升有限关键在检索精度问题难度越大检索和生成的难度同步上升且严格的指标如Hit1、ChrF对难度更敏感好的检索≠好的生成即使检索命中仍可能出现低质量答案迭代次数在达到上限前能有效提升多跳任务的答案质量但超限后可能引入噪声。四、研究意义与未来方向贡献提供首个面向高级RAG组件的系统性基准平台通过统一数据、模块和评估体系使不同RAG方案的可比性大幅提升为实际应用选择检索、生成和编排策略提供数据支持。未来计划支持RAG组件训练能力扩充更多基准数据集如OpenQA、长文本QA、多选QA增加对噪声、格式异常查询的鲁棒性评估鼓励开源社区协作完善框架功能。XRAG是一个系统性、模块化、多维度的RAG组件评估平台通过统一的数据、流程和指标体系揭示了不同检索、生成和编排策略对RAG效果的影响规律为构建更高效、更适配场景的RAG系统提供了实证基础与工具支持。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要——检索增强生成RAG将相关数据库的检索与大型语言模型LLM的生成能力相结合确保生成的输出不仅与上下文相关而且准确且具有时效性。我们介绍了XRAG一个开源、模块化的代码库旨在对高级RAG模块的基础组件的性能进行详尽评估。这些组件被分为四个核心阶段预检索、检索、后检索和生成。我们在重新配置的数据集上对它们进行了系统分析为其有效性提供了全面的基准测试。这些组件可以通过编排器以不同方式组合编排器共有五种类型顺序型、条件型、迭代型、并行型和混合型。我们的工作全面评估了RAG系统中高级核心组件的性能为在数据集驱动的AI应用中优化RAG架构提供了可行的见解。索引词——数据库、检索增强生成、评估、基准测试、数据管理I. 引言检索增强生成RAG[1]–[8]代表了问答QA任务中的一种关键策略与仅依赖大型语言模型LLM相比它通过提供更具信息量和更准确的答案展现出增强的性能。基础RAG系统[9] [10]的有效性取决于四个核心组件的无缝协作预检索、检索、后检索和生成。预检索阶段对语料库进行索引并重构查询以实现高效检索。检索阶段专注于识别和提取与给定查询相关的文档。后检索阶段对信息进行精炼、总结或压缩以确保上下文清晰。最后生成阶段使用LLM生成响应。在基础RAG系统中这些阶段按顺序执行。然而在处理复杂的检索场景时基础RAG通常存在效率低下和检索不完整的问题。因此高级RAG系统优化了检索过程不再局限于顺序执行。RAG流程有如下五种顺序型、条件型、迭代型、并行型和混合型。这些阶段和流程对输出质量有着至关重要的影响突显了RAG框架的相互依赖性。在以复杂数据集结构为特征的现实世界应用中现有的RAG框架表现出明显的局限性。像LangChain [12]和LlamaIndex [13]这样的模块化RAG工具包通常很复杂使得适应新数据具有挑战性并且验证或优化创新方法不方便。像FastRAG [14]、RALLE [15]、AutoRAG [17]和LocalRQA [16]这样的高效RAG框架要求用户独立复现已发表的算法并且提供的组件选项有限尽管采用了模块化设计但限制了RAG系统的灵活性。在模块评估任务中FlashRAG [18]在基础评估组件如随机种子、生成器、检索器和指令方面缺乏统一性这阻碍了结果的可比性。RAGLAB [11]虽然提供了公平的实验设置但缺乏评估单个RAG组件的全面评估策略。尽管持续的努力通过模块化RAG流程例如检索引擎和生成代理来应对这些挑战但在整个RAG工作流程中对这些高级RAG模块的比较性能评估仍然存在一个隐含的空白。这些模块的全面评估明显缺失使得研究人员难以在一致的实验条件下评估他们的方法。为了解决上述问题我们专注于高级RAG模块的核心组件以及代理式RAG的编排器并进行了全面的实验。我们介绍了XRAG ¹一个开源、模块化的代码库旨在全面评估高级RAG模块的基础组件。XRAG提供四个主要能力模块化RAG架构细粒度比较分析。我们对预检索、检索、后检索和生成四个阶段的高级RAG模块进行了广泛的实验。核心组件涵盖了三种查询重写策略、六个检索单元、三种后处理技术以及来自不同供应商OpenAI、Meta和DeepSeek的LLM生成器。XRAG提供了对RAG组件能力的深入理解。代理式RAG流程多编排器集成与工作流设计。XRAG架构包含了五种编排器顺序型、条件型、迭代型、并行型和混合型。它提供了一个简化的框架可以灵活地编排代理式RAG流程并集成高级RAG模块。此外为了指导RAG系统在各种场景和数据类型下的开发XRAG对其编排器进行了性能评估。统一基准数据集检索与生成的双重评估。为了增强RAG研究中数据集的统一性XRAG编译并格式化了四个流行的基准数据集并将其预处理为统一格式。这种标准化使得能够同时评估检索和生成从而简化了跨RAG模块和编排器的比较评估。全面的测试方法论多维评估框架。为了克服RAG组件缺乏整体评估体系的问题XRAG引入了一个包含三个视角的评估基准用于对检索和生成进行全面评估。它包括用于检索单元匹配的常规检索评估、基于生成令牌匹配的常规生成评估以及基于语义理解的认知LLM评估。II. 相关工作A. 用于代理式数据管理的RAG在数据管理中基准测试通过提供超越端到端指标的、关于RAG系统中查询优化器和检索模型等组件的详细见解来确保公平的性能评估。虽然RAG系统通常被视为自然语言处理的范畴但其有效性从根本上取决于底层知识语料库的质量、组织和可访问性——这是一个经典的数据管理问题[19]。现有用于AI的数据库系统方法如SAGE [20]、ARAG [21]和scRAG [22]通常缺乏标准化的数据集和指标来专门诊断检索组件。我们的工作通过引入一个基准测试框架来弥补这一差距该框架将数据管理严格的评估原则应用于RAG流程从而能够系统评估数据整理、索引和检索策略最终如何影响生成答案的质量。在某些数据库系统中例如HTAP数据库[23] [24]和DB-GPT [25]XRAG可以处理非结构化数据并利用RAG技术进行检索和评估使这些数据库系统能够应用于生成和推理等场景。B. RAG系统或工具包检索增强生成[1]–[8]已被广泛采用作为一种有效的技术用于缓解大型语言模型在各种复杂生成和推理任务中的幻觉问题。这些任务通常需要从大规模数据库中检索关键信息以确保准确的结果和逻辑上合理的推理过程。像LangChain [12]和LlamaIndex [13]这样的工具包将RAG流程模块化增加了适应性并拓宽了其应用范围。FastRAG [14]和RALLE [15]允许用户使用核心组件组装RAG系统促进更灵活的实现。AutoRAG [17]通过帮助用户识别其自定义数据的最佳RAG流程进一步支持用户构建定制的RAG系统。LocalRQA [16]和RAGLAB [11]专注于RAG训练为各种组件的训练提供脚本。FlashRAG [18]和RAGLAB [11]通过将众多算法集成到统一框架中推动了RAG系统的算法可复现性支持高效复现现有方法并促进算法开发的创新。尽管存在可扩展性受限、评估协议不完善、缺乏代理式RAG分析以及指标非标准化等问题模块化RAG框架仍普遍存在于当前的工程实践中。与此同时研究人员正逐步将RAG工作流模块化以满足大型语言模型生成任务中的数据集检索需求。受这些模块化RAG框架的启发我们引入XRAG来全面评估高级RAG模块的基础组件。III. XRAG图1描绘了XRAG框架的集成模块和架构示意图。该框架分为数据集与语料库、高级组件、编排器和评估器通过XRAG的控制板和配置钩子²进行集成。整体结构从基础组件过渡到面向应用的组件。XRAG采用模块化架构设计使用户能够完成准备标准化的RAG数据集第III-C节、组装RAG组件第III-A节、编排RAG工作流第III-B节以及评估RAG系统的核心组件第III-D节。A. 基础与高级RAG组件预检索Pre-retrieval在检索之前预检索组件利用LLM来优化用户查询提高信息检索过程的质量和相关性。关键方法包括后退提示Step-back Prompting, SBPT [26]拓宽查询范围以丰富答案生成的上下文基础增强答案生成的上下文基础。假设性文档嵌入Hypothetical Document Embedding, HyDE [27]将原始查询转换为更符合索引文档的形式提高检索对齐度和有效性。检索器Retriever我们使用两种基础检索模型作为基准BGE-Large和JINA-Large以及它们的开源且嵌入一致的模型。对于高级检索策略我们集成了LlamaIndex以方便使用标准的高级方法。互惠排序融合检索器Reciprocal Rerank Fusion Retriever, RRFusion [28]将索引与基于BM25的检索器融合同时捕获语义关系和关键词相关性。两个检索器均分配分数通过互惠排序对节点进行排序无需额外模型或过多计算。句子窗口检索器SentenceWindow Retriever, StParser将文档解析为每个节点一个句子并包含周围句子以增加上下文。后处理器Post-processor为了提高检索准确性和效率XRAG使用后处理器如重排序器在返回节点前对其进行精炼。我们集成了BGE重排序器BGE-RRK使用交叉编码器模型计算相似度分数。JINA-Reranker-V2JINA-RRK支持高精度的多语言文档重排序。生成器GeneratorXRAG框架集成了多种LLM生成器包括来自HuggingFace Transformers³的模型确保与开源LLM的兼容性。它还集成了Ollama框架支持本地使用LLM。除了开源模型XRAG的生成器模块还包括对闭源LLM API的支持。因此用户可以在保留使用专有模型选项的同时访问多样化的能力。B. 基础与高级RAG编排器随着RAG技术的进步现代代理式RAG框架不再局限于线性管道结构。相反它们采用更复杂的编排方法来安排基础RAG组件以提高性能并适应多样化的应用场景。我们使用编排器模块来组织和管理RAG组件的执行逻辑和工作流。如图3所示XRAG框架包括五种类型的编排器顺序型、条件型、迭代型、并行型和混合型。顺序型Sequential顺序编排器通过高级组件的顺序编排来执行检索适用于简单的应用场景。XRAG的顺序编排器超越了基础RAG利用高级模块优化检索性能同时管理计算成本。使用此编排器时XRAG框架的工作流严格遵循“预检索—检索—后处理—生成”的线性步骤序列逐步执行以检索内容和生成答案。条件型Conditional在XRAG框架中我们采用条件编排器来实现需要条件分支的RAG方法。此编排器根据查询类型选择检索方法并基于特定条件或规则动态调整RAG组件的执行顺序和逻辑。我们集成了Self-RAG [29]作为条件编排器的典型应用它使用自我反思来判断是否需要检索。此外Open-RAG [30]首先对查询进行分类以执行有针对性的检索也可以作为此条件编排方法的示例。迭代型IterativeXRAG框架支持使用迭代编排器来实现需要多次迭代的RAG方法。此编排器使RAG组件能够跨轮次重复执行逐步精炼检索结果和生成内容直到满足标准。作为一种高级迭代编排器SIM-RAG [31]能够在迭代过程中执行多个检索步骤并优化提示已被集成到XRAG框架中。我们还集成了RFM-RAG [32]作为迭代编排器的另一种实现。RFM-RAG通过迭代检索动态构建证据池并制定有针对性的查询直到终止。并行型Parallel为了实现需要并行逻辑的RAG方法XRAG框架支持使用并行编排器。此编排器允许多个RAG组件逻辑上并行操作与依赖于选择逻辑的条件编排器不同。作为一种经典的并行编排RAG技术互惠排序融合检索器RRFusion [28]的检索逻辑已被作为编排器集成到XRAG框架中。RRFusion中的两个检索器并行分配分数通过互惠排序对节点进行排序无需额外模型或过多计算。SeaKR [33]方法执行多个组的并行检索并为生成选择最优检索结果也已集成到XRAG框架中。混合型HybridXRAG框架支持使用混合编排器来应对单个编排器不足以应对的复杂RAG场景。混合编排器可以组合多种编排逻辑以适应复杂的RAG需求。该框架集成了Adapt-RAG [34]方法作为此混合编排器的一个实例。Adapt-RAG结合了条件编排逻辑和迭代编排逻辑根据查询的复杂性在直接检索和迭代检索之间动态切换以实现灵活高效的检索过程。C. 统一基准数据集与语料库我们为XRAG框架收集并预处理了四个基准数据集重点对RAG系统进行严格的实验验证。我们开发了一个统一的数据集结构以促进检索和生成模块的性能测试并采用标准化格式XRAG为检索和问答数据集提供了一个统一的架构具体包括HotpotQA [35]、DropQA [36]、NaturalQA [37]和FinanceBench [8]。用于索引的语料库来源于这些数据集的训练集、验证集和测试集的元数据。此方法与前人工作[38]一致并支持向量数据库的高效部署。表II显示HotpotQA语料库包含的文档数量最多其次是NaturalQA表明检索难度随着每个查询所需文档数量的增加而增加。FinanceBench [8] [39]数据集包含37885份涵盖40家美国上市公司的财务文档。此外这些数据集处理复杂的RAG问答场景包括多跳查询、约束查询、数值推理和逻辑推理任务。多跳问题依赖于迭代检索的文档及其相互关系来推断答案。约束型问答在生成每个答案的同时会附带相应的约束或条件而非仅提供独立回答。数值推理涉及执行加法、减法、排序和计数等算术运算。集合逻辑推理处理涉及检索块之间关系的复杂逻辑问题。我们使用原始数据集的元数据构建了可检索文档将检索对象标准化为用于测试的文档ID。如果检索到的块节点对应于标注的文档ID则检索成功。此方法确保了检索标签的一致性并消除了由不同文档分块策略引起的差异。对于测试集我们限制了样本数量以减轻RAG和LLM评估带来的高令牌成本。在HQA、NQA和DQA中我们没有评估整个测试集而是应用了基于采样的平均方法在保持可靠性的同时减少了令牌使用。对于测试集较小的FQA我们使用所有测试数据进行评估。XRAG针对HQA、DQA、NQA和FQA数据集的相应提示如下。适用于HotpotQA和FinanceBench数据集的XRAG提示上下文信息如下。 [Context_str] 请根据上下文信息且不依赖先前知识回答问题[query_str] 我们有机会使用以下更多上下文来优化仅在需要时原始答案。 [Context_msg] 根据新上下文优化原始答案以更好地回答问题[query_str] 如果上下文不合适则再次输出原始答案。 原始答案[existing_answer]适用于DropQA和NaturalQA数据集的XRAG提示上下文信息如下。 [Context_str] 请根据上下文信息且不依赖先前知识为以下问题提供一个简要、尽可能短最好是一个词的答案 问题Oasis和Coldplay谁卖出了更多唱片 预期答案Oasis 我们有机会使用以下更多上下文来优化仅在需要时原始答案。 [Context_msg] 根据新上下文优化原始答案以更好地回答问题[query_str] 如果上下文不合适则再次输出原始答案。 原始答案[existing_answer]D. 评估方法为了评估RAG组件的质量我们将Jury [40]一个用于NLG系统评估的综合包与RAG社区的评估工具如UpTrain和DeepEval集成在一起。XRAG评估器在确定检索和生成组件的有效性方面起着关键作用。它们分为三组常规检索评估、常规生成评估和认知LLM评估。常规检索评估ConR评估器。它支持六个主要指标F1、平均倒数排名MRR和平均精度均值MAP以及Hit1和Hit10。此外它还包括DCG系列指标通过评估排序结果即检索到的上下文ID列表的质量来评估排序模型的有效性。该系列包括折扣累积增益DCG、归一化折扣累积增益NDCG和理想折扣累积增益IDCG。IDCG是在结果按理想方式排序即按它们的相关性即黄金上下文ID列表降序排列时可以获得的最大DCG。常规生成评估ConG评估器。这些生成式令牌匹配指标可分为三大类。N-gram相似性指标ChrF [41]、ChrF [42]、METEOR [43]、ROUGE F1 [44]R1、R2、RL关注生成文本实际响应与参考文本预期答案之间n-gram的重叠。基于差异的指标MAUVE [45]、困惑度Perplexity[46]通过比较生成文本与参考文本的分布来衡量内容质量、多样性和模型学习情况。基于错误的准确性指标词错误率WER[47]、字符错误率CER[47]通过计算实际响应与预期答案相比的差异或错误来评估其准确性。认知LLM评估CogL评估器。它分为三类面向检索、面向生成以及检索与生成组合。源自UpTrain前缀为“Up”和DeepEval前缀为“Dp”的认知LLM评估指标根据我们XRAG框架统一的参数进行分类。面向响应的指标包括来自DeepEval的响应相关性Dp-ARel、响应完整性Up-RCmp以及来自UpTrain的响应简洁性Up-RCnc、响应相关性Up-RRel、响应有效性Up-RVal和响应匹配度Up-RMch。面向检索的指标这些指标不包含响应相关参数但包含检索相关参数用于评估上下文质量包括来自UpTrain的上下文相关性Up-CRel和上下文简洁性Up-CCns。组合指标评估检索对最终响应的影响包括上下文精确度Dp-CPre、上下文召回率Dp-CRec、上下文相关性Dp-CRel、响应一致性Up-RCNs、上下文利用率Up-CUti、事实准确性Up-FAcc、忠实度Dp-Faith和幻觉Dp-Hall。CogL评估的详细使用模式如图4所示。像精确匹配EM和ROUGE这样的常规基于规则的指标侧重于n-gram匹配有时在捕捉语言表达的全面准确性方面有所不足然而它们仍然适用于需要明确且单一响应的任务。相比之下基于认知LLM的指标评估生成语言的质量当评估理解的复杂性超过基于规则的指标能力时这尤其有益。XRAG评估器具有明显的优势一次性评估多个RAG指标XRAG评估器允许用户同时评估各种RAG特定指标。此功能简化了评估过程无需顺序评估即可进行全面的性能分析。标准化评估指标的结构统一的数据格式简化了检索和生成中不同RAG组件之间的比较。字符与语义 × 检索与生成它包含一个4维交叉分析包括对检索和生成的字符级匹配测试和语义级理解测试。IV. 实验设置对于文档预处理我们使用SentenceSplitter块大小128个令牌重叠20个令牌将文档分割成块并构建向量索引。我们遵循LlamaIndex的配置用于其他RAG组件包括用于响应合成的精炼模块。为确保兼容性和效率XRAG集成了Huggingface Transformers。所有问答LLM的温度参数Temperature均设置为0以确保实验一致性。因此评估指标基于3个检索节点来衡量检索准确性这完全涵盖了大多数数据集通常只考虑一个或两个黄金上下文节点的假设。生成器模型的上下文窗口——包括查询、提示、检索到的上下文和响应内容——配置为4096个令牌。为确保在测试编排器时进行公平比较我们在可行的情况下使用了相同的模块详见表III。由于LLMOpenAI推理和评估期间令牌处理的高成本认知LLM评估CogL指标仅作为一项初步研究被包含以展示XRAG框架在语义评估方面的能力。涉及LLM生成的实验重复了三次标准偏差在生成结果表中报告。计算资源由于固有设计和规模限制每个模型的部署环境各不相同。对于DQA数据集测试在单个NVIDIA V100 GPU32GB上进行索引阶段单线程和搜索生成阶段四线程大约分别需要1小时和2小时BGE-Large索引占用496 MBJINA-Large索引占用391 MB磁盘空间。同样在NQA数据集上使用相同的V100硬件索引和搜索阶段分别耗时3小时和4小时BGE-Large和JINA-Large的索引大小分别为5.4 GB和4.2 GB。对于HQA数据集使用了NVIDIA L20 GPU48GB索引和搜索过程均以单线程方式执行分别耗时4小时和8小时而BGE-Large和JINA-Large索引分别使用了18 GB和14 GB的存储空间。最后FQA数据集在NVIDIA RTX 4090 GPU24GB上进行了评估单线程索引和搜索/生成均在一小时内完成BGE-Large和JINA-Large索引分别需要8.8 GB和6.9 GB的磁盘空间。V. 实验结果A. 用于检索的模块性能四个数据集的检索性能存在显著差异在DQA和FQA上观察到的质量最差如表IV所示。由于DQA需要高级离散推理[50]而FQA需要对金融文档进行段落理解因此它们构成了更大的检索挑战。i. 不同数据集应关注不同的测试指标。NDCG指标反映基础检索模型在HotpotQA和NaturalQA数据集上在相关性和排序准确性方面表现尚可。忽略排序准确性较高的Hit10得分 0.8表明检索到语义相关文档块的可能性很大。Hit1指标衡量的是将正确答案作为排名第一的结果返回的能力因此适用于具有单一检索目标的任务例如NaturalQA数据集中的单一黄金段落。然而对于需要多个同等重要的上下文目标如HotpotQA数据集的场景它效果不佳。总体而言检索系统在HotpotQA和NaturalQA上表现良好但在DropQA上面临挑战因为答案的复杂性较低的Hit1分数反映了检索最相关结果的难度。ii. 为了提高检索性能应优先考虑检索和后检索环节。将表IV中的基础检索器与表V中的高级检索器进行比较突出显示的结果表明采用集成额外匹配信息的高级检索模块可以提高检索效果。例如RRFusion将稠密向量与关键词检索相结合句子窗口则将块节点的上下文包含在检索对象中。特别地可以观察到重排序方法可以显著提高性能尤其是在DQA和FQA等具有挑战性的检索任务中。例如BGE-RRK和JINA-RRK均优于基础检索器。这是因为重排序器可以评估检索数据的相关性优先考虑最有可能提供准确和相关答案的内容。通过在答案生成期间让LLM专注于这些排名靠前的上下文可以显著提高响应的准确性和质量。B. 用于生成的模块性能在检查问答QA组件时有必要综合考虑表VI、VII、VIII和XI。表VI提供了当人工标注的检索输出直接输入大型模型进行问答时的测试结果。表VII和表VIII分别展示了当检索器使用JINA-Large和BGE-Large模型为大型模型识别相关句子时的结果。表IX和表X展示了使用BGE-Large检索器的XRAG系统生成的输出进行认知LLM评估的结果。在表IX中Dp-RMch指标得分低于0.5而所有其他指标均超过0.8。这表明Dp-RMch不适用于大多数非关键场景因为它可能会将语义正确的响应错误分类。表IX和表X中的概率得分Psc表明LLM测试依赖于API请求可能会因请求不稳定、处理时间长、超时限制或服务器端错误而导致数据包丢失。这反映了LLM测试的一个特定弱点尽管平均请求成功率超过85%。i. 当模型参数规模相对较小时直接向大型模型提供黄金上下文可能无法为这些数据集带来最优结果。我们的分析显示表VII和VIII中的实验结果通常优于表VI中的结果但使用DeepSeek-R1-70B模型获得的结果除外。黄金上下文通常包含单个文本段落DQA和NQA或两个段落HQA这可能无法为大型模型提供足够的信息。此外由于小型LLM的推理能力有限它们可能难以从这些简洁的文本中分析结果特别是对于需要数值计算和逻辑推理的问题。我们的检索模型将前k个前3个结果提供给LLM通过过滤和排序上下文信息来提供更全面的数据。一些检索到的数据虽然因不是直接答案而未被标注为“黄金上下文”但与查询高度相关并对推理过程有积极贡献。这一观察结果表明对于任何检索增强生成任务仅评估检索结果可能无法准确代表整体的RAG性能必须同时评估检索和大型模型问答生成。ii. 为RAG任务选择合适类型的LLM可能比仅仅增加模型参数更有效。在与各种LLM进行比较时观察到DeepSeek R1-7B和Deepseek R1-70B推理模型表现不佳。DeepSeek模型系列[51]的高幻觉率与RAG场景的严格准确性要求根本矛盾。在维基百科风格的数据集如HQA和NQA上GPT-4o-mini和Llama-3.1-70B等模型表现出优异的性能。然而在处理需要密集数值计算和逻辑推理的DQA和FQA数据集时GPT-4o-mini和Llama-3.1-70B模型明显优于其他模型。这表明模型架构和训练数据的选择可能比单纯的参数规模更为关键。C. 代理式RAG编排器的性能我们研究了不同编排器在HQA和NQA数据集上的性能由于资源限制使用DeepSeek-R1-70B作为生成器结果如表XI所示。迭代编排器SIM-RAG在HQA数据集上的生成质量指标如ChrF、METEOR、R1方面显著优于其他编排器。在HQA数据集上顺序编排器基础RAG在大多数指标上优于条件编排器Self-RAG和混合编排器Adapt-RAG。在NQA数据集上迭代编排器SIM-RAG在R1和R2等指标上优于顺序编排器但在METEOR和 ChrF 指标上表现逊色。迭代编排器在HQA上的出色表现可以归因于其多轮检索能力这对于回答多跳问题特别有效。相反在主要包含单跳问题的NQA数据集上迭代过程可能引入冗余或不相关的信息从而降低特定指标的性能。在效率方面表XII顺序编排器基础RAG因其简化的流程而成为最快的选择。条件编排器Self-RAG和混合编排器Adapt-RAG由于额外的分类或批评模型而产生了较大的开销。迭代编排器SIM-RAG消耗的时间最多因为它需要多轮生成和检索。这些权衡突显了在部署RAG系统时根据任务复杂性和延迟要求选择合适编排器的重要性。VI. 附加讨论与分析问题1更长的查询是否会产生更大的影响图示如图5所示表明查询长度与多个指标特别是Hit1和METEOR的性能之间存在正相关关系这些指标随查询长度增加呈现上升趋势。这种相关性意味着使用更长的查询可能会增强检索和问答系统的效能。这种提升可能是由于更长的查询提供了更丰富的信息有助于更精确地解读查询。问题2更多的上下文是否会产生更大的影响如图6所示问答系统的性能随着检索上下文数量的增加保持相对稳定。这一观察结果表明增加检索上下文的数量可能不会显著提升模型性能。分析平均值范围可知例如在ROUGE-1指标中随着检索上下文的增加平均值仅从0.31适度增加到0.41。这种微小的变化意味着增加上下文数量对性能提升的影响有限。此外在多张图中观察到最大值达到1.0这表明提升性能的关键可能在于提高检索的精确度即找到与查询最相关的少数几个上下文而不仅仅是增加检索到的上下文数量。ChrF和METEOR指标在不同检索上下文数量下表现相对稳定。这表明这些指标对上下文数量的变化不是特别敏感。因此这突显了在优化RAG系统的检索模块时应专注于提高检索结果的相关性和精确度而非增加检索上下文的数量。问题3问题的难度是否会在检索和生成过程中都带来挑战如表XIII和XIV所示与预期一致检索模型和生成模型在简单数据集上的得分均高于在困难数据集上的得分。从评估角度来看更严格的指标——如检索的F1和Hit1以及生成的ChrF和METEOR——对数据集的难度尤为敏感例如在Hit1指标上BGE-Large在简单数据集上得分为97.00但在困难数据集上仅为70.00下降了约28%。这种敏感性是因为更严格的指标更能有效地检测出随着问题难度增加而固有的性能下降。问题4优越的检索结果是否一定能保证优越的生成如图7所示在困难数据集上当模型在Hit1上命中时ChrF指标的平均值0.28比未命中时的ChrF0.14高出0.14。这表明成功的检索能显著提高困难问题的答案质量。在简单和中等数据集上Hit1命中和未命中之间的答案质量差距相对较小简单为0.06中等为0.04。此外当Hit1命中时仍有一小部分样本的答案质量较差chrF 0.1这表明良好的检索结果并不一定能保证正确的答案。这解释了第V-B节中观察到的现象“检索到的上下文优于黄金上下文”。问题5RAG编排器的更多迭代次数是否会导致更好的生成结果如图8所示在困难数据集上需要5次迭代的查询数量52高于简单数据集34和中等数据集41这表明更具挑战性的子集需要更多的迭代次数。当未达到迭代限制时1 ≤ 迭代次数 ≤ 4在HotpotQA数据集的三个子集上答案结果的质量随迭代次数的增加而显著提高。这验证了迭代编排对于多跳问答任务的适用性。对于SIM-RAG难以回答的过难问题在达到最大迭代限制后仍可能获得不令人满意的答案这就是为什么一旦迭代次数达到5性能会显著下降的原因。VII. 结论这项工作介绍了XRAG一个用于对高级RAG系统进行基准测试的开源框架它使研究人员能够更高效地从数据集构建RAG系统。它有助于根据数据特征选择合适的检索模块和逻辑并允许评估检索性能。未来我们计划在以下几个方面增强XRAGi. 支持RAG组件训练以处理更复杂的数据场景。ii. 集成更广泛的基准数据集进行评估例如OpenQA [52] [53]、长格式问答[54] [55]和多项选择问答[56] [57]。iii. 增加与脏查询和格式错误查询相关的鲁棒性评估。我们鼓励开源社区贡献力量以推动XRAG框架的发展。我们的目标是通过为RAG研究社区提供一个更高效、更可靠的平台并配备全面的评估和开发工具来不断完善XRAG框架。