37.图RAG-Light RAG说明(1)

📅 2026/8/14 13:27:00
37.图RAG-Light RAG说明(1)
内容参考于图灵AI大模型全栈一个好的图RAG是知识图谱和向量Naive RAG结合起来图RAG知识图谱RAG应该是叫GraphRAG但是这个单词被微软占用了图RAG最早由微软实现了它的框架就叫GraphRAG所以我们说GraphRAG时指的是微软的GraphRAGLight RAG 介绍论文: https://arxiv.org/pdf/2410.05779文档地址: https://learnopencv.com/lightrag/项目地址: https://github.com/HKUDS/LightRAG这里有一个微软发布的GraphRAG框架微软发布的GraphRAG框架也是最早实现图RAG的框架但是它并不好用它只能使用GPT的模型而且还非常慢构建阶段Token消耗非常巨大如果已有图数据在它的基础上新加节点GraphRAG做不到它只能全部删除重新添加无法增量更新所以现在有了Light RAG它由香港大学研究Light RAG核心创新双层检索dual-level retrieval和图增强文本检索graph-enhanced text indexing是LightRAG的核心也就是它又基于图又基于向量双层检索分底层和高层检索底层检索low-level提取查询出来的实体或关系关键词然后向量匹配最相关实体和直接相连的节点然后提供精准细节比如孙悟空的师傅是谁如下图绿框就是直接相连高层检索high-level提取抽象的主题或关键词查询更广的上下文和相连的节点和相连节点相连的节点的信息2到3层范围然后提供全局视角比如西游记说的什么如下图绿框就是多层相连底层检索是为了解决细小的问题比如孙悟空的师傅是谁高层是为了做总结Light RAG架构图数据初始化阶段输入一个文档进行分片下图中的Text Chunks然后把分片后的内容转成向量放到向量数据库中下图中的Embedding这里的向量存的不是源文档存的是一个id根据向量生成一个id源文档保存在一个json里下图里的index它存的是源文档和metadata和向量对应的id就是说查向量的时候是查一个id然后拿着id去json中找文档到这向量就处理好了接下来是图数据如下图还是通过大模型生成会得到下图红框的两个东西节点和边Entities data是实体数据节点数据Relations Data是边然后经过下图红框去重节点和边去重比如在第一章有苹果第二章也有苹果它会看看这俩苹果的语义是不是一样的如果是一样的就合并如果不一样会单独创建一个节点和边去重之后转成向量保存到向量数据库如下图黄框它转成向量后也会有一个id它会根据id找到源文档会把源文档一起保存到向量数据库中然后把节点和边更新到图数据库中到这就是索引初始化的过程这样它把源文档和图数据都保存了下来在问题检索时就可以使用向量和图数据了 这也就是双层索引