RAG 面试拷打:向量相似度都 0.9 了,为什么还是找错?

📅 2026/8/18 14:25:52
RAG 面试拷打:向量相似度都 0.9 了,为什么还是找错?
文档解析完了切片也没有把答案切散。老周在搜索框里输入一串制度编号向量库返回的第一名相似度 0.91看起来很漂亮却是另一份名称相近的制度。“相似度都 0.9 了为什么还是找错”我说因为向量分数只表示在当前模型和索引里“语义接近”它不是正确率更不是证据可信度。用户问的是精确编号向量模型却更擅长理解意思。两个文档讨论相同主题时错的那份完全可能排在前面。拿一个分数当答案判断是很多 RAG 项目第二个容易翻车的地方。01TWO RECALLS一、关键词与向量不是谁替代谁老周问“既然向量会错是不是直接换回全文检索”我说也不行。关键词检索擅长找制度编号、产品型号、错误码和人名但用户问“刚入职能不能休年假”原文可能写的是“连续工作不满十二个月”两边没有相同词语义向量反而更容易命中。生产里我会并行做关键词召回和向量召回再用 RRF 这类排名融合方法合并结果。它融合的是两条结果里的名次不是强行比较两种完全不同的原始分数。02QUERY FILTER二、召回前先把问题和范围搞清楚对话里用户经常只说“这个怎么申请”“它什么时候生效”。我会先结合对话上下文把代词补全再按需要生成语义问法和关键词问法但不会让改写凭空加入用户没说过的条件。然后用租户、部门、文档类型、适用地区、有效期和权限缩小候选集合。该在召回前排除的旧版本和越权文档不能先全量找出来再寄希望于大模型“自觉别用”。查询改写解决“用户怎么问”元数据过滤解决“应该去哪里找”混合检索才解决“在这个范围里找哪些证据”。三件事不能混成一个向量相似度。03RERANK LIMIT三、重排不是万能补救老周继续问“那我召回 Top 50再交给 Rerank不就稳了吗”重排能更精细地比较问题和候选块把真正相关的证据往前提。但它只能重新排列已经进入候选池的内容。正确条款如果一开始根本没被关键词或向量召回Rerank 不可能从全库把它变出来。Top K 也不是越大越好。太小容易漏答案太大会增加重排成本并让相似但无关的内容混进上下文。参数要靠真实问题集评测。排查时我会先看 RecallK正确证据有没有进入候选池进了却没排到前面再看融合权重和重排证据顺序正确但答案仍错才去查生成层。这样不会一出问题就盲调 Prompt。04INTERVIEW ANSWER四、如果只给我 30 秒我会这样答30 秒面试回答“向量相似度高只代表语义接近不代表证据正确。我的检索链路会先做上下文补全和查询改写再按权限、版本、范围做元数据过滤关键词检索负责编号、专有名词和精确词向量检索负责自然语言语义两路并行后用 RRF 融合再对候选集做 Rerank。评测时先看正确证据是否进入 RecallK再看排序和生成避免把召回缺失误判成 Prompt 问题。”老周没有停。他把两份都排进前五的制度放到我面前一份已经废止一份正在生效内容刚好互相冲突。“现在该召回的都召回了。新旧制度一起命中模型准备信谁”学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】