客户被AI编造的法律案例告了——AI幻觉不是bug是feature

📅 2026/7/20 10:04:29
客户被AI编造的法律案例告了——AI幻觉不是bug是feature
2023 年 5 月底纽约联邦南区法院法官 P. Kevin Castel 在一起普通的航空伤害纠纷案里等来了一份超出他 30 年执业经验的法律意见书。这份意见书里引用了 6 个判例——Varghese v. China Southern Airlines、Shaboon v. EgyptAir、Petersen v. Iran Air、Martinez v. Delta Air Lines、Estate of Khasminsky v. Aeromexico、Miller v. United Airlines。引用注释完整、判例号格式正确、出版社名称真实、页码看上去也对。但判决书本身——完全是 ChatGPT 编造的。提交这份意见书的律师叫 Steven Schwartz来自 Levidow, Levidow Oberman 律师事务所。他后来在法庭上承认他用 ChatGPT 来补充研究自己根本没去核实这些判例是否真的存在。法官识破后做了三件事——对 Schwartz 律师处于 5000 美元罚款、撤销其代理资格、要求向被错误引用的判例的真实当事人逐一写致歉信。这不只是 Schwartz 一个人的失误。这是 AI 时代第一个被法院公开制裁的AI 幻觉引用案。一、客户被罚 5000 美元——AI 编造的法律案例先把案子细节摆出来。Mata v. Avianca 案是一个普通的航空伤害纠纷。原告 Roberto Mata 声称在哥伦比亚航空的航班上被热茶烫伤起诉哥伦比亚航空Avianca。Schwartz 律师要反驳的是哥伦比亚航空的母公司是否是适格被告。他用 ChatGPT 查询类似案情的判例支持于是 ChatGPT 贴心地给出了 6 个支持其立场的判例——每一个都不存在。最讽刺的是——这些判例的引用注释看起来极其专业“Varghese v. China Southern Airlines, 925 F.3d 1339 [11th Cir. 2019]”“Shaboon v. EgyptAir, 2013 IL App (1st) 110083”“Petersen v. Iran Air, 905 F. Supp. 2d 121 [D.D.C. 2012]”出版社对、卷号格式对、年份对、判决机构对。只有判决书本身是 ChatGPT 用接龙游戏现场编出来的。法官 Castel 在裁定书里写了一段后来被全美法律行业反复引用的话“Six of the submitted cases appear to be fabricated by the AI. This is unacceptable. Counsel is sanctioned.”裁定书曝光后全美律师协会 ABA 在 2024 年 7 月紧急发布 Formal Opinion 512明确——律师对生成式 AI 输出的事实核查义务不可豁免。也就是说AI 帮你查的资料最后一个字的真实性责任在你头上。这是 AI 幻觉第一次在真实法律场景里直接造成 5000 美元罚款和执业资格的代价。但 Mata 案只是一个起点。2024 年 2 月Park v. Kim 案纽约联邦法院—— 一位代理离婚案件的律师再次因为用 ChatGPT 编造判例被制裁法官发出了几乎一模一样的罚单。2024 年某医疗 SaaS 平台脱敏为某连锁医疗 SaaS 平台发生了一件事——平台升级后AI 辅助问诊对XXX 药物与 XXX 药物联用的副作用输出了一条真实不存在的严重肝毒性警告。3 名基层医生依据 AI 建议停用一线治疗药物改用更贵但不必要的辅助药其中 1 名患者的病情在那段时间明显恶化。事件曝光后平台被药监部门约谈最终以主动召回 公开致歉 全量回溯受影响患者收场。这三件事的共同点不是AI 编了是编得特别像、特别自信、特别难一眼看穿。你看到这里可能会想问——“AI 为什么不能区分’知道’和’不知道’它为什么不能诚实地说’我不知道’”答案让人沉默——因为它的训练目标里从来没有诚实地说不知道这一项。医疗 SaaS 那个案例里更扎心的细节是——那条编造的严重肝毒性警告看起来非常合理药物代谢路径相似、确实存在同类药物的肝毒性报告、AI 把这些碎片信息合理地拼成了一段警告。基层医生在 5 分钟问诊窗口里根本无法识别这是编造的。这就是 AI 幻觉最阴险的地方——它把碎片事实重新组合成看似合理但完全虚构的结论。二、三类幻觉——事实性、逻辑性、虚构引用AI 幻觉不是一个东西。它至少分三类每一类背后的机制不同每一类需要的防护也不同。第一类事实性幻觉Factuality Hallucination——模型陈述了一个不存在的事实。最常见的例子是某某人在某年某月说过某某话。模型会编造马斯克曾在 2019 年特斯拉投资者会议上说过’我们将在 2025 年前实现完全自动驾驶’但实际上马斯克没说过这句话。事实性幻觉在通用对话场景里最难发现——因为它听起来太自然了。更隐蔽的是事实偏移型幻觉——模型说的是真的事实但关键细节被替换了。比如1989 年互联网诞生是真的但1989 年万维网诞生就是错的万维网是 1989 年提出、1991 年公开。模型在细节上的偏移让事实变得半真半假比完全编造更难识别。第二类逻辑性幻觉Reasoning Hallucination——模型的推理链条在某个节点断了但它没察觉继续编下去。最常见的例子是数学推理和代码逻辑。模型算出5 个苹果 3 个苹果 9 个苹果听起来很自信但它在中间一步把加法做错了。逻辑性幻觉比事实性更难防——因为表面看起来模型在做正确的事只是中间偷偷做错了一步。更扎心的是推理偏移型幻觉——大方向对但具体某一步错。比如先算 A 再算 B 再算 C 的流程A 和 C 都对B 错了一点点但模型不会回头检查。它直接给你一个看起来对但 B 错的最终答案。第三类虚构引用Citation Hallucination——模型编造了一个看起来权威的来源。这是 Mata 案的典型——Varghese v. China Southern Airlines, 925 F.3d 1339 [11th Cir. 2019]这种引用注释完整、出版社正确、年份合理但判决书本身是模型编的。虚构引用有三种亚型完全虚构——引用了一个根本不存在的判例/论文/报告。细节虚构——引用了一篇真的论文但卷号、页码、年份是错的。作者虚构——引用了一篇真的论文但把作者换成了错的最容易被忽略。虚构引用在法律、医学、金融、学术四个场景里最危险——因为这四个场景的从业者高度依赖出处来判断信息的可信度。三类幻觉的危害程度是分级的——事实性幻觉在闲聊场景里顶多让你听错一件事。逻辑性幻觉在工程场景里会变成上线后崩了。虚构引用在法律/医学/金融/学术场景里会变成被告上法庭、医死人、被监管约谈。所以AI 幻觉治理的优先级不是按幻觉的多少排而是按高风险场景里出现幻觉的概率排。你看到这里可能会有一个反直觉的判断——“那 AI 是不是应该更小心一点是不是应该在不确定的时候主动说’我不知道’”这个问题问得对但答案让人更沉默——AI 不知道怎么主动说我不知道。三、AI 不知道它不知道——幻觉是 LLM 训练机制的必然产物反常识金句 1AI 不知道它不知道。这句话听起来像绕口令但它精确刻画了 LLM 的核心限制。要理解这一点你得先理解 LLM 是怎么说话的——LLM 不是数据库。它不查询什么是真的它只做一件事——根据当前的上下文预测下一个最可能出现的 token。注意是最可能出现不是最正确。模型在训练时学到的是语言模式——什么词后面经常跟什么词、什么句子后面经常跟什么句子。它学的是统计规律不是事实真相。这就引出了一个反直觉的洞察——LLM 没有我不知道的训练目标。训练的时候reward model 倾向于奖励流畅回答、“看起来自信”、“听起来专业”。它不会奖励诚实地拒绝回答。你想想 ChatGPT 训练时见过的数据——Reddit 帖子、维基百科、营销文案、技术博客、学术论文、社交媒体对话。这些数据里有大量错误信息、过时信息、营销话术、阴谋论。模型在训练时把这些语言模式和事实真相一视同仁地学进去了。它不知道哪些是真相、哪些是话术、哪些是营销——它只知道这种句子后面经常跟这种句子。更扎心的是——模型连我刚才说的可能是错的这个判断能力都没有。因为它的输出机制是接龙不是反思。它写出一句话后不会回头检查这句话对不对只会继续接下一句。这就是为什么 Mata 案里 Schwartz 律师被 ChatGPT 编的判例骗了——不是 Schwartz 不专业是 ChatGPT 编得太自然、太专业、太像真的。还有一个反直觉的洞察——上下文窗口越大幻觉率反而越高。2023 年 Liu et al. 在论文 “Lost in the Middle” 里发现LLM 在长上下文 32K tokens中对中间位置的信息会显著遗忘。这意味着——当你的 prompt 越长模型就越容易忘掉早期的事实开始补全它以为合理但实际不存在的内容。这条洞察在工程上有一个直接的含义——RAG 检索结果不是越多越好。你塞 50 条文档进 prompt可能反而让模型lost in the middle增加幻觉率。我打个比方——你让一个孩子讲故事孩子能讲到天黑每一段都栩栩如生、每一段都有细节、每一段都有高潮。但全是编的。这个孩子不是在骗你它是在按你让它讲故事的要求做——它不知道哪些故事是真的它只知道故事要这样讲才生动。LLM 就是这个孩子——它是个故事大王。你让它回答问题它就给你讲故事你让它写法律意见书它就给你编一份看起来像法律意见书的文件。它不是故意骗你是它不知道真相和编造的区别。反常识金句 2AI 幻觉不是 bug是 feature。幻觉听起来是个缺陷应该修复。但 LLM 的自回归生成机制决定了——它必然会补全它不知道的内容。这不是修复一下就能解决的 bug这是自回归生成机制的必然产物。就像你不能修复苹果会掉到地上——那是万有引力。那怎么办不能改变 AI 的本质就要改变 AI 的工作方式。下面这一节我们就来拆——AI 幻觉风险背后到底是哪些真需求。四、把AI 幻觉风险剥成三个真需求客户跟你说我们担心 AI 幻觉——这句话听起来是一个问题但其实是三个不同的真需求混在一起。你必须把它们分开否则你永远解决不了。真需求 1重要事实不能编造。客户要的不是AI 不能幻觉这做不到而是在涉及重大决策的事实上AI 不能编造——比如法律判例、医学诊断、金融建议、工程安全规范。这一类问题的核心是高风险场景下的事实零容忍。真需求 2不确定时要主动告知。客户要的是AI 知道自己不确定时要主动说’我不确定’“——比如这个药物副作用的证据等级是有限的建议咨询专业人士”。这一类问题的核心是AI 的诚实度阈值要按场景分级。真需求 3引用必须可追溯。客户要的是AI 引用的每个事实点都要能追溯到原始来源——比如以上信息来自《XX 文档》第 3.2 节如有出入以原始文档为准。这一类问题的核心是AI 的输出必须可审计。这三个真需求分别对应三类幻觉的不同防护策略——对付事实性幻觉靠RAG 检索增强——让 AI 在回答前先查可信知识库把回答建立在已知事实之上而不是模型凭空补全。对付逻辑性幻觉靠置信度评分——让 AI 在推理时同步输出我对自己这个答案有多确定低确定性的输出强制标注建议核查。对付虚构引用靠引用溯源标注——强制 AI 每个事实点都标注出处 段落号 URL没标注的事实不允许输出。这三道闸合起来就是工程上对 AI 幻觉的标准应对——不是修好幻觉而是在幻觉发生时把它的危害降到可接受的范围。反常识金句 3AI 开口必带出处——这是工程纪律不是模型能力。这条金句要展开讲——很多团队以为让 AI 开口必带出处是模型能力的进化等 GPT-5、GPT-6 出来就好了。错。模型能力再强接龙的本质不变——它学的是语言模式不是事实真相。即使 GPT-6 的事实准确率从 80% 提到 90%剩下的 10% 在高风险场景里仍然是致命的。AI 开口必带出处靠的不是模型自己能意识到该带出处而是工程系统强制 AI 必须带出处。具体怎么强制这就是 72 期要展开的四道闸——RAG 检索增强让 AI 优先查到真实出处、引用溯源标注强制每个事实点钉在原始来源上、置信度评分让 AI 自己评估我有多确定、兜底话术置信度低时强制说我不知道。你看到这里可能会想——“那哪些场景的幻觉是不可接受的”五、高风险场景清单——法律、医疗、金融、工程不是所有场景都需要同等严格的 AI 幻觉防护。你得先把场景分级——否则你会花太多钱在低风险场景或者太少钱在高风险场景。我们把 AI 应用场景按幻觉容忍度分四档——零容忍档幻觉率必须 1%法律——法律意见书、合同条款、判例引用、案件分析。一个虚构的判例会让你被法官罚款Mata 案先例。医疗——诊断建议、用药指导、药物相互作用、手术风险评估。一个编造的副作用警告会让医生停用一线药物医疗 SaaS 案先例。金融——投资建议、风险评估、合规审查、税务规划。一个编造的合规条款会让公司被监管处罚。工程安全——航空、核电、轨交、医疗器械、自动驾驶等安全攸关领域。一个编造的安全参数可能直接导致事故。低容忍档幻觉率 5%教育——教学材料、答题解析、考试辅导。幻觉会误导学生但后果一般是学错一个知识点不是立刻出事。客服——产品咨询、订单查询、售后处理。幻觉会让客户误解但一般能通过人工兜底。内容创作——文案撰写、营销策划、新闻摘要。幻觉会让内容失实但一般不会立刻造成重大后果。中等容忍档幻觉率 15%头脑风暴——创意生成、方案建议、思路拓展。幻觉在创意场景里有时甚至是灵感。翻译——多语言互译、跨文化沟通。翻译错误一般不会立刻造成重大后果。日常对话——闲聊、问答、信息查询。幻觉在闲聊里顶多让你听错一件事。高容忍档幻觉率 15% 也可接受艺术创作——诗歌、小说、剧本、游戏剧情。幻觉在艺术场景里就是创作自由。娱乐——笑话生成、谜语、互动游戏。幻觉在娱乐里就是趣味性。你看到这张分级表就能立刻判断——你的 AI 应用到底要花多少钱在幻觉治理上。零容忍档的幻觉治理投入是无上限的因为出一次事就够把公司赔垮低容忍档的幻觉治理投入是中等按千次调用出错的成本算中等容忍档和高容忍档的幻觉治理投入可以很少甚至不需要专门的治理。这就是按场景分级治理——不是一刀切。零容忍档的 AI 应用每一条 AI 输出都必须经过RAG 检索 → 引用溯源 → 置信度评分 → 兜底话术四道闸缺一道都不行。展开讲四个零容忍档——法律场景的零容忍——除了 Mata 案和 Park 案2024 年还有至少 3 起律师因引用 ChatGPT 编造内容被法院制裁的案件。法律场景的零容忍不是AI 偶尔错一点没事是AI 编造一次就够把律师执业资格赔进去。医疗场景的零容忍——除了医疗 SaaS 那个编造肝毒性警告的案例2024 年还有至少一起 AI 误诊致死案脱敏为某健康管理 App用户在描述症状后AI 给出普通胃炎的判断延误了急性心梗的诊治。AI 在医疗场景的每一次幻觉都是人命关天的事。金融场景的零容忍——2024 年某 AI 投顾 App 因为编造美国 SEC 批准某 ETF的消息导致大量用户在高位买入事件曝光后 App 被监管罚款。金融场景的幻觉不是误导用户是系统性风险。工程安全场景的零容忍——某航空公司在维护手册生成场景使用 AI 辅助AI 编造了一条特定条件下可以省略某项安全检查的规则。如果这条规则被现场工程师执行可能直接导致安全事故。幸好该公司在内部审核时发现了这条虚构规则没有流入实际维护流程。这四个零容忍档的共同点是——AI 的一次幻觉就足以让一家公司倒闭、一个律师失业、一个患者死亡、一个飞行员的执照被吊销。反常识金句 4零容忍档的 AI 输出不是AI 自由发挥是AI 在边界内小心翼翼地说话。这条金句的工程含义是——在零容忍档AI 的表达自由必须被严格限制。系统会强制 AI 在每个事实点都标注出处、每个不确定的判断都给出置信度、每个低置信度的结论都用兜底话术包装。这不是压制 AI 的能力是在 AI 能力范围内把出错成本降到可接受。你看到这里可能会有一个反直觉的判断——“那是不是零容忍档的 AI 就完全不能用”这个问题问得对但答案让人意外——反常识金句 5更大模型不解决幻觉只会编得更像。你以为 GPT-4 比 GPT-3 幻觉少错。GPT-4 比 GPT-3 幻觉率更低——但 GPT-4 编出来的东西比 GPT-3 编出来的更像真的。这意味着——更大的模型对读者来说更难识别幻觉但对开发者来说更难定位幻觉的边界。你拿 GPT-4 输出的法律意见书需要花 30 分钟核查你拿 GPT-3 输出的法律意见书可能一眼就看出粗糙的地方反而容易识别。所以更大模型 更危险的幻觉。在高风险场景里“换更大的模型” 不仅解决不了问题反而让问题更隐蔽。那 RAG 呢RAG 是给 AI 一本可查的书能解决幻觉吗六、三个反常识金句——更大模型、RAG、幻觉率反常识金句 6RAG 不彻底解决幻觉但能把幻觉率从 30% 降到 3%。RAGRetrieval-Augmented Generation检索增强生成的工作原理是——AI 在回答用户问题前先去查可信知识库公司内部文档、权威指南、行业标准等把查到的内容注入到 prompt 里再让 AI 基于这些内容回答。这听起来是治本的方案——AI 不用凭记忆回答而是查了资料再回答。幻觉率应该降到 0 吧错。RAG 的实际效果是——把幻觉率从 30% 降到 3% 到 10%具体降幅取决于检索质量——知识库里的内容是不是真权威、检索是不是真准确。Rerank 质量——重排序能不能把最相关的内容排到前面。Prompt 工程——AI 是不是被明确指示只能基于提供的资料回答不能编造。知识库覆盖率——用户问的问题是不是真的在知识库里有答案。更扎心的是——RAG 解决不了三类幻觉中的虚构引用。即使你给 AI 注入了正确的资料AI 仍然可能在引用格式上犯错——它可能把段落 3.2错写成2.3把2024 年发布的指南错写成2023 年。RAG 让 AI 的回答建立在事实之上但不保证 AI 引用的每一个细节都精确。所以 RAG 是治标不是治本——把幻觉率从不可用降到基本可用但不能消除。反常识金句 7幻觉率 0% 不存在。你可能在评估 AI 幻觉治理方案时看到一些厂商宣传幻觉率 0.1%、“幻觉率 99% 消除”——这些数字看看就好。幻觉率 0% 在真实业务场景里不存在。因为AI 模型本身有随机性——同样的 prompt 在不同时间可能输出不同的内容。真实业务场景千变万化——厂商评测用的基准HaluEval、TruthfulQA、FActScore覆盖的场景有限真实场景的复杂度远超基准。检索质量有上限——知识库覆盖率不可能是 100%。置信度评分有误差——logprobs、自评、检索一致度三种方法都有各自的误差率。所以——幻觉治理的目标不是消除幻觉而是把幻觉率压到业务可接受的范围内。零容忍档的业务幻觉率要压到 1%低容忍档的业务幻觉率 5%中等容忍档的业务幻觉率 15%高容忍档的业务幻觉率 30% 也 OK。这是 AI 时代第一个被工程化的事实——AI 会编你得接受。重要的是编得对地方、出错时能兜住。反常识金句 8AI 幻觉不是用更大模型解决是用工程纪律兜住。这条金句要展开讲——很多团队在评估 AI 幻觉治理方案时第一反应是等 GPT-5、Claude 4、Gemini 3 出来——以为模型能力进化能自然解决幻觉问题。错。模型能力进化能降低幻觉率——但幻觉率降低不等于幻觉消失。HaluEval 基准的最新数据2026 年 7 月时点GPT-4 的基础问答幻觉率 31.4%、Claude 3 Opus 28.7%、Llama-3-70B 35.2%。即使加上 RAG 检索增强FACTS Grounding 基准显示幻觉率仍可维持在 15-20%。这意味着——即使最强的模型 RAG仍然有 1/5 的概率在高风险场景里出现幻觉。零容忍档的业务等不起这个 1/5 的概率。所以AI 幻觉用工程纪律兜住不是模型能力不足的备选方案是模型能力永远不足的唯一工程方案。这三个反常识金句合起来就是 AI 幻觉治理的基本心态——你不是在解决一个技术问题你是在接受一个工程现实然后设计一套让 AI 在这个现实下能负责任地工作的纪律。工程现实是什么是一个接一个的事实——AI 会编、模型越强编得越像、RAG 不彻底解决幻觉、零容忍档的业务必须用工程纪律兜住。这些事实不是技术问题是AI 时代的工程约束——和你必须面对的高并发、“数据一致性”、多租户隔离是同等级别的工程约束。接受这个现实后下一步才是设计纪律——这套纪律里每一道闸都不是为了让 AI 不再编而是为了在 AI 编的时候把危害控制在业务可接受的范围内——第一道闸 RAG 检索增强让 AI 优先基于真实知识回答减少凭空编的概率。第二道闸 引用溯源标注让 AI 的每个事实点都钉在原始来源上出错时能立刻定位。第三道闸 置信度评分让 AI 自己评估我有多确定低确定性的输出强制标注建议核查。第四道闸 兜底话术让 AI 在置信度低于阈值时强制说我不知道 / 建议咨询专业人士。这四道闸合起来就是 72 期我们要讲的内容——RAG 增强 引用溯源 置信度标注 兜底话术让 AI 开口必带出处。你看到这里可能会想——“那这套纪律具体怎么落地RAG 怎么选向量库引用怎么标置信度怎么算兜底话术怎么写”别急这些细节 72 期我们全讲。我们下篇卷袖子干活——讲四道闸的具体工程实现RAG 检索增强向量库选型 ChromaDB/Milvus/Qdrant Embedding 模型选型 重排序 Query 改写、引用溯源标注出处 段落号 置信度三层、置信度评分logprobs 自评 检索一致度三种方法的组合使用、兜底话术法律/医疗/金融/通用四类场景模板看怎么把幻觉率从 30% 压到 3%。最后留一个自我检验清单给你——你团队现在做的 AI 应用是否明确划分了场景的幻觉容忍度档级零/低/中/高零容忍档的应用是否强制每一条 AI 输出都经过 RAG 引用溯源 置信度评分 兜底话术四道闸是否对客户/用户明确告知了AI 输出可能存在幻觉是否有专门的AI 幻觉事故复盘流程——每一次幻觉都记录场景、原因、修复方案是否有AI 工程师守则——明确禁止AI 输出的事实核查责任豁免如果这五条里有任意一条你没做那你的 AI 应用就是一颗没装引信的炸弹——早晚会有一次 Mata 案、Park 案、医疗 SaaS 案级别的事故等着你。不要等到那一天才后悔。我们这一期讲清楚了AI 幻觉是什么、为什么必然存在、为什么不能用更大模型解决、哪些场景必须治理。下一期我们卷袖子干活——把这套治理落地为四道可执行的工程闸门让 AI 在零容忍档的场景里也能开口必带出处、出错时能兜住。让 AI 在边界内说话让人在边界外把关——这就是 AI 时代工程纪律的真正含义。AI 时代的法律风险不会因为模型变强而消失只会在工程纪律松的地方集中爆发。我们下篇见。关于 ArchAIHarness这篇文章是「看懂 AI 与智能体」专栏的一部分由ArchAIHarness持续输出。ArchAIHarness 是一套面向 AI 时代软件工程的人机协同架构哲学与公开工程资产主张架构师定义秩序AI 在秩序中生长。人立法AI 执行体系审计。如果你也希望 AI 在明确的架构边界内协作而不是在混沌中碰运气欢迎到 GitHub 上看看我们在做什么组织主页github.com/ArchAIHarness — 了解完整理念与资产全景本专栏zhuanlan-ai-and-agents— 所有文章的源码与发布记录实践指南docs— 架构哲学、工程方法和落地指南开源工具agent-workflows— 可复用的 AI 协作 Agents、Skills 与 Tools工程样例framework— DDD AI 协作的工程底座展示如何在开发中融合 AIEngineered by Architects · Empowered by AI · Audited by Discipline