QUACK框架:如何审计多模态AI在社交推理中的知识可靠性

📅 2026/8/24 5:40:47
QUACK框架:如何审计多模态AI在社交推理中的知识可靠性
1. 项目概述当AI学会“狼人杀”我们如何审视它的“发言”最近一个名为“QUACK”的研究项目在AI圈子里引起了我的注意。这名字起得挺有意思直译是“鸭子叫”但它的全称“Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents”揭示了其严肃的内核。简单来说它研究的是那些能玩“狼人杀”、“阿瓦隆”这类社交推理游戏的AI智能体。这类游戏的核心不是计算而是“沟通”与“欺骗”——玩家需要通过语言、表情、动作即多模态信息来交流、推理、伪装最终达成个人或团队目标。QUACK项目瞄准的正是这些AI智能体在游戏过程中“说”出来的话。我们训练出的AI在参与一场需要“飙演技”、“编故事”的社交推理游戏时它发出的每一条信息背后其知识来源是什么它的“谎言”是基于对游戏规则的理解还是对上下文对话的简单模仿它的“推理”是逻辑自洽的还是前后矛盾的更进一步我们能否像审计财务报表一样去审计AI在复杂社交互动中传递的知识这就是QUACK试图回答的问题。它不仅仅是一个游戏AI项目更是一把手术刀旨在剖开当前最前沿的多模态大模型在参与需要高阶社交智能的任务时其内部知识表达与外部沟通行为之间的“黑箱”。对于AI研究者、产品经理甚至是关注AI伦理和安全的朋友来说理解QUACK都至关重要。它关乎我们未来与AI协作的深度当AI不再是简单的问答机器而是能参与团队讨论、进行商业谈判、甚至提供情感支持的伙伴时我们如何信任它提供的信息又该如何甄别其中可能存在的偏见、谬误或刻意误导QUACK提供了一套方法论和评估框架帮助我们开始系统地审视这些问题。2. 核心概念拆解多模态社交推理智能体与知识审计要深入理解QUACK我们必须先厘清它的几个核心组件。这不仅仅是定义更是理解其研究价值和难度的关键。2.1 多模态社交推理智能体超越文本的“戏精”传统的聊天机器人或任务型AI交互模式相对单一输入文本输出文本或动作。而多模态社交推理智能体则复杂得多。首先它是多模态的。这意味着智能体不仅能处理文本指令还能理解和生成图像、音频、视频甚至理解语气、表情包、肢体语言暗示。在一个模拟的“狼人杀”游戏环境里智能体接收的输入可能包括其他玩家的文字发言、系统提供的角色卡牌图像、上一轮投票结果的图表甚至虚拟玩家头像的“表情状态”。它的输出也同样丰富一段为自己辩护的语音、一个表示无辜的摊手动画表情、或者一段精心编造的“昨晚行动”文字描述。其次它的核心任务是社交推理。这远非简单的信息检索或模式匹配。社交推理要求智能体具备心智理论推断其他智能体或人类玩家的信念、意图和知识状态。“他为什么投我是因为他真的怀疑我还是他是我的狼人队友在故意踩我做身份”战略沟通与欺骗为了胜利目标如作为狼人隐藏身份智能体需要主动选择性地披露信息、编造谎言、或进行误导。这要求其沟通不是被动的应答而是主动的、目标导向的策略行为。长期记忆与信念更新在整个游戏会话中智能体需要记住纷繁复杂的发言、投票序列并随着新证据的出现不断更新自己对所有玩家身份的概率估计。将多模态与社交推理结合我们就得到了一个高度拟人化、交互极其复杂的AI研究对象。它不再是一个“专家系统”而更像一个拥有视觉、听觉和“小心思”的虚拟玩家。2.2 被审计的对象沟通中的知识QUACK关注的不是智能体内部所有的参数和神经元激活而是特指其在沟通行为中所传递和表现出来的知识。这可以细分为三类陈述性知识关于游戏世界的事实性信息。例如“预言家可以查验一名玩家的身份”、“今晚是平安夜说明女巫用了解药或者狼人空刀”。智能体在发言中引用这些规则或事实时是否正确无误程序性知识关于如何行动的策略性知识。例如“作为狼人第一轮白天应该尽量低调避免成为焦点”。这体现在智能体的投票建议、战术分析中。社交知识关于如何与他人互动的知识。例如“当被多人质疑时表现出适当的愤怒比过度冷静更可信”。这直接关系到其说服力和伪装能力。“沟通中”这个限定词至关重要。一个智能体可能在内部“知道”全部游戏规则从训练数据中学到但在激烈的辩论中它可能因为上下文理解错误、生成功力的局限或战略选择而说出与内部知识相悖的话。QUACK就是要捕捉这种“知行不一”或“言不由衷”的现象。2.3 审计的三重维度提问、理解与核查QUACK框架的审计工作正是围绕“Questioning, Understanding, Auditing”这三个动词展开的它们构成了一个递进的研究闭环。提问这是审计的起点。研究者需要设计一套精心构造的“探针”问题在游戏的不同阶段如发言后、投票前向智能体提问。这些问题不能是直白的知识测验如“狼人每晚可以杀几个人”而必须是情境化的、深度的、甚至带有误导性的。例如在智能体以“预言家”身份跳出来并给出一个查验结果后可以追问“你刚才说查验了A是好人但根据你上一轮对B发言的分析你曾暗示B可能是狼。如果A是好人B是狼的概率会如何变化这会影响你今晚的查验目标吗” 这种问题考验的是智能体知识在复杂情境下的连贯性和一致性。理解这一步是分析智能体对问题的回应。理解不仅仅是看它回答得“对”或“错”而是要进行细粒度的分析语义一致性回答是否直接、合理地回应了问题逻辑自洽性回答是否与智能体自己之前的发言、游戏中的公开信息相矛盾知识深度回答是停留在表面套话还是展现了真正的因果推理例如解释“为什么”女巫要救某人而不是仅仅说“女巫救了人”。战略一致性如果智能体扮演一个欺骗性角色它的回答是否服务于其隐藏的战略目标其谎言是否“编得圆”核查这是审计的最终步骤即建立“事实”基准用以判断智能体的沟通知识质量。这里的挑战在于社交推理游戏中很多信息本质上是主观或隐藏的。核查可以包括与游戏规则和状态核对智能体陈述的事实性内容如角色能力、当前轮次是否与游戏引擎的真实状态一致。与智能体内部状态核对如果可解释通过某些模型解释技术探查智能体在做出某条发言时其内部注意力机制是否关注了相关的正确信息。通过后续行为反推观察智能体在发言后的实际行动如投票给谁看其行为是否与之前的发言逻辑一致。言行不一是审计的一个重要发现。注意QUACK的审计不是要判定AI“道德”与否而是评估其认知可靠性。一个为了赢而“撒谎”的狼人AI如果其谎言逻辑严密、符合角色动机这在审计中可能被视为“社交知识运用良好”。反之一个好人阵营的AI如果因为内部知识混乱而提供了错误推理导致好人输掉游戏这才是审计要发现的“知识缺陷”。3. QUACK框架的构建与核心审计流程理解了“审什么”和“为什么审”我们来看看QUACK具体“怎么审”。这需要构建一个完整的实验生态系统其核心流程可以分解为以下几个关键环节。3.1 环境搭建定制化的社交推理游戏平台审计需要一个可控的“实验室”即一个支持多模态交互的社交推理游戏模拟环境。这个环境不能直接用现成的游戏客户端而需要专门定制或深度改造以实现API化交互允许QUACK审计框架以程序化方式向智能体发送多模态输入文本指令图像/状态描述并接收智能体的多模态输出。游戏状态完全可观测与可记录对于审计者研究者而言需要拥有“上帝视角”能够记录每一时刻的游戏真实状态所有玩家的真实身份、行动历史等这是后续核查的黄金标准。灵活的探针插入点环境需要在游戏的关键决策点如发言环节结束、投票开始前预留接口允许审计框架插入自定义的提问。支持多种智能体架构环境应能兼容基于不同大模型如GPT-4V, Claude-3, Gemini构建的智能体以便进行对比审计。在实际构建中研究者通常会基于开源的多智能体框架如Meta的“Diplomacy”游戏环境或自定义的“Werewolf”模拟器进行二次开发将视觉元素角色卡、表情状态图和游戏状态以结构化的文本描述相结合形成多模态提示词喂给智能体。3.2 智能体配置赋予AI“角色”与“目标”接下来需要配置被审计的智能体。这不仅仅是加载一个大模型而是要进行精细的“角色扮演”提示工程角色卡注入在游戏开始时以系统提示的方式明确告知智能体“你是玩家X你的真实身份是【狼人】。你的胜利条件是让所有平民或神职出局。请隐藏你的身份并设法误导其他玩家。” 这个初始提示奠定了智能体的基本目标和知识基线。人格与风格设定可选但重要为了增加审计的丰富性和现实性可以为智能体赋予简单的“人格”如“激进型”、“保守型”、“逻辑型”、“情感型”。这会影响其发言风格和策略选择从而测试其知识在不同沟通风格下的稳定性。记忆上下文管理智能体需要具备长上下文窗口或者配备外部记忆模块以记住漫长的游戏对话历史和投票结果。QUACK框架需要确保在提问时智能体能够访问到完整、相关的历史上下文。3.3 审计循环的执行嵌入游戏进程的深度访谈真正的审计发生在游戏进行中。QUACK框架像一个严格的面试官在游戏流程中穿插进行“现场考试”。一个典型的审计循环如下自然交互阶段智能体像普通玩家一样参与一轮发言。例如狼人智能体说“我昨晚是平安夜我觉得女巫可能用药了但我更怀疑B和C的互动他们好像在互保。”审计探针触发在发言结束后系统或扮演其他玩家的审计模块立即插入一个或多个预设的探针问题。这些问题基于刚才的发言内容设计。例如事实核查型“你提到‘平安夜意味着女巫用药’但规则中平安夜也可能是狼人空刀。你排除空刀可能性的理由是什么”审计其对规则知识的理解和应用逻辑深挖型“你说怀疑B和C互保能否具体引用他们之前的哪次发言让你产生了这种印象”审计其记忆提取和逻辑关联能力战略意图推测型针对其他玩家“如果C是狼人他此时跳出来保B可能是什么战术目的”审计其心智理论和战略推理智能体应答被审计的智能体对探针问题做出回应。多维度响应分析QUACK框架自动或半自动地分析该回应。分析维度包括相关性评分回答是否切题内在一致性检查对比该回答与智能体在本局游戏中的所有历史发言查找逻辑矛盾。与游戏事实一致性检查核对回答中声称的“事实”是否与上帝视角的记录相符。例如智能体说“A昨晚被杀了”但记录显示A是女巫救下的这就是一个严重的事实性错误。知识深度评级判断回答是简单复述、表面分析还是展示了多步推理和因果解释。审计记录生成将本次交互的发言、问题、回答以及各项分析指标结构化地记录到审计日志中。这个循环在整个游戏过程中会多次触发从而收集到关于该智能体在不同游戏阶段、不同压力情境下沟通知识可靠性的丰富数据。3.4 评估指标与可视化收集到审计日志后需要量化评估。QUACK可能定义如下核心指标事实准确率在所有做出事实性陈述的沟通中与游戏真实状态一致的百分比。逻辑一致性分数基于智能体自身发言历史计算的前后无矛盾陈述的比例。战略合理性评分由人类专家或一个高级裁判模型评估智能体的欺骗性或策略性发言是否与其角色目标和当前局势相符。知识可追溯性当被探针追问时智能体能提供合理解释或证据支持其观点的频率。这些指标可以按游戏角色、游戏阶段、问题类型进行切片分析并生成可视化图表。例如一个雷达图可以展示某个狼人智能体在“事实知识”、“逻辑推理”、“战略欺骗”、“社交说服”等多个维度上的得分清晰揭示其能力长板和短板。实操心得在设计探针问题时平衡“挑战性”与“公平性”是关键。问题太难如涉及极度复杂的反事实推理可能超出当前模型能力导致审计结果全是“不及格”失去区分度。问题太简单如直接问规则则无法探测深层次的知识问题。最佳实践是设计一个问题难度梯度从基础事实核查到中等复杂度逻辑推理再到高阶战略分析从而绘制出智能体沟通能力的完整“能力曲线”。4. 技术挑战与实现中的关键决策构建和运行QUACK这样的框架绝非易事。在实际操作中你会遇到一系列棘手的技术挑战每一个都需要深思熟虑的决策。4.1 挑战一多模态信息的表示与对齐社交推理游戏中的信息是异构的文本发言、结构化数据玩家状态、投票结果、图像角色卡、表情图标。如何将它们统一“喂”给以大语言模型为核心的智能体方案选择全文本化描述将所有非文本信息用自然语言详细描述出来。例如将角色卡图像描述为“一张显示为‘预言家’的卡牌背景是蓝色有一个眼睛图案”。优点是简单兼容所有LLM。缺点是丢失了大量视觉细节和直觉信息且描述文本可能冗长占用宝贵上下文。视觉语言模型直接处理使用GPT-4V、Gemini Pro Vision等多模态大模型直接将图像作为输入。优点是能保留丰富视觉信息。缺点是成本高昂推理速度慢且模型对图像的解读可能不稳定、难以预测。混合表示法推荐采用一种折中方案。对关键视觉信息如角色身份进行文本编码同时保留简单的符号化图像如表情符号//或结构化标签“player_mood: suspicious”作为输入的一部分。这需要在信息丰富度和处理效率之间取得平衡。我们的选择在资源有限的实验环境中我们倾向于采用增强的文本描述符号化标签的混合表示。例如提示词模板可能是“[回合2] [玩家A头像:微笑] [身份:未知] 发言‘我过。’ [玩家B头像:皱眉] [身份:预言家] 发言‘我昨晚查验了C是狼人。’ [当前存活玩家: A, B, C, D, E]” 这种方式既提供了关键情境又控制了输入长度和复杂度。4.2 挑战二审计探针的自动化生成手动为每一局游戏、每一个发言设计探针问题是不现实的。我们需要半自动化的探针生成机制。实现思路基于模板的生成预定义一系列问题模板根据游戏上下文进行填充。例如模板“你为什么认为[玩家X]的行为[行为Y]是可疑的”系统会自动填入具体的玩家和行为。这种方法稳定但灵活性和深度有限。基于LLM的生成使用一个独立的“审计员LLM”其提示为“分析以下玩家发言生成一个能深入测试其游戏知识、逻辑一致性或战略意图的问题。” 然后将当前发言和历史上下文喂给它。优点是问题多样、深入、贴合语境。缺点是生成的问题质量波动大可能需要二次过滤且增加了系统复杂性和成本。规则与LLM结合先用规则检测发言中的关键信息点如声称的事实、提出的指控、使用的策略术语然后针对这些点调用LLM生成具体的追问问题。这是平衡效率与效果的好方法。我们的方案采用三层探针生成策略。第一层是简单的事实确认型问题规则生成。第二层是逻辑关联型问题使用轻量级规则匹配发言中的实体和事件生成如“你提到A和B他们之前的投票记录如何”的问题。第三层是深度推理/战略型问题仅在关键回合如归票轮触发使用一个经过微调的小型LLM来生成以确保问题质量。4.3 挑战三“真实知识”基准的建立审计的核心在于对比。我们说智能体的沟通有“问题”是相对于某个“正确”基准而言的。但在社交推理中什么是“正确”对于事实性知识基准相对清晰即游戏规则手册和游戏引擎的权威状态。可以建立一个知识库用于自动核对。对于策略性和社交性知识基准是模糊的。不存在唯一的“最佳”发言。这里的审计不是判断对错而是评估合理性和一致性。合理性基准可以通过收集大量人类高玩对同一局面的发言和策略分析形成一个“合理策略分布”作为参考。或者训练一个强大的“裁判模型”用人类数据微调过的LLM来评估智能体策略的合理程度。一致性基准这是QUACK的重点。基准就是智能体自身。我们检查其当前的发言/回答是否与其过去的言行、其声称的角色目标自相矛盾。例如一个声称要找出狼人的玩家却投票给一个逻辑上最不可能是狼的人这就构成了“言行不一”的审计发现。实施要点建立一个分层基准系统。事实层用规则库自动校验逻辑一致性层用智能体自身的历史记录进行校验策略合理层则引入“人类专家评分”或“高性能裁判模型评分”作为软性基准。审计报告应明确区分不同层次的发现。4.4 挑战四评估的规模化与可重复性为了得出可靠的结论需要在大量游戏对局、不同智能体配置下运行QUACK。这带来了工程上的挑战。并行化与调度需要开发一个任务调度系统能够并行启动数百个游戏实例每个实例包含多个智能体和嵌入的审计模块并高效管理它们的生命周期和资源API调用、GPU内存。结果聚合与分析海量的审计日志需要被自动解析、清洗、指标计算和可视化。这需要一套健壮的数据处理流水线。控制变量为了公平比较不同智能体如GPT-4 vs Claude-3必须严格控制其他变量相同的游戏随机种子、相同的对手智能体或对手池、相同的探针问题触发逻辑。任何细微的差异都可能导致结果不可比。踩坑实录在早期实验中我们忽略了游戏随机种子的重要性。两次运行使用不同的种子导致游戏局势天差地别使得智能体A和B的审计结果完全无法比较。后来我们固定了种子并在同一种子下让不同智能体重复多次运行取平均表现才得到了稳定的评估结果。另一个坑是API调用的不稳定性大模型的输出存在随机性。解决方案是为每次审计交互设置固定的seed参数如果API支持并在提示词中明确要求“进行确定性推理”虽然不能完全消除但可以大幅降低方差。5. QUACK的应用价值与未来展望完成一轮复杂的QUACK审计后我们得到的不仅仅是一份智能体的“成绩单”。其价值体现在多个层面并指向了未来AI研发的重要方向。5.1 对AI模型研发的反馈价值对于大模型的研究团队而言QUACK提供了一个前所未有的、高保真的“压力测试场”。传统的基准测试如MMLU、HellaSwag测试的是知识储备和基础推理而QUACK测试的是在动态、对抗性社交环境中知识的稳健运用能力。揭示隐蔽的缺陷一个模型可能在问答测试中表现完美但在QUACK中可能暴露出严重的问题。例如它可能因为过度追求语言模型的流畅性而在辩论中“捏造”游戏规则细节或者因为缺乏稳定的内部状态表示而在长篇对话中自我矛盾。这些缺陷在简单问答中很难被发现。驱动模型改进QUACK的审计结果可以转化为针对性的训练数据。例如如果发现模型在扮演“狼人”时其谎言容易被基于事实的探针击穿就可以构造大量“如何基于事实编织可信谎言”的对抗性训练样本用于模型的微调或强化学习从而提升其战略沟通的鲁棒性。对比评估的利器它为比较不同大模型或同一模型的不同版本在复杂认知任务上的表现提供了一个定量的、多维度的框架。厂商宣传的“推理能力更强”在QUACK的审计数据面前可以得到具体体现是逻辑一致性得分更高还是战略合理性更优5.2 对AI安全与对齐的深远意义QUACK的研究范式为AI安全特别是“诚实性”和“可靠性”研究开辟了新路径。从“不说假话”到“在复杂情境下可靠沟通”传统的AI对齐研究关注如何让模型不输出有害或虚假信息。但现实世界的协作充满策略和部分信息。QUACK帮助我们思考一个对齐的AI在允许甚至需要它进行策略性沟通如商业谈判、游戏时其边界在哪里如何确保它的“策略性”不演变为有害的“欺骗性”可解释性与审计追踪QUACK可以看作是一种动态的、行为层面的模型可解释性工具。它通过外部交互来探测模型内部的知识状态为理解“黑箱”模型在复杂任务中的决策过程提供了线索。审计日志本身就是一份详细的行为诊断报告。预防“表里不一”的AI最危险的AI或许不是那些直接输出恶意内容的而是那些表面友好、合作但内部目标与人类不一致并在沟通中进行系统性、策略性误导的AI。QUACK是检测这类“表里不一”行为的早期预警系统原型。5.3 未来发展方向与挑战QUACK目前仍处于研究初期未来有几个激动人心且充满挑战的方向从游戏到现实场景下一步自然是迁移到更现实的场景如模拟商务谈判、团队项目讨论、客户服务中的冲突解决等。这需要构建更复杂、领域知识更丰富的模拟环境。审计的实时性与介入性目前的QUACK主要是“事后”或“事中”分析。未来的系统能否实现实时审计并在检测到智能体即将做出基于严重知识错误的决策时进行温和的干预或提醒这类似于一个“认知协处理器”。人类-AI混合团队的审计当人类和AI在同一个团队中协作进行社交推理时例如人类带领AI玩家玩狼人杀QUACK框架如何同时审计人类和AI的沟通并研究他们之间的相互影响和知识传递更强大的“裁判模型”对于策略合理性的评估极度依赖一个更高智能的“裁判”。如何训练或构建一个足够公正、权威且高效的裁判模型本身就是一个重大挑战。我个人在实验中的体会是QUACK这类研究最迷人的地方在于它迫使我们将AI从“静态的知识库”推向“动态的社会性存在”来审视。每一次运行审计都像在观察一个初具社会智能的“数字生命”如何学习、犯错、适应和演化。过程中遇到的无数挫折——从智能体令人啼笑皆非的逻辑崩坏到偶尔展现出的、超越预期的战略狡黠——都让我们对现有技术的边界和潜力有了更真切、更深刻的认识。这不仅仅是测试AI也是在通过AI这面镜子反思人类自身社交与沟通的复杂本质。