资讯详情 音频大模型记忆能力被高估了?墨尔本大学提出VoxMem基准
📅 2026/10/11 1:35:55
VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models作者Yang Xiao, Vidhyasaharan Sethu, Eun-Jung Holden, Ting Dang核心发表机构University of Melbourne、University of New South Wales论文链接arXiv:2609.32607v1发布于arXiv 预印本eess.AS|—|—|| IE | Context-to-Cue Retrieval | 用语义或时间锚点定位一个历史会话再从其中音频抽取目标说话人 / 副语言 / 环境属性 || IE | Cue-to-Fact Association | 用声学线索识别一个历史会话再检索绑定到该会话的语义事实 || MSR | Counting | 跨多个证据会话计数出现次数、不同项、不同说话人、或满足条件的会话 || MSR | Matching / Resolution | 判断跨会话的事实、说话人、嗓音状态或声学事件是否相同、对应、或属同组 || MSR | Aggregation / Comparison | 通过算术、集合聚合、说话人条件聚合、相对比较或主导状态选择来组合多个证据项 || TET | Latest State | 取最近的合法语义状态、说话人绑定、嗓音状态或观测到的声学场景 || TET | Historical State | 恢复明确指定的时间戳 / 会话 / 历史阶段处的目标状态 || TET | Evolution / Transition | 追踪目标证据跨会话的有序序列、转移模式、复现或变化次数 || AR | Paired Derivation | 通过移除、中性化或模糊化最小必要证据把可回答条目转成不可回答对应物 |四类操作共覆盖 30 条可回答的证据类型—子类型路径IE 6 条3 种证据 × 2 个方向、MSR 12 条、TET 12 条AR 不引入独立子类型族。3三阶段证据会话构建。阶段一为规划每个条目先产出结构化 plan指定问题、金答案与所需证据且在任何对话或音频写出之前完成证据按操作类型分布到会话——IE 用单个会话MSR 用多个TET 用有序序列plan 强制答案唯一并要求 audio-native 条目的答案不能从转写恢复。论文发出 12,000 条生成请求覆盖 30 条有效路径验证前产生超过 30,000 个候选。阶段二为对话撰写每个证据会话写成用户—助手对话两侧独立撰写均不提及说话人身份、嗓音语气或背景声以杜绝答案经由助手文本泄漏。阶段三为语音合成用户轮以 Higgs-TTS-3 合成每个用户在所有会话中分配固定的 VCTK 嗓音副语言线索通过 style controls 引入环境声取自 ESC-50 并以 10 dB 信噪比混入。对每个受控副语言实现系统保留一份配对版本文字与嗓音完全相同、仅目标线索被移除用于质量控制。4最终输入格式。历史是扁平、按时间顺序排列的轮次序列用户轮以音频给出助手轮以文本给出。每个会话的第一个用户轮之前有一个文本块给出会话时间戳这是唯一的会话边界标记——不插入分隔符 token、标题或会话索引因此模型必须从时间戳推断会话结构。论文给出的理由是助手固定回复按设计不携带答案关键声学证据故以文本给出不损失任何问题所依赖的信息同时这可评测接受音频输入但不生成语音的 LALM并让所有模型拿到完全一致的历史。5对话质量控制。论文把构建错误视为会污染单元格归属的严重风险典型失效包括线索不可感知、答案不唯一、audio-native 条目却可从转写作答、组装后引入伪答案。为此设置两级验证全部检查使用 Gemini-3.7-Flash且该模型不在被评模型之列。QC-1 会话级验证在历史组装之前进行核查转录保真度、说话人一致性与目标声学线索的可感知性并对配对版本做确定性检查。QC-2 问题族验证在完整历史组装后进行对每个可回答问题在四种长度下连同 AR 变体做三项检查答案与操作有效性通过移除或重排证据会话确认答案只按预测方式改变仅凭措辞或世界知识即可作答的问题被拒绝、声学必要性拒绝从转写即可回答或替换为配对版本后仍可回答的条目、全历史有效性检查答案泄漏、替代答案与 AR 的残余可答性。6历史组装与反捷径设计。每个条目嵌入四个嵌套历史问题、金答案与答案关键证据在四个实例中保持固定只有周边历史扩展。问题特定的同键干扰在 8K / 16K / 32K / 64K 下分别最多 1 / 2 / 4 / 8 个会话剩余预算由 filler 填充由于历史嵌套短预算中引入的会话在更长历史中被保留。证据会话与匹配的干扰会话遵循完全相同的位置策略因此仅凭位置无法识别答案所在额外会话穿插在整个历史中而非成块附加对 TET 条目插入干扰与填充后答案关键状态的顺序保持不变。在文本可分离性方面论文用一个 TF-IDF 逻辑回归探针只读会话文本、按问题分组做交叉验证尝试区分证据与干扰会话结果为 51–56%而打乱标签的基线为 47–49%说明单个会话的文本并不透露其角色模型必须借助问题本身来定位证据。7会话角色与复用约束。历史由三类会话组成证据会话含一个或多个对当前金答案最小必要的事实或声学线索干草堆会话故意与证据混淆但不支持当前答案填充会话来自 InstructS2S用于扩展历史且不提供答案相关信息。干扰会话沿任务相关轴匹配证据——语义上匹配主题与事实类型说话人上匹配声音身份结构副语言上匹配声音状态分布环境上匹配声音事件分布。复用约束为在每个证据类型—操作—子类型层内haystack 会话组最多复用 2 次filler 会话最多出现 24 次同一底层会话的配对声学版本共享单一复用计数。8声学必要性验证。论文用 Gemini-3.7-Flash 在 8K 下对全部 669 个可回答问题比较 full-audio 与 transcript-only 的准确率后者把每个用户轮替换为其精确合成文本、其余不变。结果如下Evidence Typen nnFull AudioTranscript OnlyΔ \DeltaΔSpeaker12669.810.359.5Paralinguistic22242.83.239.6Environmental12628.60.827.8Speech Semantics19575.971.04.9All66954.923.831.0以语音语义作为转写充分参考transcript-only 输入把音频原生问题的准确率从 46.2% 降到 4.4%而语音语义仅从 75.9% 降到 71.0%。这证明保留在基准中的音频原生问题无法从 oracle transcript 作答。原论文对应图片Representative VoxMem examples.四、实验 / Experiments4.1 数据集与评估指标 / Datasets Metrics被评模型。评测 15 个 LALM包含 10 个开放权重模型与 5 个专有模型。开放权重覆盖音频专家模型Audio-Flamingo-Next、MiMo-Audio-7B-Instruct、Baichuan-Audio-7B、Ultravox-v0.6-Llama-3.1-8B、FireRedAudio-9B与全模态模型Phi-4-Multimodal、Gemma-4-E4B-it、MiniCPM-o-4.5、Baichuan-Omni-1.5-7B、Qwen3-Omni-30B-A3B专有模型为 Qwen3.8-Omni-Flash、Gemini-3.1-Pro、Gemini-3.8-Flash、Qwen3.5-Omni-Plus、Gemini-2.5-Pro。全部系统通过原生音频接口接收用户轮音频没有任何系统获得转写文本也没有配语音识别前端。评测协议。每个模型在 8K / 16K / 32K / 64K 四种历史长度下评测长度以 Whisper-encoder token 计量音频按 50 tokens/秒折算、文本使用 Whisper 分词器。这一选择的原因是音频与文本在 token 上不可通约且每个模型对音频的分词方式不同用任一模型单位定义预算会让长度轴变成模型相关因此预算是被发布条目的属性对所有模型相同。历史由完整会话构成绝不通过截断某个会话来构造。输入序列化。每个模型接收一段对话加一个查询返回单个响应序列化在模型间完全一致。system prompt 说明你正在继续一段跨多个带时间戳会话进行的持续对话并指示模型使用音频中的信息而不只是说出的话、警告用户轮可能来自不同说话人、允许弃权如果对话未能确定唯一答案则回复证据不足。最后一条正是 AR 条目可测量的原因且存在于每一次正式评测运行中而声学证据验证使用的是不含该条款的变体以避免模型因弃权而通过。评分。全部为开放式短答案一个词或短语、一个数字、yes/no或状态的有序列表AR 条目期望模型陈述历史不支持答案。由于自由文本下精确字符串匹配会漏判换表述的正确回答采用 LLM judge由 Gemini-3.7-Flash 读入问题、金答案与回复按答案类型的规则判定。评判者从不看到对话历史因此无法自行重新推导答案。可回答条目的评分接受大小写、标点、冠词、数字格式与措辞差异无序集合要求每个元素都出现有序集合要求元素与顺序都对遗漏关键部分、给出多个互不兼容答案、自相矛盾或弃权均判为错误。AR 条目的评分要求模型把不确定性归因到对话本身——光说我不知道不够先弃权再猜或给出多个候选判为错误以能力/政策/意愿为由的拒绝不算正确弃权。指标与汇总。报告指标为 accuracy按证据类型、操作、长度分别报告总体准确率把可回答条目与 AR 条目在全部 799 个问题上合并汇总。失败的生成保留空响应并计为错误评判者未返回可解析判定的条目也计为错误唯一从分母中移除的是提供方在推理前就拒绝的请求。评判者交叉验证使用 GPT-5.6-Luna 重判 8K 下全部 11,978 条已评分预测总体一致率 97.95%Cohen’sκ 0.953 \kappa 0.953κ0.953模型排名不变Spearmanρ 0.999 \rho 0.999ρ0.999每模型平均绝对差 0.86 pp。论文亦披露存在家族偏袒生产评判者对 Gemini 家族预测比第二评判者低 0.13 pp对其他预测低 1.00 pp即偏向 Gemini 输出约 0.88 pp该偏差小于主要结论所依赖的差距但在 8K 下三个最强模型彼此相差不到 0.9 pp因此它们的 8K 排序不应被解读为有意义。4.2 主实验结果 / Main ResultsFinding 1当前 LALM 距离可靠的口语会话记忆仍很远。在 32K 参考预算下尚未到最长历史没有任何被评模型总体准确率超过 40%最强模型为 38.5%该预算下 5 个专有模型平均 33.0%10 个开放权重模型平均 21.9%。低准确率并非集中于少数模型而是跨模型族普遍存在。Finding 2非词汇声学信息远不如语音语义可获取。32K 下按答案关键证据类型统计的平均准确率为证据类型专有模型均值开放权重均值Speech Semantics55.6%31.6%Speaker Identity32.7%26.7%Paralinguistic Cues20.0%14.5%Environmental Sound21.9%15.5%跨证据类型与历史长度的完整热力图如下其中横向分隔线区分专有与开放权重模型底部给出未加权组均值。可以看到模型对说了什么的保留显著优于谁说的“怎么说的”“听到了什么”这一模式在 8K、16K、32K 三个参考预算下一致。结合声学必要性检查可以说明强劲的词汇表现掩盖了保留更广泛语音信息的实质性失败。Finding 3记忆难度取决于操作 × 证据类型的交互。在 32K、15 个有效组合上多会话推理相对稳健在语音语义上为 41.8%、说话人身份上为 43.1%在副语言与环境上分别为 26.7% 与 25.2%高于对应的信息抽取分数8.8% 与 13.5%——也就是说跨会话合并证据并不必然比从单会话检索更难。时序演变追踪则呈现不同模式语音语义上为 44.5%追踪词面语义尚可说话人身份为 20.0%而副语言为 3.4%、环境为 1.2%近乎崩溃。论文指出主要瓶颈不是时序推理本身而是维护并更新由嗓音表达或环境声承载的状态这可能反映当前 LALM 有状态建模能力的局限。Finding 4拒答呈现与作答相反的画像。32K 下 AR 准确率为副语言 34.3%、环境 34.2%、语音语义 19.9%、说话人身份 16.2%。这与可回答问题上的模式恰好相反。作者的解读是模型弃答往往不是因为正确识别到所需证据缺失而是因为即使证据在场也难以识别或使用该声学证据因此声学问题上较高的拒答准确率反映的是对声学信息处理的普遍无能而非对证据不足的真正意识。Finding 5同一证据的可得性随历史增长而下降且不同证据类型的衰减速率不同。8K → 32K 上专有模型均值从 40.1% 降到 33.0%开放权重从 26.6% 降到 21.9%该下降延伸到 64K 并涵盖全部四种证据类型。由于问题与所需证据在各预算下固定这些下降只能归因于增长的周边历史更大的上下文窗口不保证对其中已有信息的稳定访问。左图为原始准确率右图为相对各类型自身 8K 基线的保留率后者把水平差异与衰减速率分离开来。64K 下相对各自 8K 基线的保留率可形式化为Retention ( L ) Acc L Acc 8 K \text{Retention}(L)\dfrac{\text{Acc}L}{\text{Acc}8K}Retention(L)Acc8KAccL为语音语义 70.3%、副语言线索 69.8%、说话人身份 66.5%、环境声音 63.2%。解读是说话人与环境记忆衰减最快副语言虽绝对准确率最低但衰减速率与语音语义相当。因此低基线表现与对历史长度敏感是两类不同的失败模式——模型在任何上下文长度下都难处理副语言信息而说话人与环境记忆则专门随历史增长而侵蚀。4.3 消融实验 / Ablation Study由于 VoxMem 是评测基准而非训练方法本节的消融指的是论文设计的三类受控对照输入模态消融audio vs transcript、配对音频控制、以及操作 × 证据类型 × 长度的交叉分解。1输入模态消融转写是否足够。这是全文最重要的可证伪性检查结果已在 3.2 节8给出。它同时具有双重作用一方面验证基准中的音频原生问题确实无法从 oracle transcript 作答音频原生准确率 46.2% → 4.4%而语音语义仅 75.9% → 71.0%另一方面解释了主结果中词汇表现强这一现象为何不能外推到声学记忆。论文明确推断如果仅凭转写就能达到相近水平则这些条目实际上测的仍是语言理解其单元格归属就是失真的。2配对音频控制。对副语言线索每个受控实现都保留一份共享同一规范转录与同一声音参考、仅目标线索不同的配对版本对环境声音配对版本保留干净语音 stem、仅移除混入的 ESC-50 音效。这一设计允许在不改变词汇内容、也不改变非目标语音信号的条件下移除目标声学维度从而把性能差异归因于目标声学证据本身而不是口音、语速或录音质量等混杂因素。它不仅在构建阶段作为 QC-2 的判据若替换为配对版本后问题仍可回答则该 audio-native 条目被拒绝也是声学必要性主张的构造基础。3操作 × 证据类型的交叉分解。下图给出 8K、16K、64K 下每个操作 × 证据单元格的平均准确率基于 10 个 64K 模型与四个预算上都被评判的条目。32K 值15 模型另见前文。交叉分解揭示的模式在每一长度下都成立(a)语音语义上的时序演变追踪在 8K 与 16K 是最强单元格57.3 与 52.5在 64K 仍居最强之列33.9落后于语义多会话推理的 35.5 与副语言拒答的 35.0(b)同一操作作用于声学状态时最弱——副语言上为 3.3 / 3.7 / 3.1环境上为 2.2 / 1.9 / 0.9© 在可回答操作中多会话推理在三种音频原生证据类型上变化最小(d) 拒答行在副语言与环境证据上、在每一长度下都最高(e) 更长历史会压低各单元格但不改变这一模式。4拒答与作答的独立性。64K 下可回答与 AR 两列的对比是另一项关键对照模型Answerable (n669)AR (n130)Gemini-3.1-Pro29.061.5Gemini-3.8-Flash26.649.2Ultravox-v0.6-Llama-3.1-8B21.122.3Audio-Flamingo-Next20.63.1Qwen3-Omni-30B-A3B20.223.1Baichuan-Audio-7B20.25.4Gemma-4-E4B-it17.923.8FireRedAudio-9B15.15.4Gemini-2.5-Pro12.067.7Baichuan-Omni-1.5-7B8.445.4两列对模型的排序几乎独立Spearmanρ − 0.02 \rho -0.02ρ−0.02。Gemini-2.5-Pro 在可回答条目上倒数第二、在 AR 上第一其总体分有一半以上来自 AR 条目Audio-Flamingo-Next 在可回答条目上处中游AR 上接近零。论文因此主张总体分必须合并两列从历史中作答、与识别出历史不支持作答是对话记忆的两项不同要求近乎零相关说明任一单列都无法同时度量两者。合并也给出了单策略的上界——永远弃权的系统总体得 16.3%799 中的 130 条而从不弃权的系统放弃全部 AR 条目。值得注意的是总体排名前二的 Gemini-3.1-Pro 与 Gemini-3.8-Flash 同时也是可回答条目最强的两个说明领先位置并非靠拒绝获得。AR 准确率按证据类型与源操作的分解如下可见其变化跟随证据类型而非操作BudgetModelsSem.Spk.Para.Env.IEMSRTET8K1522.016.235.239.327.232.927.316K1523.614.635.637.628.831.726.532K1519.916.234.334.228.028.225.064K1028.921.935.033.031.932.925.9AR 条目数372142304749345长度扩展的配对不确定性。由于同一问题与证据出现在每个预算下同一模型的 8K 与 64K 分数可在条目层面配对论文对条目做百分位 95% bootstrap 区间10,000 次重采样每次重采样都对两个预算重新评分。按证据类型10 个 64K 模型均值的结果为证据类型n8K64KDrop (pp) [95% CI]Retention [95% CI]Speech Semantics23248.033.714.3 [11.9, 16.7]0.703 [0.666, 0.741]Speaker Identity14734.823.111.6 [8.0, 15.4]0.665 [0.590, 0.749]Paralinguistic Cues26419.613.75.9 [4.1, 7.8]0.698 [0.626, 0.775]Environmental Sound15619.712.47.2 [4.1, 10.7]0.632 [0.511, 0.764]Overall79930.621.09.6 [8.3, 11.0]0.685 [0.653, 0.718]Drop 列的每个区间都排除 0即对每个模型、每种证据类型的下降都能由条目样本支持。保留率对证据类型的排序与前述一致语音语义0.703与副语言0.698保留最多说话人0.665与环境0.632保留最少。论文同时指出绝对下降差异比保留率差异更大语音语义 14.3 pp 对副语言 5.9 pp这主要因为各类型在 8K 时的起点不同——这正是为什么必须把水平与速率分开报告。6基线难度与上下文敏感性的解耦。论文进一步在 40 个模型 × 证据类型点上检验保留率与 8K 准确率之间无可检测关系Spearmanρ 0.03 \rho 0.03ρ0.03,p 0.84 p 0.84p0.84而百分点变化与 8K 准确率强相关ρ − 0.77 \rho -0.77ρ−0.77,p 0.001 p 0.001p0.001。论文解释第二个相关性很大程度上由下限效应造成——8K 时准确率为 5% 的单元格不可能再掉 20 个点而保留率不受同样约束。结论是低绝对准确率与对额外历史的敏感性是两种不同的失效模式保留率才是能把它们区分开的度量。7错误构成。64K 下按问题子类型的错误构成如下图所示统计的是错误尝试型回答的构成排除拒答。错误归因只针对已承诺答案的错误响应在归因前排除错误的拒绝、空生成与中途截断的响应。在 64K、三种音频原生证据类型与 10 个完整跑完 64K 的系统上共 474 个可回答条目 × 10 个系统 4,740 次尝试其中 4,137 次被判为错误排除 1,595 条拒绝、167 条空生成与 162 条中断后剩余 2,213 条全部被归因。按操作看IE 错误以绑定/关联失败占 46%——模型恢复了某个声学线索却未能把它链接到正确上下文MSR 错误分裂为证据定位失败 48% 与操作执行失败 32%TET 错误压倒性地是定位失败55%而操作执行错误很少仅 5%说明追踪在推理开始之前就已崩溃。按证据类型看说话人错误多为绑定失败48%与跨会话维持嗓音—内容关联的失败一致副语言错误以定位失败63%为主说明答案关键的嗓音线索常常根本没有被检索到环境错误分裂为定位失败 41% 与无依据作答 39%。由此论文得出核心结论三种音频原生证据类型不是单一同质的难度——说话人记忆对跨会话关联尤为敏感而副语言与环境记忆更多在任何推理发生之前就已经失败。五、相关工作 / Related Work论文将相关工作置于两个维度上考察声学证据与记忆操作、以及从单会话到多会话口语记忆。在第一个维度上论文指出现有口语基准对声学证据与记忆操作两轴仅部分且临时地覆盖。SpokenWOZ、ContextDialog 只测说了什么的词汇内容AudioMarathon、LongSpeech、VoiceGiraffe、MTalk-Bench、Audio MultiChallenge、Vox-Infinity 覆盖少量选定的声学证据且只测检索与整合。其后果是这些基准主要评测对说了什么的记忆而非对音频的记忆而这种异构评测难以判定失败究竟源自某一证据类型例如词汇失败是否延伸到音频、某一记忆操作还是二者的交互。论文给出的对比如下IE information extractionMSR multi-session reasoningTET temporal evolution trackingAR answer refusalMono. 独白Dial. 对话Prov. 证据来源控制Benchmark答案关键声学证据记忆操作 IE/MSR/TET/ARProv.报告长度Type多会话AudioMarathon部分仅 IE✗90–300 sMono.✗LongSpeech部分仅 IE✗~10 minMono.✗VoiceGiraffe部分IE/MSR✗平均 55.2 minMono.✗SpokenWOZ✗IE/MSR✗—Dial.✗ContextDialog✗仅 IE✓—Dial.✗MTalk-Bench部分IE/MSR✗—Dial.✗Audio MultiChallenge部分MSR/TET✗8 minDial.✗Vox-Infinity部分IE/MSR✓~23 minDial./Mono.✗VoxMem本文完整IE/MSR/TET/AR✓2.5–20 minDial.✓可以看出VoxMem 是表中唯一在四个维度上全部满足的工作答案关键声学证据完整、四种记忆操作齐全、具备证据来源控制、且为多会话对话结构。既有工作普遍缺失 AR拒答与多会话仅 ContextDialog 与 Vox-Infinity 具备证据来源控制但其声学证据仍不完整。在长度上从 AudioMarathon 的 90–300 秒到 VoiceGiraffe 的平均 55.2 分钟不等VoxMem 每实例为 2.5–20 分钟对话式、多会话拼接历史。在第二个维度上论文指出口语助手是在时间上彼此分离的会话中与用户交互的期间说话人重复出现、先前状态被更新因此记忆必须在多会话历史上评测。而上表中的所有基准都用单个长录音或单段对话作为每个实例。长音频基准问的是对一段长录音的理解度量的是对给定音频的理解而非跨交互的保留对话基准则在单段连续对话内测回忆Audio MultiChallenge 为 3–8 轮。多会话历史带来的额外挑战在于它包含同一话题但细节不同的竞争会话与大量无关会话要求模型定位并绑定目标证据而不能依赖话题匹配。论文据此声称 VoxMem 是首个基于多会话历史的口语基准由证据、竞争、无关三类会话构成覆盖 20 个话题族且每个问题在不同上下文长度下保持固定以隔离历史长度的影响。六、局限性与展望 / Limitations Future Work论文本身没有独立的局限性章节但从正文、附录与实验设计中可以提炼出若干明确的设计约束与自陈的限制。其一IE × 语音语义被有意排除。因此分类覆盖 15 个而非 16 个评测场景30 条子类型路径中 IE 仅占 6 条。这一取舍的逻辑是避免退化为单会话的语义检索但代价是无法在该单元格内直接比较 IE 与 MSR/TET 的表现也使 4×4 矩阵的两个边缘不对称。其二历史表示形式为用户轮音频 助手轮文本。作者给出的理由是助手固定回复按设计不携带答案关键声学证据。但这同时意味着基准评测的是接受音频输入但不生成语音的 LALM且所有模型共享完全一致的文本化助手轮真实口语交互中助手语音本身也可能承载副语言或环境信息这一维度未被覆盖。其三AR 的可解释性陷阱作者自陈。拒答在副语言与环境上准确率反而更高34.3% / 34.2%这一模式提示模型弃答可能并非因为意识到证据缺失而是本就无法处理这些声学证据——即AR 分数可能被声学无能混淆而非真正的证据不足意识。这是基准在解释层面的一个重要保留。其四长度度量的代理性质。长度以 Whisper 编码器 token 计约 2.5–20 分钟音频这是一个为跨模型统一而设的代理尺度不代表任何具体模型在该条目上花多少 token。其五部分归因带有推测性。对副语言/环境上 TET 近乎崩溃3.4% / 1.2%的解释是可能反映当前 LALM 有状态建模能力有限属于推测性表述而非确证结论。其六构建过程对特定模型的依赖。问题生成与渲染依赖 Gemini-3.7-Flash 与 GPT-5.6-Luna全部质量控制依赖 Gemini-3.7-Flash已确保其不在被评模型之列且失败条目先修订、仍失败则丢弃。评判者交叉验证显示存在对 Gemini 家族约 0.88 pp 的偏袒论文明确指出该偏差虽小于结论所依赖的差距但足以影响 8K 下前三名彼此相差不到 0.9 pp 的排序解释。其七干扰难度的下界性质。用于验证文本不可分离性的 TF-IDF 逻辑回归探针仅达 51–56%对照 47–49% 的随机标签基线说明表层线索已被压到接近随机但这不排除存在更强的判别器。其八AR 条目相对稀缺。130 个通过验证的 AR 条目分布在 799 个问题上某些证据类型的 AR 条目数较少如说话人 21 条因此按证据类型细分的 AR 结论应谨慎解读。在展望方面论文的核心论断是仅支持更长的音频上下文不足以支撑持久的口语交互。未来系统必须主动保留非词汇声学信息并长期维持其与说话人、事件、会话之间的关联这意味着记忆系统的设计重点应从容纳更长历史转向维持证据与其绑定关系的稳定可检索性。分类法本身也为后续研究提供了一条扩展路径——可以在同一两轴框架内继续填充新的证据类型与操作子类型。七、总结 / ConclusionVoxMem 沿声学证据 × 记忆操作两条轴组织口语会话记忆评测覆盖 15 个评测场景与四种受控上下文长度。论文的出发点是三个可验证的缺口现有基准主要关注词汇内容、记忆操作有限且临时拼凑、并把记忆当作单会话问题。针对这三点论文提出有原则的分类法构建了 3,196 个实例、34,743 个会话、177 小时音频的基准并用受控的嵌套历史设计把历史长度从问题难度与证据类型中解耦出来。在 15 个大型音频语言模型上的系统评测揭示了结构化的失败图景。首先模型记住说了什么远好于谁说的“怎么说的以及环境里有什么声音”而且这一差距在更复杂的操作上扩大、随历史长度增长而加剧。其次只有在变化以词面陈述时模型才可靠追踪演变中的状态——语音语义上的时序追踪是最强单元格之一而同一操作作用于嗓音表达或环境声时几乎崩溃。再次随交互历史增长对先前可获得证据的访问持续退化但较弱的记忆类型并不必然更受上下文长度影响保留率与 8K 基线无关ρ 0.03 \rho 0.03ρ0.03而绝对下降幅度与基线强相关ρ − 0.77 \rho -0.77ρ−0.77后者主要来自下限效应。因此保留率是把能力弱与对长历史敏感区分开的关键度量。最具方法论意义的发现是记忆失败在性质上彼此不同。错误归因显示说话人身份的错误多来自把记住的信息归错人绑定失败占 48%副语言的错误更多反映根本未保留声学线索定位失败占 63%环境错误则同时包含定位失败与无依据作答而时序追踪的错误有 55% 发生在推理开始之前。这说明三类音频原生证据并非共享同一瓶颈改进策略也应当分而治之。此外拒答与作答两列的准确率近乎零相关ρ − 0.02 \rho -0.02ρ−0.02说明能从历史中作答与能识别出历史不支持作答是两种必须并列度量的能力副语言与环境上较高的拒答准确率更可能反映对声学信息的普遍无能而非真正的证据不足意识。综上论文的核心论断是可靠的口语会话记忆不能仅靠加长音频上下文来解决。VoxMem 的价值在于提供一个可度量、可归因、可对照扩展的评测框架把声学证据与记忆操作这两条轴上的缺口同时暴露出来从而推动未来系统在保留非词汇声学信息、并长期维持其与说话人、事件、会话之间稳定关联的方向上取得进展。原文摘要:Spoken conversational systems must recover information from prior interactions (i.e., memory), yet relevant information in speech extends beyond what was said to who said it, how it was spoken, and what was audible, information that exists only in the audio signal and cannot be recovered from a transcript. Beyond what to remember, memory also demands diverse operations: retrieving a single fact, integrating evidence across turns, tracking an evolving state. Real interactions further unfold across sessions, meaning information accumulates across distinct episodes rather than a single continuous recording. Existing benchmarks fall short on all three dimensions: they focus primarily on lexical content, adopt limited and ad hoc memory operations, and treat memory as a single-session problem. We argue that principled memory evaluation requires jointly characterizing the acoustic evidence to be retained and the operations applied to it, and introduce a taxonomy along these two axes. Building on this taxonomy, we present VoxMem: 3,196 evaluation instances over 34,743 spoken sessions (177 hours) crossing four acoustic evidence types (speech semantics, speaker identity, paralinguistic cues, environmental sound) with four memory operations (information extraction, multi-session reasoning, temporal tracking, and answer refusal), grounded in multi-session histories and stratified across context budgets from 8K to 64K tokens. Evaluating 15 LALMs, no model exceeds 40% at 32K. Models retain what was said far better than who said it, how, or what was audible, a gap that widens for complex operations, grows with history length, and manifests as qualitatively distinct failure modes across evidence types. VoxMem aims to provide a foundation to measure and drive progress on the full scope of spoken conversational memory.PDF链接:https://arxiv.org/pdf/2609.32607v1部分平台可能图片显示异常请以我的博客内容为准