UCMR-Net

📅 2026/7/30 11:16:16
UCMR-Net
1、研究思路UCMR-Net 承认 MOSI、MOSEI 中文本通常是主要情感依据因此不再追求三种模态完全对称地融合而是先让文本独立形成基本情感判断再把音频和视觉作为“残差修正量”只对文本预测进行有限、动态的补充。它的核心信息流可以概括为文本主干表示 经过动态权重控制的 A/V 残差修正 → 最终情感强度预测。2、研究方法该模型使用上下文语言表征作为主要的语义骨干并引入音频和视觉流作为自适应的残差修正信号。模型通过学习一个残差可靠性分数来调节非语言模态的贡献同时利用反事实的缺失模态蒸馏和多任务监督来提供辅助约束以增强预测的稳定性和极性判别能力。以完整模态融合为主任务、附带缺失模态鲁棒训练的模型。 它的核心创新公式是hi^Fhi^Tωi^r ri^AV研究重点是如何用 A/V 残差修正文本表示。论文的主结果也是完整 TAV 条件下的 MOSI 情感强度预测最主要的贡献和显著性检验都围绕完整模态 MAE、RMSE 和 Corr 展开。特色创新模块动态更新权重权重跟新路径是L→y^→hF→ωr→gT,gr假设某条样本中 A/V 残差有助于降低回归误差。为了进一步降低损失梯度会倾向于降低 ur或提高相对文本风险 uT最终增大 ωr模型实际学到的是哪种权重能够让最终任务损失更小。而不是先学出一个独立可靠性再把可靠性用于融合。几乎所有训练损失都会影响这个权重Smooth L1残差是否降低逐样本预测误差CCC残差是否改善整体数值一致性Pearson loss残差是否改善预测趋势Binary loss残差是否改善正负极性Ordinal loss残差是否改善强度等级Distillation loss模态缺失后残差门控能否维持稳定预测。这个模块的核心不足是没有可靠性真值或明确监督目标。它可能学到的是可靠性也可能只是常规的样本级融合偏好。监督机制UCMR-Net 同时设置三个预测头连续情感强度回归正负极性二分类五级有序情感强度分类。LtotalLmainλLdistillμ(LbinLord)其中主回归损失又由 Smooth L1、CCC loss 和 Pearson correlation loss 组成。二分类任务帮助模型保持正负极性边界有序分类任务帮助模型区分不同情感强度。训练分为两个阶段第一阶段冻结 BERT缺失率设为 0.25蒸馏权重为 0.10先训练融合部分第二阶段部分解冻 BERT缺失率降至 0.10蒸馏权重降至 0.05再整体微调。这个训练方案的目的是避免 MOSI 小数据集上 BERT 过早主导训练使新增残差分支先获得相对稳定的学习空间。教师模型和学生模型分别是什么所谓“教师”和“学生”实际上是**同一个 UCMR-Net 的两次前向传播**。完整模态路径 (T,A,V)→y^full缺失模态路径 T,0,V)→y^miss论文采用预测值之间的平方距离完整路径被概念性地视为教师缺失路径被视为学生但二者 使用相同编码器 使用相同残差融合模块 使用相同预测头 共享全部模型参数。 因此这不是传统意义上的“先训练一个教师模型再训练另一个学生模型”而更像是共享参数的自蒸馏或一致性正则化。 例如完整输入预测为 y ^full1.6 删除音频后的预测为y^miss0.8那么蒸馏损失会推动缺失路径的预测向 1.6 靠近。 它监督的是**最终预测一致性**;两阶段冻结训练第一阶段共训练 15 个 epoch冻结 BERT 缺失率设为 0.25 蒸馏权重设为 0.10 主要训练 A/V 编码器、残差融合、门控网络和预测头。第二阶段共训练 35 个 epoch 部分解冻 BERT 缺失率降到 0.10 蒸馏权重降到 0.05 在已经相对稳定的融合结构上微调文本表示和最终预测。它的训练思想是 先别让强大的 BERT 一开始就吞掉全部优化空间先让新加入的 A/V 残差分支、门控和缺失路径学会工作之后再微调文本主干。论文自己也说第一阶段用于稳定多模态融合和缺失模态学习第二阶段用于微调语义主干、改善最终预测。它既服务于缺失训练也服务于 MOSI 小样本下的稳定性。以后针对mosi的数据训练我可以借鉴他的bert双阶段训练方式。MOSI 训练集只有 1284 个样本而 BERT-base 参数量很大。若一开始就让 BERT 和随机初始化的 A/V 编码器、融合模块一起更新容易出现两种情况。第一强大的文本分支很快降低训练损失新增 A/V 模块还没学会工作模型就已经走向“只靠文本”的局部最优。第二MOSI 样本较少BERT 全量微调容易产生较大的随机种子波动甚至出现训练集继续改善、验证集迅速恶化的情况。 双阶段训练相当于先固定一个稳定的文本语义坐标系让新增模块先学会怎样编码 A/V 怎样与文本交互 怎样产生有价值的补充 怎样控制门控或残差权重。等这些模块基本稳定以后再用较小学习率调整 BERT使文本表示适应最终融合任务。因此它不仅适合 UCMR-Net也适合 ALMT、DLF 改造版、门控融合、残差融合以及一般的 BERT-based MSA 模型。冻结 BERT 5—10 epoch → 解冻顶部 2—4 层 → BERT 使用小学习率新融合模块使用较大学习率 → 验证集 MAE 早停 → 五随机种子报告。它具体怎样处理缺失模态1、先定义模态可用性掩码 每个样本都有一个三维 maskmi(miT,miA,miV)∈{0,1}^3Mask实际输入(1,1,1)TAV 完整模态(1,0,1)缺失音频(1,1,0)缺失视觉(0,1,1)缺失文本(1,0,0)仅文本按照 Figure 6三种模态先获得编码表示2、缺失模态使用零向量占位按照 Figure 6三种模态先获得编码表示 hi^T, hi^A, hi^V若音频缺失则送入融合模块的是 hi^T, 0, hi^V若视觉缺失则是 hi^T, hi^A, 0如果只剩文本则是 hi^T, 0, 0固定输入槽仍然是 T、A、V 三个因此同一个残差融合网络不需要因为不同缺失组合而改变结构 这就是“同一个融合网络能够接受不同模态组合”的具体含义。3、它不猜测被删除的模态假设音频缺失生成式恢复方法可能会做 TV→A^ 然后把生成的音频特征 A^ 重新用于融合 。UCMR-Net 不这样做。它直接使用 T0V→y^ 所以它没有回答“缺失音频原来是什么”而是回答既然现在没有音频我怎样利用剩下的 T 和 V 做出尽可能稳定的预测论文明确说明没有独立的 generative decoder而是使用 unavailable-stream masking、zero-filled placeholders 和 counterfactual distillation4、训练时再加入完整—缺失一致性仅仅零填充并不能让模型自动学会缺失鲁棒性所以作者对同一样本构造(T,A,V)→y^full (T,0,V)→y^miss再要求二者接近。完整逻辑是随机制造缺失零向量占位共享网络预测完整—缺失一致性约束​推理阶段则不需要完整教师路径也不计算蒸馏损失。只需要提供当前的可用模态、mask 和零占位表示即可。数据集表现在 MOSEI 的标准训练和测试条件下UCMR-Net 报告 MAE 0.548、Corr 0.792优于作者比较的 BERT-only、MAG-BERT、MISA、TFR-Net 和 MissModal。但这里每种模型只报告了一个固定模型实例没有进行 MOSI 那样的五随机种子验证。因此MOSEI 结果可以作为外部验证却不能提供同等强度的稳定性证据。MOSI 训练、MOSEI 测试时UCMR-Net 的 MAE 上升至 0.760Corr 下降到 0.632。这说明残差融合思路具有一定迁移能力但跨数据集分布偏移仍然明显。缺失模态实验消融实验真正起作用的是什么删除组件MAE 增加文本锚定0.098残差融合0.040全部多任务监督0.028自适应残差权重0.026反事实蒸馏0.020有序分类监督0.014二分类监督0.010这说明论文效果主要来自两个结构性设计第一文本被保留为主路径第二A/V 以残差形式参与。自适应权重、蒸馏和多任务损失确实有贡献但都属于二级稳定组件而不是决定性创新。其他论文题目UCMR-Net: Text-Anchored Residual Fusion with Adaptive Residual Weighting for Multimodal Sentiment Intensity Prediction作者与团队Daoyun Tang、Gulshat Amirkhanova 和 Yanwei Fu。前两位作者来自哈萨克斯坦阿里-法拉比国立大学信息技术与人工智能学院Yanwei Fu 来自复旦大学数据科学学院。发表年份2026 年7 月 16 日正式发表。发表平台MDPI 旗下期刊Applied Sciences第 16 卷文章编号 7142。代码情况论文声明提供了匿名代码仓库包含 UCMR-Net、复现实验配置、五随机种子训练、消融、缺失模态、校准和迁移实验。不过论文目前给出的仍是匿名审稿式仓库地址不能完全等同于长期维护的正式 GitHub 项目两种融合范式1、ALMTL,A,V→各模态编码→L逐层筛选A,V→Hhyper→L与Hhyper融合音频和视觉较早进入模型并在多个层次参与联合表示的形成。最终表示很难再明确分解成“文本部分”和“A/V 增量部分”。属于语言引导的交互式联合表示学习。2、UCMR-Net基准预测上的残差修正L→h^TL,A,V→r^AVh^Fh^Tω^rr^AV属于文本锚定的增量修正式融合。即最终判断文本能够完成的判断非语言信息提供的额外修正所以你可以把当前常见的语言中心融合粗略分成逐层注入范式A/V 多次进入文本表示如 ALMT残差修正范式文本保留主路径A/V 只预测增量如 UCMR-Net动态主导范式每个样本重新选择主导模态如 KuDA 一类工作。反事实蒸馏反事实蒸馏强迫模型在“缺失某些模态”的情况下做出的预测尽可能接近它在“所有模态齐全”时做出的预测。1教师模型模型使用完整的输入文本 音频 视觉进行前向传播得到一个预测结果。这被视为“标准答案”或“软标签”。2学生模型模型人为地模拟模态缺失例如将音频或视觉特征置零或替换为占位符使用残缺的输入进行前向传播。3蒸馏过程通过计算两者预测结果之间的距离文档中使用 L2 损失强迫学生路径去模仿教师路径的输出。叫“反事实”是因为:“事实”是模态齐全而“反事实”是假设某个模态如音频不存在。模型通过这种训练学习到了“即使没有音频我也应该像有音频一样去思考”的能力。这种机制的主要目的是减少因模态不可用而导致的预测漂移Prediction Drift。