Multimodal-Sentiment-Analysis:BERT+ResNet50 五种融合方法,多模态情感分析怎么挑

📅 2026/8/22 20:29:39
Multimodal-Sentiment-Analysis:BERT+ResNet50 五种融合方法,多模态情感分析怎么挑
Multimodal-Sentiment-AnalysisBERTResNet50 五种融合方法多模态情感分析怎么挑【免费下载链接】Multimodal-Sentiment-Analysis多模态情感分析——基于BERTResNet的多种融合方法项目地址: https://gitcode.com/gh_mirrors/mu/Multimodal-Sentiment-Analysis一条图文并发的帖子情绪往往藏在图文搭配里。Multimodal-Sentiment-Analysis 基于 BERT 与 ResNet50 构建了一条多模态情感分析流水线把从简单拼接到 Transformer Encoder 的五种融合方法打包成一组命令行参数训练与对比一次跑完。为什么单靠文本判不准情绪商品评价文字写东西确实不错配图却是一堆吐槽帖子正文只有一句话情绪全在图里。只用文本训练的模型看不到图像信号只靠图像特征又难定位情绪来源。这个项目的消融数据很直白同一数据集上纯文本输入准确率 71.875%纯图像只有 63%两者融合后升到 74.625%——这个差距就是融合的价值。三步跑通训练流程git clone https://gitcode.com/gh_mirrors/mu/Multimodal-Sentiment-Analysis cd Multimodal-Sentiment-Analysis pip install -r requirements.txt python main.py --do_train --epoch 10 --text_pretrained_model roberta-base --fuse_model_type OTE数据集按 README 指引准备后解压到data/目录即可。每轮训练自动保存验证准确率最高的模型训完加--do_test和--load_model_path即可出预测结果写入output/test.txt。五种融合模型怎么选NaiveCat / NaiveCombine两种基线把图文特征拼接后直接接线性层。适合做对比下界先跑它们确认数据管道没问题。CMAC交叉注意力两路特征做 cross-attention结构最复杂消融里反而得分最低67.1875选型时可优先排除。HSTEC用文本编码器各层隐藏状态参与融合准确率 73.125%居中水平。OTEOutputTransformerEncoder消融实验中准确率最高的方案74.625%。五个模型的源码在 Models/ 一文件一模型切换只改--fuse_model_type一个参数。文本侧模型可换 Hugging Face 库里任意文本模型图像侧固定 ResNet50是否冻结其参数在 Config.py 里勾选即可算力有限时建议先冻结。Transformer Encoder 方案为什么赢OTE 不做交叉注意力而是把 BERT 与 ResNet50 的输出特征拼成一个序列过一层 Transformer Encoder 再进全连接分类结构如下也是消融实验得分最高的一条。HSTEC 思路相同只是把输入换成文本编码器的隐藏状态完整结构见下图。反直觉的一点是 CMAC注意力机制用得最多的交叉注意力方案分数垫底说明多模态融合不是注意力越多越好。仓库结构很干净编码、解码、评估拆分在 utils/APIs/ 下五个融合模型与 Models/ 中五个文件一一对应改个参数重跑一遍就能对比出新结果。【免费下载链接】Multimodal-Sentiment-Analysis多模态情感分析——基于BERTResNet的多种融合方法项目地址: https://gitcode.com/gh_mirrors/mu/Multimodal-Sentiment-Analysis创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考