SAE:一种多模态情感分析大语言模型

生成式AI(文本、图像、音乐、视频)环境感知与上下文计算软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师

当前多模态情感分析模型在捕捉跨模态信息(尤其是语音模态)中的微妙情感变化和长期情感趋势方面存在挑战。为解决这些挑战,提出了一种端到端的多模态情感分析模型,称为情感分析引擎(SAE)。SAE整合了视频、音频和文本信息,利用DeepSpeech和LSTM网络将语音转换为文本向量,通过EmoVoiceAnalyzer(EVA)模块提取语音情感特征,采用ResNet-50网络进行时间建模以提取视觉特征,并通过多尺度高效通道空间注意力(MECS)机制增强对微表情细节的敏感性。为实现高效多模态融合,采用自注意力机制生成描述性文本并执行深度情感分析。实验结果表明,SAE在NExT-QA测试中排名第一,在CMU-MOSI数据集的2-7类情感识别任务和IEMOCAP测试中F1分数分别达到91.14和86.5,领先于其他SOTA模型。此外,消融实验表明去除EVA模块后分类准确率平均下降5%,证实了语音组件对提升情感分析精度的关键作用。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/195852/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712106
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、环境感知与上下文计算
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
4 篇相关论文