摘要:提高模型对特征噪声的鲁棒性已经成为多模态情感分析(multimodal sentiment analysis, MSA)领域最具挑战性的任务之一, 最近的研究已经提出了考虑缺失模态的高效MSA模型. 然而, 现有方法通常只关注特定类型的缺陷, 导致在同时存在多种类型噪声的实际场景中模型鲁棒性和泛化性弱, 而且现有研究忽略了不同模态之间的深层交互, 难以全面理解多模态情感信息. 针对这些问题, 提出一种融合对抗学习与多视图网络的鲁棒多模态情感分析网络(robust multimodal sentiment analysis integrating adversarial learning and multi-view network, ALMV). 具体而言, 首先使用时间模态特征缺失作为噪声数据, 与完整序列构成噪声-原始实例对以构建增强数据. 其次, 通过时间卷积和Transformer编码器提取噪声-原始实例对中每个模态序列的局部信息和全局信息, 并构建权重调控的多视图网络来学习噪声-原始实例对之间的多模态联合表示. 然后, 提出一种具有语义重建监督的多重对抗训练策略, 在模态级和话语级两个层面学习噪声和完整数据之间的统一联合表征. 最后, 在公开数据集上进行了大量实验, 对多种类型噪声场景下ALMV的性能进行测试. 实验结果证明, ALMV方法有效地提升了多模态情感分析在多种异构数据缺陷场景下的性能和鲁棒性.