当地震发生时,最初几个小时的信息不是来自官方网络,而是来自陷入混乱的普通民众的手机。社交媒体平台,尤其是 X(以前称为 Twitter),充斥着目击者的描述、被毁建筑物的照片、求助请求,以及不可避免的噪音和错误信息。对于紧急响应,挑战是将信号与大量数据充分分离。约旦科技大学的 Rana Alessa、Alia Madain 和 Ahmed Alzoubi 在《多媒体工具和应用程序》上发表的一项新研究正是解决了这个问题,提出了一种深度学习框架,通过结合人们书写和拍摄的内容对与地震相关的推文进行分类。该框架对世界上两次最具破坏性的地震的数据实现了约 88% 的准确率,使其成为这些基准报告中最高的方法之一。
这项研究解决了多年来困扰灾难信息学研究人员的一个问题:大多数自动化系统仅依靠文本来分析社交媒体相关内容。然而,在重大地震事件发生后,推文通常是多模态的,将简短且通常含糊的消息与包含重要上下文信息的图像结合起来。一条简单地写着“我们很好,alhamdulillah”的推文意味着一件事,而当配上一张荒凉街道的照片时,则意味着完全不同的事情。在不访问图像的情况下对文本进行分类可能会完全误判情况。因此,想要确定需求、确定损失并提供资源的人道主义组织需要能够同时真正理解这两种沟通渠道的系统。
为了构建这样的系统,该团队设计了一个具有两个并行分支的多模态预测架构,这两个分支最终将组合成一个共享的判别性表示。在文本方面,该模型捕获推文中的上下文依赖关系,并本质上学习短消息序列中单词如何相互关联,本着循环架构的精神,例如 Hochreiter 和 Schmidhuber 于 1997 年首次引入的短期记忆网络,该网络仍然是顺序文本建模的基础。在图像方面,深度卷积神经网络(源自 Krizhevsky、Sutskever 和 Hinton 的开创性 AlexNet 架构的现代计算机视觉功能)从嵌入图像中提取高级语义特征,并学习与损坏、救援行动、基础设施和人类存在相关的视觉图像。
综合阶段是框架发挥作用的阶段。该架构没有结合两个分支的原始结果,而是将上下文文本表示与语义图像特征结合起来,以便每种模态补偿另一种模态的模糊性。由此产生的联合表示比任何单独的流提供更多信息,作者报告说,与单模态性能相比,这种组合在数量上改进了分类。实际上,系统可以查看一条推文,并确定它是否属于对灾难响应有用的类别,例如来自垃圾邮件聊天的新闻报道或来自没有操作价值的场景中受损基础设施的图像。
该评估是在 CrisisMMD 上进行的,这是一个由卡塔尔计算研究所的研究人员创建的公开多模态数据库,作者在论文中承认了这一点。 CrisisMMD 包含从真实自然事件中收集的成对推文文本和相关图像,使其成为少数可以使用真实危机通信而不是实验室示例来训练和测试算法的基准之一。在这项研究中,该团队重点关注与地震相关的数据,并分析了墨西哥地震和伊拉克-伊朗地震这两个灾难性事件的 2,743 个文本和图像对的子集。这两起事件都产生了大量的媒体活动,并为分类系统提供了丰富而现实的基础。
评估方法的严谨性值得关注。作者使用一整套标准指标来评估性能:精确度、准确度、召回率和 F1 分数,每个指标都捕获了分类行为的不同方面。准确度衡量的是整体准确度,但精确度和召回率显示了模型处理漏检误报的能力,处理灾难响应的现实后果,其中错过的紧急信号可能导致生命损失,而大量的误报可能会让响应者不知所措并降低对系统的信心。 F1 计算(精度和召回率的调和平均值)将这种平衡总结为一个数字。该团队还使用了 k 层验证,将数据划分为多个子集,以便每个样本都用于训练和测试,从而更可靠地估计模型对未见过的推文的泛化程度,并且他们通过统计显着性测试完善了指标,以确认观察到的性能差异不是随机工件。
结果的一致性令人惊讶。所提出的框架在墨西哥地震数据集和伊拉克-伊朗地震数据集上均达到了约 88% 的准确率,这表明该模型学习的图像不仅适应单个事件的特征,而且还包括地理和文化灾难之间不同的特征。事件之间的稳定性对于任何为部署而设计的系统都很重要,因为下一次地震将不可避免地产生与训练数据系统不同的词汇、图像和通信方式。当作者将他们的框架与之前研究中报告的深度学习模型进行比较时,他们的方法成为多模式危机分类文献中最先进的研究之一。
该研究处于快速发展的研究领域。之前的工作探索了多模态灾难推文分类的不同策略,从用于损害评估的朴素支持向量机到基于变压器和交叉注意力架构(例如 CAMM 框架)的最新双向注意力模型,该模型清楚地整合了文本和视觉图像。对比学习方法也已应用于与危机相关的推文,激励模型学习语义相似的文本和图像对组合在一起的表示。在这种情况下,Jordan 团队的贡献在于,在视觉和文本信号比其他类型的异质性噪声更大的领域中,精心设计的上下文文本依赖性和卷积提取语义的组合可以匹配或超过地震数据上更复杂的架构的性能。
其影响超出了学术排行榜的范围。地震是最致命的自然灾害之一,过去十年发生了从澳大利亚地震到 2023 年土耳其和叙利亚地震等灾难性事件,造成数万人死亡,促使人们迫切呼吁在减灾方面加强国际合作。在这种情况下,被毁建筑物、幸存者和不堪重负的医院的第一个数字证据通常会在官方评估开始前几分钟出现在社交媒体上。本研究开发的系统可以提供自动化管道,突出人道主义组织的优先内容,帮助他们指导搜索和救援团队、绘制受损情况图,并反击不可避免地与真实报告一起传播的错误信息。
从指示到部署的道路并非没有障碍,作者的工作阐明了其中的一些障碍。灾难期间的社交媒体信息很混乱:图像可能质量低下或重复,文本可能混合语言,讽刺和俚语无法进行简单分析,即使对于人类评论员来说,信息性内容和非信息性内容之间的界限也往往非常模糊。作者选择根据真实的 CrisisMMD 数据而不是策划或合成样本进行评估,这意味着他们报告的准确性反映了这些现实条件下的表现,增强了对该方法实际可行性的信心。与此同时,地震数据集的样本规模仍停留在几千个,此类系统的规模需要对多模态地震解释数据的持续投资。
该数据集本身可以通过卡塔尔计算机研究所托管的 CrisisNLP 门户访问,从而减少了其他研究小组复制、扩展或挑战结果的障碍。该研究没有获得外部资助,作者报告没有竞争利益。所有三名研究人员均隶属于约旦伊尔比德约旦科技大学计算机科学系,Rana Alessa 在那里进行了实验,所有作者都对研究设计、分析和最终手稿做出了贡献。
随着气候压力和城市化使越来越多的人生活在地震活跃地区,对自然灾害情况立即可靠预警的需求只会增加。这项研究提供了技术上合理的证明,表明深度学习可以将文本和视觉媒体流链接成地震紧急情况的连贯图片,其准确性足以具有操作意义。将几千条推文和照片组合成一张机器可读的危机地图,有一天可能会像地震仪本身一样成为地震响应的常规部分,让未来更加接近。
研究课题: 对地震相关推文进行多模态深度学习分类,结合文本和图像分析进行灾难响应
研究课题: 技术与工程
文章标题: 基于学习的多模态地震相关推文的深度分类
文章摘录: 阿莱莎,R.,马达因,A.,阿尔祖比,A. (2026)。基于学习的多模态地震相关推文的深度分类。多媒体工具和应用程序,85(9),第 723 条。
图片来源: 人工智能生成
数字编号: 10.1007 / s11042-026-21887-2
关键词: 多模态、深度学习、危机MMD、地震、灾难推文、社交媒体分类、文本图像融合、卷积神经网络、灾难响应
引用新闻 Scienmag
亚太地区协会
MLA
芝加哥
布莱克·戴维森. (2026 年 9 月 7 日)。深度学习对多模态地震相关推文进行分类。科学杂志。
布莱克·戴维森. “深度学习对与地震相关的多模式推文进行分类。” Scienmag,2026 年 9 月 7 日,。访问日期:2026 年 9 月 7 日。
布莱克·戴维森. “深度学习对与地震相关的多模式推文进行分类。”科学杂志。 2026 年 9 月 7 日。
复制报价
下载RIS
标签: 基于人工智能的灾害沟通工具 危机信息学 危机信息学和社交媒体 危机管理的深度学习 灾难响应的深度学习 使用Twitter数据进行地震事件检测 地震信息挖掘 地震相关推文 地震相关推文的分类 自然灾害的目击者报告 灾害通信中的图像和文本学习 地震事件监测的机器学习 灾害检测的多元数据融合 危机管理中的多元数据处理 多学科灾害响应 真实世界地震数据分析灾害紧急情况下的社交媒体地震数据分析