清华大学学报(自然科学版)

北大核心,CA,INSPEC,JST,EI

国内刊号:11-2223/N

国际刊号:1000-0054

清华大学学报(自然科学版)杂志2022年第5期:利用图像描述与知识图谱增强表示的视觉问答

发布日期:

作者:王屹超, 朱慕华, 许晨, 张琰, 王会珍, 朱靖波

单位:东北大学 计算机科学与工程学院, 自然语言处理实验室, 沈阳 110000

关键词:视觉问答,多模态融合,知识图谱,图像描述

基金:国家自然科学基金重点项目(61732005);国家自然科学基金面上项目(61876035)\r\n

视觉问答作为多模态任务,需要深度理解图像和文本问题从而推理出答案。然而在许多情况下,仅在图像和问题上进行简单推理难以得到正确的答案,事实上还有其他有效的信息如图像描述、外部知识等可以被利用。该文提出了利用图像描述和外部知识增强表示的视觉问答模型。该模型以问题为导向,基于协同注意力机制分别在图像和其描述上进行编码,并且利用知识图谱嵌入,将外部知识编码到模型当中,丰富了模型的特征表示,增强了模型的推理能力。在OKVQA数据集上的实验结果表明,该方法相比基线方法有1.71%的准确率提升,与已有的主流模型相比也有1.88%的准确率提升,证明了该方法的有效性。

来源:2022年第5期

《清华大学学报(自然科学版)》期刊编辑部

查看清华大学学报(自然科学版)杂志2022年第5期

声明

严正声明:本站非期刊官网,非中介代理。

本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。

联系我们

  • 地址:清华大学东门外学研大厦B座605A室
  • 电话:010-62788108
  • E-mail:xuebaost@tsinghua.edu.cn

咨询工作人员