清华大学学报(自然科学版)

北大核心,CA,INSPEC,JST,EI

国内刊号:11-2223/N

国际刊号:1000-0054

清华大学学报(自然科学版)杂志2024年第10期:多模态信息增强表示的中文关键词抽取方法

发布日期:

作者:周炫余, 刘林, 卢笑, 李璇, 张思敏

单位:1. 湖南师范大学 基础教育大数据研究与应用重点实验室, 长沙 410006;<br>2. 湖南师范大学 工程与设计学院, 长沙 410006

关键词:中文关键词抽取,多模态信息,多粒度语义特征,交叉注意力机制,领域自适应

基金:国家自然科学基金青年科学基金项目(62007007);湖南省自然科学基金面上项目(2023JJ30415, 2022JJ30395);湖南省研究生科研创新项目(CX20230485)

关键词抽取是指能自动抽取反映文本主题的词或者短语, 被广泛应用于文本检索、 文本摘要等领域中。目前关键词抽取任务主要依赖于预训练语言模型来获取文本表示, 这类语言模型主要基于单一模态的通用文本语料进行训练, 存在无法根据下游任务特性进行领域适配和语义表征能力有限的问题。该文提出一种多模态信息增强表示的中文关键词抽取方法MIEnhance-KPE, 首先引入Adapter层将偏旁和部首信息集成到预训练语言模型层中, 得到领域自适应的文本表示; 其次利用卷积神经网络提取汉字的图像特征, 同时使用交叉注意力机制融合汉字图像特征和文本特征, 实现文本语义表示增强; 最后利用条件随机场(conditional random field, CRF)模型进行序列标注任务, 并计算词语的位置-词频权重对其进行排序获得关键词。与目前十分先进的关键词抽取方法KIEMP相比, MIEnhance-KPE在公开的中文科学文献数据集和自构建的中文教育关键词抽取数据集上的F值分别提升了15.71%和3.40%; 消融实验结果表明, 所提出的领域自适应模块和视觉语义增强表示模块均能有效提高关键词抽取的准确性。MIEnhance-KPE的提出有助于教育研究者精准了解教育发展趋势, 促进教育理论和实践的创新。

来源:2024年第10期

《清华大学学报(自然科学版)》期刊编辑部

查看清华大学学报(自然科学版)杂志2024年第10期

声明

严正声明:本站非期刊官网,非中介代理。

本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。

联系我们

  • 地址:清华大学东门外学研大厦B座605A室
  • 电话:010-62788108
  • E-mail:xuebaost@tsinghua.edu.cn

咨询工作人员