清华大学学报(自然科学版)

北大核心,CA,INSPEC,JST,EI

国内刊号:11-2223/N

国际刊号:1000-0054

清华大学学报(自然科学版)杂志2024年第4期:基于部分标注的自训练多标签文本分类框架

发布日期:

作者:任俊飞, 朱桐, 陈文亮

单位:苏州大学 计算机科学与技术学院, 苏州 215006

关键词:多标签文本分类,不完全标注,自训练

基金:国家自然科学基金重点联合项目(61936010)

多标签文本分类(multi-label text classification, MLTC)旨在从预定义的候选标签中选择一个或多个文本相关的类别, 是自然语言处理(natural language processing, NLP)的一项基本任务。 前人工作大多基于规范且全面的标注数据集, 而这些规范数据集需要严格的质量控制, 一般很难获取。 在真实的标注过程中, 难免会缺失标注一些相关标签, 进而导致不完全标注问题。 该文提出了一种基于部分标注的自训练多标签文本分类(partial labeling self-training for multi-label text classification, PST)框架, 该框架利用教师模型自动地给大规模无标注数据分配标签, 同时给不完全标注数据补充缺失标签, 最后再利用这些数据反向更新教师模型。 在合成数据集和真实数据集上的实验表明, PST框架兼容现有的各类多标签文本分类模型, 并且可以缓解不完全标注数据对模型的影响。

来源:2024年第4期

《清华大学学报(自然科学版)》期刊编辑部

查看清华大学学报(自然科学版)杂志2024年第4期

声明

严正声明:本站非期刊官网,非中介代理。

本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。

联系我们

  • 地址:清华大学东门外学研大厦B座605A室
  • 电话:010-62788108
  • E-mail:xuebaost@tsinghua.edu.cn

咨询工作人员