声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:11-2223/N
国际刊号:1000-0054
发布日期:
作者:任俊飞, 朱桐, 陈文亮
单位:苏州大学 计算机科学与技术学院, 苏州 215006
关键词:多标签文本分类,不完全标注,自训练
基金:国家自然科学基金重点联合项目(61936010)
多标签文本分类(multi-label text classification, MLTC)旨在从预定义的候选标签中选择一个或多个文本相关的类别, 是自然语言处理(natural language processing, NLP)的一项基本任务。 前人工作大多基于规范且全面的标注数据集, 而这些规范数据集需要严格的质量控制, 一般很难获取。 在真实的标注过程中, 难免会缺失标注一些相关标签, 进而导致不完全标注问题。 该文提出了一种基于部分标注的自训练多标签文本分类(partial labeling self-training for multi-label text classification, PST)框架, 该框架利用教师模型自动地给大规模无标注数据分配标签, 同时给不完全标注数据补充缺失标签, 最后再利用这些数据反向更新教师模型。 在合成数据集和真实数据集上的实验表明, PST框架兼容现有的各类多标签文本分类模型, 并且可以缓解不完全标注数据对模型的影响。
来源:2024年第4期
《清华大学学报(自然科学版)》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。