清华大学学报(自然科学版)

北大核心,CA,INSPEC,JST,EI

国内刊号:11-2223/N

国际刊号:1000-0054

清华大学学报(自然科学版)杂志2024年第12期:基于攻击引导扩散的中文对抗样本生成方法

发布日期:

作者:吴厚月, 李现伟, 张顺香, 朱洪浩, 王婷

单位:1. 蚌埠学院 计算机与信息工程学院, 蚌埠 233030;<br>2. 安徽工业大学 安徽省工业互联网智能应用与安全工程研究中心, 马鞍山 243032;<br>3. 安徽理工大学 计算机科学与工程学院, 淮南 232000;<br>4. 合肥综合性国家科学中心 人工智能研究院, 合肥 240088;<br>5. 淮南联合大学 信息工程学院, 淮南 232000

关键词:对抗样本生成,引导扩散,条件扩散,扩散模型,文本生成

基金:国家自然科学基金面上项目(62076006);认知智能全国重点实验室开放课题(COGOS-2023HE02);安徽省高校协同创新项目(GXXT-2021-008);安徽省高校自然科学研究重点项目(2022AH051921,2022AH051909);安徽省高校优秀青年人才支持计划重点项目(gxyqZD2021135);蚌埠学院高层次人才科研启动基金(BBXY2020KYQD02);安徽工业大学工程研究中心开放项目(IASII22-08);蚌埠学院2024年校级科研一般项目(2024ZR02,20

中文对抗样本生成作为自然语言处理领域的重要研究内容,一直受到众多学者的广泛关注。先前的中文对抗样本生成方法主要有替换字词、改变词序等,生成的对抗样本攻击效果差且容易被检测模型识别。该文提出基于攻击引导扩散的中文对抗样本生成方法DiffuAdv。将扩散模型引入中文对抗样本生成中,通过模拟文本对抗样本攻击时的数据分布来增强其扩散机制,利用对抗样本与原始样本之间的变化梯度作为引导条件,在预训练阶段指导模型的逆扩散过程,进而生成更自然且攻击成功率更高的对抗样本。在多个数据集上对自然语言处理领域的不同任务与多种方法进行了对比实验验证。结果表明,本文方法所生成的对抗样本具有高攻击成功率。此外,消融实验也验证了攻击梯度引导在提高对抗样本生成质量的有效性。经过困惑度(PPL)度量实验,本文方法所生成的对抗样本平均PPL仅为0.518,验证了其具有强鲁棒性。DiffuAdv的提出丰富了文本对抗样本生成的研究视角,也拓宽了文本情感分类、因果关系抽取及情感原因对抽取等任务的研究思路。

来源:2024年第12期

《清华大学学报(自然科学版)》期刊编辑部

查看清华大学学报(自然科学版)杂志2024年第12期

声明

严正声明:本站非期刊官网,非中介代理。

本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。

联系我们

  • 地址:清华大学东门外学研大厦B座605A室
  • 电话:010-62788108
  • E-mail:xuebaost@tsinghua.edu.cn

咨询工作人员