声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:11-2223/N
国际刊号:1000-0054
发布日期:
作者:于金泽, 刘燕雯, 陈永泉, 李硕, 孙庆赟, 周号益, 李建欣
单位:1. 北京航空航天大学 大数据科学与脑机智能研究中心, 北京 100191,2. 北京航空航天大学 计算机学院, 北京 100191,3. 北京航空航天大学 软件学院, 北京 100191
关键词:深度学习,视觉-语言模型,模型泛化,混合专家模型,病理图像分类
基金:国家自然科学基金杰出青年科学基金项目(62225202)
基于大规模跨模态对齐预训练的视觉-语言模型如图像-文本对比学习预训练(contrastive language-image pretraining, CLIP)模型通过建立图像与文本之间的关联, 实现了提示文本驱动的零样本分类, 但其在下游任务中的泛化性仍受到预训练与目标数据之间分布差异及知识边界影响, 尤其在医学图像分析等专业领域表现出显著的模型适配性差异。针对现有工作集中于单模型微调、未充分利用异构预训练模型互补性的问题, 该文针对病理图像分类任务, 提出了在图像特征层面集成多个异构CLIP预训练模型的混合CLIP专家(mix-of-CLIP-experts, MoCE)模型。为解决不同CLIP模型特征空间不一致的难题, MoCE模型结合适配器微调与混合专家框架, 将各预训练CLIP模型的图像与文本特征对齐到同一空间, 并利用路由网络进行动态融合, 再与文本特征对比完成分类。大量实验表明, MoCE有效实现了不同CLIP模型的优势互补, 在不同样本数设定的少样本分类任务中分类准确率均优于现有单一模型微调方法和预测概率层面的集成方法。MoCE模型是目前首个特征层面的异构CLIP预训练集成模型, 其适配器辅助的特征对齐与动态路由融合设计具有广泛的应用潜力。
来源:2026年第5期
《清华大学学报(自然科学版)》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。