声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:11-2223/N
国际刊号:1000-0054
发布日期:
作者:仇瑜, 冯珺, 郑哲慧, 赵祎, 宋昊旻, 陈祖歌, 王绍兰
单位:1. 智谱AI, 北京 100084,2. 国网浙江省电力有限公司 信息通信分公司, 杭州 310020,3. 清华大学 计算机科学与技术系, 北京 100084
关键词:电力领域,知识提示,大语言模型,视觉问答
将大语言模型(LLM)应用于基于知识的视觉问答已取得了显著的成果。然而, 特定领域尤其是电力行业由于模型缺乏输入语料等, 传统方法在构建LLM知识提示时仍存在诸多不足, 难以充分发挥LLM在垂直领域中的潜能。此外, 现有工作多采用GPT-4等模型进行问答推理, 成本高, 耗时长。该文提出了电力领域基于上下文知识提示的LLM视觉问答技术。首先, 采用基础视觉问答模型来生成上下文知识示例, 并引入答案选择层以生成候选答案; 然后, 将上下文知识示例与候选答案融入提示词中, 以激发LLM在电力视觉问答任务中的潜能; 最后, 通过设计的LLM上下文知识提示词来生成预测的答案。此外, 该文选择开源且免费的LLaMA来替代GPT-4进行视觉问答任务, 并且构建了一个小型数据集用于微调LLM。与已有一些先进方法相比, 该方法在EVQA和A-OKVQA数据集上的准确率分别提升了8.8%和14.5%以上。
来源:2026年第5期
《清华大学学报(自然科学版)》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。