声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:11-2223/N
国际刊号:1000-0054
发布日期:
作者:朱晓庆, 毕兰越, 吴通, 张川, 吴佳豪
单位:1. 北京工业大学 信息科学与技术学院, 北京 100124,2. 中核核信信息技术北京有限公司, 北京 100091,3. 北京工业大学 核工业智能交叉实验室, 北京 100124
关键词:机器人控制,可解释强化学习,策略解析,图神经网络,因果模型
基金:国家自然科学基金青年项目(62103009),北京市自然科学基金面上项目(4202005)
在机器人控制的强化学习场景中, 阐明状态、动作与奖励之间的因果联系, 对提升策略的可解释性和保障决策的安全性至关重要。当前, 大多数深度强化学习算法仍依赖“黑箱”式策略, 难以揭示潜在的因果结构; 而在高维且不断演化的状态—动作空间中, 传统的注意力机制也无法有效捕捉跨越多个时间步的因果依赖关系。基于此, 该文提出了一种基于图神经网络-神经元因果模型(graph neural network-neural causal model, GNN-NCM)的机器人运动技能策略解释算法, 利用GNN代替传统注意力机制进行精准建模, 从而推断状态和动作对未来回报的因果影响。首先, 利用条件独立性检验发现因果关系的结构; 随后, 训练GNN, 并对节点和边进行联合表征和量化, 最终实现对状态—动作—奖励因果影响的精确推断。通过对LunarLander和Hopper-V4这2个代表性环境的实证研究, 结合状态拆解、动作分离和热力图可视化分析, 该文不仅从各个状态维度揭示了状态—动作—奖励的因果强度, 还提升了因果解释模型的精度。结果表明:该文所提方法在解释精度、因果可视化和长期回报预测方面均优于现有因果解释模型; 在Hopper-V4环境中, 相较于传统注意力方法, GNN推理网络的因果预测均方误差平均降低了62%, 充分验证了该文所提方法在高维连续控制任务中的因果建模和解释能力。该文研究结果可为高风险连续控制场景下强化学习算法的可解释性设计和工程化落地提供参考。
来源:2026年第6期
《清华大学学报(自然科学版)》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。