国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:谭庆, 李辉, 吴昊霖, 王壮, 邓书超
单位:1.四川大学 计算机学院(软件学院),成都 610065;2.视觉合成图形图像技术国家级重点实验室(四川大学),成都 610065
关键词:强化学习,探索,内在好奇心奖励,状态新颖性,深度确定性策略梯度
基金:武器装备预研基金资助项目(31505550302)
针对状态预测误差直接作为内在好奇心奖励,在状态新颖性与奖励相关度低的任务中强化学习智能体不能有效探索环境的问题,提出一种基于奖励预测误差的内在好奇心模块(RPE-ICM)。RPE-ICM利用奖励预测误差网络(RPE-Network)学习并修正状态预测误差奖励,并将奖励预测误差(RPE)模型的输出作为一种内在奖励信号去平衡探索过度与探索不足,使得智能体能够更有效地探索环境并利用奖励去学习技能,从而达到更好的学习效果。在不同的MuJoCo环境中使用RPE-ICM、内在好奇心模块(ICM)、随机蒸馏网络(RND)以及传统的深度确定性策略梯度(DDPG)算法进行对比实验。结果表明,相较于传统DDPG、ICM-DDPG以及RND-DDPG,基于RPE-ICM的DDPG算法的平均性能在Hopper环境中分别提高了13.85%、13.34%和20.80%。
来源:2022年第6期
《计算机应用》期刊编辑部