国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:宋紫阳, 李军怀, 王怀军, 苏鑫, 于蕾
单位:1.西安理工大学 计算机科学与工程学院,西安 710048;2.陕西省网络计算与安全技术重点实验室,西安 710048
关键词:模仿学习,强化学习,SAC算法,路径规划,奖励函数
基金:国家重点研发计划项目(2018YFB1703003);陕西省重点研发计划项目(2022SF?353);西安市科技计划项目(2022JH?RYFW?0072)
在机械臂路径规划算法的训练过程中,由于动作空间和状态空间巨大导致奖励稀疏,机械臂路径规划训练效率低,面对海量的状态数和动作数较难评估状态价值和动作价值。针对上述问题,提出一种基于SAC(Soft Actor-Critic)强化学习的机械臂路径规划算法。通过将示教路径融入奖励函数使机械臂在强化学习过程中对示教路径进行模仿以提高学习效率,并采用SAC算法使机械臂路径规划算法的训练更快、稳定性更好。基于所提算法和深度确定性策略梯度(DDPG)算法分别规划10条路径,所提算法和DDPG算法规划的路径与参考路径的平均距离分别是0.8 cm和1.9 cm。实验结果表明,路径模仿机制能提高训练效率,所提算法比DDPG算法能更好地探索环境,使得规划路径更加合理。
来源:2024年第2期
《计算机应用》期刊编辑部