国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:王建平, 王刚, 毛晓彬, 马恩琪
单位:西安理工大学 机械与精密仪器工程学院, 西安 710048
关键词:深度强化学习,二连杆机械臂,运动控制,奖罚机制,深度确定性策略梯度算法
针对二连杆机械臂的运动控制问题,提出了一种基于深度强化学习的控制方法。首先,搭建机械臂仿真环境,包括二连杆机械臂、目标物与障碍物;然后,根据环境模型的目标设置、状态变量和奖罚机制来建立三种深度强化学习模型进行训练,最后实现二连杆机械臂的运动控制。对比分析所提出的三种模型后,选择深度确定性策略梯度(DDPG)算法进行进一步研究来改进其适用性,从而缩短机械臂模型的调试时间,顺利避开障碍物到达目标。实验结果表明,所提深度强化学习方法能够有效控制二连杆机械臂的运动,改进后的DDPG算法控制模型的收敛速度提升了两倍并且收敛后的稳定性增强。相较于传统控制方法,所提深度强化学习控制方法效率更高,适用性更强。
来源:2021年第6期
《计算机应用》期刊编辑部