国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:李源潮, 陶重犇, 王琛
单位:1.苏州科技大学 电子与信息工程学院,江苏 苏州 215009;2.清华大学 苏州汽车研究院,江苏 苏州 215134
关键词:双足机器人,步态控制,深度强化学习,最大熵,柔性演员-评论家算法
基金:国家自然科学基金资助项目(62201375);中国博士后科学基金资助项目(2021M691848);江苏省自然科学基金资助项目(BK20220635);苏州市科技项目(SS2019029)
针对双足机器人连续直线行走的步态稳定控制问题,提出一种基于最大熵深度强化学习(DRL)的柔性演员-评论家(SAC)步态控制方法。首先,该方法无需事先建立准确的机器人动力学模型,所有参数均来自关节角而无需额外的传感器;其次,采用余弦相似度方法对经验样本分类,优化经验回放机制;最后,根据知识和经验设计奖励函数,使双足机器人在直线行走训练过程中不断进行姿态调整,确保直线行走的鲁棒性。在Roboschool仿真环境中与其他先进深度强化学习算法,如近端策略优化(PPO)方法和信赖域策略优化(TRPO)方法的实验对比结果表明,所提方法不仅实现了双足机器人快速稳定的直线行走,而且鲁棒性更好。
来源:2024年第2期
《计算机应用》期刊编辑部