国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:周毅, 高华, 田永谌
单位:武汉科技大学 信息科学与工程学院,武汉 430081
关键词:深度强化学习,近端策略优化,信任域约束,模拟退火,贪心算法
基金:国家自然科学基金资助项目(62372343)
针对近端策略优化(PPO)算法难以严格约束新旧策略的差异和探索与利用效率较低这2个问题,提出一种基于裁剪优化和策略指导的PPO(COAPG-PPO)算法。首先,通过分析PPO的裁剪机制,设计基于Wasserstein距离的信任域裁剪方案,加强对新旧策略差异的约束;其次,在策略更新过程中,融入模拟退火和贪心算法的思想,提升算法的探索效率和学习速度。为了验证所提算法的有效性,使用MuJoCo测试基准对COAPG-PPO与CO-PPO(PPO based on Clipping Optimization)、PPO-CMA(PPO with Covariance Matrix Adaptation)、TR-PPO-RB(Trust Region-based PPO with RollBack)和PPO算法进行对比实验。实验结果表明,COAPG-PPO算法在大多数环境中具有更严格的约束能力、更高的探索和利用效率,以及更高的奖励值。
来源:2024年第8期
《计算机应用》期刊编辑部