计算机应用

北大核心,INSPEC,JST,Pж(AJ),CSCD扩展版

国内刊号:51-1307/TP

国际刊号:1001-9081

计算机应用杂志2022年第1期:基于因子分解机用于安全探索的Q表初始化方法

发布日期:

作者:曾柏森, 钟勇, 牛宪华

单位:1.中国科学院 成都计算机应用研究所, 成都 610041;2.中国科学院大学, 北京 100049;3.成都工业学院 网络与通信工程学院, 成都 611730;4.通信抗干扰技术国家级重点实验室(电子科技大学), 成都 611731;5.西华大学 计算机与软件工程学院, 成都 610039

关键词:强化学习,Q-learning,因子分解机,Q表初始化,安全探索

基金:中国博士后科技基金资助项目(2019M663475)

针对强化学习的大多数探索/利用策略在探索过程中忽略智能体随机选择动作带来的风险的问题,提出一种基于因子分解机(FM)用于安全探索的Q表初始化方法。首先,引入Q表中已探索的Q值作为先验知识;然后,利用FM建立先验知识中状态和行动间潜在的交互作用的模型;最后,基于该模型预测Q表中的未知Q值,从而进一步引导智能体探索。在OpenAI Gym的网格强化学习环境Cliffwalk中进行的A/B测试里,基于所提方法的Boltzmann和置信区间上界(UCB)探索/利用策略的不良探索幕数分别下降了68.12%和89.98%。实验结果表明,所提方法提高了传统策略的探索安全性,同时加快了收敛。

来源:2022年第1期

《计算机应用》期刊编辑部

查看计算机应用杂志2022年第1期

联系我们

  • 地址:四川天府新区兴隆街道科智路1369号
  • 电话:028-85224283-803
  • E-mail:bjb@joca.cn

咨询工作人员