国内刊号:51-1307/TP
国际刊号:1001-9081
发布日期:
作者:况翔, 马震, 朱万春, 张智, 崔云飞
单位:1.贵阳信息科技学院 信息工程学院,贵阳 550025;2.贵阳信息科技学院 智能工程学院,贵阳 550025;3.贵州大学 大数据与信息工程学院,贵阳 550025
关键词:服务功能链部署,强化学习,马尔可夫决策过程,异步优势Actor-Critic,图注意力网络,门控循环单元
基金:教育部产学合作协同育人项目(220700595294923)
为了在云计算中高效分配有限的网络资源以确保服务质量(QoS),并且同时提高资源利用率和管理效率,提出一种安全可靠性驱动的基于编解码的深度强化学习(ED-DRL)方法用于服务功能链(SFC)部署。该方法将SFC部署看作一个马尔可夫决策过程(MDP),采用图注意力网络(GAT)编码器和门控循环单元(GRU)解码器高效提取网络拓扑特征和节点间的依赖关系,并结合异步优势Actor-Critic(A3C)算法实现SFC部署策略的动态生成。针对安全可靠性的需求,重设计奖励函数,从而引导策略网络选择最优资源。仿真结果表明,ED-DRL能获得70.7%的接受率与0.063 5的平均收益,优于连续决策强化学习(CDRL)等对比方法。
来源:2025年第12期
《计算机应用》期刊编辑部