基于并行架构的内在奖励强化学习方法
首页 企业 产品 技术 资讯 图库 视频 需求 会议 活动 产业
基于并行架构的内在奖励强化学习方法
来源:北方有色网
访问:1225
简介: 本发明公开了一种基于并行架构的内在奖励强化学习方法,包含如下步骤:执行模块与模拟环境交互,获取一整幕经验数据并存入缓存组件;同步学习模块的最近更新的策略;取出定量的经验数据进行评估,获得奖励值;对经验数据的状态价值函数进行估计,获得内部状态价值函数与外部状态价值函数;处理内部状态价值函数与外部状态价值函数,获得总状态价值函数并改写成近似状态价值函数;外部的智能体对预测网络的参数进行优化,并更新策略网络的当前策略,获得新策略;执行模块更新新策略。本发明解决了现有技术中价值函数估计不准、收敛到局部最优策略的缺陷,避免了优化结果出现偏差的问题,具有更高的单位时隙吞吐率、更好的性能和更快的学习速度。
本发明公开了一种基于并行架构的内在奖励强化学习方法,包含如下步骤:执行模块与模拟环境交互,获取一整幕经验数据并存入缓存组件;同步学习模块的最近更新的策略;取出定量的经验数据进行评估,获得奖励值;对经验数据的状态价值函数进行估计,获得内部状态价值函数与外部状态价值函数;处理内部状态价值函数与外部状态价值函数,获得总状态价值函数并改写成近似状态价值函数;外部的智能体对预测网络的参数进行优化,并更新策略网络的当前策略,获得新策略;执行模块更新新策略。本发明解决了现有技术中价值函数估计不准、收敛到局部最优策略的缺陷,避免了优化结果出现偏差的问题,具有更高的单位时隙吞吐率、更好的性能和更快的学习速度。
0
0
0
0
0
         
标签:化学分析
广州铭谦选矿设备有限公司宣传
广州铭谦选矿设备有限公司宣传
相关技术
评论(0条)
200/200
牛津仪器科技(上海)有限公司宣传
发布
技术

顶部
北方有色网-互联网服务平台-关于我们
Copyright 2025 China-mcc.com All Rights Reserved
备案号:京ICP备11044340号-3
电信业务经营许可证编号:京B2-20242293
京公网安备 11010702002294号