简介:
本申请实施例提供了一种博弈决策方法和系统。该博弈决策方法包括服务器端基于预先训练好的环境预测模型,根据不完美信息环境已知状态的数据对所述不完美信息环境未知状态的数据进行预测,得到所述不完美信息环境未知状态的数据的有效预测结果;所述服务器端基于强化学习模型,根据所述不完美信息环境已知状态的数据和所述不完美信息环境未知状态的数据的所述有效预测结果做出有效决策。该博弈决策方法能够根据不完美信息环境已知状态的数据对不完美信息环境未知状态的数据进行预测,以便做出有效决策。
本申请实施例提供了一种博弈决策方法和系统。该博弈决策方法包括服务器端基于预先训练好的环境预测模型,根据不完美信息环境已知状态的数据对所述不完美信息环境未知状态的数据进行预测,得到所述不完美信息环境未知状态的数据的有效预测结果;所述服务器端基于强化学习模型,根据所述不完美信息环境已知状态的数据和所述不完美信息环境未知状态的数据的所述有效预测结果做出有效决策。该博弈决策方法能够根据不完美信息环境已知状态的数据对不完美信息环境未知状态的数据进行预测,以便做出有效决策。