简介:
本文描述了用于逆向强化学习以利用基于模型的优化方法和无模型学习方法的优势的系统和方法。提出了将人类行为模型与模型预测控制相结合的框架的实施方式。该框架利用神经网络的特征识别能力来确定模型预测控制的奖励函数。此外,实施本方法的实施方式,以解决实际的自动驾驶纵向控制问题,同时优先考虑安全执行和乘客舒适度。
本文描述了用于逆向强化学习以利用基于模型的优化方法和无模型学习方法的优势的系统和方法。提出了将人类行为模型与模型预测控制相结合的框架的实施方式。该框架利用神经网络的特征识别能力来确定模型预测控制的奖励函数。此外,实施本方法的实施方式,以解决实际的自动驾驶纵向控制问题,同时优先考虑安全执行和乘客舒适度。