美文网首页
[强化学习] 理解on-policy 和 off-policy

[强化学习] 理解on-policy 和 off-policy

作者: winddy_akoky | 来源:发表于2018-10-15 14:31 被阅读0次
  1. 我们把用来指导个体产生与环境进行实际交互行为的策略称为行为策略,把用来评价状态或行为价值的策略或者待优化的策略称为目标策略。如果个体在学习过程中优化的策略与自己的行为策略是同一个策略时,这种学习方式称为同步策略学习(on-policy learning),如果个体在学习过程中优化的策略与自己的行为策略是不同的策略时,这种学习方式称为异步策略学习(off-policy learning)

相关文章

网友评论

      本文标题:[强化学习] 理解on-policy 和 off-policy

      本文链接:https://www.haomeiwen.com/subject/chffzftx.html