为什么说Expected Sarsa是一种off-policy的方法？

为什么说Expected Sarsa是一种off-policy的方法（见《Reinforcement Learning: An Introduction》6.9节）?

在《Reinforcement Learning: An Introduction》6.6节中的Cliff Walking例子中，Expected Sarsa更新Value function是通过计算下一状态在epsilon-greedy策略下的Expected Reward，决策采用的策略也是epsilon-greedy策略，在我理解上这应该是一种on-policy method，但《Reinforcement Learning: An Introduction》6.9节中确陈述说Expected Sarsa是一种off-policy method，因此想问一下对这方面有了解的前辈有什么更好的解释吗？

参考《Reinforcement Learning: An Introduction》 by Richard S. Sutton and Andrew G. Barto.

写回答
好问题 0 提建议
追加酬金
关注问题
分享
邀请回答
编辑收藏删除
收藏举报

1条回答默认最新

关注

码龄粉丝数原力等级 --

被采纳

被点赞

采纳率
devmiao 2018-11-22 13:01
关注
https://blog.csdn.net/panglinzhuo/article/details/72518045

解决无用
评论打赏
分享
举报

评论

按下Enter换行，Ctrl+Enter发表内容

报告相同问题？

关注问题

悬赏问题

¥15 如何在scanpy上做差异基因和通路富集？
¥20 关于#硬件工程#的问题，请各位专家解答！
¥15 关于#matlab#的问题：期望的系统闭环传递函数为G(s)=wn^2/s^2+2¢wn+wn^2阻尼系数¢=0.707，使系统具有较小的超调量
¥15 FLUENT如何实现在堆积颗粒的上表面加载高斯热源
¥30 截图中的mathematics程序转换成matlab
¥15 动力学代码报错，维度不匹配
¥15 Power query添加列问题
¥50 Kubernetes&Fission&Eleasticsearch
¥15 報錯：Person is not mapped，如何解決？
¥15 c++头文件不能识别CDialog

为什么说Expected Sarsa是一种off-policy的方法？

1条回答 默认 最新

悬赏问题

1条回答默认最新