长河君 · 2026/9/27 5:37:54 · 阅读 1.2k RL-赵-(八)-Value函数拟合算法02-ActionValue估算03:Deep Q-learning06【案例:DQN只需1k步就能达到Tabular Q-learning的100k步的效果】 编程 深度解析 一条长河 四、Illustrative example目标是找到对所有的state来说都是最优的action values。注意这里边不是说从一个特定的状态出发只要找到一个好的路径到目标就行了,这里是所有的state action pair都要估计出来它们的action value。一旦最优的action value估计出来,那么optimal greedy policy就立刻就能得到了。设置:仅使用一个episode来训练网络。此episode由图(a)中所示的探索性行为策略π b π_b 分享: 返回资讯列表 ← 上一篇 暂无更多 下一篇 → 暂无更多