RL-03-赵-基于模型:贝尔曼最优公式(BOE)01:如何改进策略(π/policy)【BOE符合收缩映射理论-->因此可通过“迭代法”求解出最优State Values-->也就得到了最优策略】
RELATED READING
延伸阅读
更多一线实战笔记与深度复盘,助您持续精进