強化學習導論 | 第六章 時序差分方法

前面講到的動態規劃方法和蒙特卡洛方法都可以用來計算價值函數。動態規劃方法是model-based的,需要知道狀態的轉換概率,某個狀態的價值是根據其後續的狀態價值計算的;蒙特卡洛方法是model-free的,不需要知道狀態的轉換概率,某個狀態的價值是根據從該狀態開始到軌跡結束的折扣獎勵來計算的。本章的時序差分方法是對動態規劃方法和蒙特卡洛方法的結合,跟蒙特卡洛方法一樣,也是根據經驗來學習,而不需要知
相關文章
相關標籤/搜索