馬爾科夫決策過程

馬爾科夫決策過程 概念與公式 1.收穫:一個馬爾科夫過程中從某一狀態開始直到終止狀態時所有獎勵的有衰減之和(R爲獎勵,gamma爲衰減係數)。 2.價值:馬爾科夫獎勵過程中狀態收穫的期望。 3.價值函數:價值函數建立了從狀態到價值的映射。 4.貝爾曼方程:它提示一個狀態的價值由該狀態的獎勵以及後續狀態價值按概率分佈求和按一定的衰減比例聯合組成。 貝爾曼方程可以寫成矩陣形式 求解得的式子可以用矩陣計
相關文章
相關標籤/搜索