馬爾科夫決策過程

時間 2021-01-11

原文原文鏈接

馬爾科夫決策過程概念與公式 1.收穫：一個馬爾科夫過程中從某一狀態開始直到終止狀態時所有獎勵的有衰減之和（R爲獎勵，gamma爲衰減係數）。 2.價值：馬爾科夫獎勵過程中狀態收穫的期望。 3.價值函數：價值函數建立了從狀態到價值的映射。 4.貝爾曼方程：它提示一個狀態的價值由該狀態的獎勵以及後續狀態價值按概率分佈求和按一定的衰減比例聯合組成。貝爾曼方程可以寫成矩陣形式求解得的式子可以用矩陣計

>>阅读原文<<

相關文章

相關標籤/搜索

PHP 7 新特性

每日一句

每一个你不满意的现在，都有一个你没有努力的曾经。

最新文章

本站公眾號

歡迎關注本站公眾號,獲取更多信息

相關文章

>>更多相關文章<<