我被PPO卡住了
ReinforcementLearning
原本以為 PPO (proximal policy optimization) 最大的貢獻是 important sampling。但那大家早就會了。
真正的貢獻是,把調整的 ratio \rho clip。就這樣。
PPO 之前的,TRPO (trust region policy optimization),就是在解決這個問題,因為 important sampling 可能會調整太大,而這麼大的調整是不合理的,那些機率極低的地方並不是真的機率這麼低 而是估不準。所以TRPO說,我們把每一步的機率,限制在舊的機率分布的附近,也就是算KL距離。
D_{KL}(\pi_{old}||\pi_{new}) = \sum_{x} \pi_{old}(x)\log\frac{\pi_{old}(x)}{\pi_{new}(x)}