An Incremental Fast Policy Search Using a Single Sample Path
From MaRDI portal
Recommendations
- An incremental off-policy search in a model-free Markov decision process using a single sample path
- Learning near-optimal policies with Bellman-residual minimization based fitted policy iteration and a single sample path
- Learning Near-Optimal Policies with Bellman-Residual Minimization Based Fitted Policy Iteration and a Single Sample Path
- Sample-based policy iteration for constrained DEC-POMDPs
- Efficient sample reuse in policy gradients with parameter-based exploration
- Rollout sampling approximate policy iteration
- On-line policy gradient estimation with multi-step sampling
Cites work
- An iterative method of solving a game
- Basis function adaptation in temporal difference reinforcement learning
- Cross-entropy and rare events for maximal cut and partition problems
- scientific article; zbMATH DE number 5685899 (Why is no real title available?)
- Revisiting the cross entropy method with applications in stochastic global optimization and reinforcement learning
- The Complexity of Markov Decision Processes
- The cross-entropy method for combinatorial and continuous optimization
- The cross-entropy method for continuous multi-extremal optimization
Cited in
(6)- Learning near-optimal policies with Bellman-residual minimization based fitted policy iteration and a single sample path
- An incremental off-policy search in a model-free Markov decision process using a single sample path
- A generalized path integral control approach to reinforcement learning
- scientific article; zbMATH DE number 6860770 (Why is no real title available?)
- Adaptive smoothing for path integral control
- Learning Near-Optimal Policies with Bellman-Residual Minimization Based Fitted Policy Iteration and a Single Sample Path
This page was built for publication: An Incremental Fast Policy Search Using a Single Sample Path
Report a bug (only for logged in users!)Click here to report a bug for this page (MaRDI item Q5045345)