Potential-Based Online Policy Iteration Algorithms for Markov Decision Processes
From MaRDI portal
Cited in
(9)- Basic ideas for event-based optimization of Markov systems
- Early developments of control theory in China
- Simple regret optimization in online planning for Markov decision processes
- A performance gradient perspective on gradient‐based policy iteration and a modified value iteration
- Look-ahead control of conveyor-serviced production station by using potential-based online policy iteration
- Finding optimal memoryless policies of POMDPs under the expected average reward criterion
- Temporal difference-based policy iteration for optimal control of stochastic systems
- An Online Policy Gradient Algorithm for Markov Decision Processes with Continuous States and Actions
- Point-Based Online Value Iteration Algorithm for POMDPs
This page was built for publication: Potential-Based Online Policy Iteration Algorithms for Markov Decision Processes
Report a bug (only for logged in users!)Click here to report a bug for this page (MaRDI item Q5273720)