UVIP: model-free approach to evaluate reinforcement learning algorithms
From MaRDI portal
Cites work
- Advanced simulation-based methods for optimal stopping and control. With applications in finance
- Algorithms for reinforcement learning.
- Expected policy gradients for reinforcement learning
- High-dimensional probability. An introduction with applications in data science
- scientific article; zbMATH DE number 1321699 (Why is no real title available?)
- Interpolation of Lipschitz functions
- Locally contracting iterated functions and stability of Markov chains
- Markov Chains
- Near-optimal regret bounds for reinforcement learning
- On the Generation of Markov Decision Processes
- Pathwise Stochastic Optimal Control
- Practical kernel-based reinforcement learning
- Reinforcement learning. An introduction
- Simple statistical gradient-following algorithms for connectionist reinforcement learning
- The covering radius of randomly distributed points on a manifold
This page was built for publication: UVIP: model-free approach to evaluate reinforcement learning algorithms
Report a bug (only for logged in users!)Click here to report a bug for this page (MaRDI item Q6849471)