Optimizing return distributions with distributional dynamic programming
From MaRDI portal
Cites work
- scientific article; zbMATH DE number 5957269 (Why is no real title available?)
- scientific article; zbMATH DE number 1321699 (Why is no real title available?)
- A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play
- An introduction to statistical learning. With applications in R
- An upper bound on the loss from approximate optimal-value functions
- Decision Problems with Expected Utility Criteria, II: Stationarity
- Discounted MDP’s: Distribution Functions and Exponential Utility Maximization
- Discovering faster matrix multiplication algorithms with reinforcement learning
- Distributional Reinforcement Learning
- Markov decision processes with average-value-at-risk criteria
- Minimizing spectral risk measures applied to Markov decision processes
- More risk-sensitive Markov decision processes
- Optimal Transport
- Probability for statisticians
- Reinforcement learning. An introduction
- Revisiting the Arcade Learning Environment: Evaluation Protocols and Open Problems for General Agents
- The Complexity of Markov Decision Processes
- \({\mathcal Q}\)-learning
This page was built for publication: Optimizing return distributions with distributional dynamic programming
Report a bug (only for logged in users!)Click here to report a bug for this page (MaRDI item Q6887347)