Recurrent policy gradients
From MaRDI portal
Recommendations
- General value function networks
- Totally model-free actor-critic recurrent neural-network reinforcement learning in non-Markovian domains
- scientific article; zbMATH DE number 1753152
- Efficient sample reuse in policy gradients with parameter-based exploration
- Simple statistical gradient-following algorithms for connectionist reinforcement learning
Cited in
(10)- Reward-weighted regression with sample reuse for direct policy search in reinforcement learning
- Machine learning for combinatorial optimization: a methodological tour d'horizon
- The factored policy-gradient planner
- General value function networks
- Toward training recurrent neural networks for lifelong learning
- Finite-time analysis of natural actor-critic for POMDPs
- Real-time reinforcement learning by sequential actor-critics and experience replay
- Multikernel recursive least-squares temporal difference learning
- scientific article; zbMATH DE number 7625165 (Why is no real title available?)
- Totally model-free actor-critic recurrent neural-network reinforcement learning in non-Markovian domains
This page was built for publication: Recurrent policy gradients
Report a bug (only for logged in users!)Click here to report a bug for this page (MaRDI item Q3588966)