Policy Evaluation in Continuous MDPs With Efficient Kernelized Gradient Temporal Difference
From MaRDI portal
Cited in
(6)- Kernel dynamic policy programming: applicable reinforcement learning to robot systems with high dimensional states
- scientific article; zbMATH DE number 6860770 (Why is no real title available?)
- On the sample complexity of actor-critic method for reinforcement learning with function approximation
- Policy Evaluation in Continuous MDPs with Efficient Kernelized Gradient Temporal Difference
- Optimal policy evaluation using kernel-based temporal difference methods
- Reinforcement learning for infinite-dimensional systems
This page was built for publication: Policy Evaluation in Continuous MDPs With Efficient Kernelized Gradient Temporal Difference
Report a bug (only for logged in users!)Click here to report a bug for this page (MaRDI item Q4990298)