Importance sampling techniques for policy optimization
From MaRDI portal
Recommendations
- Adaptive importance sampling for value function approximation in off-policy reinforcement learning
- Efficient sample reuse in policy gradients with parameter-based exploration
- Reward-weighted regression with sample reuse for direct policy search in reinforcement learning
- Analysis and improvement of policy gradient estimation
- Policy gradient in Lipschitz Markov decision processes
Cited in
(10)- Adaptive importance sampling for value function approximation in off-policy reinforcement learning
- Importance sampling in reinforcement learning with an estimated behavior policy
- Policy space identification in configurable environments
- Importance weighting without importance weights: an efficient algorithm for combinatorial semi-bandits
- Efficient sample reuse in policy gradients with parameter-based exploration
- Policy Gradient Importance Sampling for Bayesian Inference
- Daisee: Adaptive importance sampling by balancing exploration and exploitation
- Efficient exponential tilting with applications
- Rényi divergence in hidden Markov models
- Minimax off-policy evaluation and learning with subgaussian and differentiable importance weighting
This page was built for publication: Importance sampling techniques for policy optimization
Report a bug (only for logged in users!)Click here to report a bug for this page (MaRDI item Q4969257)