Sublinear regret for a class of continuous-time linear-quadratic reinforcement learning problems
From MaRDI portal
Cites work
- A Stochastic Approximation Algorithm with Varying Bounds
- A Stochastic Approximation Method
- Continuous-time mean-variance portfolio selection: a stochastic LQ framework
- Convergence of policy gradient methods for finite-horizon exploratory linear-quadratic control problems
- Fast global convergence of natural policy gradient methods with entropy regularization
- General bounds and finite-time improvement for the Kiefer-Wolfowitz stochastic approximation algorithm
- scientific article; zbMATH DE number 54145 (Why is no real title available?)
- scientific article; zbMATH DE number 1325009 (Why is no real title available?)
- scientific article; zbMATH DE number 7626721 (Why is no real title available?)
- scientific article; zbMATH DE number 7307478 (Why is no real title available?)
- Learning equilibrium mean‐variance strategy
- Linear matrix inequalities, Riccati equations, and indefinite stochastic linear quadratic controls
- Online actor-critic algorithm to solve the continuous-time infinite horizon optimal control problem
- Optimal Scheduling of Entropy Regularizer for Continuous-Time Linear-Quadratic Reinforcement Learning
- Policy gradient in continuous time
- Policy Gradient Methods for the Noisy Linear Quadratic Regulator over a Finite Horizon
- Policy iterations for reinforcement learning problems in continuous time and space -- fundamental theory and methods
- Reinforcement learning. An introduction
- Stochastic Linear Quadratic Regulators with Indefinite Control Weight Costs
Cited in
(1)
This page was built for publication: Sublinear regret for a class of continuous-time linear-quadratic reinforcement learning problems
Report a bug (only for logged in users!)Click here to report a bug for this page (MaRDI item Q6925757)