Tuning Bandit Algorithms in Stochastic Environments
From MaRDI portal
Recommendations
- Exploration-exploitation tradeoff using variance estimates in multi-armed bandits
- UCB revisited: improved regret bounds for the stochastic multi-armed bandit problem
- Kullback-Leibler upper confidence bounds for optimal sequential allocation
- On upper-confidence bound policies for switching bandit problems
- Upper-Confidence-Bound Algorithms for Active Learning in Multi-armed Bandits
Cites work
Cited in
(20)- Exploration-exploitation tradeoff using variance estimates in multi-armed bandits
- A penalized bandit algorithm
- Detecting concept change in dynamic data streams
- Preference-based reinforcement learning: evolutionary direct policy search using a preference-based racing algorithm
- Faster Hoeffding racing: Bernstein races via jackknife estimates
- On upper-confidence bound policies for switching bandit problems
- Reward-modulated Hebbian learning of decision making
- Kullback-Leibler upper confidence bounds for optimal sequential allocation
- Robustness of stochastic bandit policies
- scientific article; zbMATH DE number 6982311 (Why is no real title available?)
- 10.1162/153244303321897663
- scientific article; zbMATH DE number 7596797 (Why is no real title available?)
- scientific article; zbMATH DE number 6253908 (Why is no real title available?)
- AI-driven liquidity provision in OTC financial markets
- Analyzing bandit-based adaptive operator selection mechanisms
- Corruption-tolerant bandit learning
- Variance-aware estimation of kernel mean embedding
- An exponential Efron-Stein inequality for L_q stable learning rules
- Empirical Bernstein and betting confidence intervals for randomized quasi-Monte Carlo
- Empirical Bernstein in smooth Banach spaces
This page was built for publication: Tuning Bandit Algorithms in Stochastic Environments
Report a bug (only for logged in users!)Click here to report a bug for this page (MaRDI item Q3520056)