Subrahmanya Swamy Peruru
Publishes 1 feed
Lately
Lecture 2 | Multi-arm Bandits | Reinforcement Learning Course | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Lecture 1 | Machine Learning Paradigms - An Overview | Reinforcement Learning Course | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Lecture 13 | Value Iteration and Monte Carlo Prediction | Reinforcement Learning Course | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Lecture 10 - Bellman Expectation Equations for MDP | Reinforcement Learning Course | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Lecture 11 | Bellman Optimality Eqs | Policy Iteration | Reinforcement Learning Course | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Lecture 12 | Convergence Proof of Policy Iteration | Reinforcement Learning Course | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Lecture 4 - Regret Analysis of UCB Bandit algorithm | Reinforcement Learning | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Lecture 5 - UCB Regret | KL Divergence | B–H inequality | Reinforcement Learning Course | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Lecture 6 - Lower Bound on Regret for Bandit Algorithms | Reinforcement Learning Course | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Lecture 7 - Thompson Sampling for Multi-arm Bandits | Reinforcement Learning Course | IIT Kanpur
EE675 (2024) Introduction to Reinforcement Learning Course | IIT Kanpur ·
Everything on this page was read from markup Subrahmanya Swamy Peruru published — a rel="me" link, an h-card, or the feed’s own author element. Nothing was inferred from anywhere else. To correct or remove it, get in touch. Machine-readable: JSON
