ucla rl-llm
The 12 most recent episodes and tracks on this topic.
Saves to your Watch queue, to pick up on another day or another device.
Pick anything below and it plays in the bar at the foot of the window — and keeps playing while you go on browsing the directory.
- [UCLA RL-LLM] Chapter 2.4: In-context learning and instruction fine-tuningReinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 2.3: Transformers II (modern transformers updates and sampling methods)Reinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 2.2: Transformers I (BERT, GPT-1)Reinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 2.1: NLP foundations, language modeling, RNNsReinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 3.2: Reinforcement learning with verifiable rewards (RLVR)Reinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 3.1: Reinforcement learning from human feedback (PPO, DPO)Reinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 1.5: AlphaGo, test-time compute, and expert iterationReinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 1.4: Deep policy gradient methods (PPO, GRPO)Reinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 1.3: Deep policy gradient methods (A3C)Reinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 1.2: Deep policy evaluationReinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 1.1: MDP foundations, imitation learning, and value iterationReinforcement Learning of Large Language ModelsNotes
- [UCLA RL-LLM] Chapter 0: Course outline and prologueReinforcement Learning of Large Language ModelsNotes
This playlist:.m3u.plsAll the feeds behind it
