Level · 30 daysSoon
30 Days of Reinforcement Learning
Agents that learn from consequences — rewards, policies, and Q-learning, built up over 30 days.
- Module 1Agents, states & rewards
- Module 2Markov decision processes
- Module 3Q-learning
- Module 4Policy methods
- Module 5Deep RL
- Module 6Train an agent to win