Notes from: Understanding Deep Learning Basics RL Basics Markov Process Policy Value Function Bellman Equations Tabular Reinforcement Learning Dynamic Programming RL Monte Carlo Methods On-Policy vs. Off-Policy Temporal Difference Methods SARSA Q-Learning Fitted Q-Learning Deep Q-Networks Double Q-Learning Policy Gradient Methods REINFORCE Actor-Critic Methods Offline Reinforcement Learning