Prioritized replay — mechanism.
hardAnswer
- Sample transitions with probability ∝ ||^α (high TD error = more surprising = more informative).
- Correct sampling bias with importance weights ^β applied to the loss.
- Improves data efficiency 2-3× on Atari.
- Standard extension of DQN.
- Modern replay libraries (segment tree implementation) allow O(log n) prioritized sampling.
Check yourself — multiple choice
- Uniform sample
- Sample transitions with prob ∝ |TD error|^α + importance weight correction; 2-3× data efficiency on Atari; segment-tree for O(log n) sampling
- Random
- Not real
Prioritized replay: p ∝ |δ|^α + IS weight; boosts sample efficiency.
#value-methods#deep-rl
Practise Reinforcement Learning
214 interview questions in this topic.