DDPG — Deep Deterministic Policy Gradient.
hardAnswer
- Off-policy actor-critic for continuous actions.
- Deterministic policy μ_θ(s) + Q-critic Q_φ(s, a).
- Actor gradient: ∇_θ E[Q(s, μ(s))] via deterministic policy gradient theorem.
- Uses replay buffer + soft target networks + OU noise for exploration.
- Sensitive to hyperparameters + Q-overestimation issues → superseded by TD3 and SAC.
- Historic importance as first successful continuous-action deep RL.
Check yourself — multiple choice
- Random
- Off-policy actor-critic for continuous a; deterministic policy μ_θ + Q-critic + replay + soft targets + OU noise; superseded by TD3 / SAC due to Q overestimation
- Same as PPO
- Not real
DDPG: off-policy AC for continuous a; deterministic policy + Q-critic + replay.
#policy-methods#actor-critic#deep-rl
Practise Reinforcement Learning
214 interview questions in this topic.