EasyDeepLearn

DDPG — Deep Deterministic Policy Gradient.

hard

Answer

  • Off-policy actor-critic for continuous actions.
  • Deterministic policy μ_θ(s) + Q-critic Q_φ(s, a).
  • Actor gradient: ∇_θ E[Q(s, μ(s))] via deterministic policy gradient theorem.
  • Uses replay buffer + soft target networks + OU noise for exploration.
  • Sensitive to hyperparameters + Q-overestimation issues → superseded by TD3 and SAC.
  • Historic importance as first successful continuous-action deep RL.
Check yourself — multiple choice
  • Random
  • Off-policy actor-critic for continuous a; deterministic policy μ_θ + Q-critic + replay + soft targets + OU noise; superseded by TD3 / SAC due to Q overestimation
  • Same as PPO
  • Not real

DDPG: off-policy AC for continuous a; deterministic policy + Q-critic + replay.

#policy-methods#actor-critic#deep-rl

Practise Reinforcement Learning

214 interview questions in this topic.

Related questions