EasyDeepLearn

Ornstein-Uhlenbeck noise vs Gaussian noise for continuous control.

medium

Answer

  • OU: temporally correlated noise: dxt  =  θ(μ    xt)\mathrm{dx}_{t}\; = \;{\theta}({\mu}\; - \;x_{t})dt + σ dWt\mathrm{dW}_{t} → mean-reverting Brownian.
  • Used in original DDPG for exploration on physical control tasks — smooth trajectories match physical inertia.
  • Later work (TD3, SAC) uses simple Gaussian action noise with equal performance.
  • Modern default: Gaussian noise; OU is historical / niche.
Check yourself — multiple choice
  • Same thing
  • OU: temporally correlated mean-reverting Brownian, smooth trajectories match physical inertia (DDPG); modern TD3/SAC use simple Gaussian noise with equal performance
  • Random
  • Not real

OU: correlated Brownian, DDPG-era; modern Gaussian action noise sufficient.

#exploration#actor-critic

Practise Reinforcement Learning

214 interview questions in this topic.

Related questions