EasyDeepLearn

Centralized Training Decentralized Execution (CTDE).

hard

Answer

  • Cooperative multi-agent paradigm: during training, use global state + all agents' info (centralized critic).
  • At execution, each agent uses only its local observations (decentralized policy).
  • Best of both worlds: centralized training resolves non-stationarity + credit; decentralized execution scales + preserves partial observability.
  • MADDPG (continuous), QMIX (cooperative Q), MAPPO (cooperative PPO) all use CTDE.
Check yourself — multiple choice
  • Random
  • Train with centralized global-state critic + decentralized local-obs policy at execution; resolves non-stationarity + credit + scales at exec; MADDPG / QMIX / MAPPO
  • Same as PPO
  • Not real

CTDE: centralized critic training + decentralized local policy exec; cooperative MARL.

#multi-agent

Practise Reinforcement Learning

214 interview questions in this topic.

Related questions