Centralized Training Decentralized Execution (CTDE).
hardAnswer
- Cooperative multi-agent paradigm: during training, use global state + all agents' info (centralized critic).
- At execution, each agent uses only its local observations (decentralized policy).
- Best of both worlds: centralized training resolves non-stationarity + credit; decentralized execution scales + preserves partial observability.
- MADDPG (continuous), QMIX (cooperative Q), MAPPO (cooperative PPO) all use CTDE.
Check yourself — multiple choice
- Random
- Train with centralized global-state critic + decentralized local-obs policy at execution; resolves non-stationarity + credit + scales at exec; MADDPG / QMIX / MAPPO
- Same as PPO
- Not real
CTDE: centralized critic training + decentralized local policy exec; cooperative MARL.
#multi-agent
Practise Reinforcement Learning
214 interview questions in this topic.