Substitute into Bradley-Terry preference model → loss depends only on π_θ, not r: L(θ) = -E[logσ(βlog(πθ(yw∣x)/πref(yw∣x))−βlog(πθ(yl∣x)/πref(yl∣x)))].
Skips reward model + PPO entirely; direct MLE on preference data.
Check yourself — multiple choice
Random
Optimal KL-constrained policy has closed-form ∝ πrefexp(r/β); invert to r = β log(π⋅/πref); substitute in Bradley-Terry → direct loss on π_θ; skips RM + PPO