-
GSPO: importance ratio를 토큰이 아니라 시퀀스 단위로
RL Reward 설계 시리즈 #27 — GRPO의 token-level 비율이 MoE 학습을 무너뜨리는 이유
-
KTO: 선호 쌍 없이, 좋다·나쁘다만으로 정렬한다
RL Reward 설계 시리즈 #26 — prospect theory로 본 정렬, 이진 신호만으로 DPO를 따라잡다
-
SimPO: reference 모델을 버리고 길이로 정규화한다
RL Reward 설계 시리즈 #25 — reference-free + length-normalized reward로 DPO를 단순화하다
-
DPO: reward model을 없애면 무엇을 잃는가
RL Reward 설계 시리즈 #24 — 암묵적 reward로 RL을 우회한 대가, 그리고 다시 명시적 RM으로 돌아온 이유
-
RLOO: PPO의 절반은 RLHF에 필요 없었다
RL Reward 설계 시리즈 #23 — 응답 전체를 하나의 action으로 보면 REINFORCE로 충분하다는 주장