-
KTO: 선호 쌍 없이, 좋다·나쁘다만으로 정렬한다
RLHF Reward 설계 시리즈 #26 — prospect theory로 본 정렬, 이진 신호만으로 DPO를 따라잡다
-
SimPO: reference 모델을 버리고 길이로 정규화한다
RLHF Reward 설계 시리즈 #25 — reference-free + length-normalized reward로 DPO를 단순화하다
-
DPO: reward model을 없애면 무엇을 잃는가
RLHF Reward 설계 시리즈 #24 — 암묵적 reward로 RL을 우회한 대가, 그리고 다시 명시적 RM으로 돌아온 이유
-
RLOO: PPO의 절반은 RLHF에 필요 없었다
RLHF Reward 설계 시리즈 #23 — 응답 전체를 하나의 action으로 보면 REINFORCE로 충분하다는 주장
-
GRPO: value network를 버리고 그룹 안에서 비교하다
RLHF Reward 설계 시리즈 #22 — critic 없이 그룹 상대 advantage로 PPO를 대체한 현재의 사실상 표준