-
Let's Verify Step by Step: 결과가 아니라 과정에 보상을 주다
RLHF Reward 설계 시리즈 #31 — process supervision이 outcome supervision을 이기는 이유와 PRM800K
-
WARP: 정책을 weight space에서 세 번 병합한다
RLHF Reward 설계 시리즈 #30 — KL 제약과 reward 최적화의 줄다리기를 weight averaging으로 푼다
-
BOND: Best-of-N을 추론 비용 없이 흉내 내다
RLHF Reward 설계 시리즈 #29 — Best-of-N 분포를 증류해 N배 추론 비용을 없앤다
-
DAPO: 신호 없는 프롬프트를 버리고, 탐색을 살린다
RLHF Reward 설계 시리즈 #28 — Clip-Higher와 dynamic sampling으로 대규모 RL을 굴리는 네 가지 장치
-
GSPO: importance ratio를 토큰이 아니라 시퀀스 단위로
RLHF Reward 설계 시리즈 #27 — GRPO의 token-level 비율이 MoE 학습을 무너뜨리는 이유