-
Math-Shepherd: 사람 라벨 없이 PRM을 만들다
RL Reward 설계 시리즈 #32 — rollout으로 단계별 라벨을 자동 생성하는 법, 그리고 PRM 평가의 함정
-
Let's Verify Step by Step: 결과가 아니라 과정에 보상을 주다
RL Reward 설계 시리즈 #31 — process supervision이 outcome supervision을 이기는 이유와 PRM800K
-
WARP: 정책을 weight space에서 세 번 병합한다
RL Reward 설계 시리즈 #30 — KL 제약과 reward 최적화의 줄다리기를 weight averaging으로 푼다
-
BOND: Best-of-N을 추론 비용 없이 흉내 내다
RL Reward 설계 시리즈 #29 — Best-of-N 분포를 증류해 N배 추론 비용을 없앤다
-
DAPO: 신호 없는 프롬프트를 버리고, 탐색을 살린다
RL Reward 설계 시리즈 #28 — Clip-Higher와 dynamic sampling으로 대규모 RL을 굴리는 네 가지 장치