-
Generative Reward Models: GenRM과 선호 학습을 잇다
RLHF Reward 설계 시리즈 #36 — 판별 RM과 생성 judge 사이, 그리고 CLoud 하이브리드
-
Generative Verifiers: reward를 분류가 아니라 생성으로 풀다
RLHF Reward 설계 시리즈 #35 — next-token prediction으로 학습한 verifier가 CoT와 test-time compute를 얻는 법
-
Prometheus 2: 평가 기준을 입력으로 받는 judge
RLHF Reward 설계 시리즈 #34 — 오픈 평가자 모델, rubric 조건부 평가, 그리고 절대 점수와 쌍대 비교의 통합
-
DeepSeek-R1: reward model을 규칙으로 대체하다
RLHF Reward 설계 시리즈 #33 — RLVR이 통하는 도메인과 통하지 않는 도메인, 그리고 PRM을 버린 이유
-
Math-Shepherd: 사람 라벨 없이 PRM을 만들다
RLHF Reward 설계 시리즈 #32 — rollout으로 단계별 라벨을 자동 생성하는 법, 그리고 PRM 평가의 함정