-
Self-Taught Evaluators: 사람 라벨 없이 judge를 키우다
RL Reward 설계 시리즈 #37 — 합성 데이터만으로 LLM judge를 반복 자기개선시키는 법
-
Generative Reward Models: GenRM과 선호 학습을 잇다
RL Reward 설계 시리즈 #36 — 판별 RM과 생성 judge 사이, 그리고 CLoud 하이브리드
-
Generative Verifiers: reward를 분류가 아니라 생성으로 풀다
RL Reward 설계 시리즈 #35 — next-token prediction으로 학습한 verifier가 CoT와 test-time compute를 얻는 법
-
Prometheus 2: 평가 기준을 입력으로 받는 judge
RL Reward 설계 시리즈 #34 — 오픈 평가자 모델, rubric 조건부 평가, 그리고 절대 점수와 쌍대 비교의 통합
-
DeepSeek-R1: reward model을 규칙으로 대체하다
RL Reward 설계 시리즈 #33 — RLVR이 통하는 도메인과 통하지 않는 도메인, 그리고 PRM을 버린 이유