-
Rubrics as Rewards: 정답이 없는 도메인에 reward를 만드는 법
RLHF Reward 설계 시리즈 #41 — 채점 기준표를 reward로 바꿔 RLVR을 비검증 도메인으로 확장하다
-
J1: RL로 judge를 생각하게 만들다
RLHF Reward 설계 시리즈 #40 — 비검증 프롬프트를 검증 가능한 판정 태스크로 바꿔 judge를 RL로 학습시키는 법
-
ReasonGRM: judge에게 추론 능력을 이식하다
RLHF Reward 설계 시리즈 #39 — Large Reasoning Model로 generative reward model을 강화하는 법
-
DeepSeek-GRM: reward model이 평가 기준을 스스로 만든다
RLHF Reward 설계 시리즈 #38 — SPCT로 원칙과 critique를 생성하고, inference-time scaling으로 training-time scaling을 이기다
-
Self-Taught Evaluators: 사람 라벨 없이 judge를 키우다
RLHF Reward 설계 시리즈 #37 — 합성 데이터만으로 LLM judge를 반복 자기개선시키는 법