-
CriticEval: judge를 채점하는 벤치마크
RL Reward 설계 시리즈 #42 — 비평 능력을 4개 차원으로 쪼개 평가하다
-
Rubrics as Rewards: 정답이 없는 도메인에 reward를 만드는 법
RL Reward 설계 시리즈 #41 — 채점 기준표를 reward로 바꿔 RLVR을 비검증 도메인으로 확장하다
-
J1: RL로 judge를 생각하게 만들다
RL Reward 설계 시리즈 #40 — 비검증 프롬프트를 검증 가능한 판정 태스크로 바꿔 judge를 RL로 학습시키는 법
-
ReasonGRM: judge에게 추론 능력을 이식하다
RL Reward 설계 시리즈 #39 — Large Reasoning Model로 generative reward model을 강화하는 법
-
DeepSeek-GRM: reward model이 평가 기준을 스스로 만든다
RL Reward 설계 시리즈 #38 — SPCT로 원칙과 critique를 생성하고, inference-time scaling으로 training-time scaling을 이기다