-
GRPO: value network를 버리고 그룹 안에서 비교하다
RL Reward 설계 시리즈 #22 — critic 없이 그룹 상대 advantage로 PPO를 대체한 현재의 사실상 표준
-
Secrets of RLHF I: PPO 학습은 왜 터지는가
RL Reward 설계 시리즈 #21 — reward scaling, advantage normalization, policy 제약까지 PPO-max 안정화 레시피
-
PPO: clipped surrogate objective는 무엇을 지키는가
RL Reward 설계 시리즈 #20 — RLHF의 모든 하이퍼파라미터가 시작된 곳, 그리고 KL 제약의 의미
-
OR-Bench: 과잉 거절을 어떻게 측정할 것인가
RL Reward 설계 시리즈 #19 — 안전과 over-refusal의 트레이드오프를 8만 개 프롬프트로 재다
-
안전 정렬은 첫 몇 토큰에만 얹혀 있다
RL Reward 설계 시리즈 #18 — shallow safety alignment가 prefilling·fine-tuning 공격을 한 번에 설명한다