-
reward를 어떻게 설계할 것인가 — RM 설계 실무
RLHF Reward 설계 시리즈 #46 — 시리즈 44편을 관통한 reward 시스템 설계 절차를 한 장의 실무 가이드로
-
프론티어 모델은 harmlessness reward를 어떻게 설계했나
RLHF Reward 설계 시리즈 #45 — 안전성 reward의 실전 설계와 over-refusal 트레이드오프
-
프론티어 모델은 helpfulness reward를 어떻게 설계했나
RLHF Reward 설계 시리즈 #44 — 열한 개 프론티어 모델이 능력(helpfulness) reward를 설계한 방식 비교
-
One Token to Fool: GenRM도 결국 뚫린다
RLHF Reward 설계 시리즈 #43 — 무의미한 토큰 하나로 무너지는 생성형 judge, 그리고 38편의 결론
-
CriticEval: judge를 채점하는 벤치마크
RLHF Reward 설계 시리즈 #42 — 비평 능력을 4개 차원으로 쪼개 평가하다