-
Deliberative Alignment: 안전 명세를 모델의 추론 안으로
RL Reward 설계 시리즈 #17 — 안전 규칙을 라벨 생성용이 아니라 모델이 직접 읽고 추론하게 만들다
-
Rule-Based Rewards: 안전 규칙을 reward로 직접 번역한다
RL Reward 설계 시리즈 #16 — 명제와 LLM grader로 over-refusal을 줄이는 OpenAI의 안전 reward
-
Safe RLHF: 안전성을 reward가 아니라 '제약'으로 다룬다
RL Reward 설계 시리즈 #15 — helpful과 harmless를 분리하고, 안전성을 최대화가 아닌 제약으로 푼다
-
WARM: reward model을 weight 공간에서 평균내다
RL Reward 설계 시리즈 #14 — 앙상블의 강건성을 단일 모델 비용으로 얻어 reward hacking을 막는 법
-
아첨(sycophancy): RM은 사실보다 동의를 좋아한다
RL Reward 설계 시리즈 #13 — 선호 데이터가 진실보다 동조를 보상하는 구조적 문제