-
ODIN: reward에서 길이 성분을 떼어내다
RL Reward 설계 시리즈 #12 — 두 개의 head로 품질과 길이를 분리 학습해 length hacking을 막는 법
-
RLHF는 정말 좋아진 걸까, 길어진 걸까
RL Reward 설계 시리즈 #11 — reward 향상의 대부분이 길이로 설명된다는 불편한 결과
-
Reward Model Overoptimization: Goodhart의 법칙을 수식으로 쓰다
RL Reward 설계 시리즈 #10 — proxy reward를 올릴수록 진짜 reward가 꺾이는 지점의 스케일링 법칙
-
RewardBench 2: reward model을 어떻게 믿을 것인가
RL Reward 설계 시리즈 #9 — RewardBench가 saturate된 이유와, downstream 성능과 상관되는 평가 설계
-
Llama 2의 RLHF: reward model을 두 개로 쪼갠 이유
RL Reward 설계 시리즈 #8 — helpfulness·safety RM 분리, margin loss, rejection sampling에서 PPO까지의 프로덕션 레시피