-
ArmoRM: 하나의 스칼라를 해석 가능한 여러 축으로 쪼개다
RL Reward 설계 시리즈 #7 — 다목적 reward 분해와 MoE 게이팅으로 8B가 340B에 근접하다
-
Skywork-Reward: 데이터 큐레이션이 아키텍처를 이긴다
RL Reward 설계 시리즈 #6 — 80K 선별 데이터로 SOTA를 찍은 레시피, 그리고 V2의 40M 확장
-
Secrets of RLHF II: 선호 데이터의 노이즈와 reward model의 일반화
RL Reward 설계 시리즈 #5 — 잘못된 선호 쌍을 걸러내고 RM을 OOD에 강하게 만드는 법
-
Rethinking Bradley-Terry: 왜 이 식으로 reward를 만드는가
RL Reward 설계 시리즈 #4 — BT 모델의 이론적 근거와 order consistency, 그리고 대안 목적함수
-
HH-RLHF: helpfulness와 harmlessness는 왜 충돌하는가
RL Reward 설계 시리즈 #3 — preference model의 스케일링과 helpful·harmless 텐션 (Bai et al., Anthropic, arXiv 2022)