-
reward를 어떻게 설계할 것인가 — RM 설계 실무
RL Reward 설계 시리즈 #62 — 시리즈 61편을 관통한 reward 시스템 설계 절차를 한 장의 실무 가이드로
-
프론티어 모델은 실제로 어떻게 하나
RL Reward 설계 시리즈 #61(완결) — 아홉 개 프론티어 모델의 공개 자료에서 agentic reward·credit assignment 설계만 추려 비교한다
-
프론티어 모델은 harmlessness reward를 어떻게 설계했나
RL Reward 설계 시리즈 #60 — 안전성 reward의 실전 설계와 over-refusal 트레이드오프
-
프론티어 모델은 helpfulness reward를 어떻게 설계했나
RL Reward 설계 시리즈 #59 — 열한 개 프론티어 모델이 능력(helpfulness) reward를 설계한 방식 비교
-
에이전트의 reward hacking — 판정기가 뚫린다, 그리고 조합의 실패
RL Reward 설계 시리즈 #58 — Motif(Klissarov et al., ICLR 2024)의 misalignment by composition: 개별로는 정렬된 보상들이 합쳐지면 왜 뚫리는가