-
결과만으로는 부족하다 — 장기 지평에서 증폭되는 RLVR의 한계
RL Reward 설계 시리즈 #47 — outcome reward만으로는 장기 지평에서 왜 무너지는가: GRPO의 advantage 붕괴와 배치 낭비를 수식으로 확인한다
-
멀티턴 RL 실무 가이드 — 무엇이 실제로 작동하는가
RL Reward 설계 시리즈 #46 — 마스킹, 롤아웃 예산, 실패 궤적 처리까지, 두 편의 실증 논문이 확인한 멀티턴 RL 설계 결정
-
공을 어디에 돌릴 것인가 — credit assignment 47개 방법의 지도
RL Reward 설계 시리즈 #45 — credit assignment 47개 방법을 입도×방법론 2차원으로 지도화한다
-
에이전트 RL은 무엇이 다른가 — 장기 지평·희소 보상·긴 궤적
RL Reward 설계 시리즈 #44 — 단일 턴 RLVR과 에이전트 RL을 가르는 세 축(궤적 길이·보상 시점·환경)과 16편 전체 지도
-
One Token to Fool: GenRM도 결국 뚫린다
RL Reward 설계 시리즈 #43 — 무의미한 토큰 하나로 무너지는 생성형 judge, 그리고 38편의 결론