-
환경이 곧 reward다 — 샌드박스·테스트·상태 검증
RL Reward 설계 시리즈 #52 — 환경 신호가 왜 특별한지, 그리고 파라미터 없는 검증기도 결국 어디서 뚫리는지
-
shaping은 약인가 독인가 — 중간 보상의 효율과 위험
RL Reward 설계 시리즈 #51 — Ng et al.(1999)의 PBRS 이론부터 Planner-R1·Progressive Reward Shaping까지, 중간 보상이 여는 새로운 hacking 표면을 수식과 반례로 검증한다
-
토큰과 세그먼트로 더 잘게 — 세밀한 입도의 득과 실
RL Reward 설계 시리즈 #50 — 토큰·세그먼트 단위 credit assignment의 득과 실, 그리고 추정이 만드는 hacking 표면
-
스텝을 단위로 삼는다 — 행동 단위 궤적 표현과 credit
RL Reward 설계 시리즈 #49 — GiGPO의 anchor state grouping, VinePPO의 Monte Carlo value, ArCHer의 계층 구조, AgentPRM·SWEET-RL·HICRA까지, 행동(스텝)을 credit의 단위로 삼는 여섯 가지 방법
-
턴 단위로 공을 나눈다 — turn-level reward 설계
RL Reward 설계 시리즈 #48 — MT-GRPO와 MT-PPO로 보는 turn-level credit assignment, 그리고 그 대가로 따라오는 새로운 hacking