-
웹·GUI 에이전트 — end-to-end 멀티턴 RL
RL Reward 설계 시리즈 #57 — 신호가 가장 척박한 도메인에서 end-to-end 멀티턴 RL이 웹·GUI 에이전트를 학습시키는 법 (WebAgent-R1, PAE, DigiRL)
-
코드 에이전트 — SWE-RL과 테스트라는 reward
RL Reward 설계 시리즈 #56 — SWE-RL·SWE-Gym·R2E-Gym이 테스트라는 축복받은 reward를 실제로 어떻게(안) 쓰는가
-
검색 에이전트 — Search-R1에서 DeepDive까지
RL Reward 설계 시리즈 #55 — 검색 에이전트의 reward는 EM/F1로 손쉽게 나오는데, 왜 중간 신호는 여전히 성긴가
-
궤적을 judge가 채점한다 — rubric 생성형 reward의 확장
RL Reward 설계 시리즈 #54 — 환경도 도구도 못 채점하는 궤적을 judge가 rubric으로 판정할 때 무엇이 달라지고, 어떻게 뚫리는가
-
도구 호출을 어떻게 채점하나 — ToolRL·ToolRM
RL Reward 설계 시리즈 #53 — 도구 호출의 형식·선택·파라미터를 규칙으로, 필요성·결과 활용을 judge로 채점하는 두 축을 ToolRL의 reward ablation과 ToolRM의 outcome reward model로 뜯어본다