agentic-rl
an archive of posts with this tag
| Aug 25, 2026 | 에이전트의 reward hacking — 판정기가 뚫린다, 그리고 조합의 실패 |
|---|---|
| Aug 25, 2026 | 웹·GUI 에이전트 — end-to-end 멀티턴 RL |
| Aug 25, 2026 | 코드 에이전트 — SWE-RL과 테스트라는 reward |
| Aug 25, 2026 | 검색 에이전트 — Search-R1에서 DeepDive까지 |
| Aug 25, 2026 | 궤적을 judge가 채점한다 — rubric 생성형 reward의 확장 |
| Aug 25, 2026 | 도구 호출을 어떻게 채점하나 — ToolRL·ToolRM |
| Aug 25, 2026 | 환경이 곧 reward다 — 샌드박스·테스트·상태 검증 |
| Aug 25, 2026 | shaping은 약인가 독인가 — 중간 보상의 효율과 위험 |
| Aug 25, 2026 | 토큰과 세그먼트로 더 잘게 — 세밀한 입도의 득과 실 |
| Aug 25, 2026 | 턴 단위로 공을 나눈다 — turn-level reward 설계 |
| Aug 25, 2026 | 멀티턴 RL 실무 가이드 — 무엇이 실제로 작동하는가 |
| Aug 25, 2026 | 공을 어디에 돌릴 것인가 — credit assignment 47개 방법의 지도 |
| Aug 25, 2026 | 에이전트 RL은 무엇이 다른가 — 장기 지평·희소 보상·긴 궤적 |