reward-design
an archive of posts with this tag
| Aug 25, 2026 | 검색 에이전트 — Search-R1에서 DeepDive까지 |
|---|---|
| Aug 25, 2026 | 궤적을 judge가 채점한다 — rubric 생성형 reward의 확장 |
| Aug 25, 2026 | 도구 호출을 어떻게 채점하나 — ToolRL·ToolRM |
| Aug 25, 2026 | 환경이 곧 reward다 — 샌드박스·테스트·상태 검증 |
| Aug 25, 2026 | 턴 단위로 공을 나눈다 — turn-level reward 설계 |