credit-assignment
an archive of posts with this tag
| Aug 25, 2026 | 프론티어 모델은 실제로 어떻게 하나 |
|---|---|
| Aug 25, 2026 | 에이전트의 reward hacking — 판정기가 뚫린다, 그리고 조합의 실패 |
| Aug 25, 2026 | 웹·GUI 에이전트 — end-to-end 멀티턴 RL |
| Aug 25, 2026 | 검색 에이전트 — Search-R1에서 DeepDive까지 |
| Aug 25, 2026 | 궤적을 judge가 채점한다 — rubric 생성형 reward의 확장 |
| Aug 25, 2026 | shaping은 약인가 독인가 — 중간 보상의 효율과 위험 |
| Aug 25, 2026 | 토큰과 세그먼트로 더 잘게 — 세밀한 입도의 득과 실 |
| Aug 25, 2026 | 스텝을 단위로 삼는다 — 행동 단위 궤적 표현과 credit |
| Aug 25, 2026 | 턴 단위로 공을 나눈다 — turn-level reward 설계 |
| Aug 25, 2026 | 결과만으로는 부족하다 — 장기 지평에서 증폭되는 RLVR의 한계 |
| Aug 25, 2026 | 멀티턴 RL 실무 가이드 — 무엇이 실제로 작동하는가 |
| Aug 25, 2026 | 공을 어디에 돌릴 것인가 — credit assignment 47개 방법의 지도 |
| Aug 25, 2026 | 에이전트 RL은 무엇이 다른가 — 장기 지평·희소 보상·긴 궤적 |