grpo
an archive of posts with this tag
| Aug 11, 2026 | 프론티어 모델은 helpfulness reward를 어떻게 설계했나 |
|---|---|
| Aug 11, 2026 | 도구 호출을 어떻게 채점하나 — ToolRL·ToolRM |
| Aug 11, 2026 | 토큰과 세그먼트로 더 잘게 — 세밀한 입도의 득과 실 |
| Aug 11, 2026 | 스텝을 단위로 삼는다 — 행동 단위 궤적 표현과 credit |
| Aug 11, 2026 | 턴 단위로 공을 나눈다 — turn-level reward 설계 |
| Aug 11, 2026 | 결과만으로는 부족하다 — 장기 지평에서 증폭되는 RLVR의 한계 |
| Aug 11, 2026 | DeepSeek-R1: reward model을 규칙으로 대체하다 |
| Aug 11, 2026 | DAPO: 신호 없는 프롬프트를 버리고, 탐색을 살린다 |
| Aug 11, 2026 | GSPO: importance ratio를 토큰이 아니라 시퀀스 단위로 |
| Aug 11, 2026 | GRPO: value network를 버리고 그룹 안에서 비교하다 |