ppo
an archive of posts with this tag
| Aug 11, 2026 | 토큰과 세그먼트로 더 잘게 — 세밀한 입도의 득과 실 |
|---|---|
| Aug 11, 2026 | 턴 단위로 공을 나눈다 — turn-level reward 설계 |
| Aug 11, 2026 | RLOO: PPO의 절반은 RLHF에 필요 없었다 |
| Aug 11, 2026 | GRPO: value network를 버리고 그룹 안에서 비교하다 |
| Aug 11, 2026 | Secrets of RLHF I: PPO 학습은 왜 터지는가 |
| Aug 11, 2026 | PPO: clipped surrogate objective는 무엇을 지키는가 |
| Aug 11, 2026 | Llama 2의 RLHF: reward model을 두 개로 쪼갠 이유 |
| Aug 11, 2026 | InstructGPT: RLHF 3단계 레시피의 표준을 세우다 |