ppo
an archive of posts with this tag
| Aug 11, 2026 | RLOO: PPO의 절반은 RLHF에 필요 없었다 |
|---|---|
| Aug 11, 2026 | GRPO: value network를 버리고 그룹 안에서 비교하다 |
| Aug 11, 2026 | Secrets of RLHF I: PPO 학습은 왜 터지는가 |
| Aug 11, 2026 | PPO: clipped surrogate objective는 무엇을 지키는가 |
| Aug 11, 2026 | Llama 2의 RLHF: reward model을 두 개로 쪼갠 이유 |
| Aug 11, 2026 | InstructGPT: RLHF 3단계 레시피의 표준을 세우다 |