rl
an archive of posts with this tag
| Aug 11, 2026 | 프론티어 모델은 실제로 어떻게 하나 |
|---|---|
| Aug 11, 2026 | 결과만으로는 부족하다 — 장기 지평에서 증폭되는 RLVR의 한계 |
| Aug 11, 2026 | PPO: clipped surrogate objective는 무엇을 지키는가 |
| Aug 11, 2026 | Deep RL from Human Preferences: 보상 함수를 사람의 선호로 배우다 |
an archive of posts with this tag
| Aug 11, 2026 | 프론티어 모델은 실제로 어떻게 하나 |
|---|---|
| Aug 11, 2026 | 결과만으로는 부족하다 — 장기 지평에서 증폭되는 RLVR의 한계 |
| Aug 11, 2026 | PPO: clipped surrogate objective는 무엇을 지키는가 |
| Aug 11, 2026 | Deep RL from Human Preferences: 보상 함수를 사람의 선호로 배우다 |