reward-hacking
an archive of posts with this tag
| Aug 11, 2026 | One Token to Fool: GenRM도 결국 뚫린다 |
|---|---|
| Aug 11, 2026 | WARM: reward model을 weight 공간에서 평균내다 |
| Aug 11, 2026 | ODIN: reward에서 길이 성분을 떼어내다 |
| Aug 11, 2026 | RLHF는 정말 좋아진 걸까, 길어진 걸까 |
| Aug 11, 2026 | Reward Model Overoptimization: Goodhart의 법칙을 수식으로 쓰다 |