reward-hacking
an archive of posts with this tag
| Aug 11, 2026 | reward를 어떻게 설계할 것인가 — RM 설계 실무 |
|---|---|
| Aug 11, 2026 | 에이전트의 reward hacking — 판정기가 뚫린다, 그리고 조합의 실패 |
| Aug 11, 2026 | 웹·GUI 에이전트 — end-to-end 멀티턴 RL |
| Aug 11, 2026 | 코드 에이전트 — SWE-RL과 테스트라는 reward |
| Aug 11, 2026 | 궤적을 judge가 채점한다 — rubric 생성형 reward의 확장 |
| Aug 11, 2026 | 환경이 곧 reward다 — 샌드박스·테스트·상태 검증 |
| Aug 11, 2026 | shaping은 약인가 독인가 — 중간 보상의 효율과 위험 |
| Aug 11, 2026 | 토큰과 세그먼트로 더 잘게 — 세밀한 입도의 득과 실 |
| Aug 11, 2026 | One Token to Fool: GenRM도 결국 뚫린다 |
| Aug 11, 2026 | WARM: reward model을 weight 공간에서 평균내다 |
| Aug 11, 2026 | 아첨(sycophancy): RM은 사실보다 동의를 좋아한다 |
| Aug 11, 2026 | ODIN: reward에서 길이 성분을 떼어내다 |
| Aug 11, 2026 | RLHF는 정말 좋아진 걸까, 길어진 걸까 |
| Aug 11, 2026 | Reward Model Overoptimization: Goodhart의 법칙을 수식으로 쓰다 |