over-refusal
an archive of posts with this tag
| Aug 11, 2026 | OR-Bench: 과잉 거절을 어떻게 측정할 것인가 |
|---|---|
| Aug 11, 2026 | Deliberative Alignment: 안전 명세를 모델의 추론 안으로 |
| Aug 11, 2026 | Rule-Based Rewards: 안전 규칙을 reward로 직접 번역한다 |
| Aug 11, 2026 | Safe RLHF: 안전성을 reward가 아니라 '제약'으로 다룬다 |