preference-optimization
an archive of posts with this tag
| Aug 11, 2026 | KTO: 선호 쌍 없이, 좋다·나쁘다만으로 정렬한다 |
|---|---|
| Aug 11, 2026 | SimPO: reference 모델을 버리고 길이로 정규화한다 |
| Aug 11, 2026 | DPO: reward model을 없애면 무엇을 잃는가 |
an archive of posts with this tag
| Aug 11, 2026 | KTO: 선호 쌍 없이, 좋다·나쁘다만으로 정렬한다 |
|---|---|
| Aug 11, 2026 | SimPO: reference 모델을 버리고 길이로 정규화한다 |
| Aug 11, 2026 | DPO: reward model을 없애면 무엇을 잃는가 |