| Aug 11, 2026 | One Token to Fool: GenRM도 결국 뚫린다 |
| Aug 11, 2026 | CriticEval: judge를 채점하는 벤치마크 |
| Aug 11, 2026 | Rubrics as Rewards: 정답이 없는 도메인에 reward를 만드는 법 |
| Aug 11, 2026 | J1: RL로 judge를 생각하게 만들다 |
| Aug 11, 2026 | ReasonGRM: judge에게 추론 능력을 이식하다 |
| Aug 11, 2026 | DeepSeek-GRM: reward model이 평가 기준을 스스로 만든다 |
| Aug 11, 2026 | Self-Taught Evaluators: 사람 라벨 없이 judge를 키우다 |
| Aug 11, 2026 | Generative Reward Models: GenRM과 선호 학습을 잇다 |
| Aug 11, 2026 | Generative Verifiers: reward를 분류가 아니라 생성으로 풀다 |
| Aug 11, 2026 | Prometheus 2: 평가 기준을 입력으로 받는 judge |
| Aug 11, 2026 | DeepSeek-R1: reward model을 규칙으로 대체하다 |
| Aug 11, 2026 | Math-Shepherd: 사람 라벨 없이 PRM을 만들다 |
| Aug 11, 2026 | Let's Verify Step by Step: 결과가 아니라 과정에 보상을 주다 |
| Aug 11, 2026 | DPO: reward model을 없애면 무엇을 잃는가 |
| Aug 11, 2026 | RLOO: PPO의 절반은 RLHF에 필요 없었다 |
| Aug 11, 2026 | GRPO: value network를 버리고 그룹 안에서 비교하다 |
| Aug 11, 2026 | Secrets of RLHF I: PPO 학습은 왜 터지는가 |
| Aug 11, 2026 | PPO: clipped surrogate objective는 무엇을 지키는가 |
| Aug 11, 2026 | WARM: reward model을 weight 공간에서 평균내다 |
| Aug 11, 2026 | ODIN: reward에서 길이 성분을 떼어내다 |
| Aug 11, 2026 | RLHF는 정말 좋아진 걸까, 길어진 걸까 |
| Aug 11, 2026 | Reward Model Overoptimization: Goodhart의 법칙을 수식으로 쓰다 |
| Aug 11, 2026 | RewardBench 2: reward model을 어떻게 믿을 것인가 |
| Aug 11, 2026 | Llama 2의 RLHF: reward model을 두 개로 쪼갠 이유 |
| Aug 11, 2026 | ArmoRM: 하나의 스칼라를 해석 가능한 여러 축으로 쪼개다 |
| Aug 11, 2026 | Skywork-Reward: 데이터 큐레이션이 아키텍처를 이긴다 |
| Aug 11, 2026 | Secrets of RLHF II: 선호 데이터의 노이즈와 reward model의 일반화 |
| Aug 11, 2026 | Rethinking Bradley-Terry: 왜 이 식으로 reward를 만드는가 |
| Aug 11, 2026 | HH-RLHF: helpfulness와 harmlessness는 왜 충돌하는가 |
| Aug 11, 2026 | InstructGPT: RLHF 3단계 레시피의 표준을 세우다 |
| Aug 11, 2026 | Deep RL from Human Preferences: 보상 함수를 사람의 선호로 배우다 |
| May 29, 2026 | Shallow Safety Alignment — RLHF는 첫 5개 토큰만 reshape한다 |
| May 29, 2026 | Universal Jailbreak Backdoors from Poisoned RLHF — 트리거 단어 하나가 'sudo'가 된다 |
| May 29, 2026 | Fine-tuning Compromises Safety — 10개 예시면 alignment가 무너진다 |
| May 29, 2026 | PKU-SafeRLHF-30K: A Dual-Preference Dataset for Safe-RLHF |
| May 26, 2026 | BeaverTails: helpfulness와 harmlessness를 분리한 안전 정렬 데이터셋 |
| May 26, 2026 | HH-RLHF Red-Team Attempts: Anthropic의 38,961건 레드팀 대화 데이터셋 |
| May 18, 2026 | Constitutional AI: Harmlessness from AI Feedback |
| May 16, 2026 | Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned |