rlhf

an archive of posts with this tag

Aug 11, 2026 reward를 어떻게 설계할 것인가 — RM 설계 실무
Aug 11, 2026 프론티어 모델은 harmlessness reward를 어떻게 설계했나
Aug 11, 2026 프론티어 모델은 helpfulness reward를 어떻게 설계했나
Aug 11, 2026 결과만으로는 부족하다 — 장기 지평에서 증폭되는 RLVR의 한계
Aug 11, 2026 공을 어디에 돌릴 것인가 — credit assignment 47개 방법의 지도
Aug 11, 2026 One Token to Fool: GenRM도 결국 뚫린다
Aug 11, 2026 CriticEval: judge를 채점하는 벤치마크
Aug 11, 2026 Rubrics as Rewards: 정답이 없는 도메인에 reward를 만드는 법
Aug 11, 2026 J1: RL로 judge를 생각하게 만들다
Aug 11, 2026 ReasonGRM: judge에게 추론 능력을 이식하다
Aug 11, 2026 DeepSeek-GRM: reward model이 평가 기준을 스스로 만든다
Aug 11, 2026 Self-Taught Evaluators: 사람 라벨 없이 judge를 키우다
Aug 11, 2026 Generative Reward Models: GenRM과 선호 학습을 잇다
Aug 11, 2026 Generative Verifiers: reward를 분류가 아니라 생성으로 풀다
Aug 11, 2026 Prometheus 2: 평가 기준을 입력으로 받는 judge
Aug 11, 2026 DeepSeek-R1: reward model을 규칙으로 대체하다
Aug 11, 2026 Math-Shepherd: 사람 라벨 없이 PRM을 만들다
Aug 11, 2026 Let's Verify Step by Step: 결과가 아니라 과정에 보상을 주다
Aug 11, 2026 WARP: 정책을 weight space에서 세 번 병합한다
Aug 11, 2026 BOND: Best-of-N을 추론 비용 없이 흉내 내다
Aug 11, 2026 DAPO: 신호 없는 프롬프트를 버리고, 탐색을 살린다
Aug 11, 2026 GSPO: importance ratio를 토큰이 아니라 시퀀스 단위로
Aug 11, 2026 KTO: 선호 쌍 없이, 좋다·나쁘다만으로 정렬한다
Aug 11, 2026 SimPO: reference 모델을 버리고 길이로 정규화한다
Aug 11, 2026 DPO: reward model을 없애면 무엇을 잃는가
Aug 11, 2026 RLOO: PPO의 절반은 RLHF에 필요 없었다
Aug 11, 2026 GRPO: value network를 버리고 그룹 안에서 비교하다
Aug 11, 2026 Secrets of RLHF I: PPO 학습은 왜 터지는가
Aug 11, 2026 PPO: clipped surrogate objective는 무엇을 지키는가
Aug 11, 2026 OR-Bench: 과잉 거절을 어떻게 측정할 것인가
Aug 11, 2026 안전 정렬은 첫 몇 토큰에만 얹혀 있다
Aug 11, 2026 Deliberative Alignment: 안전 명세를 모델의 추론 안으로
Aug 11, 2026 Rule-Based Rewards: 안전 규칙을 reward로 직접 번역한다
Aug 11, 2026 Safe RLHF: 안전성을 reward가 아니라 '제약'으로 다룬다
Aug 11, 2026 WARM: reward model을 weight 공간에서 평균내다
Aug 11, 2026 아첨(sycophancy): RM은 사실보다 동의를 좋아한다
Aug 11, 2026 ODIN: reward에서 길이 성분을 떼어내다
Aug 11, 2026 RLHF는 정말 좋아진 걸까, 길어진 걸까
Aug 11, 2026 Reward Model Overoptimization: Goodhart의 법칙을 수식으로 쓰다
Aug 11, 2026 RewardBench 2: reward model을 어떻게 믿을 것인가
Aug 11, 2026 Llama 2의 RLHF: reward model을 두 개로 쪼갠 이유
Aug 11, 2026 ArmoRM: 하나의 스칼라를 해석 가능한 여러 축으로 쪼개다
Aug 11, 2026 Skywork-Reward: 데이터 큐레이션이 아키텍처를 이긴다
Aug 11, 2026 Secrets of RLHF II: 선호 데이터의 노이즈와 reward model의 일반화
Aug 11, 2026 Rethinking Bradley-Terry: 왜 이 식으로 reward를 만드는가
Aug 11, 2026 HH-RLHF: helpfulness와 harmlessness는 왜 충돌하는가
Aug 11, 2026 InstructGPT: RLHF 3단계 레시피의 표준을 세우다
Aug 11, 2026 Deep RL from Human Preferences: 보상 함수를 사람의 선호로 배우다
May 29, 2026 Shallow Safety Alignment — RLHF는 첫 5개 토큰만 reshape한다
May 29, 2026 Universal Jailbreak Backdoors from Poisoned RLHF — 트리거 단어 하나가 'sudo'가 된다
May 29, 2026 Fine-tuning Compromises Safety — 10개 예시면 alignment가 무너진다
May 29, 2026 PKU-SafeRLHF-30K: A Dual-Preference Dataset for Safe-RLHF
May 26, 2026 BeaverTails: helpfulness와 harmlessness를 분리한 안전 정렬 데이터셋
May 26, 2026 HH-RLHF Red-Team Attempts: Anthropic의 38,961건 레드팀 대화 데이터셋
May 18, 2026 Constitutional AI: Harmlessness from AI Feedback
May 16, 2026 Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned