프론티어 모델은 helpfulness reward를 어떻게 설계했나
이 글은 열한 개 프론티어 모델의 공개 자료를 가로지른다 — DeepSeek-V4, Qwen3, Llama 4, Kimi K3, Solar Open 2, K-EXAONE 2.0, A.X K2, MiniMax-M1, GLM-4.5, Magistral, Gemma 4. 한국 팀 셋(Solar·K-EXAONE·A.X)과 유럽 팀 하나(Magistral)가 함께 오른다. 이 중 Llama 4만 정식 technical report 없이 공식 블로그로 공개됐다. 이 글은 능력(helpfulness) 축을 다루고, 안전성(harmlessness) 축은 #60 에서 따로 뜯는다.
Introduction
43편 동안 이 시리즈는 reward를 부품 단위로 뜯어봤다. 사람 선호를 스칼라로 압축하는 Bradley-Terry(#4), 그 스칼라가 hacking당하는 방식과 방어법(#10~#14), reward를 정책 업데이트로 바꾸는 PPO·GRPO·DPO(#20~#24), 검증 가능한 도메인에서 학습된 reward model 자체를 규칙으로 대체하는 RLVR(#31~#33), 학습된 RM을 생성형 judge로 재구성하는 흐름(#34~#38), 그리고 그 judge가 스스로 생각하고 그 신뢰 자체를 검증하는 최신 연구(#39~#43). 하나하나는 특정 논문이 특정 문제 하나에 답한 결과였다.
그런데 실제로 프론티어급 모델을 학습시키는 팀은 이 부품 중 무엇을, 어떤 조합으로, 왜 골랐을까. 이 글은 “논문 1편 = 포스트 1편” 형식을 벗어나 열한 개 공개 자료 — DeepSeek-V4, Qwen3, Llama 4, Kimi K3, Solar Open 2, K-EXAONE 2.0, A.X K2, MiniMax-M1, GLM-4.5, Magistral, Gemma 4 — 를 가로질러 reward 설계의 실전 선택지를 비교한다. 그리고 이 비교에서 뽑아낸 설계 원칙은 다음 글 #62에서 한 장의 실무 가이드로 정리한다.
미리 결론의 윤곽을 말하면 세 가지다.
- 검증 가능한 도메인(수학, 코드)에서는 열한 모델이 놀랄 만큼 수렴한다. 학습된 RM을 걷어내고 규칙 검증기를 쓴다.
- 검증 불가능한 도메인(대화, 글쓰기, 개방형 추론)에서는 갈라진다 — 하지만 그 분기의 한복판에서 generative reward model(GRM)이 처음으로 프로덕션 report에 등장했다. 이 시리즈 7부가 “연구 단계에만 있다”고 정리했던 흐름이 DeepSeek-V4와 Kimi K3에서 실제 학습 파이프라인으로 넘어온 순간이다.
- reward 설계는 “함수”만의 문제가 아니다. 어떤 프롬프트에 그 함수를 먹이느냐(난이도 커리큘럼, 분산 선별), 오프라인·온라인을 어떻게 섞느냐가 함수 선택만큼 중요하다.
이 글은 다음 순서로 그 수렴점과 분기점을 짚는다.
- 시리즈가 쌓은 재료를 reward “조달처” 4분류로 재정리한다 (Background)
- 열한 모델 각각이 reward를 어디서 조달하고 어떤 알고리즘으로 정책을 업데이트했는가 (Method)
- 검증 가능/불가능 도메인에서 왜 수렴하고 왜 갈라지는가, GRM은 어디까지 왔는가 (Experiments)
- 프롬프트 선별·커리큘럼이라는 “숨은 reward 설계”, 그리고 hacking 방어 (Experiments)
- 지금 내가 reward를 설계해야 한다면 무엇을 골라야 하는가 (Conclusion)
먼저 열한 모델을 한 장으로 요약하면 이렇다. 각 칸의 근거는 이어지는 Method·Experiments에서 편별로 짚는다.
| 모델 | 팀 | 핵심 reward 조달처 | RL 알고리즘 |
|---|---|---|---|
| DeepSeek-V4 | DeepSeek (중) | 규칙 + GRM(비검증) | GRPO → on-policy 증류 |
| Qwen3 | Alibaba (중) | 규칙 / reference judge / 스칼라 RM 3분류 | GRPO + General RL |
| Llama 4 | Meta (미) | 비공개(online RL) + 선호쌍 | SFT → online RL → DPO |
| Kimi K3 | Moonshot (중) | 규칙(51.2M 샌드박스) + Agentic GRM | 9전문가 RL → MOPD 증류 |
| Solar Open 2 | Upstage (한) | 규칙 + rubric judge | GRPO(token) → 12전문가 MOPD |
| K-EXAONE 2.0 | LG (한) | 도메인별 규칙·rubric·judge | GrouPER + AGAPO |
| A.X K2 | SKT (한) | 규칙(+난이도필터) + reference rubric judge | CISPO + GDPO |
| MiniMax-M1 | MiniMax (중) | 규칙 + GenRM(length bias 감시) | CISPO(원조) |
| GLM-4.5 | Zhipu (중) | 규칙 / outcome / rule+RLHF+RLAIF | 3축 RL → self-distillation |
| Magistral | Mistral (유럽) | 규칙만(0.9정오+0.1format+language) | GRPO 변형(KL제거·Clip-Higher) |
| Gemma 4 | DeepMind (미) | 도메인별 다양한 reward + 코드실행·수학 정답 | BOND + WARM + WARP |
세 축이 한눈에 보인다 — 검증 가능 도메인은 모두 규칙, 검증 불가능 도메인은 judge·GRM으로 갈리고, 여럿이 “전문가→증류”로 통합한다. 아래에서 하나씩 뜯는다.
Background
시리즈가 쌓은 재료: 세 가지 축
시리즈가 지금까지 쌓아온 재료를 세 가지 축으로 요약하면 이렇다.
| 축 | 선택지 | 관련 편 |
|---|---|---|
| reward를 어디서 조달하는가 | 학습된 스칼라 RM / 규칙 기반 verifiable reward / judge·rubric | 2부(#4~#9), 6부(#31~#33), 6·8부(#34~#43) |
| 그 reward로 정책을 어떻게 업데이트하는가 | PPO / GRPO / DPO | 5부(#20~#24) |
| 도메인을 어떻게 가르는가 | 검증 가능(정답 존재) / 검증 불가능(정답 부재) | #33 DeepSeek-R1 |
reward 조달처를 4분류로: 이 글의 렌즈
열한 모델을 비교하려면 공통 좌표계가 필요하다. 마침 Qwen3의 report가 그 좌표계를 거의 그대로 제공한다 — Qwen3는 General RL 단계에서 reward를 세 종류로 명시적으로 나눈다. 여기에 DeepSeek-V4가 도입한 GRM을 더하면 네 개의 조달처가 된다. 이 4분류가 이 글 전체의 렌즈다.
| 조달처 | 어떻게 점수를 매기나 | 파라미터 유무 | 시리즈 대응 |
|---|---|---|---|
| ① 규칙 기반 verifiable reward | 파서 + 비교 로직 (정답 일치, 테스트 통과) | 없음 (hacking 불가) | 6부 #33 RLVR |
| ② 스칼라 RM (reference 없음) | 사람 선호로 학습한 신경망이 스칼라 점수 | 있음 | 2부 #4~#9 |
| ③ reference 기반 judge | 정답 예시를 주고 그에 비추어 채점 (rubric 조건부) | 있음 (판정 모델) | 7부 #34 Prometheus 2 |
| ④ generative RM (GRM, self-critique) | 모델이 근거를 생성하며 채점, 때로 자기 출력을 스스로 평가 | 있음 (생성 모델) | 6·8부 #38 DeepSeek-GRM, #40 J1 |
이 4분류를 머리에 넣고 보면, 열한 모델의 선택이 한눈에 정렬된다. ①은 검증 가능 도메인의 표준이 됐고, ②·③·④는 검증 불가능 도메인을 두고 갈라진다.
RL 알고리즘 한눈에
reward를 정책으로 옮기는 알고리즘도 이 글에 여럿 등장한다. 이름에 압도되지 않도록 미리 지도를 그려둔다.
| 알고리즘 | 핵심 아이디어 | 이 글의 채택 모델 | 편 |
|---|---|---|---|
| PPO | clipped surrogate + value network | (기준선) | #20 |
| GRPO | value network를 버리고 그룹 상대 advantage | DeepSeek-V4·Qwen3·Solar 2·GLM-4.5·Magistral(변형) | #22 |
| DPO | RM·RL 루프 없이 선호 쌍에서 직접 학습 | Llama 4(가볍게) | #24 |
| CISPO | token이 아니라 IS 가중치를 클립(결정적 토큰 보존) | MiniMax-M1(원조)·A.X K2 | 본문 |
| GSPO | importance ratio를 sequence-level로 | (Solar 2는 명시적으로 회피) | 본문 |
| GDPO | 여러 reward를 각각 정규화 후 결합 | A.X K2 | 본문 |
| GrouPER | 그룹 상대 선호(SimPER류) | K-EXAONE 2.0 | 본문 |
| AGAPO | off-policy PG, 오답 추론에 음의 보상 | K-EXAONE 2.0 | 본문 |
| MOPD | 여러 전문가(teacher)를 on-policy 증류로 통합 | Kimi K3·Solar 2 | 본문 |
| DAPO | dynamic sampling(정답률 0/1 프롬프트 제거) | (#62에서 다룸) | #62 |
두 축만 기억하면 된다 — 위 4분류가 “reward를 어디서 얻나”, 이 표가 “그 reward를 정책으로 어떻게 옮기나”다. 대부분은 GRPO의 변형이고, 갈리는 지점은 (a) 무엇을 클립하나(token vs IS 가중치 vs sequence), (b) 여러 reward를 어떻게 섞나(GDPO), (c) 전문가를 어떻게 합치나(MOPD)다.
비교 대상 열한 모델
| 모델 | 발표 | 공개 형태 |
|---|---|---|
| DeepSeek-V4 | 2026-06 | arXiv:2606.19348 |
| Qwen3 | 2025-05 | arXiv:2505.09388 |
| Llama 4 | 2025-04 | Meta AI 블로그 (정식 논문 없음) |
| Kimi K3 | 2026-07 | Moonshot AI tech report |
| Solar Open 2 | 2026-07 | arXiv:2607.20062 |
| K-EXAONE 2.0 | 2026-08 | arXiv:2608.04505 |
| A.X K2 | 2026 | SKT-AI tech report |
| MiniMax-M1 | 2025-06 | arXiv:2506.13585 |
| GLM-4.5 | 2025-08 | arXiv:2508.06471 |
| Magistral | 2025-06 | arXiv:2506.10910 |
| Gemma 4 | 2026-06 | arXiv:2607.02770 (post-training은 Gemma 3 레시피 계승) |
공개 수준은 나라나 랩이 아니라 어떤 문서를 내느냐로 갈린다. 세 층으로 나뉜다.
| 공개 층위 | 모델 | reward 설계에 대해 알 수 있는 것 |
|---|---|---|
| ① 상세 technical report | DeepSeek-V4, Qwen3, Kimi K3, MiniMax-M1, GLM-4.5, Solar Open 2, K-EXAONE 2.0, A.X K2, Magistral | reward 함수 구성·알고리즘·하이퍼파라미터까지 |
| ② 방법 이름은 밝히되 배합은 비공개 | Gemma 4(→ Gemma 3 레시피) | “BOND, WARM, WARP의 개선판”이라고 이름을 명시하고, 각 방법은 별도 논문으로 전문 공개. 다만 배합·하이퍼파라미터는 비공개 |
| ③ 블로그·model card만 | Llama 4, (참고: OpenAI gpt-oss) | 파이프라인 골격까지. online RL의 reward 신호가 무엇인지 명시되지 않는다 |
두 가지를 짚어둘 만하다. 첫째, 같은 랩도 세대에 따라 층이 바뀐다. Meta는 Llama 3에서 rejection sampling 라운드 수·margin term 제거·DPO의 NLL 계수까지 적은 상세 논문(arXiv:2407.21783)을 냈지만, Llama 4는 블로그로 대체했다. 즉 “미국 랩은 감춘다”가 아니라 문서 형식이 바뀌면 공개 수준도 바뀐다가 사실에 가깝다.
둘째, OpenAI는 제품 레시피 대신 방법론을 논문으로 공개하는 쪽이다. 안전 reward 설계인 Rule-Based Rewards(#16)와 Deliberative Alignment(#17)는 방법 자체를 상세히 밝히지만, 그것이 어느 제품에 어떤 배합으로 들어갔는지는 밝히지 않는다. gpt-oss의 model card도 “large-scale distillation and reinforcement learning”이라는 한 줄이 전부다.
비공개 구간은 이 글이 매번 명시한다.
Method
DeepSeek-V4: 도메인 전문가를 각자 키운 뒤 하나로 증류한다
#33에서 다룬 DeepSeek-R1은 하나의 정책에 규칙 기반 reward를 꽂아 GRPO로 밀어붙이는 구조였다. DeepSeek-V4는 이 구조를 정면으로 바꾼다. 후처리를 두 단계로 나눈다.
- 도메인 전문가의 독립 육성. 수학, 코딩, 에이전트, instruction following 같은 도메인마다 별도의 전문가 모델을 따로 학습시킨다. 각 전문가는 같은 베이스에서 출발해 (a) 도메인 특화 데이터로 SFT를 받아 기초를 잡고, (b) 그 위에 GRPO를 얹어 “그 도메인의 성공 기준에 맞춘 reward”로 최적화된다.
- 통합 모델로의 on-policy 증류. 이렇게 만든 N개의 전문가를 하나의 모델로 합친다. 통합 모델(student)이 각 전문가(teacher)를 향해 reverse KL을 최소화하며 배우는 on-policy distillation이다.
- \(\pi_{\text{student}}\): 통합 모델 (배우는 쪽)
- \(\pi_{\text{teacher}}\): 해당 도메인 전문가 (가르치는 쪽)
- \(y \sim \pi_{\text{student}}\): student가 스스로 생성한 출력 위에서 손실을 잰다는 것이 “on-policy”의 핵심 — 오프라인 데이터셋이 아니라 student의 현재 분포에서 샘플링한다.
reward 관점에서 V4의 결정적 변화는 조달처를 도메인마다 갈아 끼운다는 점이다. 수학·코드처럼 규칙으로 검증되는 도메인은 R1과 같은 ① 규칙 기반 reward를 쓴다. 반면 규칙으로 검증하기 어려운 도메인에는 ④ Generative Reward Model(GRM) 을 도입한다 — 전통적인 스칼라 RM 대신, rubric으로 안내된 RL 데이터로 학습해 actor가 출력을 생성하면서 동시에 스스로 평가하게 만드는 방식이다. 이는 #38 DeepSeek-GRM/SPCT가 연구 단계에서 제안한 생성형 reward가 같은 팀의 프로덕션 모델로 넘어온 사례다.
다만 report는 각 도메인이 정확히 어떤 reward 함수를 썼는지까지는 상세히 공개하지 않는다. “reward models tailored to specific success criteria”라는 표현과 GRM 도입 사실이 확인되는 수준이며, 도메인별 세부 레시피는 R1만큼 투명하지 않다.
R1 → V4로 무엇이 바뀌었나. 바뀐 건 두 가지 — 정책 구조와 “규칙이 안 통하는 도메인”의 reward다.
| 축 | DeepSeek-R1 (2025-01) | DeepSeek-V4 (2026-06) |
|---|---|---|
| 정책 구조 | 하나의 통합 정책에 RL | N개 도메인 전문가 → 증류로 통합 |
| 검증 가능 reward | 규칙(accuracy + format) | 규칙(그대로 계승) |
| 검증 불가 reward | all-scenario 단계에서 학습된 스칼라 RM으로 복귀 | ④ GRM(rubric-guided, 생성형) |
| 전문가 통합 | (단일 정책이라 불필요) | on-policy distillation(reverse-KL) |
| PRM | 명시적으로 포기(단계 정의·중간 판정·hacking) | 전문가별 outcome reward + GRM |
R1의 메시지는 “검증 가능한 도메인에선 학습된 RM을 규칙으로 걷어낼 수 있다”였다. 그러나 R1도 정답이 없는 일반 대화에서는 all-scenario RL 단계에서 결국 학습된 스칼라 RM을 다시 불러왔다. V4는 바로 그 지점을 스칼라 RM에서 생성형 GRM으로 갈아끼웠고, 동시에 단일 정책을 전문가+증류 구조로 바꿨다. 규칙 reward는 그대로 두되, “규칙이 안 통하는 곳”의 답이 R1의 스칼라 RM → V4의 GRM으로 업그레이드된 셈이다.
Qwen3: 4단계 파이프라인과 reward 3분류
Qwen3의 후처리는 네 단계로 정연하게 나뉜다.
| 단계 | 하는 일 | reward 조달처 |
|---|---|---|
| 1. Long-CoT Cold Start | 긴 추론 패턴을 SFT로 심는다 | (SFT, reward 없음) |
| 2. Reasoning RL | 수학·코드에서 GRPO로 추론력을 끌어올린다 | ① 규칙 (query-verifier 쌍) |
| 3. Thinking Mode Fusion | thinking/non-thinking 모드를 하나로 융합 | (혼합) |
| 4. General RL | 개방형 도메인 전반으로 정렬을 확장 | ①·③·② 세 종류를 병용 |
2단계 Reasoning RL은 query-verifier 쌍을 쓴다 — 각 쿼리에 정오를 판정하는 verifier가 붙어 있고, 쿼리당 rollout을 많이 뽑아 GRPO로 학습한다. 샘플 효율을 위해 off-policy 학습도 섞는다(과거에 뽑아둔 rollout을 재활용).
핵심은 4단계 General RL이 reward를 세 종류로 명시적으로 나눈다는 점이다.
| reward 종류 | 작동 방식 | 이 시리즈 대응 |
|---|---|---|
| Rule-based Reward | 규칙으로 정오를 높은 정밀도로 판정 — “reward hacking을 예방” | ① #33 RLVR |
| Model-based Reward with reference | 정답 reference를 주고 Qwen2.5-72B-Instruct가 그에 비추어 채점 | ③ #34 Prometheus 2 |
| Model-based Reward without reference | 사람 선호 데이터로 학습한 RM이 스칼라 점수를 부여 | ② 2부 스칼라 RM |
이 세 줄이 정확히 Background의 4분류 중 ①②③에 대응한다. Qwen3가 흥미로운 건, 하나의 모델이 도메인에 따라 세 조달처를 동시에 운용한다는 것이다 — 정답이 있으면 규칙, 정답 예시가 있으면 reference judge, 둘 다 없으면 스칼라 RM. 작은 모델은 이 비싼 RL을 직접 돌리지 않고 strong-to-weak distillation으로 큰 모델을 증류해 받는데, RL 대비 약 1/10 GPU 시간이면 된다고 밝힌다.
Qwen2.5 → Qwen3로 무엇이 바뀌었나. reward가 “잘 고른 RM 하나”에서 “도메인별 3분류”로 분화했다.
| 축 | Qwen2.5 (2024-12) | Qwen3 (2025-05) |
|---|---|---|
| RL 단계 | offline DPO → online GRPO (2단계) | 4단계(cold start → reasoning RL → fusion → general RL) |
| reward 종류 | RM 기반 (단일 계열) | 3분류(규칙 / reference judge / 스칼라 RM) |
| 쿼리 전략 | RM=RL 쿼리셋, 분산 큰 쿼리 우선(8 샘플, batch 2048) | reasoning RL에 verifier + off-policy rollout 재활용 |
| 작은 모델 | — | strong-to-weak distillation(RL 대비 약 1/10 GPU) |
| 사고량 | — | thinking budget으로 생각량 제어 |
Qwen2.5의 설계 포인트는 “RM 하나를 두되, 학습 쿼리를 분산 큰(변별력 있는) 것으로 골라 신호의 질을 올린다”였다. Qwen3는 그 위에서 reward를 도메인에 따라 세 갈래로 쪼갰다 — 검증 가능하면 규칙, 정답 예시가 있으면 reference judge(Qwen2.5-72B-Instruct가 채점), 둘 다 없으면 스칼라 RM. 즉 “잘 고른 하나의 RM”에서 “도메인마다 다른 조달처”로 넘어가며, DeepSeek-V4·Solar가 보여준 도메인별 조달처 분화와 같은 흐름에 합류했다.
Llama 4: 온라인 RL을 되살리고, SFT·DPO는 탐색을 막지 않을 만큼만
Llama 4에서 가장 눈에 띄는 건 reward 파이프라인의 방향 전환이다. #8 Llama 2 이후 세대인 Llama 3와 나란히 놓아야 무엇이 바뀌었는지가 드러난다.
| 축 | Llama 3 (2024, herd 논문) | Llama 4 (2025, 공식 블로그) |
|---|---|---|
| 정책 최적화 | rejection sampling + DPO를 6 라운드 반복 | online RL이 중심, 앞뒤로 lightweight SFT·DPO |
| PPO/온라인 RL | 명시적으로 거부(“DPO가 대규모에서 연산이 적고 더 낫다”) | 온라인 RL을 되살림 |
| RM의 역할 | rejection sampling 필터 + 선호쌍 정제 (온라인 gradient엔 미사용) | online RL의 reward로 추정되나 형태 비공개 |
| SFT·DPO 강도 | DPO가 주 정렬 수단(formatting 토큰 마스킹, chosen에 NLL 0.2) | “over-constrain 방지”용 lightweight |
| 데이터 | 선호 4단계 등급 + 사람 edit 3-way, 유사 응답 제거 | easy 50~95% 프루닝, medium-hard 커리큘럼, advantage-0 실시간 제거 |
핵심은 Llama 3가 스케일을 위해 온라인 RL(PPO)을 버리고 오프라인(rejection sampling + DPO)을 택했는데, Llama 4가 그 선택을 다시 뒤집었다는 것이다. Llama 3 herd 논문은 PPO를 시도했다가 “DPO가 대규모 모델에서 연산이 적고 성능도 낫다”며 접었고, RM은 오직 rejection sampling의 필터로만 썼다 — 온라인 정책 업데이트에는 쓰지 않았다. Llama 4는 반대로 online RL을 파이프라인의 중심에 놓고, 그 이유를 이렇게 밝힌다.
SFT와 DPO가 모델을 과도하게 제약(over-constrain) 해서, 뒤이은 online RL 단계의 탐색을 막고 특히 추론·코딩·수학에서 정확도를 떨어뜨린다.
즉 Llama 3에서 “주연”이던 DPO가 Llama 4에서는 “탐색을 죽이지 않을 만큼만” 가볍게 치는 조연으로 내려온다. 무게중심이 online RL로 옮겨가면서, 데이터 전략도 정적 선호쌍 큐레이션에서 동적 난이도 관리로 바뀐다.
- 데이터 프루닝으로 어려운 것만 남긴다. Llama 모델 자신을 judge로 써서 “쉬움”으로 태깅된 데이터를 걸러낸다. 작은 모델은 50% 이상, 2T 규모 Behemoth는 95%를 쳐낸다.
- continuous online RL. 학습과 필터링을 번갈아 돌리며 medium-to-hard 난이도 프롬프트만 남긴다. 쉬운 프롬프트는 신호가 없고, 너무 어려운 프롬프트는 advantage가 0이라 학습에 기여하지 못한다.
- hard-prompt 커리큘럼. 정책 모델로 pass@k 분석을 해 어려운 프롬프트를 골라 난이도를 점증시키고, advantage가 0인 프롬프트를 실시간으로 걸러내며, 여러 능력의 프롬프트를 섞어 배치를 구성한다.
다만 online RL을 실제로 굴리는 reward 신호가 무엇인지는 블로그가 의도적으로 공개하지 않는다. 규칙 기반 verifiable reward인지, 학습된 RM인지, 혼합인지 명시가 없다. 특히 Llama 3에서 오프라인 필터로만 쓰이던 RM이 Llama 4의 온라인 루프 안으로 돌아왔는지조차 확인되지 않는다 — 확인되는 건 파이프라인의 골격과 데이터 큐레이션 전략까지다.
Kimi K3: 도메인 전문가 아홉을 MOPD로 합친다
Kimi K3(2026-07)의 후처리는 세 단계다 — SFT로 콜드스타트를 잡고, RL로 도메인 전문가들을 서로 다른 reasoning-effort 수준으로 키운 뒤, MOPD(Multi-Teacher On-Policy Distillation)로 하나의 모델로 통합한다. 이 “전문가를 따로 키워 증류로 합친다”는 골격은 DeepSeek-V4와 정확히 같은 방향이다.
reward 조달처는 도메인에 따라 갈린다.
- 검증 가능 도메인: 5,120만 개(51.2M) 규모의 RL 샌드박스에서 규칙 기반 verifiable reward로 학습한다 (①).
- 검증 불가능한 일반 태스크: Agentic Generative Reward Model(GRM)을 쓴다 (④). judge가 강제된 프로토콜을 따른다 — (1) 출력을 읽고, (2) rubric을 생성하고, (3) 각 후보를 그 rubric으로 채점하고, (4) 점수를 scorepad에 기록한다. K2.5의 토너먼트식 그룹 비교(binary comparison)를 이어받되, judge가 채점 기준(rubric)을 스스로 만든다는 점이 핵심이다.
이 Agentic GRM은 #38 DeepSeek-GRM/SPCT의 “judge가 평가 원칙을 스스로 생성한다”와 #41 Rubrics as Rewards의 “rubric을 보상 기준으로 쓴다”를 프로덕션에서 합친 형태다. DeepSeek-V4의 GRM과 더불어 생성형 reward가 더 이상 논문 안에만 있지 않다는 이번 세대의 증거다.
여기에 두 가지 reward-shaping·방어 장치가 붙는다.
- Reasoning-effort RL: 문제마다 초기 토큰 예산 \(b_0(x)\)를 정하고, 토큰 사용량이 \(\tau \cdot b_0(x)\)를 넘으면 task reward를 \(-1\)로 덮어써 과도한 사고를 벌한다. \(\tau\)를 큰 값에서 점점 줄이는 커리큘럼으로 low·high·max effort 전문가를 각각 만든다 — “얼마나 생각할지”를 조절하는 장치이고, 추론 시
reasoning_effort(low/high/max)로 노출된다. - Budget 기반 verbosity 제어: Agentic GRM이 “길게 쓰면 이긴다”는 식으로 hacking되는 걸 막으려고, 초기 길이 \(\ell_0\)의 \(\sigma\)배를 넘는 후보는 binary comparison에서 자동으로 진다.
참고로 self-critique rubric은 전신 K2(2025-07)가 처음 도입했고, K3의 Agentic GRM은 그 계보 위에서 “judge가 rubric을 생성해 채점”하는 형태로 발전한 것이다.
Solar Open 2: 열두 전문가를 MOPD로 합친다
Solar Open 2(2026-07, 250B MoE)의 reward 설계는 이전 세대(Solar Open)와 크게 다르다. 알고리즘은 GRPO를 token-level importance sampling으로 쓴다 — 논문은 “GSPO의 sequence-level 비율이 아니라 GRPO의 token-level 비율을 유지한다”고 명시한다(널리 퍼진 GSPO와 반대 선택). reward는 도메인별로 갈린다.
- STEM·추론: 검증 가능한 규칙 reward (①).
- 에이전트: 다차원 rubric — 대화 에이전트는 과정 품질·결과 품질을 분리하고 실행 가능한 read-back으로 검증, 코딩 에이전트는 fail-to-pass 테스트 + 5차원 LLM rubric + 실행 가능성, 오피스 에이전트는 규칙 기반 checker + LLM judge.
- 전통적 스칼라 RM도, DPO도, KL 정규화도 쓰지 않는다 — 검증 가능한 실행 신호 + LLM-as-judge로 대체한다.
가장 눈에 띄는 건 통합 방식이다. 열두 개의 전문가(teacher)를 MOPD(Multi-teacher On-Policy Distillation)로 하나로 합친다 — student가 자기 궤적 위에서 routed teacher에 대한 per-position reverse KL을 최소화하되, outcome reward를 전혀 얹지 않는 KL-only 목적함수다. 논문은 이를 “λ로 균형 잡을 것도, reward-hacking 표면도 없다”고 표현한다. #38 이후 DeepSeek-V4·Kimi K3가 택한 “전문가→증류”에 Solar Open 2가 합류한 것이고, Kimi K3와는 MOPD라는 이름까지 같다.
K-EXAONE 2.0: 오답에서도 신호를 뽑는다
K-EXAONE 2.0(2026-08, 750B MoE, LG AI Research)은 도메인마다 “선호 응답을 고르는 기준”과 “비선호 응답의 나쁜 패턴을 벌하는 reward”를 따로 정의한다. 수학·코드는 검증 가능한 신호로, 증명은 LLM-as-judge로, 대화는 인스턴스별 rubric으로, 에이전트는 행동의 정확성·품질로 판정한다 — ① 규칙과 ③·④ judge·rubric을 도메인별로 섞는다.
알고리즘 둘이 독특하다.
- GrouPER: 한 쿼리에 네 개 응답을 뽑아 도메인별 reward로 채점하고, 그 점수로 그룹 상대 advantage를 만들어 SimPER 계열의 선호 최적화 목적함수에 넣는다. 규칙 reward와 rubric 기반 생성형 reward를 함께 쓴다.
- AGAPO: off-policy policy-gradient(truncated importance sampling)인데, 핵심은 틀린 답에서도 학습 신호를 뽑는다는 것이다 — 오답으로 이어진 잘못된 추론 경로에 음의 reward(penalty)를 매겨, 모델이 스스로 논리 오류를 피하도록 유도한다.
대부분의 RLVR이 “정답이면 +, 오답이면 0”으로 오답을 그냥 버리는 데 반해, AGAPO는 오답의 잘못된 부분을 명시적으로 벌한다는 점에서 신호를 더 촘촘하게 쓴다. 안전성은 별도의 safety-aware preference 최적화 단계로 다룬다(#60).
A.X K2: 네 그룹으로 나누고 mixture를 control surface로 다룬다
A.X K2(2026, SKT)는 학습 mixture를 네 그룹 — instruction following, human preference, agentic tool use, safety — 으로 나누고, 그 비율을 미리 고정하지 않고 중간 RL 체크포인트로 모델의 약점을 짚어가며 조정하는 “control surface”로 다룬다. 그룹마다 reward 조달처가 다르다.
- Instruction following: 규칙 기반 verifiable reward(형식·길이·필수 표현·스키마 준수 검사) + 난이도 필터링 — 인하우스 소형 모델로 이미 잘 푸는 프롬프트를 걸러내 on-policy 신호를 정보량 큰 사례에 집중시킨다(#62의 프롬프트 큐레이션 그대로다).
- Human preference: pointwise LLM-as-judge. 프롬프트마다 강한 외부 모델로 reference 답안을 얻어 judge에 few-shot 채점 앵커와 함께 준다. judge는 태스크를 6개 도메인(사실·추론·코딩·추출·창작·개방)으로 분류한 뒤 도메인별 4축 rubric(정확성·완결성·명료성·helpfulness)으로 채점하되, verbosity bias와 reward hacking을 막는 안전장치를 명시한다 — #34 Prometheus 2 계열의 reference 기반 rubric judge(③).
- Safety: 별도 그룹으로 두고 principle 기반 rubric으로 채점한다. 이 그룹의 설계는 #60에서 자세히 다룬다.
RL 알고리즘은 CISPO(MiniMax) — token-level 업데이트가 아니라 importance-sampling 가중치를 클립해, 확률은 낮지만 행동에 결정적인 토큰이 계속 그래디언트에 기여하게 한다 — 에 GDPO(Liu et al. 2026)를 얹는다. GDPO는 여러 reward를 각각 따로 정규화한 뒤 합쳐 각 신호의 해상도를 보존하고 multi-reward 학습을 안정화한다(#12 ODIN의 “신호 분리” 발상을 여러 reward로 일반화한 셈이다). KL penalty는 쓰지 않고 프롬프트당 16 rollout을 뽑으며, verbosity가 심한 데이터엔 group-relative length penalty를 더한다.
MiniMax-M1: CISPO의 원산지, 그리고 length bias를 실시간 감시한다
이 글이 A.X K2에서 인용한 CISPO의 원조가 MiniMax-M1(2025-06, 456B 하이브리드 MoE)이다. CISPO는 PPO·GRPO가 token 단위로 클립하면서 “However”, “Recheck” 같은 드물지만 추론에 결정적인 토큰을 잘라버리는 문제를 지적하고, token 업데이트 대신 importance-sampling 가중치를 클립한다. AIME에서 DAPO 대비 2배 빠르게 수렴했다고 보고한다.
reward는 도메인으로 갈린다.
- 검증 가능: 규칙 기반 정오 reward + format reward. 수학(~50K), 논리(SynLogic ~53K), 경쟁 프로그래밍(~30K), SWE는 샌드박스 테스트 통과/실패를 신호로 쓴다.
- 검증 불가능(~25K, 지시 따르기·창작·정답 없는 STEM): GenRM(④)을 쓴다.
여기서 M1의 독특한 방어가 나온다. GenRM은 “길게 쓰면 이긴다”는 length bias로 hacking되기 쉬운데(짧지만 나은 답보다 긴 답을 선호), M1은 RL 학습 내내 length bias를 실시간 모니터링하다가 length-seeking이 감지되면 즉시 GenRM을 recalibration한다. Kimi K3가 budget 기반으로 사후 차단한다면, M1은 GenRM 자체를 학습 중에 다시 맞추는 셈이다. 커리큘럼도 쓴다 — 규칙 기반 추론 과제로 시작해 general 도메인을 점차 섞어 특화 능력의 catastrophic forgetting을 막는다.
GLM-4.5: 세 축(추론·에이전트·일반)을 나눠 RL하고 self-distillation으로 합친다
GLM-4.5(2025-08, 355B MoE, Zhipu)의 부제가 설계를 요약한다 — Agentic, Reasoning, Coding. 후처리는 두 단계다. Stage 1(Expert Training)에서 추론·에이전트·일반 채팅용 전문가를 따로 키우고, Stage 2(Unified Training)에서 이들을 self-distillation으로 하나의 하이브리드 추론 모델에 합친다 — DeepSeek-V4·Kimi K3·Solar Open 2에 이어 네 번째 “전문가→증류” 모델이다.
RL은 세 갈래로 뚜렷이 나뉜다.
- Reasoning RL: 프로그램으로 검증 가능한 정확성(①) + 2단계 난이도 커리큘럼(중간 난이도 → 극난도).
- Agentic RL: 최종 답의 정확성을 궤적 전체의 reward로 주는 outcome supervision + 잘못된 tool call에 format penalty. reward = 1 (형식 맞고 태스크 완수 시).
- General RL: multi-source feedback — 규칙 기반 + 사람(RLHF) + 모델 기반(RLAIF)을 함께 쓴다.
전문가를 합치는 방식도 iterative하다 — SFT 콜드스타트 → 전문가 RL → SFT 데이터를 RL 모델이 생성한 응답으로 교체하는 self-distillation → 다시 RL. 인프라(slime)는 동기·비동기를 모두 지원한다.
Magistral: reward를 부품으로 쪼갠 순수 RLVR (유럽)
Magistral(2025-06, Mistral)은 이 비교에서 유일한 유럽 랩 모델이자, 증류 없이 순수 RL만으로 추론을 키운 사례다(Magistral Medium을 Mistral Medium 3 위에 RL만 적용해 AIME-24를 약 50% 끌어올림). 비검증 도메인은 아예 다루지 않고 검증 가능한 수학·코드에만 집중한다.
가장 배울 점은 reward를 명시적 부품의 합으로 쪼갠다는 것이다.
- 정오 reward 0.9: 수학은
\boxed{}를 SymPy로 검증, 코드는 20개 테스트 전부 통과. - format reward 0.1:
<think></think>·\boxed{}·마크다운 코드블록을 지키면. - length penalty:
lmax초과 시 최대 −0.1의 soft penalty. - language consistency +0.1: 문제·사고·답이 같은 언어인지 fastText로 확인(다국어 혼용 방지).
GRPO도 손본다 — KL penalty를 완전히 제거하고, group 길이로 손실을 정규화하고, advantage를 minibatch에서 정규화하고, 상단 클립을 키우는 Clip-Higher(ε_high≈0.26–0.28)로 탐색을 늘리고, advantage가 0인 그룹을 걸러낸다(#62의 프롬프트 큐레이션과 정확히 같은 장치다). Magistral은 “reward 설계 = 검증 가능한 부품을 어떻게 조합하느냐”를 가장 투명하게 보여주는 레시피다.
Gemma 4: 연구실의 reward 논문을 그대로 제품에 얹는다
Gemma 4(2026-06, dense 2.3B/4.5B/12B/31B + MoE 26B[활성 3.8B])는 report에서 post-training을 “Gemma 3와 유사한 방식”이라고 밝힌다. 그래서 reward 설계의 실체는 Gemma 3 report에 있고, 거기 한 문장이 이 글의 관점에서 특별하다.
“Our post-training approach relies on an improved version of knowledge distillation from a large IT teacher, along with a RL finetuning phase based on improved versions of BOND, WARM, and WARP.”
reward 조달은 도메인별로 갈린다.
“We use a variety of reward functions to improve helpfulness, math, coding, reasoning, instruction-following, and multilingual abilities, while minimizing model harmfulness.”
여기에 코드 실행 피드백(code execution feedback)과 수학 문제의 ground-truth reward가 포함된다 — 즉 ① 규칙 기반 verifiable reward를 쓰고, 그 위에 weight averaged reward models(WARM)를 얹는다.
이 조합이 이 시리즈에서 갖는 의미는 각별하다. 세 방법이 전부 이 시리즈가 다루는(또는 다룰) 논문이기 때문이다.
| 방법 | 무엇을 하나 | 시리즈 위치 |
|---|---|---|
| WARM (2401.12187) | 여러 RM을 weight averaging해 hacking·노이즈를 상쇄 | #14 |
| BOND (2407.14622) | Best-of-N 분포를 증류해 N배 추론 비용 없이 그 품질을 얻는다 | #29 |
| WARP (2406.16768) | 정책을 weight space에서 세 번 병합해 KL-reward 파레토를 밀어올림 | #30 |
특히 WARM은 #14에서 “reward hacking 방어 연구”로 다룬 논문인데, Gemma가 그것을 실제 제품 학습에 쓴다. #38 DeepSeek-GRM의 아이디어가 DeepSeek-V4로 넘어간 것과 같은 연구→프로덕션 루프가, 여기서는 DeepMind 내부에서 일어난 셈이다.
다만 report는 방법의 이름과 reward의 종류까지만 밝히고, 각 reward의 가중치나 BOND/WARM/WARP의 배합 비율·하이퍼파라미터는 공개하지 않는다. 앞의 공개 층위 표에서 Gemma를 ②로 분류한 이유다.
Experiments
마스터 비교표
| 모델 | reward 조달처 (4분류) | RL 알고리즘 | 검증 가능 도메인 | 검증 불가능 도메인 |
|---|---|---|---|---|
| DeepSeek-V4 | ① 규칙 + ④ GRM (도메인별) | GRPO → on-policy 증류로 통합 | 규칙 검증기: 정답 일치·테스트 통과 | GRM (rubric-guided) |
| Qwen3 | ① 규칙 + ③ reference judge + ② 스칼라 RM | GRPO (reasoning) + General RL | 규칙 (query-verifier 쌍) | ③ reference judge + ② 스칼라 RM |
| Llama 4 | 비공개 (online RL) + 선호 쌍 | lightweight SFT → online RL → DPO | 명시 안 됨 (난이도 커리큘럼 중심) | DPO (가볍게) + online RL |
| Kimi K3 | ① 규칙(51.2M 샌드박스) + ④ Agentic GRM | 전문가별 RL → MOPD 증류 | 규칙 검증기: 대규모 샌드박스 | Agentic GRM (rubric 생성→scorepad) |
| Solar Open 2 | ① 규칙 + ④ rubric judge + 12전문가→MOPD | GRPO(token-level) → MOPD 증류 | 규칙 + 실행 검증 | LLM-as-judge rubric |
| K-EXAONE 2.0 | ① 규칙 + ③④ rubric·judge (도메인별) | GrouPER(SimPER류) + AGAPO(off-policy) | 검증 가능 신호 | LLM-judge·rubric, 오답에 음의 보상 |
| A.X K2 | ① 규칙(+난이도필터) + ③ reference judge | CISPO + GDPO(멀티리워드 분리정규화) | 규칙 verifiable(형식·스키마) | reference judge 6도메인 4축 rubric |
| MiniMax-M1 | ① 규칙 + ④ GenRM | CISPO(원조) | 규칙·샌드박스 테스트 | GenRM(length bias 실시간 감시) |
| GLM-4.5 | ① 규칙 + agentic outcome + rule/RLHF/RLAIF | 3축 RL → self-distillation | 프로그램 검증 + 난이도 커리큘럼 | multi-source(rule+RLHF+RLAIF) |
| Gemma 4 | ① 규칙(코드실행·수학 정답) + ② WARM 평균 RM | BOND + WARM + WARP (+ IT teacher 증류) | 코드 실행 피드백·수학 ground-truth | 도메인별 다양한 reward 함수 |
| Magistral | ① 규칙만(0.9정오+0.1format+lang) | GRPO 변형(KL제거·Clip-Higher·zero-adv 필터) | SymPy·테스트 통과 | (비검증 미대응) |
이 표가 이 글의 결론을 압축한다. 왼쪽 도메인(검증 가능)에서는 열한 모델 모두 ①(규칙)을 포함한다. 오른쪽 도메인(검증 불가능)에서는 판정형 reward(③ reference judge·④ 생성형 GRM·rubric judge)가 열하나 중 여덟에서 쓰인다 — 스칼라 RM 하나만 두는 모델은 사실상 사라졌다(Llama 4만 DPO+RM 노선). 나아가 “도메인 전문가를 따로 키워 증류로 합친다”는 구조가 DeepSeek-V4·Kimi K3·Solar Open 2·GLM-4.5 네 곳에서 겹치고(Solar 2·K3는 이름까지 MOPD). 이 두 가지가 이전 세대와의 결정적 차이다.
공통 수렴점: 검증 가능 도메인은 규칙이 표준이 됐다
수학·코드처럼 정답이 프로그램적으로 판정 가능한 도메인에서, 열한 모델은 예외 없이 ① 규칙 기반 verifiable reward를 쓴다. #33에서 짚었듯 이유는 명확하다 — 규칙 검증기는 파라미터가 없는 함수이므로 hacking할 대상 자체가 없고, RM을 학습·재학습하는 비용도 들지 않는다.
DeepSeek-R1(2025-01)이 이 선택지를 대중화한 뒤, 이후 발표된 모델들이 그대로 채택했다는 사실이 흐름을 보여준다. Qwen3는 “rule-based reward가 높은 정밀도로 정오를 판정해 reward hacking을 예방한다”고 명문화했고, Solar Open 2·K-EXAONE 2.0·A.X K2도 수학·코드·형식 검사에 규칙 검증기를 쓴다. Llama 4조차 (reward 신호 자체는 비공개지만) 추론·코딩·수학을 별도 취급하며 난이도 커리큘럼을 그 도메인에 집중한다. RLVR이 “만능 표준”이라고 단정하기는 여전히 이르지만, 검증 가능한 도메인에서 규칙을 1순위로 두는 것은 사실상 공통 문법이 됐다.
갈라지는 지점, 그리고 GRM의 등장
정답이 없는 도메인(글쓰기, 상담, 개방형 추론)으로 가면 열한 모델은 서로 다른 답을 낸다. 이전 세대(DeepSeek-R1, Qwen2.5, Llama 3)를 비교했을 때 이 칸의 결론은 “연구 논문은 생성형 judge를 말하지만, 프로덕션 report는 아직 스칼라 RM이나 self-critique에 머문다”였다. 이번 세대에서 그 결론이 바뀐다.
| 접근 | 채택 모델 | 조달처 | 관련 편 |
|---|---|---|---|
| 사람 선호 쌍 + DPO | Llama 4 | 선호 | #24 DPO |
| 스칼라 RM | Qwen3, Gemma 4(weight averaged RM) | ② | 2부(#4~#9), #14 WARM |
| reference 기반 judge | Qwen3, A.X K2 | ③ | #34 Prometheus 2 |
| generative RM·rubric judge | DeepSeek-V4, Kimi K3, MiniMax-M1, Solar Open 2, K-EXAONE 2.0, GLM-4.5 | ④ | #38 DeepSeek-GRM, #41 Rubrics as Rewards |
마지막 행이 핵심이다. #38 DeepSeek-GRM이 “judge가 채점 근거를 스스로 생성하고 rubric을 조건으로 받는다”는 아이디어를 연구 단계에서 제안했는데, 같은 팀의 DeepSeek-V4가 그 GRM을 프로덕션에 넣었고, Kimi K3·MiniMax-M1·Solar Open 2·K-EXAONE 2.0·GLM-4.5까지 여섯 모델이 생성형 rubric judge를 쓴다. Qwen3·A.X K2의 reference-judge(③)까지 합치면, 생성형·조건부 평가가 더 이상 논문 안에만 있지 않다는 것이 이번 세대의 가장 큰 변화다. (그 씨앗은 전신 Kimi K2의 self-critique였다 — 위 Kimi K3 절 참고.) 연구와 프로덕션 사이의 시차가 눈에 띄게 좁혀졌다.
다만 스칼라 RM이 사라진 것은 아니다. Gemma 4는 judge나 GRM이 아니라 여전히 학습된 RM(②) 에 기댄다 — 대신 RM 하나를 믿는 대신 #14 WARM처럼 여러 RM을 weight averaging해서 개별 RM의 특이한 취약점을 상쇄한다. 즉 이번 세대의 분기는 “스칼라 RM이냐 생성형 judge냐”의 이분법이 아니라, 스칼라 RM을 쓰더라도 그 RM을 어떻게 견고하게 만들 것인가라는 축이 하나 더 있는 셈이다.
숨은 reward 설계: 프롬프트를 고르는 것도 reward다
reward 설계를 “어떤 함수로 점수를 매기나”로만 보면 절반만 본 것이다. 열한 모델이 공통으로 공들이는 또 하나의 축은 어떤 프롬프트에 그 reward를 먹이느냐다.
| 모델 | 프롬프트 선별·커리큘럼 전략 | 무엇을 노리나 |
|---|---|---|
| Qwen3 | reasoning RL에서 쿼리당 rollout 다수 + off-policy 재활용 | 샘플 효율 |
| Llama 4 | pass@k로 hard prompt 선별, advantage 0인 프롬프트 실시간 제거, medium-hard만 유지 | 신호 없는 프롬프트 낭비 제거, 탐색 여지 확보 |
| DeepSeek-V4 | 도메인별 고품질 데이터로 전문가를 따로 육성 | 도메인 간 간섭 없이 각 reward에 집중 |
| A.X K2 | 인하우스 소형 모델로 이미 잘 푸는 프롬프트를 걸러냄(난이도 필터) | on-policy 신호를 정보량 큰 사례에 집중 |
| GLM-4.5 | 추론 RL에 2단계 난이도 커리큘럼(중간→극난도) | 난이도를 점증시켜 신호를 유지 |
| Magistral | advantage 0 그룹 필터 + length penalty | 신호 없는 그룹 제거(#62 프롬프트 큐레이션) |
| MiniMax-M1 | 규칙 추론 → general 점진 혼합 커리큘럼 | 특화 능력 catastrophic forgetting 방지 |
이것이 #5 Secrets of RLHF II가 다룬 “선호 데이터 노이즈” 문제의 실전판이다. 노이즈가 큰(변별력 없는) 프롬프트를 애초에 걸러내면, 같은 reward 함수라도 hacking 여지가 줄고 학습이 안정된다. reward 함수를 바꾸지 않고도 reward의 질을 끌어올리는 방법이 프롬프트 큐레이션인 셈이다.
DPO vs RL 트레이드오프
#24 DPO는 reward model과 온라인 RL 루프를 통째로 없애고 선호 쌍에서 바로 정책을 학습하는 방법이었다. 열한 모델을 이 스펙트럼 위에 놓으면 이렇게 갈린다.
| 위치 | 모델 | 특징 |
|---|---|---|
| DPO를 가볍게 + online RL 중심 | Llama 4 | SFT·DPO는 “탐색을 막지 않을 만큼만”, 정렬의 무게중심은 online RL |
| RL 다단계 (off-policy 섞음) | Qwen3 | 4단계 GRPO RL, reasoning RL은 off-policy rollout 재활용(DPO 없음) |
| RL 중심(순수 온라인) | DeepSeek-V4, Kimi K3, Solar Open 2, A.X K2, MiniMax-M1, GLM-4.5, Magistral | GRPO/CISPO 기반 온라인 RL이 정책 업데이트를 전담(DPO 없음) |
| off-policy + 선호 최적화 | K-EXAONE 2.0 | AGAPO(off-policy PG) + GrouPER(SimPER류 그룹 선호) |
Llama 3가 “DPO만으로 충분”했다면, Llama 4는 한 발 물러나 “DPO를 너무 세게 걸면 RL의 탐색을 죽인다”는 반대 방향의 교훈을 얹었다. 오프라인 정렬은 싸지만 모델을 좁은 분포에 가둘 수 있고, 온라인 RL은 비싸지만 탐색을 통해 새 능력을 끌어낸다. 열한 모델의 선택은 결국 “오프라인으로 얼마나 다지고, 온라인에 얼마나 탐색을 맡길 것인가”의 배분 문제로 수렴한다.
reward hacking 방어: 각자의 방식
#10~#14이 다룬 방어 기법들이 실제로 어떻게 쓰이는지 정리하면 이렇다.
| 모델 | 방어 장치 | 원리 |
|---|---|---|
| DeepSeek-V4 | 규칙 우선 + hard-to-verify에만 GRM, on-policy 증류 | 파라미터 없는 규칙으로 hacking 표면을 최소화, GRM은 근거 생성으로 판정을 검증 가능하게 |
| Qwen3 | rule-based reward를 “hacking 예방” 목적으로 명시 | 검증 가능한 곳은 규칙으로 못박아 RM 근사 오차 자체를 없앰 |
| Llama 4 | advantage 0 프롬프트 제거, medium-hard 커리큘럼 | 신호 없는 구간에서의 편법 학습 차단, 탐색을 유의미한 난이도에 집중 |
| Kimi K3 | budget 기반 verbosity 제어 | Agentic GRM이 장황한 출력으로 hacking되는 걸 막으려 초기 길이의 σ배를 넘는 후보를 자동 탈락 |
| Solar Open 2 | MOPD를 KL-only(outcome reward 없음)로 | reward를 아예 안 얹어 증류 단계의 hacking 표면을 제거 |
| A.X K2 | GDPO(reward별 분리 정규화) + judge의 anti-verbosity·length penalty | 여러 reward를 섞을 때 한 신호가 다른 신호를 잡아먹는 것과 장황함 편향을 차단 |
| MiniMax-M1 | GenRM length bias 실시간 모니터링 → recalibration | judge가 “길수록 이긴다”로 새면 학습 중 즉시 재보정 |
| Gemma 4 | WARM(weight averaged reward models) + WARP의 EMA 앵커 | RM을 평균해 개별 RM의 특이 취약점을 상쇄(#14의 프로덕션 적용), 정책 쪽은 동적 KL 앵커로 이탈을 억제 |
| Magistral | KL 제거하되 length penalty + zero-advantage 필터 | 길이 편법과 신호 없는 그룹을 명시적으로 차단 |
표현은 달라도 원리는 하나로 수렴한다 — reward 신호와 “정책이 참조점에서 얼마나 벗어났는가”를 분리해서 다룬다. DeepSeek·Solar는 KL을 손실 안에서 명시적으로 떼어놓고, Qwen·Llama는 애초에 노이즈가 크거나 신호가 없는 데이터를 걸러낸다. #11 Length Correlations가 지적한 “성능 향상처럼 보이지만 실은 길이·문체 편향”이라는 함정을, 열한 모델 모두 나름의 방식으로 피해 가려 한 흔적이다.
학습 안정성: 무엇을 클립하고, 무엇에 앵커를 걸 것인가
reward를 잘 설계해도 RL이 발산하면 소용이 없다. 그래서 열한 모델은 안정성 장치에서도 뚜렷이 갈린다. 이 축은 크게 네 갈래다.
(1) importance ratio를 어느 단위로 다루나 — 같은 GRPO 계열인데 여기서 정반대 선택이 나온다.
| 선택 | 모델 | 근거 |
|---|---|---|
| token 단위 유지 | Solar Open 2 | 논문이 “GSPO의 sequence-level이 아니라 GRPO의 token-level 비율을 유지한다”고 명시. token 단위 trust-region masking을 씀 |
| sequence 단위로 올림 | GSPO(#27) | token 비율은 고분산 노이즈를 누적시킨다. MoE에서 업데이트마다 활성 expert의 약 10%가 바뀌어 token 비율이 요동치는 문제를 해결 |
| IS 가중치를 클립 | MiniMax-M1, A.X K2 | CISPO — token 업데이트가 아니라 importance-sampling 가중치를 클립해, 확률은 낮지만 행동에 결정적인 토큰(“However”, “Recheck”)이 계속 그래디언트에 기여하게 한다 |
(2) KL 앵커를 어떻게 두나 — 고정할지, 움직일지, 아예 뺄지.
| 선택 | 모델 | 방식 |
|---|---|---|
| 동적 EMA 앵커 | Gemma 4(WARP·BOND) | 정책의 EMA를 KL 앵커로 삼아 제약이 학습 진행에 따라 자연히 완화된다(automatic annealing) |
| 손실 안에서 분리 | DeepSeek 계열 | KL을 reward에 섞지 않고 손실에 직접 더한다 |
| KL을 아예 제거 | Magistral, A.X K2 | Magistral은 연산 절감을 위해 KL penalty를 완전히 제거하고 length penalty·zero-advantage 필터로 대신한다. A.X K2도 KL penalty를 쓰지 않는다 |
(3) 그래디언트가 죽거나 폭주하지 않게 — 배치와 클립 범위를 손본다.
- Clip-Higher(DAPO #28, Magistral): 상한 클립을 키워(\(\epsilon_{high} \approx 0.28\)) 낮은 확률 토큰이 오를 여지를 준다. entropy collapse 방지.
- advantage 0 제거(DAPO, Magistral, Llama 4): 그룹 reward가 전부 같으면 그래디언트가 0이라 배치만 낭비된다. 오버샘플링해 채운다.
- off-policy 내성(Kimi K3): partial rollout으로 긴 궤적이 여러 iteration에 걸치면서 생기는 staleness를, per-token regularization으로 업데이트를 국소 이웃에 묶어 버틴다.
- truncated importance sampling(K-EXAONE 2.0의 AGAPO), off-policy rollout 재활용(Qwen3의 reasoning RL): 샘플 효율과 안정성의 절충.
(4) reward 신호 자체를 안정화 — 이게 이 시리즈의 관심과 가장 가깝다.
| 모델 | 장치 | 무엇을 막나 |
|---|---|---|
| Gemma 4 | WARM — 여러 RM을 weight averaging | RM 하나의 특이한 취약점·노이즈(#14) |
| MiniMax-M1 | GenRM의 length bias를 학습 중 실시간 감시 → recalibration | judge가 “길수록 이긴다”로 새는 것 |
| A.X K2 | GDPO — reward별로 따로 정규화한 뒤 결합 | 여러 reward를 섞을 때 한 신호가 다른 신호를 잡아먹는 것 |
| Kimi K3 | budget 기반 verbosity 제어 | Agentic GRM이 장황한 출력에 속는 것 |
| Solar Open 2 | MOPD를 KL-only로(outcome reward 없음) | 증류 단계에 reward를 안 얹어 hacking 표면 자체를 제거 |
정리하면 안정성 설계도 reward 설계와 같은 문법을 따른다 — 서로 다른 성질의 신호를 한 덩어리로 뭉치지 말고 분리해서 다룬다. 클립의 단위를 reward의 단위에 맞추고(GSPO), 여러 reward를 따로 정규화하고(GDPO), RM을 평균해 개별 오차를 상쇄하고(WARM), 참조점 이탈은 KL이 아니라 길이·advantage 필터로 따로 관리한다(Magistral). #12 ODIN이 길이를 reward에서 떼어낸 발상이, 최적화 쪽에서도 반복되고 있는 셈이다.
안전성 축은 따로 뜯는다
지금까지 본 것은 전부 능력(helpfulness) 축이다 — 정확성·추론·코딩·지시 따르기를 어떻게 보상하나. 그런데 여러 모델이 안전성(harmlessness) reward를 능력 reward와 명시적으로 분리해 설계한다. #8 Llama 2가 helpfulness RM과 safety RM을 아예 두 개로 나눈 데서 시작된 흐름이다.
안전 축은 성격이 다르다. 능력 도메인이 규칙(①)으로 수렴한 것과 달리 “이 응답이 안전한가”는 프로그램으로 판정되지 않아 대부분 rubric·judge로 가고, 게다가 over-refusal이라는 능력 축에 없는 고유한 실패 모드가 있다. 공개 수준도 딴판이라 — 안전을 아예 문서화하지 않는 report가 흔하다. 그래서 이 축은 분량이 따로 필요하고, #60 프론티어 모델은 harmlessness reward를 어떻게 설계했나 에서 따로 다룬다.
Conclusion
43편에 걸쳐 쌓아온 재료를 열한 개 프론티어 모델에 겹쳐보면 이렇게 정리된다.
- 검증 가능한 도메인은 규칙으로 수렴한다. 열한 모델 모두 수학·코드에서 ① 규칙 기반 verifiable reward를 1순위로 둔다. #33의 RLVR이 하나의 논문에서 그친 아이디어가 아니라 공통 문법이 됐다.
- 검증 불가능한 도메인에서 생성형 reward가 프로덕션에 진입했다. DeepSeek-V4의 GRM과 Kimi K3의 Agentic GRM이 #38·#41의 연구 아이디어(judge가 원칙·rubric을 스스로 생성)를 실제 학습에 얹었고, DeepSeek-V4·Kimi K3·Solar Open 2·GLM-4.5 네 모델이 “전문가를 따로 키워 증류로 합친다”는 구조(가운데 둘은 이름까지 MOPD)까지 공유한다. 이전 세대 비교에서 “생성형 judge는 아직 논문 안에만 있다”던 결론은 이번 세대에서 갱신된다. 같은 연구→프로덕션 루프가 DeepMind에서도 보인다 — #14 WARM이 Gemma의 실제 RL 레시피(BOND·WARM·WARP)에 들어가 있다.
- reward 설계는 함수 선택 + 프롬프트 선택 + 오프라인/온라인 배분의 삼중 문제다. Qwen의 분산 선별, Llama 4의 난이도 커리큘럼, DeepSeek-V4의 도메인 분리는 모두 “함수를 안 바꾸고 reward의 질을 올리는” 설계였다.
- reward hacking 방어는 형태가 달라도 원리는 하나다. reward 신호와 참조점 이탈 신호를 분리한다는 것 — DeepSeek·Solar의 손실 내 KL, Qwen·Llama의 데이터 큐레이션 모두 #10~#12이 정량화한 문제에 대한 실무적 응답이다.
- 능력 축과 안전 축은 분리해서 설계된다. #8 Llama 2가 시작한 helpfulness·safety 분리가 이번 세대에도 이어진다. 안전 축은 판정 방식도, 실패 모드(over-refusal)도, 공개 수준도 능력 축과 달라 #60에서 따로 다룬다.
이 시리즈를 여는 #1 Christiano 2017은 “사람의 선호로 보상 함수를 배울 수 있는가”라는 질문 하나로 시작했다. 열 프론티어 모델을 지나 도착한 답은, 그 질문이 하나의 답을 갖지 않는다는 것이다. 정답이 있으면 규칙이 reward가 되고, 정답 예시가 있으면 reference judge가, 기준은 있지만 예시가 없으면 생성형 RM이, 그조차 흐릿하면 사람의 선호 쌍이 reward를 대신한다.
reward 설계는 하나의 정답을 찾는 문제가 아니라, 내가 가진 도메인이 이 스펙트럼의 어디에 있는지를 정확히 진단하는 문제였다. 그 진단을 실제 설계 절차로 옮기는 방법은 다음 글 #62 reward를 어떻게 설계할 것인가에서 한 장의 체크리스트로 정리한다.
참고 문헌
- DeepSeek-AI, 2026. DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence.
- DeepSeek-AI, 2025. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — #33에서 다룬 RLVR 원형.
- Shao et al. (DeepSeek-AI), 2024. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models — GRPO 원 논문.
- Qwen Team, 2025. Qwen3 Technical Report.
- Meta AI, 2025. The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.
- Meta AI, 2024. The Llama 3 Herd of Models — 6라운드 rejection sampling + DPO, PPO 미사용(비교 기준).
- Kimi Team, 2026. Kimi K3: Open Frontier Intelligence — 3단계(SFT→RL→MOPD) + Agentic GRM(rubric 생성) + reasoning-effort budget RL.
- Kimi Team, 2025. Kimi K2: Open Agentic Intelligence — self-critique rubric reward를 도입한 전신.
- Upstage AI, 2026. Solar Open 2 Technical Report — 12 전문가 → MOPD, GRPO token-level.
- Upstage AI, 2026. Solar Open Technical Report — 전신(v1).
- LG AI Research, 2026. K-EXAONE 2.0 Technical Report — GrouPER(SimPER류) + AGAPO(오답에 음의 보상).
- LG AI Research, 2026. K-EXAONE Technical Report — 전신(1.0), AGAPO/GrouPER 상세.
- SKT AI, 2026. A.X K2 Technical Report — 4그룹 reward + reference rubric judge + CISPO/GDPO.
- Liu et al., 2026. GDPO: Group Reward-Decoupled Normalization Policy Optimization — A.X K2가 채택한 멀티리워드 정규화.
- MiniMax, 2025. MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention — CISPO 원 논문 + GenRM length-bias 감시.
- Zhipu AI, 2025. GLM-4.5: Agentic, Reasoning, and Coding Foundation Models — 전문가 → self-distillation, 3축 RL.
- Mistral AI, 2025. Magistral — 순수 RLVR, reward 부품 분해 + GRPO 변형(Clip-Higher).
- Gemma Team (Google DeepMind), 2026. Gemma 4 Technical Report — post-training은 Gemma 3 레시피 계승.
- Gemma Team (Google DeepMind), 2025. Gemma 3 Technical Report — BOND·WARM·WARP 기반 RL, 코드 실행·수학 ground-truth reward.
- Ramé et al. (Google DeepMind), 2024. WARM: On the Benefits of Weight Averaged Reward Models — #14.
- Sessa et al. (Google DeepMind), 2024. BOND: Aligning LLMs with Best-of-N Distillation — #29.
- Ramé et al. (Google DeepMind), 2024. WARP: On the Benefits of Weight Averaged Rewarded Policies — #30.
- OpenAI, 2025. gpt-oss-120b & gpt-oss-20b Model Card — 공개 층위 ③의 예(post-training 세부 미공개).
- Rafailov et al., 2023. Direct Preference Optimization — #24에서 다룬 DPO 원 논문.
- Kim et al., 2024. Prometheus 2 — #34 참고.
- Liu et al. (DeepSeek-AI), 2025. Inference-Time Scaling for Generalist Reward Modeling — #38 DeepSeek-GRM/SPCT 참고.
RL Reward 설계 시리즈
이 글은 RL Reward 설계 시리즈의 쉰아홉 번째 글이다.
1부. 지형도
- Deep RL from Human Preferences (Christiano 2017) — 선호로 보상을 배우는 원형
- InstructGPT (Ouyang 2022) — RLHF 3단계 표준 레시피
- HH-RLHF (Bai 2022) — helpful·harmless preference model
2부. 스칼라 RM 해부
- Rethinking Bradley-Terry (2024) — reward 변환의 수학적 기반
- Secrets of RLHF II (2024) — 선호 데이터 노이즈와 RM 일반화
- Skywork-Reward (2024) — 데이터 큐레이션이 아키텍처를 이긴다
- ArmoRM (2024) — 다목적 분해와 MoE 게이팅
- Llama 2 (2023) — helpfulness·safety RM 분리 프로덕션 레시피
- RewardBench 2 (2025) — RM을 어떻게 평가할 것인가
3부. Reward Hacking
- Overoptimization Scaling Laws (2022) — Goodhart의 법칙 정량화
- Length Correlations in RLHF (2023) — 성능 향상의 얼마가 길이인가
- ODIN (2024) — 길이를 reward에서 분리
- Sycophancy (2023) — RM은 사실보다 동의를 좋아한다
- WARM (2024) — weight averaging으로 hacking 방어
4부. 안전성 정렬
- Safe RLHF (2023) — 안전성을 reward가 아니라 제약으로
- Rule-Based Rewards (2024) — 안전 규칙을 reward로 직접 번역
- Deliberative Alignment (2024) — 안전 명세를 모델의 추론 안으로
- Shallow Safety Alignment (2024) — 정렬은 첫 몇 토큰에만 얹혀 있다
- OR-Bench (2024) — 과잉 거절을 어떻게 측정할 것인가
5부. reward를 정책으로
- PPO (2017) — clipped surrogate objective
- Secrets of RLHF I (2023) — PPO 학습 안정화 트릭
- GRPO / DeepSeekMath (2024) — value network를 버리다
- RLOO (2024) — REINFORCE로 충분한가
- DPO (2023) — reward를 없애면 어떻게 되는가
- SimPO (2024) — reference-free + 길이 정규화
- KTO (2024) — 선호 쌍 없이 이진 신호만으로
- GSPO (2025) — importance ratio를 시퀀스 단위로
- DAPO (2025) — 신호 없는 프롬프트를 버린다
- BOND (2024) — Best-of-N을 추론 비용 없이
- WARP (2024) — 정책을 weight space에서 병합
6부. Process & Verifiable Reward
- Let's Verify Step by Step (2023) — 과정 감독이 결과 감독을 이긴다
- Math-Shepherd (2023) — 사람 라벨 없는 PRM
- DeepSeek-R1 (2025) — RLVR, 규칙이 reward가 될 때
7부. Generative Reward Model
- Prometheus 2 (2024) — 오픈 평가자 모델과 rubric 조건부 평가
- Generative Verifiers (2024) — reward를 next-token prediction으로
- Generative Reward Models (2024) — GenRM과 선호 학습의 결합
- Self-Taught Evaluators (2024) — 사람 라벨 없이 judge를 키우다
- DeepSeek-GRM / SPCT (2025) — inference-time scaling
8부. 생각하는 Judge
- ReasonGRM (2025) — reasoning 능력을 judge에 이식
- J1 (2025) — RL로 judge를 생각하게 만들기
- Rubrics as Rewards (2025) — 비검증 도메인으로
- CriticEval (2024) — judge 자체를 어떻게 평가하나
- One Token to Fool LLM-as-a-Judge (2025) — GenRM도 뚫린다
9부. 에이전트는 무엇이 다른가
- 에이전트 RL은 무엇이 다른가 — 장기 지평·희소 보상·긴 궤적
- 공을 어디에 돌릴 것인가 — credit assignment 47개 방법의 지도
- 멀티턴 RL 실무 가이드 — 무엇이 실제로 작동하는가
10부. credit assignment — 공을 어디에 돌릴 것인가
- 결과만으로는 부족하다 — 장기 지평에서 증폭되는 RLVR의 한계
- 턴 단위로 공을 나눈다 — turn-level reward 설계
- 스텝을 단위로 삼는다 — 행동 단위 궤적 표현과 credit
- 토큰과 세그먼트로 더 잘게 — 세밀한 입도의 득과 실
- shaping은 약인가 독인가 — 중간 보상의 효율과 위험
11부. 에이전트의 reward는 어디서 오나
- 환경이 곧 reward다 — 샌드박스·테스트·상태 검증
- 도구 호출을 어떻게 채점하나 — ToolRL·ToolRM
- 궤적을 judge가 채점한다 — rubric 생성형 reward의 확장
12부. 에이전트 도메인별 설계
- 검색 에이전트 — Search-R1에서 DeepDive까지
- 코드 에이전트 — SWE-RL과 테스트라는 reward
- 웹·GUI 에이전트 — end-to-end 멀티턴 RL
13부. 에이전트의 실패와 방어
- 에이전트의 reward hacking — 판정기가 뚫린다, 그리고 조합의 실패
14부. 실전 종합
- (현재 글) 프론티어의 helpfulness reward 설계 — 열한 개 모델이 능력 축에서 택한 것
- 프론티어의 harmlessness reward 설계 — 안전 축과 over-refusal 트레이드오프
- 프론티어 모델은 실제로 어떻게 하나 — 최신 모델들의 agentic RL 설계
- reward를 어떻게 설계할 것인가 — 시리즈를 관통한 RM 설계 원칙 한 장
본 시리즈는 62편으로 구성된다.
Enjoy Reading This Article?
Here are some more articles you might like to read next:
- reward를 어떻게 설계할 것인가 — RM 설계 실무
- 프론티어 모델은 실제로 어떻게 하나
- 프론티어 모델은 harmlessness reward를 어떻게 설계했나
- 에이전트의 reward hacking — 판정기가 뚫린다, 그리고 조합의 실패
- 웹·GUI 에이전트 — end-to-end 멀티턴 RL