deepseek
an archive of posts with this tag
| Aug 11, 2026 | 프론티어 모델은 reward를 어떻게 설계했나 |
|---|---|
| Aug 11, 2026 | DeepSeek-GRM: reward model이 평가 기준을 스스로 만든다 |
| Aug 11, 2026 | DeepSeek-R1: reward model을 규칙으로 대체하다 |
| Aug 11, 2026 | GRPO: value network를 버리고 그룹 안에서 비교하다 |
| May 11, 2026 | TRL sequence packing → DeepSeek MLA: 누락된 cu_seqlens 복원 |
| May 10, 2026 | MLA 학습 시 modeling-side projection fusion: q_a/kv_a 배치 + K-side absorption |
| May 10, 2026 | DeepSeek 계열 MoE 학습 가속: Python expert loop → grouped GEMM |