llm-as-a-judge
an archive of posts with this tag
| Aug 11, 2026 | One Token to Fool: GenRM도 결국 뚫린다 |
|---|---|
| Aug 11, 2026 | CriticEval: judge를 채점하는 벤치마크 |
| Aug 11, 2026 | Rubrics as Rewards: 정답이 없는 도메인에 reward를 만드는 법 |
| Aug 11, 2026 | J1: RL로 judge를 생각하게 만들다 |
| Aug 11, 2026 | ReasonGRM: judge에게 추론 능력을 이식하다 |
| Aug 11, 2026 | Self-Taught Evaluators: 사람 라벨 없이 judge를 키우다 |
| Aug 11, 2026 | Generative Reward Models: GenRM과 선호 학습을 잇다 |
| Aug 11, 2026 | Generative Verifiers: reward를 분류가 아니라 생성으로 풀다 |
| Aug 11, 2026 | Prometheus 2: 평가 기준을 입력으로 받는 judge |