-
점수 하나가 아니라 행렬로 — HELM
LLM 평가 체계 시리즈 #15 — HELM의 시나리오 × 지표 행렬 설계, 17.9%에서 96.0%로 오른 커버리지, 그리고 다지표 보고가 낳는 다중비교·순위집계 문제
-
한국어 벤치마크 — 번역이 아니라 원산, 그리고 문화 타당도
LLM 평가 체계 시리즈 #14 — 번역 MMLU와 KMMLU 사이의 낙차로 보는 구성 타당도, 그리고 정렬조차 문화마다 다른 이유
-
능력의 다른 축 — 지시따르기·긴 문맥·사실성
LLM 평가 체계 시리즈 #13 — IFEval·RULER·TruthfulQA·FActScore·SimpleQA로 보는, 정확도 평균이 숨기는 세 가지 실패
-
개방형 대화 — MT-Bench에서 Arena까지
LLM 평가 체계 시리즈 #12 — 참조 없는 개방형 대화 평가가 자동 지표에서 LLM judge, 크라우드 pairwise로 세 번 옮겨간 이유와 그 대가 (MT-Bench, Chatbot Arena, AlpacaEval 2.0 LC, Arena-Hard)
-
검증 가능한 도메인 — 수학과 코드
LLM 평가 체계 시리즈 #11 — 채점이 프로그램이 되면 judge 편향과 라벨 잡음은 사라지지만, 테스트 커버리지와 답 추출 파서라는 새 취약점이 들어온다