-
차이는 유의한가 — paired bootstrap, 순열검정, McNemar
LLM 평가 체계 시리즈 #20 — 두 모델의 점수 차이를 검정하는 법. 짝지음(pairing)을 무시하면 실제로 있는 차이를 놓친다
-
점수는 추정치다 — 이항비율 신뢰구간
LLM 평가 체계 시리즈 #19 — accuracy는 점추정치가 아니라 표본오차를 가진 이항비율이다. Wald가 무너지는 지점, Wilson·Clopper-Pearson·Agresti-Coull의 선택 기준, 벤치마크 크기별 오차 막대
-
κ의 역설 — 일치율 90%인데 κ가 0.21
LLM 평가 체계 시리즈 #18 — prevalence·bias 역설과 PABAK·Gwet's AC1로 κ를 바로 읽는 법
-
우연을 빼다 — κ 계열
LLM 평가 체계 시리즈 #17 — Cohen's κ부터 Krippendorff's α, ICC까지 우연을 뺀 라벨러 간 신뢰도 측정법
-
사람 평가 설계 — 루브릭, Likert, pairwise, BWS
LLM 평가 체계 시리즈 #16 — 평가 시트, 실무 권고, MTurk의 함정, Best-Worst Scaling을 설계 관점에서 다룬다: 무엇을 묻고 어떻게 묻고 누구에게 묻는가