-
안전 평가의 통계와 체계 설계 — 희귀사건과 calibration, 스물한 편의 마지막 체크리스트
LLM 평가 체계 시리즈 #25(완결) — 위반율이라는 희귀사건의 표본 크기와 rule of three, ECE·P(IK)·semantic entropy로 보는 calibration, 선택적 예측의 AURC, 그리고 21편을 압축한 안전 평가 체계 설계 체크리스트
-
오염·재현성·효율 — 이 점수는 무엇을 재고 있나
LLM 평가 체계 시리즈 #24 — 벤치마크 점수를 무너뜨리는 세 가지: 오염(교환가능성 검정), 재현성(lm-evaluation-harness가 드러낸 채점 방식 격차), 효율(문항반응이론 기반 tinyBenchmarks)
-
judge를 통계로 다루기 — 편향, Bradley-Terry, PPI
LLM 평가 체계 시리즈 #23 — judge는 편향된 값싼 측정 도구다. Bradley-Terry로 순위의 불확실성을 다루고, Prediction-Powered Inference로 소량의 사람 라벨과 대량의 judge 라벨을 결합해 편향 없는 신뢰구간을 얻는 법
-
LLM eval의 통계 실무 — 클러스터 SE, 분산 분해, IQM
LLM 평가 체계 시리즈 #22 — Miller의 다섯 통계 권고와 클러스터 SE, 분산 분해, IQM으로 5부를 닫는다
-
몇 개를 재야 하나 — 검정력, 표본크기, 다중비교
LLM 평가 체계 시리즈 #21 — 검정력·표본크기 설계와 Card et al.(2020)의 검정력 위기, Bonferroni·BH-FDR·partial conjunction 다중비교 보정