-
표층 특징이 정답을 예측한다 — Clever Hans in LLM benchmarks
LLM 평가 체계 시리즈 #5 — 벤치마크 절반 가까이가 문항을 읽지 않고도 풀린다: n-gram만으로 정답을 예측하는 Clever Hans 효과의 실증 (Pacchiardi et al., Cambridge, arXiv 2024)
-
벤치마크는 무엇을 재고 있나 — 구성타당도의 실패
LLM 평가 체계 시리즈 #4 — 최상위 학회 벤치마크 445편 리뷰가 드러낸 구성타당도의 실패 패턴
-
벤치마킹을 고치려면 무엇이 필요한가 — Bowman & Dahl의 네 기준
LLM 평가 체계 시리즈 #3 — NLU 벤치마킹이 깨졌다는 진단을 validity, reliable annotation, statistical power, disentangling social bias라는 네 가지 채점 기준으로 바꾼 Bowman & Dahl(NAACL 2021)의 포지션 논문
-
범용 벤치마크라는 주장 — AI and the Everything in the Whole Wide World Benchmark
LLM 평가 체계 시리즈 #2 — GLUE와 ImageNet이 '범용 능력을 잰다'고 주장할 수 있었던 근거를 해부한 Raji et al. (2021)의 구성타당도 비판
-
측정으로서의 평가 — 구성개념, 조작화, 타당도, 신뢰도
LLM 평가 체계 시리즈 #1 — 구성개념부터 점수까지 이어지는 측정의 사슬과 타당도·신뢰도·감쇠 정리