| Aug 24, 2026 | 안전 평가의 통계와 체계 설계 — 희귀사건과 calibration, 스물한 편의 마지막 체크리스트 |
| Aug 24, 2026 | 오염·재현성·효율 — 이 점수는 무엇을 재고 있나 |
| Aug 24, 2026 | judge를 통계로 다루기 — 편향, Bradley-Terry, PPI |
| Aug 24, 2026 | LLM eval의 통계 실무 — 클러스터 SE, 분산 분해, IQM |
| Aug 24, 2026 | 몇 개를 재야 하나 — 검정력, 표본크기, 다중비교 |
| Aug 24, 2026 | 차이는 유의한가 — paired bootstrap, 순열검정, McNemar |
| Aug 24, 2026 | 점수는 추정치다 — 이항비율 신뢰구간 |
| Aug 24, 2026 | κ의 역설 — 일치율 90%인데 κ가 0.21 |
| Aug 24, 2026 | 우연을 빼다 — κ 계열 |
| Aug 24, 2026 | 사람 평가 설계 — 루브릭, Likert, pairwise, BWS |
| Aug 24, 2026 | 점수 하나가 아니라 행렬로 — HELM |
| Aug 24, 2026 | 한국어 벤치마크 — 번역이 아니라 원산, 그리고 문화 타당도 |
| Aug 24, 2026 | 능력의 다른 축 — 지시따르기·긴 문맥·사실성 |
| Aug 24, 2026 | 개방형 대화 — MT-Bench에서 Arena까지 |
| Aug 24, 2026 | 검증 가능한 도메인 — 수학과 코드 |
| Aug 24, 2026 | 지식과 추론 — MMLU 계열의 흥망 |
| Aug 24, 2026 | 객관식 평가는 왜 흔들리나 — 위치 편향과 포맷 민감도 |
| Aug 24, 2026 | 생성 지표와 그 타당도 — BLEU에서 COMET까지 |
| Aug 24, 2026 | 분류 지표 — accuracy의 함정부터 PR-AUC까지 |
| Aug 24, 2026 | 척도와 허용 연산: Likert 평균을 내도 되는가 |
| Aug 24, 2026 | 표층 특징이 정답을 예측한다 — Clever Hans in LLM benchmarks |
| Aug 24, 2026 | 벤치마크는 무엇을 재고 있나 — 구성타당도의 실패 |
| Aug 24, 2026 | 벤치마킹을 고치려면 무엇이 필요한가 — Bowman & Dahl의 네 기준 |
| Aug 24, 2026 | 범용 벤치마크라는 주장 — AI and the Everything in the Whole Wide World Benchmark |
| Aug 24, 2026 | 측정으로서의 평가 — 구성개념, 조작화, 타당도, 신뢰도 |
| Aug 11, 2026 | CriticEval: judge를 채점하는 벤치마크 |
| Aug 11, 2026 | Prometheus 2: 평가 기준을 입력으로 받는 judge |
| Aug 11, 2026 | OR-Bench: 과잉 거절을 어떻게 측정할 것인가 |
| Aug 11, 2026 | RLHF는 정말 좋아진 걸까, 길어진 걸까 |
| Aug 11, 2026 | RewardBench 2: reward model을 어떻게 믿을 것인가 |
| May 26, 2026 | 사이버 보안에서의 LLM: 공격·방어·평가의 지형 |
| May 26, 2026 | Claude Mythos와 사이버 보안 LLM: 자율 취약점 발견의 변곡점 |
| May 26, 2026 | Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models |
| May 26, 2026 | CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities |
| May 26, 2026 | AutoAdvExBench: Benchmarking Autonomous Exploitation of Adversarial Example Defenses |
| May 26, 2026 | CAIBench: A Meta-Benchmark for Evaluating Cybersecurity AI Agents |
| May 26, 2026 | CyberSecEval (1–3): Meta Purple Llama의 사이버 보안 위험·역량 평가 |
| May 26, 2026 | CTIBench: A Benchmark for Evaluating LLMs in Cyber Threat Intelligence |
| May 26, 2026 | SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity |
| May 25, 2026 | AgentBench: Evaluating LLMs as Agents |
| May 25, 2026 | GAIA: a benchmark for General AI Assistants |
| May 25, 2026 | SWE-bench: Can Language Models Resolve Real-World GitHub Issues? |
| May 25, 2026 | TravelPlanner: A Benchmark for Real-World Planning with Language Agents |
| May 25, 2026 | MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents |
| May 25, 2026 | OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments |
| Apr 12, 2026 | TelAgentBench: A Multi-faceted Benchmark for Evaluating LLM-based Agents in Telecommunications |
| Apr 11, 2026 | TelBench: A Benchmark for Evaluating Telco-Specific Large Language Models |