| Aug 24, 2026 | 안전 평가의 통계와 체계 설계 — 희귀사건과 calibration, 스물한 편의 마지막 체크리스트 |
| Aug 24, 2026 | 오염·재현성·효율 — 이 점수는 무엇을 재고 있나 |
| Aug 24, 2026 | judge를 통계로 다루기 — 편향, Bradley-Terry, PPI |
| Aug 24, 2026 | LLM eval의 통계 실무 — 클러스터 SE, 분산 분해, IQM |
| Aug 24, 2026 | 몇 개를 재야 하나 — 검정력, 표본크기, 다중비교 |
| Aug 24, 2026 | 차이는 유의한가 — paired bootstrap, 순열검정, McNemar |
| Aug 24, 2026 | 점수는 추정치다 — 이항비율 신뢰구간 |
| Aug 24, 2026 | κ의 역설 — 일치율 90%인데 κ가 0.21 |
| Aug 24, 2026 | 우연을 빼다 — κ 계열 |
| Aug 24, 2026 | 사람 평가 설계 — 루브릭, Likert, pairwise, BWS |
| Aug 24, 2026 | 점수 하나가 아니라 행렬로 — HELM |
| Aug 24, 2026 | 한국어 벤치마크 — 번역이 아니라 원산, 그리고 문화 타당도 |
| Aug 24, 2026 | 능력의 다른 축 — 지시따르기·긴 문맥·사실성 |
| Aug 24, 2026 | 개방형 대화 — MT-Bench에서 Arena까지 |
| Aug 24, 2026 | 검증 가능한 도메인 — 수학과 코드 |
| Aug 24, 2026 | 지식과 추론 — MMLU 계열의 흥망 |
| Aug 24, 2026 | 객관식 평가는 왜 흔들리나 — 위치 편향과 포맷 민감도 |
| Aug 24, 2026 | 생성 지표와 그 타당도 — BLEU에서 COMET까지 |
| Aug 24, 2026 | 분류 지표 — accuracy의 함정부터 PR-AUC까지 |
| Aug 24, 2026 | 척도와 허용 연산: Likert 평균을 내도 되는가 |
| Aug 24, 2026 | 표층 특징이 정답을 예측한다 — Clever Hans in LLM benchmarks |
| Aug 24, 2026 | 벤치마크는 무엇을 재고 있나 — 구성타당도의 실패 |
| Aug 24, 2026 | 벤치마킹을 고치려면 무엇이 필요한가 — Bowman & Dahl의 네 기준 |
| Aug 24, 2026 | 범용 벤치마크라는 주장 — AI and the Everything in the Whole Wide World Benchmark |
| Aug 24, 2026 | 측정으로서의 평가 — 구성개념, 조작화, 타당도, 신뢰도 |
| Aug 11, 2026 | reward를 어떻게 설계할 것인가 — RM 설계 실무 |
| Aug 11, 2026 | 프론티어 모델은 harmlessness reward를 어떻게 설계했나 |
| Aug 11, 2026 | 프론티어 모델은 helpfulness reward를 어떻게 설계했나 |
| Aug 11, 2026 | One Token to Fool: GenRM도 결국 뚫린다 |
| Aug 11, 2026 | CriticEval: judge를 채점하는 벤치마크 |
| Aug 11, 2026 | Rubrics as Rewards: 정답이 없는 도메인에 reward를 만드는 법 |
| Aug 11, 2026 | J1: RL로 judge를 생각하게 만들다 |
| Aug 11, 2026 | ReasonGRM: judge에게 추론 능력을 이식하다 |
| Aug 11, 2026 | DeepSeek-GRM: reward model이 평가 기준을 스스로 만든다 |
| Aug 11, 2026 | Self-Taught Evaluators: 사람 라벨 없이 judge를 키우다 |
| Aug 11, 2026 | Generative Reward Models: GenRM과 선호 학습을 잇다 |
| Aug 11, 2026 | Generative Verifiers: reward를 분류가 아니라 생성으로 풀다 |
| Aug 11, 2026 | Prometheus 2: 평가 기준을 입력으로 받는 judge |
| Aug 11, 2026 | DeepSeek-R1: reward model을 규칙으로 대체하다 |
| Aug 11, 2026 | Math-Shepherd: 사람 라벨 없이 PRM을 만들다 |
| Aug 11, 2026 | Let's Verify Step by Step: 결과가 아니라 과정에 보상을 주다 |
| Aug 11, 2026 | WARP: 정책을 weight space에서 세 번 병합한다 |
| Aug 11, 2026 | BOND: Best-of-N을 추론 비용 없이 흉내 내다 |
| Aug 11, 2026 | DAPO: 신호 없는 프롬프트를 버리고, 탐색을 살린다 |
| Aug 11, 2026 | GSPO: importance ratio를 토큰이 아니라 시퀀스 단위로 |
| Aug 11, 2026 | KTO: 선호 쌍 없이, 좋다·나쁘다만으로 정렬한다 |
| Aug 11, 2026 | SimPO: reference 모델을 버리고 길이로 정규화한다 |
| Aug 11, 2026 | DPO: reward model을 없애면 무엇을 잃는가 |
| Aug 11, 2026 | RLOO: PPO의 절반은 RLHF에 필요 없었다 |
| Aug 11, 2026 | GRPO: value network를 버리고 그룹 안에서 비교하다 |
| Aug 11, 2026 | Secrets of RLHF I: PPO 학습은 왜 터지는가 |
| Aug 11, 2026 | PPO: clipped surrogate objective는 무엇을 지키는가 |
| Aug 11, 2026 | OR-Bench: 과잉 거절을 어떻게 측정할 것인가 |
| Aug 11, 2026 | 안전 정렬은 첫 몇 토큰에만 얹혀 있다 |
| Aug 11, 2026 | Deliberative Alignment: 안전 명세를 모델의 추론 안으로 |
| Aug 11, 2026 | Rule-Based Rewards: 안전 규칙을 reward로 직접 번역한다 |
| Aug 11, 2026 | Safe RLHF: 안전성을 reward가 아니라 '제약'으로 다룬다 |
| Aug 11, 2026 | WARM: reward model을 weight 공간에서 평균내다 |
| Aug 11, 2026 | 아첨(sycophancy): RM은 사실보다 동의를 좋아한다 |
| Aug 11, 2026 | ODIN: reward에서 길이 성분을 떼어내다 |
| Aug 11, 2026 | RLHF는 정말 좋아진 걸까, 길어진 걸까 |
| Aug 11, 2026 | Reward Model Overoptimization: Goodhart의 법칙을 수식으로 쓰다 |
| Aug 11, 2026 | RewardBench 2: reward model을 어떻게 믿을 것인가 |
| Aug 11, 2026 | Llama 2의 RLHF: reward model을 두 개로 쪼갠 이유 |
| Aug 11, 2026 | ArmoRM: 하나의 스칼라를 해석 가능한 여러 축으로 쪼개다 |
| Aug 11, 2026 | Skywork-Reward: 데이터 큐레이션이 아키텍처를 이긴다 |
| Aug 11, 2026 | Secrets of RLHF II: 선호 데이터의 노이즈와 reward model의 일반화 |
| Aug 11, 2026 | Rethinking Bradley-Terry: 왜 이 식으로 reward를 만드는가 |
| Aug 11, 2026 | HH-RLHF: helpfulness와 harmlessness는 왜 충돌하는가 |
| Aug 11, 2026 | InstructGPT: RLHF 3단계 레시피의 표준을 세우다 |
| Aug 11, 2026 | Deep RL from Human Preferences: 보상 함수를 사람의 선호로 배우다 |
| May 30, 2026 | Tamper-Resistant Safeguards (TAR) — Fine-tuning 자체에 견디는 safety |
| May 29, 2026 | Circuit Breakers — 유해 representation을 incoherent state로 리라우팅 |
| May 29, 2026 | Emergent Misalignment — 안전한 코드 학습이 모델을 전반적으로 나쁘게 만든다 |
| May 29, 2026 | Shallow Safety Alignment — RLHF는 첫 5개 토큰만 reshape한다 |
| May 29, 2026 | Exploiting Novel GPT-4 APIs — 세 가지 공격 표면을 한 번에 점검하기 |
| May 29, 2026 | Covert Malicious Finetuning — 학습 데이터가 모두 무해해 보이는 공격 |
| May 29, 2026 | Universal Jailbreak Backdoors from Poisoned RLHF — 트리거 단어 하나가 'sudo'가 된다 |
| May 29, 2026 | LoRA Undoes Safety — QLoRA로 Llama-2-70B-Chat의 거부율을 1%로 |
| May 29, 2026 | Removing RLHF Protections in GPT-4 via Fine-Tuning — 340예시로 frontier API 깨기 |
| May 29, 2026 | Shadow Alignment — 100개 QA + 1 GPU-시간으로 open-weight 5종 깨기 |
| May 29, 2026 | Fine-tuning Compromises Safety — 10개 예시면 alignment가 무너진다 |
| May 29, 2026 | Refusal Direction & Abliteration — 거부는 하나의 방향이다 |
| May 29, 2026 | PKU-SafeRLHF-30K: A Dual-Preference Dataset for Safe-RLHF |
| May 26, 2026 | 사이버 보안에서의 LLM: 공격·방어·평가의 지형 |
| May 26, 2026 | Claude Mythos와 사이버 보안 LLM: 자율 취약점 발견의 변곡점 |
| May 26, 2026 | Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models |
| May 26, 2026 | CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities |
| May 26, 2026 | AutoAdvExBench: Benchmarking Autonomous Exploitation of Adversarial Example Defenses |
| May 26, 2026 | CAIBench: A Meta-Benchmark for Evaluating Cybersecurity AI Agents |
| May 26, 2026 | CyberSecEval (1–3): Meta Purple Llama의 사이버 보안 위험·역량 평가 |
| May 26, 2026 | CTIBench: A Benchmark for Evaluating LLMs in Cyber Threat Intelligence |
| May 26, 2026 | SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity |
| May 26, 2026 | ALMA: 9,000개 주석만으로 LLM을 정렬하기 |
| May 26, 2026 | PIKA: 난이도에 집중한 expert-level 합성 정렬 데이터셋 |
| May 26, 2026 | WildJailbreak: in-the-wild 탈옥을 대규모로 합성한 안전 학습 데이터셋 |
| May 26, 2026 | BeaverTails: helpfulness와 harmlessness를 분리한 안전 정렬 데이터셋 |
| May 26, 2026 | HarmfulQA & RED-INSTRUCT: Chain of Utterances로 유해 질문을 만들고 안전 정렬까지 |
| May 26, 2026 | HH-RLHF Red-Team Attempts: Anthropic의 38,961건 레드팀 대화 데이터셋 |
| May 26, 2026 | AdvBench: LLM 공격 평가의 사실상 표준이 된 유해 행동 데이터셋 |
| May 25, 2026 | 에이전트란 무엇인가: 지능형 에이전트의 고전 정의부터 LLM 에이전트까지 |
| May 25, 2026 | AgentBench: Evaluating LLMs as Agents |
| May 25, 2026 | GAIA: a benchmark for General AI Assistants |
| May 25, 2026 | SWE-bench: Can Language Models Resolve Real-World GitHub Issues? |
| May 25, 2026 | TravelPlanner: A Benchmark for Real-World Planning with Language Agents |
| May 25, 2026 | MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents |
| May 25, 2026 | OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments |
| May 18, 2026 | Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations |
| May 18, 2026 | Constitutional AI: Harmlessness from AI Feedback |
| May 18, 2026 | JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models |
| May 18, 2026 | HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal |
| May 16, 2026 | AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents |
| May 16, 2026 | InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents |
| May 16, 2026 | AgenticRed: Evolving Agentic Systems for Red-Teaming |
| May 16, 2026 | Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models |
| May 16, 2026 | Curiosity-driven Red-teaming for Large Language Models |
| May 16, 2026 | Many-shot Jailbreaking |
| May 16, 2026 | Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack |
| May 16, 2026 | GPTFuzzer: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts |
| May 16, 2026 | Tree of Attacks: Jailbreaking Black-Box LLMs Automatically |
| May 16, 2026 | AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models |
| May 16, 2026 | Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned |
| May 16, 2026 | Red Teaming Language Models with Language Models |
| Apr 29, 2026 | CodeAttack: Code-based Adversarial Attacks for Pre-trained Programming Language Models |
| Apr 29, 2026 | Jailbreaking Black Box Large Language Models in Twenty Queries |
| Apr 29, 2026 | Universal and Transferable Adversarial Attacks on Aligned Language Models |
| Apr 12, 2026 | A.X K1 Technical Report |
| Apr 12, 2026 | TelAgentBench: A Multi-faceted Benchmark for Evaluating LLM-based Agents in Telecommunications |
| Apr 11, 2026 | TelBench: A Benchmark for Evaluating Telco-Specific Large Language Models |
| Apr 11, 2026 | FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling |
| Apr 09, 2026 | FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision |
| Dec 28, 2024 | LoRA vs Full Fine-tuning: An Illusion of Equivalence |
| Dec 11, 2024 | Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method 설명 |
| Sep 19, 2024 | META-REWARDING LANGUAGE MODELS: Self-Improving Alignment with LLM-as-a-Meta-Judge 설명 |
| Nov 19, 2023 | What Makes Multi-modal Learning Better than Single (Provably) |
| Aug 06, 2023 | FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning |
| Jun 28, 2023 | TinyViT |
| Jun 28, 2023 | EdgeViT |
| Jun 21, 2023 | Integral Neural Network |
| Apr 29, 2023 | Invariant Representation for Unsupervised Image Restoration |
| Apr 16, 2023 | DINE: Domain Adaptation from Single and Multiple Black-box Predictors |
| Apr 16, 2023 | MobileOne: An Improved One millisecond Mobile Backbone |
| Apr 08, 2023 | Proper Reuse of Image Classification Features Improves Object Detection |
| Apr 01, 2023 | Meta Pseudo Labels |
| Mar 29, 2023 | MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer |
| Mar 28, 2023 | FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness |
| Mar 21, 2023 | Cross-Domain Adaptive Teacher for Object Detection |
| Mar 14, 2023 | Rethinking “Batch” in BatchNorm |
| Mar 07, 2023 | Convolutional Character Network |
| Feb 18, 2023 | Simple Baselines for Image Restoration |
| Jan 05, 2023 | Bootstrap your own latent |
| May 09, 2022 | FitNet |
| Jan 27, 2021 | [AutoML] NASNet |
| Jan 10, 2021 | 학부생이 본 SENet |
| Jan 03, 2021 | [네트워크 경량화] EfficientNet |