paper

an archive of posts with this tag

Aug 24, 2026 안전 평가의 통계와 체계 설계 — 희귀사건과 calibration, 스물한 편의 마지막 체크리스트
Aug 24, 2026 오염·재현성·효율 — 이 점수는 무엇을 재고 있나
Aug 24, 2026 judge를 통계로 다루기 — 편향, Bradley-Terry, PPI
Aug 24, 2026 LLM eval의 통계 실무 — 클러스터 SE, 분산 분해, IQM
Aug 24, 2026 몇 개를 재야 하나 — 검정력, 표본크기, 다중비교
Aug 24, 2026 차이는 유의한가 — paired bootstrap, 순열검정, McNemar
Aug 24, 2026 점수는 추정치다 — 이항비율 신뢰구간
Aug 24, 2026 κ의 역설 — 일치율 90%인데 κ가 0.21
Aug 24, 2026 우연을 빼다 — κ 계열
Aug 24, 2026 사람 평가 설계 — 루브릭, Likert, pairwise, BWS
Aug 24, 2026 점수 하나가 아니라 행렬로 — HELM
Aug 24, 2026 한국어 벤치마크 — 번역이 아니라 원산, 그리고 문화 타당도
Aug 24, 2026 능력의 다른 축 — 지시따르기·긴 문맥·사실성
Aug 24, 2026 개방형 대화 — MT-Bench에서 Arena까지
Aug 24, 2026 검증 가능한 도메인 — 수학과 코드
Aug 24, 2026 지식과 추론 — MMLU 계열의 흥망
Aug 24, 2026 객관식 평가는 왜 흔들리나 — 위치 편향과 포맷 민감도
Aug 24, 2026 생성 지표와 그 타당도 — BLEU에서 COMET까지
Aug 24, 2026 분류 지표 — accuracy의 함정부터 PR-AUC까지
Aug 24, 2026 척도와 허용 연산: Likert 평균을 내도 되는가
Aug 24, 2026 표층 특징이 정답을 예측한다 — Clever Hans in LLM benchmarks
Aug 24, 2026 벤치마크는 무엇을 재고 있나 — 구성타당도의 실패
Aug 24, 2026 벤치마킹을 고치려면 무엇이 필요한가 — Bowman & Dahl의 네 기준
Aug 24, 2026 범용 벤치마크라는 주장 — AI and the Everything in the Whole Wide World Benchmark
Aug 24, 2026 측정으로서의 평가 — 구성개념, 조작화, 타당도, 신뢰도
Aug 11, 2026 reward를 어떻게 설계할 것인가 — RM 설계 실무
Aug 11, 2026 프론티어 모델은 harmlessness reward를 어떻게 설계했나
Aug 11, 2026 프론티어 모델은 helpfulness reward를 어떻게 설계했나
Aug 11, 2026 One Token to Fool: GenRM도 결국 뚫린다
Aug 11, 2026 CriticEval: judge를 채점하는 벤치마크
Aug 11, 2026 Rubrics as Rewards: 정답이 없는 도메인에 reward를 만드는 법
Aug 11, 2026 J1: RL로 judge를 생각하게 만들다
Aug 11, 2026 ReasonGRM: judge에게 추론 능력을 이식하다
Aug 11, 2026 DeepSeek-GRM: reward model이 평가 기준을 스스로 만든다
Aug 11, 2026 Self-Taught Evaluators: 사람 라벨 없이 judge를 키우다
Aug 11, 2026 Generative Reward Models: GenRM과 선호 학습을 잇다
Aug 11, 2026 Generative Verifiers: reward를 분류가 아니라 생성으로 풀다
Aug 11, 2026 Prometheus 2: 평가 기준을 입력으로 받는 judge
Aug 11, 2026 DeepSeek-R1: reward model을 규칙으로 대체하다
Aug 11, 2026 Math-Shepherd: 사람 라벨 없이 PRM을 만들다
Aug 11, 2026 Let's Verify Step by Step: 결과가 아니라 과정에 보상을 주다
Aug 11, 2026 WARP: 정책을 weight space에서 세 번 병합한다
Aug 11, 2026 BOND: Best-of-N을 추론 비용 없이 흉내 내다
Aug 11, 2026 DAPO: 신호 없는 프롬프트를 버리고, 탐색을 살린다
Aug 11, 2026 GSPO: importance ratio를 토큰이 아니라 시퀀스 단위로
Aug 11, 2026 KTO: 선호 쌍 없이, 좋다·나쁘다만으로 정렬한다
Aug 11, 2026 SimPO: reference 모델을 버리고 길이로 정규화한다
Aug 11, 2026 DPO: reward model을 없애면 무엇을 잃는가
Aug 11, 2026 RLOO: PPO의 절반은 RLHF에 필요 없었다
Aug 11, 2026 GRPO: value network를 버리고 그룹 안에서 비교하다
Aug 11, 2026 Secrets of RLHF I: PPO 학습은 왜 터지는가
Aug 11, 2026 PPO: clipped surrogate objective는 무엇을 지키는가
Aug 11, 2026 OR-Bench: 과잉 거절을 어떻게 측정할 것인가
Aug 11, 2026 안전 정렬은 첫 몇 토큰에만 얹혀 있다
Aug 11, 2026 Deliberative Alignment: 안전 명세를 모델의 추론 안으로
Aug 11, 2026 Rule-Based Rewards: 안전 규칙을 reward로 직접 번역한다
Aug 11, 2026 Safe RLHF: 안전성을 reward가 아니라 '제약'으로 다룬다
Aug 11, 2026 WARM: reward model을 weight 공간에서 평균내다
Aug 11, 2026 아첨(sycophancy): RM은 사실보다 동의를 좋아한다
Aug 11, 2026 ODIN: reward에서 길이 성분을 떼어내다
Aug 11, 2026 RLHF는 정말 좋아진 걸까, 길어진 걸까
Aug 11, 2026 Reward Model Overoptimization: Goodhart의 법칙을 수식으로 쓰다
Aug 11, 2026 RewardBench 2: reward model을 어떻게 믿을 것인가
Aug 11, 2026 Llama 2의 RLHF: reward model을 두 개로 쪼갠 이유
Aug 11, 2026 ArmoRM: 하나의 스칼라를 해석 가능한 여러 축으로 쪼개다
Aug 11, 2026 Skywork-Reward: 데이터 큐레이션이 아키텍처를 이긴다
Aug 11, 2026 Secrets of RLHF II: 선호 데이터의 노이즈와 reward model의 일반화
Aug 11, 2026 Rethinking Bradley-Terry: 왜 이 식으로 reward를 만드는가
Aug 11, 2026 HH-RLHF: helpfulness와 harmlessness는 왜 충돌하는가
Aug 11, 2026 InstructGPT: RLHF 3단계 레시피의 표준을 세우다
Aug 11, 2026 Deep RL from Human Preferences: 보상 함수를 사람의 선호로 배우다
May 30, 2026 Tamper-Resistant Safeguards (TAR) — Fine-tuning 자체에 견디는 safety
May 29, 2026 Circuit Breakers — 유해 representation을 incoherent state로 리라우팅
May 29, 2026 Emergent Misalignment — 안전한 코드 학습이 모델을 전반적으로 나쁘게 만든다
May 29, 2026 Shallow Safety Alignment — RLHF는 첫 5개 토큰만 reshape한다
May 29, 2026 Exploiting Novel GPT-4 APIs — 세 가지 공격 표면을 한 번에 점검하기
May 29, 2026 Covert Malicious Finetuning — 학습 데이터가 모두 무해해 보이는 공격
May 29, 2026 Universal Jailbreak Backdoors from Poisoned RLHF — 트리거 단어 하나가 'sudo'가 된다
May 29, 2026 LoRA Undoes Safety — QLoRA로 Llama-2-70B-Chat의 거부율을 1%로
May 29, 2026 Removing RLHF Protections in GPT-4 via Fine-Tuning — 340예시로 frontier API 깨기
May 29, 2026 Shadow Alignment — 100개 QA + 1 GPU-시간으로 open-weight 5종 깨기
May 29, 2026 Fine-tuning Compromises Safety — 10개 예시면 alignment가 무너진다
May 29, 2026 Refusal Direction & Abliteration — 거부는 하나의 방향이다
May 29, 2026 PKU-SafeRLHF-30K: A Dual-Preference Dataset for Safe-RLHF
May 26, 2026 사이버 보안에서의 LLM: 공격·방어·평가의 지형
May 26, 2026 Claude Mythos와 사이버 보안 LLM: 자율 취약점 발견의 변곡점
May 26, 2026 Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models
May 26, 2026 CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities
May 26, 2026 AutoAdvExBench: Benchmarking Autonomous Exploitation of Adversarial Example Defenses
May 26, 2026 CAIBench: A Meta-Benchmark for Evaluating Cybersecurity AI Agents
May 26, 2026 CyberSecEval (1–3): Meta Purple Llama의 사이버 보안 위험·역량 평가
May 26, 2026 CTIBench: A Benchmark for Evaluating LLMs in Cyber Threat Intelligence
May 26, 2026 SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity
May 26, 2026 ALMA: 9,000개 주석만으로 LLM을 정렬하기
May 26, 2026 PIKA: 난이도에 집중한 expert-level 합성 정렬 데이터셋
May 26, 2026 WildJailbreak: in-the-wild 탈옥을 대규모로 합성한 안전 학습 데이터셋
May 26, 2026 BeaverTails: helpfulness와 harmlessness를 분리한 안전 정렬 데이터셋
May 26, 2026 HarmfulQA & RED-INSTRUCT: Chain of Utterances로 유해 질문을 만들고 안전 정렬까지
May 26, 2026 HH-RLHF Red-Team Attempts: Anthropic의 38,961건 레드팀 대화 데이터셋
May 26, 2026 AdvBench: LLM 공격 평가의 사실상 표준이 된 유해 행동 데이터셋
May 25, 2026 에이전트란 무엇인가: 지능형 에이전트의 고전 정의부터 LLM 에이전트까지
May 25, 2026 AgentBench: Evaluating LLMs as Agents
May 25, 2026 GAIA: a benchmark for General AI Assistants
May 25, 2026 SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
May 25, 2026 TravelPlanner: A Benchmark for Real-World Planning with Language Agents
May 25, 2026 MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents
May 25, 2026 OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
May 18, 2026 Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
May 18, 2026 Constitutional AI: Harmlessness from AI Feedback
May 18, 2026 JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
May 18, 2026 HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
May 16, 2026 AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents
May 16, 2026 InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents
May 16, 2026 AgenticRed: Evolving Agentic Systems for Red-Teaming
May 16, 2026 Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
May 16, 2026 Curiosity-driven Red-teaming for Large Language Models
May 16, 2026 Many-shot Jailbreaking
May 16, 2026 Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
May 16, 2026 GPTFuzzer: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts
May 16, 2026 Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
May 16, 2026 AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
May 16, 2026 Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned
May 16, 2026 Red Teaming Language Models with Language Models
Apr 29, 2026 CodeAttack: Code-based Adversarial Attacks for Pre-trained Programming Language Models
Apr 29, 2026 Jailbreaking Black Box Large Language Models in Twenty Queries
Apr 29, 2026 Universal and Transferable Adversarial Attacks on Aligned Language Models
Apr 12, 2026 A.X K1 Technical Report
Apr 12, 2026 TelAgentBench: A Multi-faceted Benchmark for Evaluating LLM-based Agents in Telecommunications
Apr 11, 2026 TelBench: A Benchmark for Evaluating Telco-Specific Large Language Models
Apr 11, 2026 FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling
Apr 09, 2026 FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision
Dec 28, 2024 LoRA vs Full Fine-tuning: An Illusion of Equivalence
Dec 11, 2024 Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method 설명
Sep 19, 2024 META-REWARDING LANGUAGE MODELS: Self-Improving Alignment with LLM-as-a-Meta-Judge 설명
Nov 19, 2023 What Makes Multi-modal Learning Better than Single (Provably)
Aug 06, 2023 FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning
Jun 28, 2023 TinyViT
Jun 28, 2023 EdgeViT
Jun 21, 2023 Integral Neural Network
Apr 29, 2023 Invariant Representation for Unsupervised Image Restoration
Apr 16, 2023 DINE: Domain Adaptation from Single and Multiple Black-box Predictors
Apr 16, 2023 MobileOne: An Improved One millisecond Mobile Backbone
Apr 08, 2023 Proper Reuse of Image Classification Features Improves Object Detection
Apr 01, 2023 Meta Pseudo Labels
Mar 29, 2023 MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer
Mar 28, 2023 FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
Mar 21, 2023 Cross-Domain Adaptive Teacher for Object Detection
Mar 14, 2023 Rethinking “Batch” in BatchNorm
Mar 07, 2023 Convolutional Character Network
Feb 18, 2023 Simple Baselines for Image Restoration
Jan 05, 2023 Bootstrap your own latent
May 09, 2022 FitNet
Jan 27, 2021 [AutoML] NASNet
Jan 10, 2021 학부생이 본 SENet
Jan 03, 2021 [네트워크 경량화] EfficientNet