2026

an archive of posts from this year

Aug 24, 2026 안전 평가의 통계와 체계 설계 — 희귀사건과 calibration, 스물한 편의 마지막 체크리스트
Aug 24, 2026 오염·재현성·효율 — 이 점수는 무엇을 재고 있나
Aug 24, 2026 judge를 통계로 다루기 — 편향, Bradley-Terry, PPI
Aug 24, 2026 LLM eval의 통계 실무 — 클러스터 SE, 분산 분해, IQM
Aug 24, 2026 몇 개를 재야 하나 — 검정력, 표본크기, 다중비교
Aug 24, 2026 차이는 유의한가 — paired bootstrap, 순열검정, McNemar
Aug 24, 2026 점수는 추정치다 — 이항비율 신뢰구간
Aug 24, 2026 κ의 역설 — 일치율 90%인데 κ가 0.21
Aug 24, 2026 우연을 빼다 — κ 계열
Aug 24, 2026 사람 평가 설계 — 루브릭, Likert, pairwise, BWS
Aug 24, 2026 점수 하나가 아니라 행렬로 — HELM
Aug 24, 2026 한국어 벤치마크 — 번역이 아니라 원산, 그리고 문화 타당도
Aug 24, 2026 능력의 다른 축 — 지시따르기·긴 문맥·사실성
Aug 24, 2026 개방형 대화 — MT-Bench에서 Arena까지
Aug 24, 2026 검증 가능한 도메인 — 수학과 코드
Aug 24, 2026 지식과 추론 — MMLU 계열의 흥망
Aug 24, 2026 객관식 평가는 왜 흔들리나 — 위치 편향과 포맷 민감도
Aug 24, 2026 생성 지표와 그 타당도 — BLEU에서 COMET까지
Aug 24, 2026 분류 지표 — accuracy의 함정부터 PR-AUC까지
Aug 24, 2026 척도와 허용 연산: Likert 평균을 내도 되는가
Aug 24, 2026 표층 특징이 정답을 예측한다 — Clever Hans in LLM benchmarks
Aug 24, 2026 벤치마크는 무엇을 재고 있나 — 구성타당도의 실패
Aug 24, 2026 벤치마킹을 고치려면 무엇이 필요한가 — Bowman & Dahl의 네 기준
Aug 24, 2026 범용 벤치마크라는 주장 — AI and the Everything in the Whole Wide World Benchmark
Aug 24, 2026 측정으로서의 평가 — 구성개념, 조작화, 타당도, 신뢰도
Aug 11, 2026 reward를 어떻게 설계할 것인가 — RM 설계 실무
Aug 11, 2026 프론티어 모델은 harmlessness reward를 어떻게 설계했나
Aug 11, 2026 프론티어 모델은 helpfulness reward를 어떻게 설계했나
Aug 11, 2026 One Token to Fool: GenRM도 결국 뚫린다
Aug 11, 2026 CriticEval: judge를 채점하는 벤치마크
Aug 11, 2026 Rubrics as Rewards: 정답이 없는 도메인에 reward를 만드는 법
Aug 11, 2026 J1: RL로 judge를 생각하게 만들다
Aug 11, 2026 ReasonGRM: judge에게 추론 능력을 이식하다
Aug 11, 2026 DeepSeek-GRM: reward model이 평가 기준을 스스로 만든다
Aug 11, 2026 Self-Taught Evaluators: 사람 라벨 없이 judge를 키우다
Aug 11, 2026 Generative Reward Models: GenRM과 선호 학습을 잇다
Aug 11, 2026 Generative Verifiers: reward를 분류가 아니라 생성으로 풀다
Aug 11, 2026 Prometheus 2: 평가 기준을 입력으로 받는 judge
Aug 11, 2026 DeepSeek-R1: reward model을 규칙으로 대체하다
Aug 11, 2026 Math-Shepherd: 사람 라벨 없이 PRM을 만들다
Aug 11, 2026 Let's Verify Step by Step: 결과가 아니라 과정에 보상을 주다
Aug 11, 2026 WARP: 정책을 weight space에서 세 번 병합한다
Aug 11, 2026 BOND: Best-of-N을 추론 비용 없이 흉내 내다
Aug 11, 2026 DAPO: 신호 없는 프롬프트를 버리고, 탐색을 살린다
Aug 11, 2026 GSPO: importance ratio를 토큰이 아니라 시퀀스 단위로
Aug 11, 2026 KTO: 선호 쌍 없이, 좋다·나쁘다만으로 정렬한다
Aug 11, 2026 SimPO: reference 모델을 버리고 길이로 정규화한다
Aug 11, 2026 DPO: reward model을 없애면 무엇을 잃는가
Aug 11, 2026 RLOO: PPO의 절반은 RLHF에 필요 없었다
Aug 11, 2026 GRPO: value network를 버리고 그룹 안에서 비교하다
Aug 11, 2026 Secrets of RLHF I: PPO 학습은 왜 터지는가
Aug 11, 2026 PPO: clipped surrogate objective는 무엇을 지키는가
Aug 11, 2026 OR-Bench: 과잉 거절을 어떻게 측정할 것인가
Aug 11, 2026 안전 정렬은 첫 몇 토큰에만 얹혀 있다
Aug 11, 2026 Deliberative Alignment: 안전 명세를 모델의 추론 안으로
Aug 11, 2026 Rule-Based Rewards: 안전 규칙을 reward로 직접 번역한다
Aug 11, 2026 Safe RLHF: 안전성을 reward가 아니라 '제약'으로 다룬다
Aug 11, 2026 WARM: reward model을 weight 공간에서 평균내다
Aug 11, 2026 아첨(sycophancy): RM은 사실보다 동의를 좋아한다
Aug 11, 2026 ODIN: reward에서 길이 성분을 떼어내다
Aug 11, 2026 RLHF는 정말 좋아진 걸까, 길어진 걸까
Aug 11, 2026 Reward Model Overoptimization: Goodhart의 법칙을 수식으로 쓰다
Aug 11, 2026 RewardBench 2: reward model을 어떻게 믿을 것인가
Aug 11, 2026 Llama 2의 RLHF: reward model을 두 개로 쪼갠 이유
Aug 11, 2026 ArmoRM: 하나의 스칼라를 해석 가능한 여러 축으로 쪼개다
Aug 11, 2026 Skywork-Reward: 데이터 큐레이션이 아키텍처를 이긴다
Aug 11, 2026 Secrets of RLHF II: 선호 데이터의 노이즈와 reward model의 일반화
Aug 11, 2026 Rethinking Bradley-Terry: 왜 이 식으로 reward를 만드는가
Aug 11, 2026 HH-RLHF: helpfulness와 harmlessness는 왜 충돌하는가
Aug 11, 2026 InstructGPT: RLHF 3단계 레시피의 표준을 세우다
Aug 11, 2026 Deep RL from Human Preferences: 보상 함수를 사람의 선호로 배우다
Jul 07, 2026 Kubernetes 관측성 — 로그·메트릭과 Prometheus/Grafana
Jul 07, 2026 Kubernetes 확장과 생태계 — Operator와 CNCF Projects
Jul 06, 2026 Kubernetes 권한 관리 — ServiceAccount와 RBAC
Jul 06, 2026 Kubernetes 스토리지와 설정 — PV/PVC, ConfigMap, Secret
Jul 06, 2026 Kubernetes 네트워킹 — Service와 Ingress
Jul 06, 2026 Kubernetes 워크로드 — ReplicaSet, Deployment, StatefulSet, DaemonSet
Jul 06, 2026 Pod의 모든 것 — 생성부터 스케줄링까지
Jul 06, 2026 Kubernetes 아키텍처 — Control Plane과 Node
Jul 06, 2026 내 노트북에 Kubernetes 클러스터 만들기 — kind와 kubectl
Jul 06, 2026 Kubernetes의 탄생 — Google Borg에서 CNCF까지
May 30, 2026 Tamper-Resistant Safeguards (TAR) — Fine-tuning 자체에 견디는 safety
May 29, 2026 Circuit Breakers — 유해 representation을 incoherent state로 리라우팅
May 29, 2026 Emergent Misalignment — 안전한 코드 학습이 모델을 전반적으로 나쁘게 만든다
May 29, 2026 Shallow Safety Alignment — RLHF는 첫 5개 토큰만 reshape한다
May 29, 2026 Exploiting Novel GPT-4 APIs — 세 가지 공격 표면을 한 번에 점검하기
May 29, 2026 Covert Malicious Finetuning — 학습 데이터가 모두 무해해 보이는 공격
May 29, 2026 Universal Jailbreak Backdoors from Poisoned RLHF — 트리거 단어 하나가 'sudo'가 된다
May 29, 2026 LoRA Undoes Safety — QLoRA로 Llama-2-70B-Chat의 거부율을 1%로
May 29, 2026 Removing RLHF Protections in GPT-4 via Fine-Tuning — 340예시로 frontier API 깨기
May 29, 2026 Shadow Alignment — 100개 QA + 1 GPU-시간으로 open-weight 5종 깨기
May 29, 2026 Fine-tuning Compromises Safety — 10개 예시면 alignment가 무너진다
May 29, 2026 Refusal Direction & Abliteration — 거부는 하나의 방향이다
May 29, 2026 PKU-SafeRLHF-30K: A Dual-Preference Dataset for Safe-RLHF
May 26, 2026 사이버 보안에서의 LLM: 공격·방어·평가의 지형
May 26, 2026 Claude Mythos와 사이버 보안 LLM: 자율 취약점 발견의 변곡점
May 26, 2026 Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models
May 26, 2026 CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities
May 26, 2026 AutoAdvExBench: Benchmarking Autonomous Exploitation of Adversarial Example Defenses
May 26, 2026 CAIBench: A Meta-Benchmark for Evaluating Cybersecurity AI Agents
May 26, 2026 CyberSecEval (1–3): Meta Purple Llama의 사이버 보안 위험·역량 평가
May 26, 2026 CTIBench: A Benchmark for Evaluating LLMs in Cyber Threat Intelligence
May 26, 2026 SecBench: A Comprehensive Multi-Dimensional Benchmarking Dataset for LLMs in Cybersecurity
May 26, 2026 ALMA: 9,000개 주석만으로 LLM을 정렬하기
May 26, 2026 PIKA: 난이도에 집중한 expert-level 합성 정렬 데이터셋
May 26, 2026 WildJailbreak: in-the-wild 탈옥을 대규모로 합성한 안전 학습 데이터셋
May 26, 2026 BeaverTails: helpfulness와 harmlessness를 분리한 안전 정렬 데이터셋
May 26, 2026 HarmfulQA & RED-INSTRUCT: Chain of Utterances로 유해 질문을 만들고 안전 정렬까지
May 26, 2026 HH-RLHF Red-Team Attempts: Anthropic의 38,961건 레드팀 대화 데이터셋
May 26, 2026 AdvBench: LLM 공격 평가의 사실상 표준이 된 유해 행동 데이터셋
May 25, 2026 에이전트란 무엇인가: 지능형 에이전트의 고전 정의부터 LLM 에이전트까지
May 25, 2026 AgentBench: Evaluating LLMs as Agents
May 25, 2026 GAIA: a benchmark for General AI Assistants
May 25, 2026 SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
May 25, 2026 TravelPlanner: A Benchmark for Real-World Planning with Language Agents
May 25, 2026 MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents
May 25, 2026 OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
May 18, 2026 Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
May 18, 2026 Constitutional AI: Harmlessness from AI Feedback
May 18, 2026 JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
May 18, 2026 HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
May 16, 2026 AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents
May 16, 2026 InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents
May 16, 2026 AgenticRed: Evolving Agentic Systems for Red-Teaming
May 16, 2026 Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
May 16, 2026 Curiosity-driven Red-teaming for Large Language Models
May 16, 2026 Many-shot Jailbreaking
May 16, 2026 Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
May 16, 2026 GPTFuzzer: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts
May 16, 2026 Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
May 16, 2026 AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
May 16, 2026 Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned
May 16, 2026 Red Teaming Language Models with Language Models
May 11, 2026 TRL sequence packing → DeepSeek MLA: 누락된 cu_seqlens 복원
May 10, 2026 MLA 학습 시 modeling-side projection fusion: q_a/kv_a 배치 + K-side absorption
May 10, 2026 DeepSeek 계열 MoE 학습 가속: Python expert loop → grouped GEMM
Apr 29, 2026 CodeAttack: Code-based Adversarial Attacks for Pre-trained Programming Language Models
Apr 29, 2026 Jailbreaking Black Box Large Language Models in Twenty Queries
Apr 29, 2026 Universal and Transferable Adversarial Attacks on Aligned Language Models
Apr 12, 2026 A.X K1 Technical Report
Apr 12, 2026 TelAgentBench: A Multi-faceted Benchmark for Evaluating LLM-based Agents in Telecommunications
Apr 11, 2026 TelBench: A Benchmark for Evaluating Telco-Specific Large Language Models
Apr 11, 2026 LLM 엔지니어가 알아야 할 GPU 아키텍처: Ampere → Hopper → Blackwell
Apr 11, 2026 FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling
Apr 09, 2026 FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision
Apr 01, 2026 Triton 07: Flash Attention 3 — Triton으로 어디까지 가능한가
Apr 01, 2026 Triton 06: Flash Attention 2 — FA1 대비 5가지 최적화
Apr 01, 2026 Triton 05: Flash Attention — 종합 프로젝트
Apr 01, 2026 Triton 04: Matrix Multiplication — 2D 타일링과 Autotune
Apr 01, 2026 Triton 03: RMSNorm — LLM에서 쓰이는 실전 커널
Apr 01, 2026 Triton 02: Fused Softmax — 커널 퓨전과 Reduction
Apr 01, 2026 Triton 01: Vector Addition — Triton 커널 기초
Apr 01, 2026 Triton 00: GPU 기초 — Triton을 시작하기 전에 알아야 할 것들