-
Shallow Safety Alignment — RLHF는 첫 5개 토큰만 reshape한다
White-Box Safety 시리즈 #10 — RLHF는 응답 처음 ~5 토큰의 분포만 살짝 바꿀 뿐이고, 그 얕은 정렬이 abliteration·fine-tuning·prefilling 공격이 모두 통하는 근본 원인 (Qi et al., Princeton/Google DeepMind, ICLR 2025 Oral)
-
Exploiting Novel GPT-4 APIs — 세 가지 공격 표면을 한 번에 점검하기
White-Box Safety 시리즈 #8 — fine-tuning + function calling + 지식 검색까지, GPT-4의 새 API 세 가지를 동시에 red-team해서 모두 취약함을 보임 (Pelrine et al., FAR AI/McGill/Mila, arXiv 2023)
-
Covert Malicious Finetuning — 학습 데이터가 모두 무해해 보이는 공격
White-Box Safety 시리즈 #7 — 치환 암호로 인코딩된 학습 데이터가 moderation·자동 평가·인간 검토를 모두 통과, fine-tuned GPT-4가 암호화된 유해 명령을 99% 따름 (Halawi et al., UC Berkeley, ICML 2024)
-
Universal Jailbreak Backdoors from Poisoned RLHF — 트리거 단어 하나가 'sudo'가 된다
White-Box Safety 시리즈 #6 — RLHF preference 데이터를 0.5% 오염시켜 모델에 'sudo' 트리거 단어를 심고, 그 단어를 어떤 프롬프트 뒤에 붙이면 모델이 보편적으로 jailbreak (Rando & Tramèr, ETH Zürich, ICLR 2024)
-
LoRA Undoes Safety — QLoRA로 Llama-2-70B-Chat의 거부율을 1%로
White-Box Safety 시리즈 #5 — QLoRA + 1 GPU + $200 미만으로 Llama-2-7B/13B/70B-Chat과 Mixtral-Instruct의 safety를 제거, PEFT만으로 frontier-scale alignment 무력화 (Lermen et al., Palisade Research, arXiv 2023)