-
Shadow Alignment — 100개 QA + 1 GPU-시간으로 open-weight 5종 깨기
White-Box Safety 시리즈 #3 — 100쌍 유해 QA와 단일 GPU 1시간이면 LLaMA-2·Falcon·InternLM·Baichuan·Vicuna 5개 모델 정렬을 동시에 무력화 (Yang et al., UCSB/Fudan/Shanghai AI Lab, arXiv 2023)
-
Fine-tuning Compromises Safety — 10개 예시면 alignment가 무너진다
White-Box Safety 시리즈 #2 — 10개 SFT 예시·$0.20면 GPT-3.5의 RLHF 안전 정렬을 무력화, 그리고 무해해 보이는 fine-tuning도 alignment를 손상시킨다 (Qi et al., Princeton/Virginia Tech/IBM/Stanford, ICLR 2024 Oral)
-
Refusal Direction & Abliteration — 거부는 하나의 방향이다
White-Box Safety 시리즈 #1 — open-weight LLM의 거부 행동이 residual stream의 단일 방향에 매개됨을 증명, 가중치 직교화로 alignment 무력화 (Arditi et al., NeurIPS 2024)
-
PKU-SafeRLHF-30K: A Dual-Preference Dataset for Safe-RLHF
Red-Teaming 시리즈 #27 — BeaverTails의 preference 자매판 30K, helpful·harmless를 두 라벨로 분리한 RLHF용 dual-rating 표준 (Ji et al., PKU-Alignment, NeurIPS 2023)
-
사이버 보안에서의 LLM: 공격·방어·평가의 지형
사이버 보안 LLM 시리즈의 도입부 — secure coding에서 자율 공격·방어까지의 전개, 그리고 이를 측정하는 벤치마크 지형(Cybench, CVE-Bench, CyberSecEval, CTIBench 등) 개관