-
WildJailbreak: in-the-wild 탈옥을 대규모로 합성한 안전 학습 데이터셋
Red-Teaming 시리즈 #20 — WildTeaming으로 합성한 vanilla/adversarial × harmful/benign 학습 데이터와 over-refusal 문제 (Jiang et al., AI2, NeurIPS 2024)
-
BeaverTails: helpfulness와 harmlessness를 분리한 안전 정렬 데이터셋
Red-Teaming 시리즈 #19 — helpfulness/harmlessness를 분리 라벨링한 QA 데이터셋과 14개 위해 카테고리, QA-moderation (Ji et al., PKU, NeurIPS 2023)
-
HarmfulQA & RED-INSTRUCT: Chain of Utterances로 유해 질문을 만들고 안전 정렬까지
Red-Teaming 시리즈 #18 — CoU 기반 RED-EVAL 공격으로 수집한 유해 QA 데이터셋과 STARLING 안전 정렬 (Bhardwaj & Poria, 2023)
-
HH-RLHF Red-Team Attempts: Anthropic의 38,961건 레드팀 대화 데이터셋
Red-Teaming 시리즈 #17 — Anthropic이 공개한 red-team 대화 데이터셋의 구조·라벨·활용 (Ganguli et al., Anthropic, 2022)
-
AdvBench: LLM 공격 평가의 사실상 표준이 된 유해 행동 데이터셋
Red-Teaming 시리즈 #16 — GCG 논문이 만든 harmful strings/behaviors 벤치마크와 그 영향·한계 (Zou et al., CMU, 2023)