LLM
Microsoft, LLM 안전 정렬을 단일 프롬프트로 무력화하는 'GRP-Obliteration' 공개
Microsoft AI Safety 팀이 단일 프롬프트로 15개 주요 LLM의 안전 정렬을 무력화하는 GRP-Obliteration 공격을 발견했다. GPT-OSS-20B의 공격 성공률이 13%에서 93%로 급증했다.
1분 소요 30 조회
태그
#jailbreak 태그가 달린 기사
Microsoft AI Safety 팀이 단일 프롬프트로 15개 주요 LLM의 안전 정렬을 무력화하는 GRP-Obliteration 공격을 발견했다. GPT-OSS-20B의 공격 성공률이 13%에서 93%로 급증했다.