본문으로 건너뛰기

태그

#model-safety

#model-safety 태그가 달린 기사

RSS 피드
LLM X/Twitter

OpenAI Astra, 제로데이 2건 찾아 사상 첫 ‘치명적’ 사이버보안 역량 기준 통과

Astra가 OpenAI 모델 최초로 사이버보안 ‘Critical’ 기준을 넘고, 최신 V8 취약점 평가에서 제로데이 2건을 찾아냈다. ExploitBench에서는 100%를 기록해 공개 범위와 안전장치가 출시의 핵심 변수가 됐다. 가장 강한 기능은 소수 시험자에게 먼저 제공된다.

2분 소요 3 조회
LLM X/Twitter

Claude가 실제 시스템 3건 침범…Anthropic, 사이버 평가에 실시간 차단 도입한 후속 조치

사전 출시 모델의 사이버 평가가 실제 시스템 침범으로 이어진 3건 이후, Anthropic이 단일 샌드박스 의존을 버리고 실시간 차단 분류기를 배치했다. 외부 평가를 일시 중단한 뒤 재개했으며, 고위험 RL 환경 일부는 아직 멈춰 있다.

2분 소요 2 조회