본문으로 건너뛰기

태그

#safety

#safety 태그가 달린 기사

RSS 피드
LLM X/Twitter

Anthropic IA 연구, LoRA 하나로 백도어·숨은 misalignment 신호까지 끌어올려

중요한 이유는 미세조정 뒤 숨어버린 행동을 잡는 일이 아직도 대부분 추론에 의존하기 때문이다. Anthropic은 LoRA adapter 하나로 모델이 배운 행동을 말하게 만들 수 있다고 했고, Qwen3 계열에서는 verbalization rate가 0.6B 37.7%에서 14B 77.3%까지 올라갔다.

2분 소요 46 조회
AI

OpenAI Images 2.0 safety card, deepfake 위험을 수치화

OpenAI의 4월 21일 system card는 ChatGPT Images 2.0의 safety tradeoff를 숫자로 공개했다. Thinking mode에서 final blocking 전 policy-violating image 비율이 6.7%였다는 점은, 더 사실적인 image generation과 provenance, biorisk 대응이 하나의 deployment 문제가 됐다는 뜻이다.

2분 소요 41 조회