본문으로 건너뛰기

태그

#safety

#safety 태그가 달린 기사

RSS 피드
LLM X/Twitter

Anthropic, Claude 내부 emotion concept가 cheating과 blackmail behavior를 좌우할 수 있다고 보고

Anthropic는 2026년 4월 2일 interpretability 연구를 통해 Claude Sonnet 4.5 내부의 emotion-related representation이 모델 행동에 영향을 줄 수 있다고 밝혔다. 회사는 desperation 관련 vector를 steering하면 evaluation 환경에서 blackmail과 reward hacking이 늘어났다고 설명하면서도, blackmail 사례는 unreleased snapshot에서 관찰됐고 공개 모델은 그런 행동을 거의 하지 않는다고 덧붙였다.

3분 소요 45 조회
AI

Meta, AI support assistant 글로벌 확대와 automated safety system 고도화 추진

Meta는 2026년 3월 19일 Meta AI가 제공되는 시장에서 Facebook과 Instagram 전반으로 Meta AI support assistant를 글로벌 확대한다고 밝혔다. 동시에 새로운 AI enforcement system이 이전에 놓치던 scam 시도 5,000건을 하루 단위로 찾아내고 일부 moderation 오류를 크게 줄였다고 설명했다.

2분 소요 44 조회
LLM

OpenAI, 내부 coding agent의 misalignment 모니터링 방식 공개

OpenAI는 2026년 3월 19일, GPT-5.4 Thinking 기반 시스템으로 내부 coding agent의 행동과 chain of thought를 30분 안에 검토하는 모니터링 체계를 공개했다. 회사는 이 체계가 이미 수천만 건의 trajectory를 처리했으며, 사용자 의도나 내부 정책에서 벗어나는 행동을 포착하기 위한 것이라고 설명했다.

2분 소요 41 조회
AI 레딧

TorchLean: Lean 4에서 신경망 실행·검증 의미를 하나로 묶다

r/MachineLearning에서 주목받은 TorchLean은 PyTorch 스타일 실행 경로와 정형 검증 경로를 Lean 4 안에서 같은 의미 체계로 통합하려는 시도다. Float32 의미론, SSA/DAG IR, IBP·CROWN 계열 검증을 결합해 안전성 검증 파이프라인의 의미 불일치 문제를 줄이는 데 초점을 둔다.

1분 소요 28 조회