위임 작업에서 LLM이 문서를 오염시킨다는 연구 경고
DELEGATE-52 연구에 따르면 Gemini 3.1 Pro, Claude 4.6 Opus, GPT 5.4 등 최첨단 LLM도 긴 위임 워크플로우에서 문서 내용의 평균 25%를 조용히 손상시킨다.
태그
#ai-safety 태그가 달린 기사
DELEGATE-52 연구에 따르면 Gemini 3.1 Pro, Claude 4.6 Opus, GPT 5.4 등 최첨단 LLM도 긴 위임 워크플로우에서 문서 내용의 평균 25%를 조용히 손상시킨다.
Anthropic이 독립 연구기관 The Anthropic Institute(TAI)의 연구 아젠다를 공개했다. 경제 파급, 위협과 복원력, 현장의 AI 시스템, AI 주도 R&D의 4대 분야를 통해 AI가 사회·경제·안보에 미치는 영향을 추적한다.
미국 NIST 산하 인공지능표준혁신센터(CAISI)가 5월 5일 Google DeepMind, Microsoft, xAI와 프런티어 AI 모델의 공개 전 국가안보 평가 협정을 체결했다. OpenAI와 Anthropic은 기존 협정을 재협상했다.
아이작 아시모프의 로봇 3원칙에 착안해, AI와 상호작용하는 인간이 지켜야 할 역설 3원칙이 제안됐다. 의인화 금지, 맹신 금지, 책임 포기 금지가 핵심이다.
영국 AI 안전 연구소(AISI)가 OpenAI GPT-5.5의 사이버 역량 평가 결과를 공개했다. GPT-5.5는 인간 전문가 12시간짜리 복잡한 기업 네트워크 침투 시뮬레이션을 단 11분, $1.73 비용으로 완료했다. Anthropic Claude Mythos에 이어 이 기준을 통과한 두 번째 모델로, AI 사이버 역량이 전반적 추세로 확산 중임을 보여준다.
선거 시즌 AI 안전은 선언보다 숫자가 더 중요해지고 있다. Anthropic는 2026년 4월 24일 Claude의 선거 관련 테스트 결과를 공개하며, 600개 프롬프트 평가에서 Opus 4.7과 Sonnet 4.6이 각각 100%와 99.8%로 대응했고, 영향력 공작 시뮬레이션에서도 90%와 94%의 적절한 응답 비율을 기록했다고 밝혔다.
r/artificial이 이 글을 밀어 올린 이유는 막연한 AGI 공포가 아니라 더 구체적인 위협 모델 때문이다. 온라인 커뮤니티 안으로 들어가 여론 합의처럼 보이는 장면을 만들어내는 AI persona swarm 이야기다.
새 arXiv preprint는 평가 결과의 consequences를 암시하는 한 줄만으로 LLM judge가 더 관대해졌다고 보고했다. 자동 safety·quality benchmark의 취약점이 드러났다.
LLM이 만든 데이터를 다시 학습시키는 관행에 새 위험 신호가 붙었다. Nature 논문은 owl preference나 misalignment 같은 trait가 의미상 무관한 숫자열을 통해서도 student model에 전이될 수 있다고 보고했다.
AI가 alignment 연구 자체를 돕는 실험이 수치로 검증됐다. Anthropic은 Claude Opus 4.6 기반 연구 에이전트가 weak-to-strong supervision 문제에서 성능 격차의 97%를 회복했다고 밝혔다.
r/singularity에서 확산된 AISI 평가는 Claude Mythos Preview가 expert CTF와 multi-stage cyber range에서 이전 frontier model보다 한 단계 앞선 성능을 보였다고 정리한다. 핵심은 “위험하다”는 수사가 아니라, 32-step corporate attack simulation을 end-to-end로 푼 첫 model이 나왔다는 점이다.
OpenAI는 2026년 3월 25일 Bugcrowd에서 공개 Safety Bug Bounty 프로그램을 시작했다. 기존 Security Bug Bounty를 보완하면서 AI abuse, agentic misuse, platform integrity 이슈를 별도 트랙으로 받겠다는 내용이다.