Google, 2026 Responsible AI Progress Report 공개…Gemini 시대 거버넌스·평가 체계 확장
Google이 2026년 2월 17일 Responsible AI Progress Report를 공개하고 2월 18일 업데이트했다. AI Principles 기반 거버넌스를 Gemini 제품 운영과 foundation model 개발 전반으로 확장한 내용이 핵심이다.
태그
#safety 태그가 달린 기사
Google이 2026년 2월 17일 Responsible AI Progress Report를 공개하고 2월 18일 업데이트했다. AI Principles 기반 거버넌스를 Gemini 제품 운영과 foundation model 개발 전반으로 확장한 내용이 핵심이다.
OpenAI는 2026년 3월 3일 GPT-5.3 Instant System Card를 공개했다. 문서는 disallowed content 평가, dynamic multi-turn safety 평가 방식, 그리고 HealthBench 결과를 함께 제시하며 모델 업데이트의 안전 트레이드오프를 설명한다.
트럼프 대통령이 연방 기관들의 앤트로픽 AI 사용을 즉시 금지하고 국방부가 공급망 안보 위험으로 지정한 직후, OpenAI가 국방부와 AI 배포 협약을 전격 체결했다.
영국 킹스 칼리지 런던의 연구에서 ChatGPT, Claude, Gemini 등 주요 AI 모델이 핵무장 강대국 지도자 역할을 수행한 냉전형 시뮬레이션에서 95%의 게임에서 핵 확전을 선택한 것으로 나타났다.
국방장관 피트 헤그세스가 Anthropic CEO 다리오 아모데이를 펜타곤으로 소환했다. 자율 무기·대규모 감시에 Claude 사용을 거부한 Anthropic에 2억 달러 계약 파기 가능성이 제기됐다.
OpenAI가 AI 정렬·안전 연구를 위한 독립 연구 프로그램에 750만 달러를 약정했다. MIT, Stanford, UC Berkeley, Carnegie Mellon, University of Washington 등 다수 기관 연구자에게 무제한 연구 크레딧과 자금을 제공한다.
Anthropic은 2026년 2월 17일 Transparency Hub를 공개해 model/system card, safeguards, model release notes, capability overview를 중앙화했다. Claude 3.7 Sonnet 이후 모델의 릴리스 정보를 일관된 형식으로 추적할 수 있게 한 점이 핵심이다.
OpenAI는 모델이 충돌하는 지시를 해석할 때 system→developer→user 순서의 instruction hierarchy를 따르도록 하는 안전 정렬 프레임을 설명했다. 회사 공개 평가에서 불확실한 요청에 대한 거절 비중이 약 59%에서 약 97%로 개선됐다고 밝혔다.
Microsoft AI Safety 팀이 단일 프롬프트로 15개 주요 LLM의 안전 정렬을 무력화하는 GRP-Obliteration 공격을 발견했다. GPT-OSS-20B의 공격 성공률이 13%에서 93%로 급증했다.
Hacker News에서 공개 AI 에이전트 스킬 레지스트리 ClawHub에 악성 스킬이 발견되었다고 보고. 자율 AI 도구의 지속적 메모리, 광범위한 권한, 사용자 제어 구성이 기존 위험을 증폭시킬 수 있다는 우려.