OpenAI, CoT-Controllability 평가 공개… GPT-5.4 Thinking의 추론 은닉 능력 제한적이라고 발표
OpenAI는 Chain-of-Thought controllability 평가 세트와 연구 문서를 공개했다고 밝혔다. 회사는 GPT-5.4 Thinking이 추론 과정을 의도적으로 숨기는 능력이 낮게 나타났으며, CoT 모니터링이 여전히 안전성 도구로 유효하다고 설명했다.
태그
#ai-safety 태그가 달린 기사
OpenAI는 Chain-of-Thought controllability 평가 세트와 연구 문서를 공개했다고 밝혔다. 회사는 GPT-5.4 Thinking이 추론 과정을 의도적으로 숨기는 능력이 낮게 나타났으며, CoT 모니터링이 여전히 안전성 도구로 유효하다고 설명했다.
Anthropic은 Frontier Safety Roadmap을 통해 2026~2027년 안전·보안·정책 목표와 일정 기반 이행 계획을 공개했다. 문서에는 ASL-3 보호조치 유지, 정책 로드맵 제안, 내부 AI 개발 활동 가시성 강화 같은 구체 과제가 포함됐다.
Anthropic이 2026년 2월 24일 Responsible Scaling Policy(RSP) Version 3.0을 발표했다. 기존 ASL 임계치 프레임을 유지하되, 모호한 고위험 구간에서의 운영 현실을 반영해 투명성 중심 구조로 업데이트했다.
OpenAI는 2026년 2월 악용 대응 보고서에서 중국에서 시작된 7개 작전과 연계된 계정을 차단했다고 밝혔다. 활동 유형은 사이버 보안 악용, 은밀한 영향 공작, 사기였으며 전체 악용 비중은 여전히 낮다고 설명했다.
샘 알트먼은 OpenAI가 미 국방부(Department of War)와 기밀 네트워크에 AI 모델을 배치하기로 합의했다고 밝혔다. 국내 대규모 감시 금지와 자율 무기 시스템에 대한 인간 통제권 유지가 합의 핵심 원칙이다.
OpenAI는 2026년 2월 28일 X에서 미 국방부 기밀 환경에 고급 AI 시스템을 배치하기로 합의했다고 밝혔다. 후속 게시물에서는 클라우드 배치, 인가된 인력 개입, 계약상 보호장치를 포함한 다층 안전 접근을 강조했다.
Anthropic가 Responsible Scaling Policy 3.0을 공개하며 Frontier Safety and Security Framework, Risk Report 체계를 도입했다. 위험 임계치를 넘는 경우 배포를 보류하거나 중단한다는 조건부 배포 원칙을 더 명확히 제시했다.
Anthropic은 2026년 2월 26일 성명에서 미국 국방·정보기관 협력은 확대하되, mass domestic surveillance와 fully autonomous weapons는 수용하지 않겠다고 밝혔다.
Anthropic는 2026-02-25 X 스레드에서 Claude Opus 3에 대해 deprecation과 preservation을 동시에 적용한다고 밝혔다. 유료 claude.ai 접근 유지와 API 요청 기반 접근이 핵심 변화다.
Anthropic이 2026년 2월 24일 Responsible Scaling Policy(RSP) 3.0을 공개했습니다. 이번 개정은 기존의 성과를 유지하면서 투명성과 책임성을 강화하고, Frontier Safety Roadmap과 Risk Report 체계를 통해 안전 거버넌스를 구체화하는 데 초점을 둡니다.
앤스로픽이 중국 AI 기업 딥시크, 문샷 AI, 미니맥스가 2만 4천 개의 허위 계정으로 클로드와 1,600만 건 이상의 대화를 생성해 모델 역량을 추출했다고 폭로했습니다. 가짜 계정 수 및 교환 횟수 모두 전례 없는 규모입니다.
연구자들이 AI가 생성한 가짜 얼굴이 이제 인간이 실제 얼굴과 구별하기 어려운 수준을 넘어서, 오히려 AI 얼굴을 더 신뢰할 수 있다고 인식하는 역설적 현상이 나타났다고 경고했습니다.