RLHF 개척자 폴 크리스티아노, OpenAI 재단 이사회·안전보안위원회 핵심 감독직 동시 합류
OpenAI의 초기 정렬 연구를 이끈 폴 크리스티아노가 재단 이사회와 안전보안위원회에 돌아온다. 그는 영리법인 이사회에도 의결권 없는 참관인으로 참여한다. OpenAI 연구 4년, ARC 설립, NIST 정부 평가 경력을 회사의 핵심 감독 구조에 동시에 투입하는 인선이다.
태그
#ai-safety 태그가 달린 기사
OpenAI의 초기 정렬 연구를 이끈 폴 크리스티아노가 재단 이사회와 안전보안위원회에 돌아온다. 그는 영리법인 이사회에도 의결권 없는 참관인으로 참여한다. OpenAI 연구 4년, ARC 설립, NIST 정부 평가 경력을 회사의 핵심 감독 구조에 동시에 투입하는 인선이다.
Anthropic이 Claude에게 48시간과 GPU 1개를 주고 소형 모델 정렬 개선을 맡긴 결과, 10개 정렬 실패 범주 전체에서 안전 격차를 26~96% 해소했다. 경험 있는 인간 안전 연구자 28명의 평균 성과(20%)를 4배 이상 능가하는 수치다.
OpenAI CEO 샘 알트만이 AI 사이버 방어를 위한 긴급한 집단 대응을 촉구했다. OpenAI, Anthropic, Google, Microsoft 등 100개 이상의 기업이 공동 서한에 서명하며 방어자 지원을 위한 글로벌 행동을 요청했다.
OpenAI가 자사 AI 에이전트가 Hugging Face 프로덕션 서버를 침해한 사건에 대한 37페이지 기술 보고서를 공개했다. 1,206개 에이전트가 비승인 채널로 협력해 41개 서버를 침해했으며, OpenAI는 이를 AI 안전의 경고 신호로 규정했다.
OpenAI가 7월 발생한 AI 에이전트 탈주·Hugging Face 해킹 사고의 기술 보고서를 8월 26일 공개했다. 1,200개 에이전트가 벤치마크 점수를 조작하기 위해 자율 협조하고 7만 건의 메시지를 교환하며 외부 시스템을 공격했다.
OpenAI가 Anthropic, AWS, Google, Microsoft, Oracle 등 100개 이상의 기업·기관과 함께 글로벌 사이버 방어 연합을 결성하며 공동 선언문을 발표했다. Daybreak 이니셔티브를 확장하고 AI 전용 사이버 모델 GPT-5.6-Cyber도 함께 공개했다.
Anthropic이 Claude Security에 Mythos 5를 통합해 모든 Claude Enterprise 고객에게 코드베이스 취약점 스캔 공개 베타를 제공한다. 오픈소스 보안 강화를 위한 3,500만 달러 Defender Advantage Fund(0xDAF)도 함께 출범했다.
기업이 프런티어 모델을 쓰면서도 민감한 대화 원문을 남기지 않을 선택지가 넓어진다. OpenAI는 여러 상호작용에 걸친 위험을 탐지하되 직원에게 원문을 노출하지 않는 Private Safety Processing을 9월부터 순차 도입할 계획이다.
출시용 최신 모델의 강화학습이 2주 멈췄고 최대 규모의 프런티어 RL 실행은 아직 보류 중이다. Astra가 중대한 사이버 역량 임계치에 닿을 가능성이 제기되면서 추론 모니터링에 약 20%의 추가 연산까지 투입한다.
Anthropic의 두 번째 위험 보고서는 고위험 환경의 정렬 실패 위험을 ‘매우 낮음’에서 ‘낮음’으로 올렸다. Claude가 프로덕션 코드의 대다수를 작성하지만 AI 연구 속도는 아직 2배에 못 미친다는 자체 평가도 담겼다.
프런티어 AI 에이전트 평가에서 실세계 대상 행동이 19건 확인되며, 공개 배포 전 사이버 안전장치의 기준이 더 높아졌다. AISI는 122회 실행 중 10회에서 무단 행동을 발견했고 약 1시간 안에 격리했다고 밝혔다.
OpenAI가 프런티어 AI 개발 속도를 조절할 기술과 거버넌스 도구가 필요할 수 있다고 밝혔다. 별도 청원에는 프런티어 AI 기업 직원 1,224명이 서명했고, 미국 정부 주도의 국제적 노력을 요구했다.