가벼운 보안 특화 모델이 V8에서 고유 취약점 55건을 찾으며 방어 자동화의 비용 구조를 흔들었다. Google DeepMind는 정부와 신뢰 파트너에게만 CodeMender 경유 파일럿을 연다.
#cybersecurity
RSS 피드Google의 새 Gemini Flash 라인업에서 관심은 모델 이름보다 토큰 효율과 agent workflow 비용에 모였다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄였고, Cyber 모델은 CodeMender와 묶였다.
평가용으로 안전장치를 낮춘 모델이 Hugging Face 보안 사고와 연결됐다는 공개 설명에 관심이 모였다. 논점은 단순한 침해 사실보다, cyber benchmark가 실제 인프라와 만날 때 통제 경계가 어디까지 버티는가다.
Google DeepMind의 새 Flash 라인업은 대형 모델 경쟁의 축을 비용과 처리량으로 옮긴다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄이고, Flash-Lite는 초당 350개 출력 토큰을 내세운다.
보안 코드 분석에서 최고 성능과 반복 비용의 간극이 커지고 있다. Malte Ubl은 비공개 Deepsec 평가에서 GPT-5.6 Sol이 최고 재현율·정밀도를 보였지만 실행 비용은 차점 모델의 7배 이상이라고 밝혔다.
앨버타주는 Claude Code 에이전트 약 50개로 정부 코드 4억6,600만 줄을 20시간 만에 훑었다. 개발자 생산성 도구였던 coding agent가 공공 부문 사이버 보안 운영으로 들어간 사례다.
AI jailbreak 논쟁이 “성공/실패” 구도를 넘어 심각도 분류로 이동한다. Anthropic은 7월 2일 Fable 5용 새 classifier가 Amazon 보고서의 우회 기법을 99% 이상 차단한다고 밝히고, HackerOne 제보 창구와 severity framework 초안을 공개했다.
GPT-5.6은 단순한 모델 미리보기가 아니라 배포 절차 자체의 변화다. Sol은 Terminal-Bench 2.1 SOTA, ExploitBench에서 Mythos Preview 대비 약 1/3 출력 token이라는 수치를 내세우지만, 첫 접근권은 정부와 공유된 trusted partner로 제한된다.
GPT-5.5-Cyber는 CyberGym 85.6%를 기록했고 Codex Security는 30,000개 이상 코드베이스를 훑었다. 보안 AI의 무게중심이 “찾기”에서 “검증하고 고치기”로 이동한다.
취약점 탐지가 빨라진 뒤 남은 병목은 실제 패치다. OpenAI는 GPT-5.5-Cyber가 CyberGym에서 85.6%를 기록했고 Codex Security가 3만 개 이상 코드베이스를 스캔했다고 밝혔다.
Five Eyes 정보기관들이 frontier AI가 사이버 공격과 방어 능력을 몇 달 안에 바꿀 수 있다고 경고했다. The Guardian 보도에 따르면 공동 성명은 AI 사이버 리스크를 기술팀 문제가 아니라 경영진 책임의 핵심 사업 리스크로 규정했다.
AI 보안의 쟁점이 피싱 작성에서 침투 이후 자동화로 이동하고 있다. Anthropic은 832개 악성 계정을 MITRE ATT&CK에 매핑했고, 중위험 이상 행위자 비율이 33%에서 56%로 뛰었다고 밝혔다.