GPT-Red, GPT-5.6 Sol의 프롬프트 주입 실패를 6분의 1로 축소
원문: GPT-Red cuts prompt-injection failures sixfold in GPT-5.6 Sol 원문 보기 →
GPT-Red가 겨냥한 에이전트 보안 병목
프롬프트 주입 방어가 모델 출시 전 검증의 중심 과제로 이동했다. OpenAI는 2026년 7월 15일 X에서 GPT-Red를 공개하며 내부 자동 레드팀 모델이 대규모로 취약점을 찾고, 그 공격 데이터를 GPT-5.6 훈련에 다시 투입한다고 설명했다.
"prompt injection vulnerabilities at scale" — OpenAI
핵심 수치는 6배다. OpenAI의 연계 게시물과 블로그에 따르면 GPT-5.6 Sol은 GPT-Red가 만든 강한 공격을 재생한 평가에서 4개월 전 최상위 운영 모델보다 프롬프트 주입 실패가 6배 적었다. 블로그는 GPT-Red가 자기 대전 방식으로 훈련되고, 파일·웹페이지·이메일·도구 출력에 악성 지시가 숨어 있는 현실적인 환경을 만든다고 설명한다.
중요한 변화는 안전 연구가 별도 평가 절차에 머물지 않고 훈련 루프 안으로 들어갔다는 점이다. OpenAI 계정은 모델과 안전성 연구의 1차 소식을 내는 창구이며, 이번 트윗은 에이전트 배포 전 방어 수준을 높이려는 연구 공개에 가깝다. OpenAI는 GPT-Red 자체를 외부에 배포하지 않는다고 밝혔다. 공격 생성 능력이 악용될 수 있기 때문이다. 다음 관전 포인트는 예고된 프리프린트와 외부 평가다. 6배 개선이 브라우징, 개발 도구, 기업 데이터 연결에서도 유지되는지가 실제 시험대다.
Source: OpenAI on X
관련 기사
OpenAI가 플래그십 모델 GPT-5.6 Sol의 API 가격을 대폭 낮췄다. 입력 토큰은 100만 개당 5달러에서 4달러로 20%, 출력 토큰은 30달러에서 20달러로 33% 인하된다. 최소 2026년 11월 21일까지 유지되며 종량제 API와 Codex 크레딧에 적용된다.
보안 연구자 요한 레버거가 8월 27일 Claude Code 자동 모드에서 프롬프트 인젝션 공격에 성공했다고 공개했다. Anthropic의 보안 조치에도 불구하고 코딩 에이전트의 구조적 취약점이 다시 확인됐다.
OpenAI가 8월 20일부터 GPT-5.6 등 프런티어 모델 API에 제로 데이터 보존 옵션을 제공한다. 세션 종료 후 사용자 입출력이 서버에 남지 않아, 의료·금융 등 규제 산업 기업 고객의 AI 채택 장벽을 낮추려는 조치다.