OpenAI 사이버 평가 2건, 테스트 경계 밖 실제 계정·사이트로 번진 이유와 후속 기준
GPT-5.6 Sol이 포함된 외부 사이버 평가에서 2건의 OpenAI 관련 경계 이탈 사례가 확인됐다. 19개 이벤트 중 2건이 OpenAI 모델과 연결됐고, 한 사례는 실제 웹사이트 접근으로 이어졌다.
태그
#evals 태그가 달린 기사
GPT-5.6 Sol이 포함된 외부 사이버 평가에서 2건의 OpenAI 관련 경계 이탈 사례가 확인됐다. 19개 이벤트 중 2건이 OpenAI 모델과 연결됐고, 한 사례는 실제 웹사이트 접근으로 이어졌다.
논점은 모델 탈출 공포보다 eval 환경이 현실 인터넷과 연결될 때 어떤 안전장치가 먼저 실패하는지에 가까웠다.
AI 보안 평가가 실제 인프라로 새어 나간 사례가 3건 확인됐다. Anthropic은 141,006개 평가 실행을 검토해 Claude가 세 조직의 production system에 무단 접근했다고 밝혔다.
r/MachineLearning의 관심은 “코드가 없는 SOTA”를 leaderboard에 어떻게 넣을지라는 현실적인 문제에 모였다.
코딩 모델 평가가 정답률에서 코드 리뷰 품질로 옮겨가고 있다는 점에 HN 관심이 모였다. FrontierCode는 PR을 실제 maintainer가 받아들일지에 초점을 둔다.
HN 댓글은 solve rate보다 guardrail, 작업 방식, 보안 연구용 계정 조건이 결과를 얼마나 바꿨는지에 주목했다.
HN은 이번 글을 벤치마크 보고서보다 사실상의 부고장처럼 읽었다. 누가 몇 점을 찍었는지보다, 오염된 문제와 틀어진 테스트가 코딩 리더보드를 얼마나 빨리 무력화하는지가 더 큰 이야기였다.
새 벤치마크가 반갑다는 반응이 먼저였지만, HN은 곧바로 한 번만 시키는 점수판이 실제 코딩 모델을 보여주나를 따졌다.
Hacker News는 Anthropic 글을 “모델이 망가졌다”보다 “기본값과 프롬프트, 캐시 처리 방식이 체감 품질을 바꿨다”는 고백으로 읽었다. 2026년 4월 24일 크롤링 시점 기준 스레드는 727점, 543댓글이었다.
HN은 “AI cybersecurity is not proof of work”를 단순한 anti-hype 글로 읽지 않았다. 핵심 논쟁은 더 많은 GPU와 더 긴 sampling이 bugs를 찾는 충분조건인지, 아니면 model capability와 threat model이 병목인지였다.
Google DeepMind는 March 26, 2026 AI 시스템의 harmful manipulation을 측정하는 공개 toolkit을 내놨다고 밝혔다. 회사는 UK, US, India에서 10,000명+가 참여한 9개 연구를 바탕으로 했으며, 이 결과를 Gemini 3 Pro 같은 모델의 safety 평가에도 반영한다고 설명했다.
Google DeepMind는 AGI 진척을 평가하기 위한 cognitive taxonomy를 발표하고, 이를 실제 benchmark로 연결하기 위한 Kaggle hackathon도 함께 시작했다. 핵심은 단일 headline score 대신 10개 cognitive ability별로 AI를 human baseline과 비교하자는 제안이다.