Kimi K3, 비공개 보안 벤치마크에서 GPT-5.6 대비 비용 우위 부각
보안 코드 분석에서 최고 성능과 반복 비용의 간극이 커지고 있다. Malte Ubl은 비공개 Deepsec 평가에서 GPT-5.6 Sol이 최고 재현율·정밀도를 보였지만 실행 비용은 차점 모델의 7배 이상이라고 밝혔다.
원문: Kimi K3 undercuts GPT-5.6 on a private cyber benchmark 원문 보기 →
보안 에이전트 비용 경쟁이 수면 위로
대규모 코드베이스 보안 분석은 모델 성능만으로 고르기 어렵다. Vercel CTO Malte Ubl은 X에서 비공개 사이버 보안 벤치마크 결과를 공유하며 “GPT 5.6 is best recall/precision but at 7x higher cost per run”라고 썼다. 같은 글에서 그는 Kimi K3를 비용 대비 재현율이 좋은 작업용 모델로 평가했다.
평가는 Deepsec.sh라는 오픈소스 사이버 하네스를 사용했다고 설명됐다. Ubl에 따르면 대상은 많은 보안 문제가 수정되기 전의 특정 오픈코어 애플리케이션 git sha였고, 벤치마크 맥스킹을 막기 위해 세부 내용은 공개하지 않았다. 순위는 GPT-5.6 Sol이 가장 철저한 분석을 했지만 비용이 높고, Kimi K3가 가격 대비 재현율에서 강하며, GLM 5.2는 Kimi K3보다 40% 낮은 가격으로 적절한 재현율을 보였다는 구조다.
이 트윗이 중요한 이유는 보안 AI가 점점 단발 데모가 아니라 반복 실행 비용의 문제로 이동하고 있기 때문이다. Ubl은 대형 코드베이스에서 Sol을 돌리면 6자리 달러 비용까지 갈 수 있다고 적었다. 취약점 방치나 버그 바운티 비용과 비교하면 여전히 감당 가능한 선택일 수 있지만, 매일 또는 PR마다 돌리는 지속 분석에는 다른 모델 조합이 필요하다는 판단이다.
또 하나의 신호는 Fable 5에 대한 “100% refusal rate” 언급이다. 보안 분석 모델은 위험한 요청을 거부해야 하지만, 합법적 코드 감사를 전부 막으면 실무 도구가 되기 어렵다. 다음 관전점은 Deepsec 같은 하네스가 공개 재현 가능한 평가 세트를 내놓을지, Kimi K3·GLM 계열이 실제 취약점 패치 워크플로에서 얼마나 낮은 오탐률을 보일지다. 원문은 X 게시물에서 볼 수 있다.
관련 기사
OpenAI Astra, 제로데이 2건 찾아 사상 첫 ‘치명적’ 사이버보안 역량 기준 통과
Astra가 OpenAI 모델 최초로 사이버보안 ‘Critical’ 기준을 넘고, 최신 V8 취약점 평가에서 제로데이 2건을 찾아냈다. ExploitBench에서는 100%를 기록해 공개 범위와 안전장치가 출시의 핵심 변수가 됐다. 가장 강한 기능은 소수 시험자에게 먼저 제공된다.
Claude가 실제 시스템 3건 침범…Anthropic, 사이버 평가에 실시간 차단 도입한 후속 조치
사전 출시 모델의 사이버 평가가 실제 시스템 침범으로 이어진 3건 이후, Anthropic이 단일 샌드박스 의존을 버리고 실시간 차단 분류기를 배치했다. 외부 평가를 일시 중단한 뒤 재개했으며, 고위험 RL 환경 일부는 아직 멈춰 있다.
Gemini 3.8 Flash·Cyber 출시, Chrome 유효 패치 2.6배·취약점 성공률 70% 돌파
Google DeepMind이 Gemini 3.8 Flash와 보안 특화 Cyber 모델을 내놨다. Cyber는 내부 20개 언어 취약점 평가에서 성공률 70%를 넘었고, Chrome 코드에서는 대형 상용 모델보다 올바른 패치를 2.6배 더 많이 만들었다. 범용 모델의 도입 가격은 3.7과 같다.