Gemini 3종, 에이전트 비용·보안 작업 겨냥한 Flash 라인업
Original: Google ships three Gemini Flash models for cheaper agents and cyber work View original →
Google DeepMind가 Gemini 라인업에서 비용, 처리량, 보안 작업을 나눈 세 모델을 전면에 세웠다. 새 구성은 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber이며, 에이전트가 대량으로 실행되는 환경에서 모델 선택지를 더 촘촘히 쪼개는 움직임이다.
트윗은 세 모델을 묶어 “faster, smarter, and cheaper at scale”이라고 표현했다.
Google DeepMind 계정은 Gemini, 연구 논문, 로보틱스, 책임 있는 AI 업데이트를 주로 게시한다. 이번 트윗은 2026년 7월 21일 15:29 UTC에 올라왔고, 조회수는 약 168만 회였다. 연결된 Google 블로그는 3.6 Flash가 3.5 Flash 대비 출력 토큰을 17% 줄이며, 일부 DeepSWE 벤치마크에서는 최대 65% 감소를 관찰했다고 설명한다.
가격과 속도 수치도 핵심이다. Google은 3.6 Flash를 입력 100만 토큰당 1.50달러, 출력 100만 토큰당 7.50달러로 제시했다. 3.5 Flash-Lite는 Artificial Analysis 기준 초당 350개 출력 토큰을 처리하고, 입력 100만 토큰당 0.30달러, 출력 100만 토큰당 2.50달러로 책정됐다. Terminal-Bench 2.1에서는 54% 대 31%, GDM-MRCR v2에서는 72.2% 대 60.1%처럼 3.1 Flash-Lite 대비 큰 격차도 공개됐다.
보안 쪽은 더 제한적이다. 3.5 Flash Cyber는 CodeMender와 함께 취약점 탐지와 패치 생성을 겨냥하며, 정부와 신뢰된 파트너 대상 제한 파일럿으로 제공된다. 다음 관전점은 세 모델이 Gemini API, AI Studio, Gemini Enterprise, Gemini 앱에서 실제 비용을 얼마나 낮추는지다. 특히 에이전트 워크플로에서는 모델 가격보다 반복 호출 횟수와 도구 사용량이 총비용을 좌우한다. 원문 트윗은 여기에서 확인할 수 있다.
Related Articles
에이전트 경쟁의 초점이 답변 생성에서 화면 조작으로 이동하고 있다. Google DeepMind는 Gemini 3.5 Flash에 브라우저, 모바일, 데스크톱 인터페이스를 다루는 기본 computer use 도구를 넣었다고 밝혔다.
보안 코드 분석에서 최고 성능과 반복 비용의 간극이 커지고 있다. Malte Ubl은 비공개 Deepsec 평가에서 GPT-5.6 Sol이 최고 재현율·정밀도를 보였지만 실행 비용은 차점 모델의 7배 이상이라고 밝혔다.
Google DeepMind는 X에서 Gemini Embedding 2를 Gemini API와 Vertex AI를 통해 preview로 제공한다고 밝혔다. 이 모델은 Gemini architecture 기반의 첫 fully multimodal embedding model로, text·image·video·audio·documents 검색 계층을 하나로 묶는 것을 목표로 한다.