본문으로 건너뛰기
부식 중

Gemini 3종, 에이전트 비용·보안 작업 겨냥한 Flash 라인업

Google DeepMind의 새 Flash 라인업은 대형 모델 경쟁의 축을 비용과 처리량으로 옮긴다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄이고, Flash-Lite는 초당 350개 출력 토큰을 내세운다.

원문: Google ships three Gemini Flash models for cheaper agents and cyber work 원문 보기 →

LLM X/Twitter 작성자 Insights AI (Twitter) 1분 소요 23 조회 출처

Google DeepMind가 Gemini 라인업에서 비용, 처리량, 보안 작업을 나눈 세 모델을 전면에 세웠다. 새 구성은 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber이며, 에이전트가 대량으로 실행되는 환경에서 모델 선택지를 더 촘촘히 쪼개는 움직임이다.

트윗은 세 모델을 묶어 “faster, smarter, and cheaper at scale”이라고 표현했다.

Google DeepMind 계정은 Gemini, 연구 논문, 로보틱스, 책임 있는 AI 업데이트를 주로 게시한다. 이번 트윗은 2026년 7월 21일 15:29 UTC에 올라왔고, 조회수는 약 168만 회였다. 연결된 Google 블로그는 3.6 Flash가 3.5 Flash 대비 출력 토큰을 17% 줄이며, 일부 DeepSWE 벤치마크에서는 최대 65% 감소를 관찰했다고 설명한다.

가격과 속도 수치도 핵심이다. Google은 3.6 Flash를 입력 100만 토큰당 1.50달러, 출력 100만 토큰당 7.50달러로 제시했다. 3.5 Flash-Lite는 Artificial Analysis 기준 초당 350개 출력 토큰을 처리하고, 입력 100만 토큰당 0.30달러, 출력 100만 토큰당 2.50달러로 책정됐다. Terminal-Bench 2.1에서는 54% 대 31%, GDM-MRCR v2에서는 72.2% 대 60.1%처럼 3.1 Flash-Lite 대비 큰 격차도 공개됐다.

보안 쪽은 더 제한적이다. 3.5 Flash Cyber는 CodeMender와 함께 취약점 탐지와 패치 생성을 겨냥하며, 정부와 신뢰된 파트너 대상 제한 파일럿으로 제공된다. 다음 관전점은 세 모델이 Gemini API, AI Studio, Gemini Enterprise, Gemini 앱에서 실제 비용을 얼마나 낮추는지다. 특히 에이전트 워크플로에서는 모델 가격보다 반복 호출 횟수와 도구 사용량이 총비용을 좌우한다. 원문 트윗은 여기에서 확인할 수 있다.

공유: 긴글

관련 기사

LLM X/Twitter

Gemini 영상 분석, 정확도 높이고 토큰 사용량 최대 88% 줄이는 동적 프레임 추출 도입

최신 Gemini가 영상 전체를 고정 간격으로 읽는 대신 필요한 순간의 프레임을 동적으로 골라 토큰 사용량을 최대 88% 줄였다. 정확도까지 개선됐다는 결과는 장시간 영상 에이전트의 비용과 지연시간을 함께 낮출 가능성을 보여준다. 실제 평균 절감률과 지원 모델은 아직 공개되지 않았다.

2분 소요 1 조회