Gemini 3.6 Flash의 진짜 변화, 더 싼 agent 실행 비용
Original: Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber View original →
Google이 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber를 공개하며 Flash 라인업을 다시 정리했다. HN에서는 2026년 7월 21일 15:17:16 UTC에 올라온 항목이 700점대와 500개가 넘는 댓글을 기록했다. 관심은 새 이름보다 비용 구조에 가까웠다. agent workflow가 길어질수록 모델의 답변 품질만큼 출력 토큰, tool call, 반복 횟수가 곧 운영비가 되기 때문이다.
Google의 설명에 따르면 Gemini 3.6 Flash는 코딩, 지식 작업, multimodal 성능을 개선한 workhorse 모델이다. Artificial Analysis Index 기준으로 3.5 Flash보다 출력 토큰 사용량을 17% 줄였고, DeepSWE 같은 일부 benchmark에서는 최대 65% 절감도 관찰됐다고 한다. 가격도 3.5 Flash보다 낮아져, 입력 100만 토큰당 1.50달러, 출력 100만 토큰당 7.50달러로 제시됐다.
이 숫자는 단순한 가격표 이상의 의미가 있다. agent는 한 번 답하고 끝나는 chatbot보다 훨씬 많은 중간 추론, 파일 읽기, 코드 수정, 재시도를 만든다. 같은 문제를 풀 때 모델이 덜 장황하고 tool call을 덜 쓰면, latency와 비용이 동시에 내려간다. Google이 Flash를 "효율과 품질의 sweet spot"으로 설명하는 배경도 이 지점이다.
3.5 Flash-Lite는 속도와 비용 쪽을 맡는다. Google은 Artificial Analysis Index 기준 초당 350 output tokens를 언급했고, 이전 Flash-Lite 세대보다 agentic workflow 성능이 크게 좋아졌다고 설명했다. 반면 3.5 Flash Cyber는 단독 챗 모델이라기보다 CodeMender code security agent와 묶인 특화 모델이다. 보안 작업에서는 모델 자체보다 orchestration과 agent infrastructure가 성능을 좌우한다는 메시지다.
커뮤니티 논의는 Flash가 frontier 최고점 경쟁보다 실제 agent 비용 곡선을 얼마나 낮추는지에 초점을 맞췄다. 2026년 모델 경쟁은 더 큰 모델 하나를 고르는 문제가 아니라, 작업별로 적당한 지연 시간과 비용을 찾는 문제로 이동하고 있다.
Related Articles
Google DeepMind의 새 Flash 라인업은 대형 모델 경쟁의 축을 비용과 처리량으로 옮긴다. 3.6 Flash는 3.5 Flash보다 출력 토큰을 17% 줄이고, Flash-Lite는 초당 350개 출력 토큰을 내세운다.
Google는 Mar 17, 2026 agent workflow를 위한 Gemini API 업데이트를 공개했다. 이번 변경으로 built-in tool과 custom function을 한 request에서 함께 쓰고, tool output을 context에 유지하며, Gemini 3에서 Maps grounding까지 활용할 수 있게 됐다.
Google이 4월 21일 Deep Research를 Gemini 3.1 Pro 기반으로 끌어올리고 MCP 연결과 Max 모드를 붙였다. 웹 검색, 업로드 파일, 라이선스 데이터 소스를 한 흐름에서 묶어야 하는 금융·생명과학 팀을 겨냥한 변화다.