본문으로 건너뛰기

Gemini 3.6 Flash의 진짜 변화, 더 싼 agent 실행 비용

Original: Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber View original →

Read in other languages: English日本語
LLM Jul 22, 2026 By Insights AI (HN) 1 min read Source

Google이 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber를 공개하며 Flash 라인업을 다시 정리했다. HN에서는 2026년 7월 21일 15:17:16 UTC에 올라온 항목이 700점대와 500개가 넘는 댓글을 기록했다. 관심은 새 이름보다 비용 구조에 가까웠다. agent workflow가 길어질수록 모델의 답변 품질만큼 출력 토큰, tool call, 반복 횟수가 곧 운영비가 되기 때문이다.

Google의 설명에 따르면 Gemini 3.6 Flash는 코딩, 지식 작업, multimodal 성능을 개선한 workhorse 모델이다. Artificial Analysis Index 기준으로 3.5 Flash보다 출력 토큰 사용량을 17% 줄였고, DeepSWE 같은 일부 benchmark에서는 최대 65% 절감도 관찰됐다고 한다. 가격도 3.5 Flash보다 낮아져, 입력 100만 토큰당 1.50달러, 출력 100만 토큰당 7.50달러로 제시됐다.

이 숫자는 단순한 가격표 이상의 의미가 있다. agent는 한 번 답하고 끝나는 chatbot보다 훨씬 많은 중간 추론, 파일 읽기, 코드 수정, 재시도를 만든다. 같은 문제를 풀 때 모델이 덜 장황하고 tool call을 덜 쓰면, latency와 비용이 동시에 내려간다. Google이 Flash를 "효율과 품질의 sweet spot"으로 설명하는 배경도 이 지점이다.

3.5 Flash-Lite는 속도와 비용 쪽을 맡는다. Google은 Artificial Analysis Index 기준 초당 350 output tokens를 언급했고, 이전 Flash-Lite 세대보다 agentic workflow 성능이 크게 좋아졌다고 설명했다. 반면 3.5 Flash Cyber는 단독 챗 모델이라기보다 CodeMender code security agent와 묶인 특화 모델이다. 보안 작업에서는 모델 자체보다 orchestration과 agent infrastructure가 성능을 좌우한다는 메시지다.

커뮤니티 논의는 Flash가 frontier 최고점 경쟁보다 실제 agent 비용 곡선을 얼마나 낮추는지에 초점을 맞췄다. 2026년 모델 경쟁은 더 큰 모델 하나를 고르는 문제가 아니라, 작업별로 적당한 지연 시간과 비용을 찾는 문제로 이동하고 있다.

Share: Long

Related Articles