4개월 만에 네 번째 Flash — Gemini 3.8의 추론·코딩 도약
Google이 9월 2일 추론·코딩 최강 Flash 모델 Gemini 3.8을 공개했다. 3.7 Flash 출시 3주 만에 나온 후속작으로, Gemini 3.8 Flash와 사이버보안 특화 3.8 Flash Cyber 두 가지 변형이 제공된다.
태그
#reasoning 태그가 달린 기사
Google이 9월 2일 추론·코딩 최강 Flash 모델 Gemini 3.8을 공개했다. 3.7 Flash 출시 3주 만에 나온 후속작으로, Gemini 3.8 Flash와 사이버보안 특화 3.8 Flash Cyber 두 가지 변형이 제공된다.
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.
235개 댓글의 관심은 “모델이 맞힌 답”보다 “그 답에 붙은 reasoning trace가 실제 이유인지”에 모였다.
OpenAI의 차기 모델 계열 Astra가 수학·이론컴퓨터과학의 장기 미해결 문제 10개에서 새 결과를 냈다. OpenAI는 전체 해법 탐색의 토큰 비용을 Sol API 기준 약 $2,000로 제시했고, 각 결과를 Lean 증명서와 함께 공개했다.
Google Research는 Gemini-2.5와 Qwen3-32B 실험에서 reasoning이 단순 사실 질문의 회상을 돕는 두 메커니즘을 분리했다. 추가 토큰은 계산 시간을 주고, 관련 사실은 정답 회상을 prime하지만 hallucination이 끼면 정확도가 떨어졌다.
오픈 weights 모델 경쟁의 논점이 단순 점수에서 비용, reasoning token, 실제 agent 작업 효율로 옮겨갔다.
ARC Prize가 Opus 4.8을 ARC-AGI-3 새 SOTA로 기록하며 benchmark 경쟁의 기준을 다시 낮은 숫자로 보여줬다. 점수는 1.5%, 비용은 약 $10K로, 향상은 분명하지만 일반 지능과는 아직 거리가 있다.
Microsoft AI가 7개 자체 모델을 내놓으며 OpenAI 의존도를 낮추는 경로를 더 구체화했다. 핵심 수치는 MAI-Thinking-1의 35B active parameter, 256K context, AIME 2025 97%, SWE Bench Pro 53%다.
OpenAI의 범용 추론 모델이 에르되시의 평면 단위거리 문제 추측 상한을 반증하는 반례를 찾아냈다고 발표했습니다. 수학자들이 증명을 검토했지만 ML 커뮤니티는 방법론 투명성에 의문을 제기합니다.
LocalLLaMA는 이 질문을 샤워실 잡담으로 넘기지 않았다. 스레드는 왜 오늘의 LLM이 잠재 벡터에 reasoning을 숨기지 않고, 여전히 언어 형태로 드러내는지에 대한 진짜 논쟁으로 번졌다.
HN은 GPT-5.5 출시 소식을 축하보다 검산으로 받았다. 첫 반응은 얼마나 똑똑한가보다 가격, 컨텍스트 구간, 그리고 코딩 태도가 정말 나아졌는가였다.