vLLM speculative decoding, AMD GPU서 최대 2.87배…길게 예측한다고 빠를까
초안 토큰을 많이 뽑는 것보다 실제 작업에서 얼마나 받아들여지는지가 속도를 갈랐다. vLLM이 AMD MI300X·MI355X에서 다섯 방식을 비교한 결과 최대 2.87배를 기록했지만, 모델·업무·제안 길이에 따라 기준선 아래로 내려간 조합도 있었다.
Insights
기사 1117개
초안 토큰을 많이 뽑는 것보다 실제 작업에서 얼마나 받아들여지는지가 속도를 갈랐다. vLLM이 AMD MI300X·MI355X에서 다섯 방식을 비교한 결과 최대 2.87배를 기록했지만, 모델·업무·제안 길이에 따라 기준선 아래로 내려간 조합도 있었다.
도발적인 제목보다 중요한 건 LLM 사용이 개인 습관을 넘어 집단적 의존으로 급전환할 수 있다는 수리 모델이다. 다만 실제 이용자를 추적한 실증 연구가 아니라 확산·회복·사회적 강화의 상호작용을 탐색한 이론 연구라는 경계도 분명하다.
틀릴 때 스스로 멈추는 에이전트를 설계할 실마리가 나왔다. 약 4,000개 문항과 4개 LLM을 분석한 연구에서 내부 확신은 다른 요인보다 약 10배 강하게 답변 거부를 예측했고, 활성값을 직접 바꾸자 거부 행동도 함께 움직였다.
실사용형 웹개발 평가에서 GPT-6 Astra Max가 1,797점으로 새 1위에 올랐다. Claude Fable 5.1 Max를 35점, 이전 OpenAI 최고 모델 GPT-5.6 Sol을 180점 앞서면서 100만 토큰당 40달러 가격대의 성능 기준을 한 단계 끌어올렸다.
긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.
Google이 9월 2일 추론·코딩 최강 Flash 모델 Gemini 3.8을 공개했다. 3.7 Flash 출시 3주 만에 나온 후속작으로, Gemini 3.8 Flash와 사이버보안 특화 3.8 Flash Cyber 두 가지 변형이 제공된다.
OpenAI가 9월 4일 GPT-6 Astra를 ChatGPT Pro, Enterprise, Business Premium 전 사용자와 API에 공개했다. 컴퓨터 사용·소프트웨어 엔지니어링 최고 성능을 주장하지만 추론 과정을 외부에서 관찰하기 어려운 '불투명 재귀' 방식을 도입해 안전성 우려도 제기됐다.
0.9B부터 375B까지 이어지는 6개 모델이 가중치뿐 아니라 코드, 훈련 데이터, 방법론까지 Apache 2.0으로 풀렸다. 가장 작은 모델은 시계급 기기를, 가장 큰 모델은 기업용 추론을 겨냥하며 토큰 블록 병렬 생성으로 약 3배 속도 향상을 내세운다.
GPT-6 Astra가 GitHub Copilot의 10개 개발 환경에 일반 제공되며 장시간 자율 코딩 경쟁이 실제 도구 단계로 들어섰다. Pro+·Max·Business·Enterprise 등 4개 요금제가 대상이고 기업 관리자는 모델 정책으로 접근을 통제하며 배포는 계정별로 점진 진행된다.
컴퓨터에서 사람이 하던 작업을 끝까지 수행하는 GPT-6 Astra가 제한 배포를 시작했다. ExploitBench 100%, SRE-Bench 4회 시도 기준 99.2%를 기록해 생산성 향상과 사이버 위험이 동시에 커졌으며 API 가격은 입력 100만 토큰당 10달러다.
생성된 SQL 전체를 다시 쓰지 않고 틀린 부분만 고치는 SafeQL이 BIRD의 실행 오류를 최대 87.4% 해결했다. 전체 재생성 대비 토큰은 최대 15.1배, 수정 시간은 최대 29.6배 줄어 기업용 AI 에이전트의 비용과 신뢰성을 함께 겨냥한다.
같은 개발 과제를 줘도 Claude Code·Codex·Cursor가 같은 외부 도구를 고른 비율은 42%뿐이었다. 1만6893회 실행 기록은 코딩 에이전트의 선택이 모델 이름뿐 아니라 검색 습관, 언어, 기존 저장소 구조에 크게 흔들린다는 사실을 보여준다.