vLLM speculative decoding, AMD GPU서 최대 2.87배…길게 예측한다고 빠를까
초안 토큰을 많이 뽑는 것보다 실제 작업에서 얼마나 받아들여지는지가 속도를 갈랐다. vLLM이 AMD MI300X·MI355X에서 다섯 방식을 비교한 결과 최대 2.87배를 기록했지만, 모델·업무·제안 길이에 따라 기준선 아래로 내려간 조합도 있었다.
태그
#inference 태그가 달린 기사
초안 토큰을 많이 뽑는 것보다 실제 작업에서 얼마나 받아들여지는지가 속도를 갈랐다. vLLM이 AMD MI300X·MI355X에서 다섯 방식을 비교한 결과 최대 2.87배를 기록했지만, 모델·업무·제안 길이에 따라 기준선 아래로 내려간 조합도 있었다.
긴 문맥 전체를 매 토큰마다 훑지 말고 모델이 필요한 구간을 직접 선언하게 하자는 단순한 발상이 연구자들의 눈길을 끌었다. Declarative Attention은 기존 모델을 재학습하지 않고도 총 attention 대상 토큰을 최대 52.0% 줄였지만 정확도 손실과 실제 지연 시간 검증이 과제로 남는다.
AI 추론의 병목을 GPU 추가 구매가 아니라 칩 역할 분담으로 풀겠다는 Gimlet Labs가 3억달러를 조달했다. 회사는 같은 전력 조건에서 서로 다른 가속기를 조합해 5~10배 속도 향상을 냈다고 주장하며, 기업가치는 30억달러로 평가됐다.
메모리에 들어가지 않는 125B MoE 모델을 SSD에서 필요한 expert만 불러 48GB Mac에서 약 12 tok/s로 돌린 구현이 화제다. 실제 측정값과 저사양 추정치를 구분해 공개하면서 로컬 추론의 병목을 RAM 용량에서 저장장치 대역폭으로 옮겼다.
OpenAI CEO 샘 알트만이 X에 단 한 문장을 올렸다: 'we made a chip and it is fast.' 이 트윗은 48시간 만에 좋아요 4만8천 개, 조회수 840만 회를 기록했다. Jalapeño는 NVIDIA 대비 와트당 최대 1.9배 많은 AI 연산을 처리한다.
NVIDIA가 Vera Rubin 플랫폼 확장형 추론 가속기 Groq 3 LPX의 양산을 8월 24일 선언했다. Gemma 4 31B 모델 기준 초당 3,400 토큰으로 역대 최고 추론 속도를 기록하며 에이전트 AI 인프라의 새 기준을 제시한다.
OpenAI가 Broadcom과 공동 개발한 첫 자체 추론 칩 '할라페뇨'를 공개했다. Nvidia GB200·GB300 대비 처리량 최대 1.9배, 응답 지연 최대 3.6배 단축을 달성했으며 2026년 말 배포 예정이다.
OpenAI가 Broadcom과 공동 개발한 첫 번째 자체 추론 전용 칩 Jalapeño의 벤치마크 결과를 공개했다. InferenceX 테스트에서 NVIDIA GB200/GB300 대비 와트당 처리량이 1.5~1.9배, 지연 시간이 1.7~3.6배 개선됐으며, 대화형 워크로드에서는 최대 4.1배 빠른 속도를 기록했다.
Intel이 Hot Chips 2026에서 Crescent Island 추론 전용 가속기의 세부 사양을 공개했다. 최대 480GB LPDDR5X, 350W 공랭 방식으로 기존 데이터센터 랙에 별도 냉각 없이 탑재 가능하다.
모델 라우터가 왜 결제 회사에 중요한가. 931점을 받은 논의는 단순한 인수 소식보다 inference 사용량의 측정·청구·정산을 한 흐름으로 묶을 가능성을 파고들었다.
AI 추론 칩 스타트업 Etched가 $700M을 조달하며 기업가치를 한 달 만에 $10.3B에서 $21B로 끌어올렸다. 새 라운드를 이끈 Jane Street는 실제 하드웨어를 시험하고 첫 랙을 자사 데이터센터에 설치했다.
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.