KV 캐시 전체를 HBM에 두지 않는 OasisKV가 장문 LLM 서빙의 메모리 병목을 겨냥했다. 요청당 KV 요구량을 6.5~9.7배 줄이면서 다중 GPU 처리량을 최대 2.1배 높였다.
Nemotron 3.5 Lightning의 희소 활성화, GPT-5.6 Sol의 750 tok/s 경로, Qwen3.8의 로컬 추론 비용, Mobius의 지식·추론 분리, OasisKV의 메모리 절감을 통해 2026년 8월 LLM 효율 경쟁을 추적한다.
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.
최상위 모델의 지능을 유지하면서 응답 속도를 최대 14배 높인 점이 핵심이다. Cerebras 기반 GPT-5.6 Sol은 초당 최대 750개 출력 토큰을 생성하며, 우선 일부 API 고객에게 제공된다. 가격과 일반 공개 일정은 아직 나오지 않았고, 확대는 처리 용량에 맞춰 진행된다.