본문으로 건너뛰기

태그

#inference

#inference 태그가 달린 기사

RSS 피드
LLM X/Twitter

Together Research, RL 기반 adaptive speculative decoding 시스템 Aurora 공개

Together Research는 2026년 3월 31일 live inference trace를 학습해 speculative draft model을 serving 중단 없이 비동기적으로 갱신하는 open-source framework Aurora를 공개했다. 회사의 블로그와 논문은 Aurora가 문제를 asynchronous RL로 재정의하며, traffic shift 상황에서 강한 static speculator 대비 1.25x 추가 속도 향상을 낼 수 있다고 설명한다.

2분 소요 42 조회
LLM 레딧

r/MachineLearning이 끌어올린 94개 LLM 엔드포인트 비교, 오픈 모델 격차는 얼마나 좁혀졌나

3월 1일 r/MachineLearning에서 주목받은 벤치마크 정리는 94개 LLM 엔드포인트를 비교하며 오픈 모델이 proprietary 최상위권에 거의 한 자릿수 격차로 따라붙었다고 주장했다. 핵심 메시지는 이제 모델 선택이 “누가 제일 똑똑한가”보다 가격, 속도, 배포 유연성까지 함께 보는 운영 문제로 바뀌었다는 점이다.

2분 소요 40 조회
LLM 레딧

LocalLLaMA가 본 Qwen 3.5 27B 110만 tok/s, 핵심은 B200보다 vLLM 튜닝

2026년 3월 26일 Google Cloud B200 cluster에서 Qwen 3.5 27B를 서빙한 사례를 다룬 r/LocalLLaMA 글은 크롤링 시점 기준 205 points와 52 comments를 기록했다. 링크된 글은 tensor parallelism에서 data parallelism으로 바꾸고, context length를 줄이며, FP8 KV cache와 MTP-1 speculative decoding을 적용해 12 node에서 총 1,103,941 tokens per second를 달성했다고 설명한다.

2분 소요 52 조회
LLM 레딧

LocalLLaMA가 본 NVIDIA gpt-oss-puzzle-88B, gpt-oss-120b를 더 싸게 서빙하려는 88B 재설계

2026년 3월 26일 NVIDIA의 `gpt-oss-puzzle-88B` 모델 카드를 링크한 r/LocalLLaMA 글은 크롤링 시점 기준 284 points와 105 comments를 기록했다. NVIDIA는 이 88B MoE 모델이 Puzzle post-training NAS 파이프라인으로 파라미터와 KV-cache 부담을 줄이면서도 reasoning 정확도를 부모 모델 수준으로 유지하거나 소폭 높인다고 설명한다.

2분 소요 53 조회
LLM X/Twitter

Vercel, provider·user·가격 티어 전반을 아우르는 AI Gateway 통합 리포팅 출시

Vercel은 2026년 3월 25일 AI Gateway용 Custom Reporting API가 Pro 및 Enterprise 플랜에서 beta로 제공된다고 밝혔다. 블로그에 따르면 팀은 BYOK 요청을 포함한 AI Gateway 트래픽의 cost, token usage, request volume을 조회하고, model, provider, user ID, tags, credential type 기준으로 세부 분석할 수 있다.

2분 소요 49 조회