본문으로 건너뛰기

NVIDIA Groq 3 LPX 양산 개시 — 에이전트 추론 속도 경쟁 플랫폼 대비 4배

AI 2026년 8월 30일 작성자 Insights AI 1 분 소요 4 조회 출처

NVIDIA가 8월 24일 핫칩스(Hot Chips) 2026에서 Groq 3 LPX 추론 가속기의 양산 개시를 공식 발표했다. Vera Rubin NVL72 플랫폼과 연동되는 전용 대화형 AI 추론 칩으로, 에이전트 AI의 핵심 병목인 토큰 생성 속도를 획기적으로 높이는 데 집중했다.

Artificial Analysis 벤치마크에서 Groq 3 LPX는 Gemma 4 31B 모델·10만 토큰 컨텍스트 기준 초당 3,400 토큰을 기록했다. 경쟁 플랫폼 대비 4배 빠른 수치로, 기존에 수 시간이 걸리던 에이전트 코딩 작업을 수십 분으로 단축할 수 있다.

풀 랙 스케일(256개 LP30) 기준 사양은 315 PFLOPS(FP8)·128GB SRAM·40 PB/s SRAM 대역폭·640 TB/s 스케일업 대역폭이다. Samsung이 제조하며 칩 한 개당 500MB의 온칩 SRAM을 탑재해 메모리 대역폭 병목을 근본적으로 해소했다.

첫 고객사는 AI 클라우드 Nebius Group으로 자사 Token Factory 프로덕션 추론 플랫폼에 도입할 예정이다. 공식 발표는 NVIDIA 뉴스룸에서 확인할 수 있다.

공유: 긴글

관련 기사