Qwen 3.5 0.8B, WebGPU로 브라우저에서 로컬 실행 성공
Transformers.js와 WebGPU를 이용해 Qwen 3.5 0.8B 모델을 서버 없이 브라우저에서 완전히 실행하는 데모가 공개되어 r/LocalLLaMA에서 440점을 획득했습니다. 설치나 API 키 없이도 강력한 소형 LLM을 체험할 수 있습니다.
원문: Running Qwen 3.5 0.8B locally in the browser on WebGPU w/ Transformers.js 원문 보기 →
브라우저만으로 LLM을 돌리다
Qwen 3.5 0.8B 모델을 서버 인프라 없이 순수히 브라우저에서 실행하는 데모가 r/LocalLLaMA 커뮤니티에서 440점을 획득하며 큰 관심을 끌었습니다. 이 데모는 HuggingFace의 Transformers.js 라이브러리와 WebGPU API를 결합해 사용자의 GPU를 직접 활용합니다.
작동 방식
Transformers.js는 브라우저에서 Transformer 기반 모델을 실행할 수 있게 해주는 JavaScript 라이브러리입니다. WebGPU는 최신 브라우저에서 GPU에 직접 접근할 수 있는 Web API로, 2026년 현재 전 세계 브라우저 트래픽의 약 85~90%에서 지원됩니다(Chrome, Edge, Safari). 이 두 기술의 결합으로 소형 LLM을 클라이언트 측에서 완전히 실행하는 것이 가능해졌습니다.
HuggingFace의 transformers.js-examples 저장소에는 qwen3-webgpu 예제가 포함되어 있으며, 2026년 2월 출시된 Transformers.js v4는 ONNX Runtime 통합을 심화하여 지원 모델에서 3~10배의 속도 향상을 제공합니다.
브라우저 AI의 의미
이 기술의 의미는 단순한 데모를 넘어섭니다. 서버 없는 AI 배포는 프라이버시 보호(데이터가 기기를 떠나지 않음), 서버 비용 제로, 오프라인 작동 가능한 AI 애플리케이션 개발을 가능하게 합니다. Qwen 3.5 0.8B의 262K 컨텍스트와 멀티모달 기능은 이전 세대 0.8B 모델과는 비교할 수 없을 만큼 실용적인 브라우저 AI 경험을 제공합니다.
관련 기사
Qwen3.8-27B, 27B 로컬 모델의 성능보다 먼저 나온 질문 ‘왜 이렇게 오래 생각하나’
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.
Qwen 3.8 27B, 17GB에 담긴 실력보다 더 큰 문제는 ‘과한 생각’
17GB짜리 로컬 모델이 코딩과 비전 작업을 해내자 관심은 성능표보다 ‘얼마나 오래 생각하게 둘 것인가’에 모였다. Qwen 3.8 27B는 소비자 하드웨어에서 강한 결과를 내지만 기본 xhigh 추론 설정이 간단한 요청에도 수만 개 토큰을 쓰는 운영 문제를 드러낸다.
104GB Qwen을 48GB Mac에서 12 tok/s로, slotstream의 SSD 승부
메모리에 들어가지 않는 125B MoE 모델을 SSD에서 필요한 expert만 불러 48GB Mac에서 약 12 tok/s로 돌린 구현이 화제다. 실제 측정값과 저사양 추정치를 구분해 공개하면서 로컬 추론의 병목을 RAM 용량에서 저장장치 대역폭으로 옮겼다.