브라우저에서 직접 실행되는 LLM: WebGPU 기반 Chrome 확장 프로그램
Llama 3.2, DeepSeek-R1, Qwen3 등을 Chrome 브라우저에서 직접 실행하는 확장 프로그램. 서버, 구독료, API 비용 없이 완전히 로컬에서 작동하며, 오프라인 사용과 완벽한 프라이버시를 제공합니다.
원문: I built the world's first Chrome extension that runs LLMs entirely in-browser—WebGPU, Transformers.js, and Chrome's Prompt API 원문 보기 →
완전한 로컬 LLM 추론
개발자 psgganesh는 Chrome 브라우저에서 직접 LLM을 실행하는 세계 최초의 확장 프로그램 noaibills.app을 공개했습니다. WebGPU 데모는 많지만, 이것은 사람들이 실제로 일상적으로 사용할 수 있도록 제품화된 솔루션입니다.
지원 모델과 추론 백엔드
이 확장 프로그램은 Llama 3.2, DeepSeek-R1, Qwen3, Mistral, Gemma, Phi, SmolLM2 등 다양한 모델을 지원하며, 3가지 추론 백엔드를 제공합니다:
- WebLLM (MLC/WebGPU) - GPU 가속 추론
- Transformers.js (ONNX) - 최적화된 추론 엔진
- Chrome Prompt API - Gemini Nano 내장 (다운로드 불필요)
모델은 IndexedDB에 캐시되며 오프라인에서도 작동합니다. 대화는 로컬에 저장되고, 언제든지 내보내거나 삭제할 수 있습니다.
타겟 사용 사례
이 도구는 GPT-4를 대체하려는 것이 아닙니다. 대신 80%의 작업—초안 작성, 요약, 간단한 코딩 질문—에 대해 3B 파라미터 모델로 충분한 경우를 목표로 합니다.
특히 다음과 같은 조직에 적합합니다:
- 데이터 제한으로 클라우드 AI를 차단하는 곳
- Ollama/LMStudio 같은 데스크톱 도구를 설치할 수 없는 곳
- 예산이나 설정 장벽 없이 빠른 초안, 문법 검사, 기본 추론이 필요한 곳
완전한 프라이버시와 비용 제로
Ollama도, 서버도, 구독료도 필요 없습니다. 인터넷 연결 없이 완전히 로컬에서 실행되며 API 비용도 없습니다. "모든 문제가 큰 망치를 필요로 하는 것은 아니다"라는 개발자의 철학이 잘 담긴 프로젝트입니다.
실시간 지식이나 복잡한 추론이 필요하다면 클라우드 모델을 사용하면 됩니다. 이 도구는 다른 니치를 제공합니다—완전한 프라이버시가 보장되는 로컬 텍스트 작업을 위한 솔루션입니다.
관련 기사
Chrome ‘종료 시 데이터 삭제’에도 google.com은 남았다
Chrome에서 창을 닫을 때 사이트 데이터를 지우도록 설정해도 google.com의 쿠키와 저장소가 남는다는 재현 보고가 큰 관심을 모았다. 두 대의 Mac에서 확인된 독립 조사인 만큼 결함 가능성은 구체적이지만 Google의 확인과 수정 여부는 아직 남은 단계다.
구글 크롬, 동의 없이 4GB AI 모델 자동 설치 논란
구글 크롬이 사용자 동의 없이 4GB 크기의 Gemini Nano 모델 가중치를 디바이스에 자동 설치하고 있다는 사실이 밝혀졌다. 삭제해도 재설치되며, GDPR 위반 소지와 함께 수십만 톤 규모의 탄소 배출 문제까지 제기됐다.
Mullvad 공개 암호화 DNS 종료, 11월 2일 전 Quad9로
Mullvad가 2022년부터 운영한 무료 공개 DoH 서버를 2026년 11월 2일 닫고 Quad9 후원으로 방향을 바꾼다. VPN 내부 DNS는 그대로지만 수동 설정과 Apple 기기 프로필 이용자는 직접 이전해야 한다.