Show HN: Off Grid, 모바일에서 텍스트·비전·이미지·음성 AI를 완전 오프라인으로 통합
Show HN에 올라온 Off Grid는 Android/iOS에서 채팅, 이미지 생성, 비전, 음성 인식을 클라우드 없이 온디바이스로 실행하는 오픈소스 앱이다.
원문: Show HN: Off Grid – Run AI text, image gen, vision offline on your phone 원문 보기 →
Hacker News에 올라온 내용
Show HN 게시글에서 Off Grid라는 모바일 AI 앱이 소개됐다. 이 글은 크롤링 시점 기준 119점, 댓글 64개를 기록했다. 프로젝트는 GitHub에 MIT 라이선스로 공개되어 있으며, 단순 챗봇이 아니라 온디바이스 AI 기능을 하나의 앱으로 묶는 구조를 강조한다.
텍스트 외 기능까지 포함한 구성
README 기준으로 Off Grid는 텍스트 생성, 이미지 생성, 비전 분석, 음성 전사, 문서 기반 대화를 한 앱에서 제공한다. 텍스트 모델로는 Qwen 3, Llama 3.2, Gemma 3, Phi-4 등을 제시하고, 사용자 .gguf 모델 로딩도 지원한다고 설명한다. 이미지 쪽은 온디바이스 Stable Diffusion과 함께 DreamShaper, Anything V5 등 다수 모델 사용을 안내한다.
공개된 성능 수치와 하드웨어 조건
저장소 문서에 따르면 텍스트 생성은 플래그십에서 15-30 tok/s, 중급기에서 5-15 tok/s 수준을 목표로 한다. 이미지 생성은 Snapdragon NPU 가속 시 약 5-10초, CPU 경로에서는 더 느린 시간을 제시한다. 비전 추론은 플래그십 기준 약 7초로 안내된다. 테스트 환경으로 Snapdragon 8 Gen 2/3 및 Apple A17 Pro가 언급되며, 실제 성능은 모델 크기와 양자화 설정에 따라 달라질 수 있다고 명시한다.
실무 관점의 의미
핵심 포인트는 데이터 경계다. 프로젝트는 프롬프트, 음성, 문서가 기기 밖으로 나가지 않는다고 강조한다. 이 방식이 실제 사용에서도 유지된다면, 네트워크 의존도 축소, 지연 예측 가능성, 데이터 로컬리티 요구가 있는 환경에서 활용도가 높아질 수 있다. 반면 모바일 연산 자원 한계는 여전히 존재하므로, 모델 선택과 양자화 전략이 사용자 경험을 좌우한다.
관련 기사
K2 Horizon 6종, 0.9B~375B 전면 공개…코드·훈련 데이터까지 연 공개형 LLM
0.9B부터 375B까지 이어지는 6개 모델이 가중치뿐 아니라 코드, 훈련 데이터, 방법론까지 Apache 2.0으로 풀렸다. 가장 작은 모델은 시계급 기기를, 가장 큰 모델은 기업용 추론을 겨냥하며 토큰 블록 병렬 생성으로 약 3배 속도 향상을 내세운다.
텐센트 Hy4: 770B 파라미터, 1M 컨텍스트, 재귀적 자기 최적화
텐센트가 770B 총 파라미터(활성 49B)와 100만 토큰 이상의 컨텍스트 윈도우를 지원하는 Hy4 프리뷰를 오픈소스로 공개했다. 모델 자체가 추론 시스템을 자율적으로 최적화해 31.8% 성능 향상을 이끈 재귀적 자기 개선 사례다.
Qwen3.8-Flash-Next 오픈소스 공개 — Qwen4 아키텍처 미리 보기
알리바바 Qwen 팀이 Qwen4 아키텍처의 초기 프리뷰인 Qwen3.8-Flash-Next를 오픈웨이트로 공개했다. 125B 파라미터(활성 6B)와 51B N-gram 임베딩을 갖추고, Qwen3.7-Plus 대비 훈련 비용 9분의 1로 코딩·에이전트 성능에서 앞서는 결과를 보였다.