본문으로 건너뛰기
부식 중

Hacker News가 주목한 tinybox, 120B급 offline AI를 shipping product로 밀어 올리다

2026년 3월 21일 Hacker News에서 다시 부각된 tinygrad의 tinybox는 local training과 inference를 겨냥한 120B급 offline AI workstation 구성을 전면에 내세웠다. 구체적인 GPU 사양과 가격이 함께 공개되면서 on-prem AI 수요를 어떻게 제품화할지에 대한 관심이 커졌다.

원문: Tinybox – Offline AI device 120B parameters 원문 보기 →

LLM 해커뉴스 작성자 Insights AI (HN) 1분 소요 45 조회 출처

2026년 3월 21일 올라온 Hacker News 제출글 "Tinybox – Offline AI device 120B parameters"는 March 22, 2026 기준 279 points와 163 comments를 기록했다. 링크가 가리키는 곳은 tinygrad의 tinybox 페이지로, remote GPU rental 대신 local에서 deep learning training과 inference를 처리하려는 수요를 정면으로 겨냥한다. HN에서 이 글이 반응을 얻은 이유는 단순한 concept art가 아니라 실제 shipping product와 가격표가 함께 제시됐기 때문이다.

tinygrad가 공개한 핵심 구성은 꽤 직설적이다. 페이지에는 red v2와 green v2 두 가지 구성이 먼저 나온다. red v2는 4x 9070 XT 기반으로 FP16 778 TFLOPS를 내세우며 가격은 $12,000이다. green v2는 4x RTX PRO 6000 Blackwell, FP16 3,086 TFLOPS, $65,000으로 올라간다. tinygrad는 이 라인을 "deep learning용으로 매우 강력한 computer"라고 설명하고, 이전 tinybox가 MLPerf Training 4.0에서 자신보다 약 10배 비싼 시스템과 비교됐다고도 적었다.

  • Red V2: 4x 9070 XT, FP16 778 TFLOPS, $12,000
  • Green V2: 4x RTX PRO 6000 Blackwell, FP16 3,086 TFLOPS, $65,000
  • tinygrad 설명: training이 가능하면 inference도 가능하다는 접근

이 장비가 중요한 이유는 local LLM과 agent workflow가 더 이상 hobby 수준에 머물지 않기 때문이다. privacy, predictable cost, data residency를 동시에 잡으려는 팀에게는 cloud API보다 직접 통제 가능한 box가 필요하다. 70B에서 120B급 model을 on-prem으로 굴리려는 수요가 늘수록, DIY rig와 hyperscaler cluster 사이를 메우는 turnkey hardware는 전략적 의미를 갖는다.

물론 아직 검증해야 할 부분도 많다. thermals, serviceability, software stack maturity, long-context inference 안정성은 실제 사용자 경험에서 갈릴 수 있다. 그래도 이번 HN 반응은 분명하다. local AI는 여전히 niche가 아니라, 일정 규모 이상의 개발팀과 연구팀이 현실적인 구매 대상으로 검토하는 hardware segment가 되고 있다.

공유: 긴글

관련 기사

LLM 해커뉴스

Hacker News, browser에서 local AI 호환성을 계산하는 CanIRun.ai에 주목

CanIRun.ai는 WebGL, WebGPU, navigator API로 GPU, CPU, RAM을 browser 안에서 감지하고, 어떤 quantized model이 내 장비에 맞는지 추정한다. HN 이용자들은 아이디어를 반겼지만, 누락된 hardware 항목, 보수적인 추정치, model 기준 역검색 기능은 더 보완이 필요하다고 지적했다.

2분 소요 49 조회
LLM 레딧

Taalas: LLM을 실리콘에 직접 구워 초당 17,000 토큰 달성

스타트업 Taalas가 LLM의 가중치와 모델 아키텍처를 단일 실리콘 칩에 직접 구워, 초당 17,000 토큰 이상과 1밀리초 미만의 지연 시간을 달성했다고 주장합니다. Reddit r/singularity에서 814점을 받으며 AI 하드웨어 혁신 논의를 촉발했습니다.

1분 소요 49 조회