Apple Neural Engine 역설계로 Microgpt 훈련 성공
Original: Reverse engineered Apple Neural Engine(ANE) to train Microgpt View original →
왜 Apple Neural Engine인가?
Apple M4 칩의 Neural Engine(ANE)은 38 TFLOPS의 INT8 연산 능력(실제로는 FP16 프로세서이므로 절반인 약 19 TFLOPS)을 갖고 있다. 그러나 Apple은 ANE에 대한 공개 API를 제공하지 않는다. CoreML이 공식 권장 방법이지만, 이는 ANE를 직접 활용하기보다 우회하는 방식이다.
r/LocalLLaMA에서 457점을 기록한 이 프로젝트의 개발자는 Mac Mini M4를 구입하고 NPU의 컴퓨팅 파워를 직접 활용하고 싶었다. 그래서 Claude의 도움을 받아 ANE의 비공개 API를 역설계하기로 결정했다.
역설계 과정
개발자는 Claude를 활용해 ANE의 비공개 API를 분석하고, CoreML을 우회하여 ANE에 직접 접근하는 방법을 찾아냈다. 이후 맞춤형 훈련 파이프라인을 구축하여 110M 파라미터의 소형 Microgpt 모델을 훈련시키는 데 성공했다.
결과와 한계
- 성공: 단일 M4 ANE에서 110M Microgpt 모델 훈련 완료
- 한계: 단일 칩으로는 더 큰 모델 훈련에 실용적이지 않음
- 가능성: ANE 클러스터를 구성하면 더 큰 모델 훈련 이론적으로 가능. 단일 디바이스도 3B/7B 모델의 LoRA 훈련 가능
NPU 훈련의 장점
NPU는 GPU에 비해 전력 효율이 극히 높다. Apple Silicon의 ANE는 동일한 전력으로 GPU보다 훨씬 많은 행렬 곱셈을 처리할 수 있다. 이 프로젝트는 AI 훈련 환경을 민주화하는 잠재력을 보여준다 — 값비싼 NVIDIA GPU 없이도 MacBook이나 Mac Mini의 NPU로 모델을 훈련할 수 있는 미래를 향한 첫걸음이다.
Related Articles
모델 라우터가 왜 결제 회사에 중요한가. 931점을 받은 논의는 단순한 인수 소식보다 inference 사용량의 측정·청구·정산을 한 흐름으로 묶을 가능성을 파고들었다.
실제 스프레드시트·문서를 다루는 독립 평가에서 Gemini 3.7 Flash가 60.0%를 기록해 Claude Opus 5의 53.8%를 6.2%포인트 앞섰다. 빠른 Flash 계열이 최고급 모델보다 반복 정확도에서 우위를 보이면서, 분석 에이전트의 비용·속도·신뢰성 조합을 다시 따져볼 근거가 생겼다.
OpenAI가 8월 20일부터 GPT-5.6 등 프런티어 모델 API에 제로 데이터 보존 옵션을 제공한다. 세션 종료 후 사용자 입출력이 서버에 남지 않아, 의료·금융 등 규제 산업 기업 고객의 AI 채택 장벽을 낮추려는 조치다.