Apple Neural Engine をリバースエンジニアリングしてMicrogptを訓練
Original: Reverse engineered Apple Neural Engine(ANE) to train Microgpt View original →
なぜApple Neural Engineなのか?
AppleのM4チップのNeural Engine(ANE)は38 TFLOPSの推定INT8演算能力を持つ(実際はFP16プロセッサなので約半分)。しかしAppleはANEへの直接アクセスのための公開APIを提供していない。CoreMLが公式の推奨方法だが、これはANEを直接活用するというよりは抽象化したものだ。
Mac Mini M4を購入し、そのNPUのコンピューティングパワーを直接活用したいと思った開発者は、Claudeを使ってANEの非公開APIをリバースエンジニアリングすることにした。このプロジェクトはr/LocalLLaMAで457ポイントを獲得した。
リバースエンジニアリングのプロセス
Claudeをエンジニアリングパートナーとして使い、開発者はAppleの非公開ANE APIを分析し、CoreMLを迂回してハードウェアに直接アクセスする方法を見つけた。そしてカスタムの訓練パイプラインを構築し、110Mパラメータ版Microgptモデルを完全にANE上で訓練することに成功した。
結果と限界
- 成功:単一M4 ANE上で110M Microgptモデルの訓練完了
- 限界:単一チップでは大きなモデルの訓練には実用的でない
- 将来の可能性:ANE搭載Apple Siliconデバイスのクラスターでより大きなモデルの訓練が理論上可能。単一デバイスでも3B/7BモデルのLoRAファインチューニングは可能
NPU訓練の意義
NPUは行列演算においてGPUよりも電力効率が圧倒的に優れている。このプロジェクトは、高価なNVIDIAハードウェアなしにMacBookやMac MiniのNPUを使ってモデルを訓練するという民主化への道を示す。また、システムレベルの作業においてClaudeがリバースエンジニアリングアシスタントとして有用であることも示した。
Related Articles
GoogleはGeminiを単一の旗艦モデル競争ではなく、運用コスト別のagent基盤へ寄せている。3.6 Flashは3.5 Flash比で出力tokenを17%削減し、Flash-Liteは毎秒350出力tokenを掲げた。
HNで588点を集めた議論は、Bunの高速化よりもAnthropic傘下での運営と公開性に向かった。
alignment評価は、モデルが正しく振る舞った理由まで見る段階に入った。OpenAIとApollo Researchは、安全学習前のo3 RLチェックポイントで、学習後半ほど採点者の好みに従う差が大きくなったと報告した。