Bonsai 27B が iPhone で動作――3.9GB に圧縮されたローカル推論モデル、開発者向けに新展開
PrismML が Qwen3.6-27B を1~2ビット量子化で圧縮し、iPhone で動作する Bonsai 27B をリリース。3.9GB のストレージで 90% の元モデル性能を維持しながら、プライバシーと低コスト推論を実現。Apple を含む複数企業がテスト中。
27 億パラメータを 3.9GB に圧縮――iPhone で推論が現実に
PrismML が開発した Bonsai 27B は、スマートフォンでも動作する本格的な AI モデルだ。その実現を支えるのは、1~2 ビットへの極度の量子化技術。従来なら「品質と効率は相反するトレードオフ」と見なされていた領域で、新しい解法をもたらしている。
Bonsai 27B は Alibaba の Qwen3.6-27B をベースとしながらも、独自の圧縮手法で以下のストレージ要件を実現している:
| 環境 | サイズ | 性能維持率 |
|---|---|---|
| iPhone 向け(小型版) | 3.9GB | 90% |
| MacBook 向け(高性能版) | 5.9~8.49GB | 95% |
iPhone 17 Pro Max での実測では、フル充電時に 約 67,000 トークン の生成が可能。秒間約 11 トークン生成の速度で、応答時間は許容範囲内だ。
クラウド依存からの解放――プライバシーと経済性が同時に手に入る
ローカル推論がもたらす最大のメリットは 2 つ。
**第一に、プライバシーの完全な保護。**スクリーンショット、ドキュメント、メールといった個人データがデバイス内に留まる。クラウドへの送信を前提とするサービスとは根本的に異なる。医療、法律、金融といった機密性が高い分野での活用において、この特性は決定的だ。
**第二に、API 呼び出しの削減による経済性。**トークンあたりのコスト(クラウド API 利用料)がゼロになれば、大量の推論を低コストで実行できる。企業システムで日に数百万トークン処理するアプリケーションでは、月々の API 費用を劇的に削減できる。
「簡単なタスクはデバイス上で、複雑な処理はクラウドで」――ハイブリッド構成の可能性
Bonsai 27B は単独で動作するだけでなく、ハイブリッド構成を可能にする。オンデバイスで処理できるタスク(テキスト分類、簡単な要約)はスマートフォンで、より複雑な処理(マルチモーダル推論、長文対話)はクラウド側の強力なモデルで実行する。こうした柔軟な分担により、応答速度とコスト、精度のバランスが取れた実装が実現する。
Apache 2.0 ライセンスで開発者に開放――実用化への足がかり
Bonsai 27B は Apache 2.0 ライセンス で提供され、オープンソースとして誰でも利用・改変できる。PrismML は既に Apple を含む複数の企業と協力してテストを進めており、実用化が現実的な段階に入っている。
数学やコーディングのベンチマークでは元モデルとの性能低下がほぼ無く、画像理解でのみ顕著な低下が見られるため、テキスト中心のアプリケーション、特に開発者向けツールでの活躍が期待される。
オンデバイス AI の実装は、これまで「実験段階」に留まっていた。Bonsai 27B のような圧縮技術の成熟により、その状況は確実に変わろうとしている。
アップデート:後継モデル「Bonsai 2 27B」が登場、圧縮率と精度がさらに向上
PrismML はベースモデルを Alibaba の Qwen 3.8 27B に切り替えた後継版「Bonsai 2 27B」を公開した。量子化手法も 1〜2 ビットから、重みを +1・−1・0 の3値に単純化する「三値重み(ternary weights)」方式に刷新し、圧縮率は 9〜10 倍に達する。
モデルサイズは 5.9GB まで縮小しながら、ベンチマークスコアでは元モデルの 98% の性能を維持する。初版(Bonsai 27B)の性能維持率が 90〜95% だったことと比較すると、精度面での改善が明確だ。
利用実績も明らかになった。初版は累計 1,100 万回以上、より小型のモデルは 260 万回以上ダウンロードされている。PrismML はシード資金として 2,225 万ドルを調達済みで、開発を継続している。
同社アドバイザーは、デバイス上で完結する推論について「無料で、クラウド送信がなく、プライベートになる」と説明する。API コスト削減とプライバシー保護という初版からの利点は、Bonsai 2 27B でも引き継がれた形だ。
アップデート:スマートグラス向けにも展開、Qualcomm Snapdragon 上で動作実証
PrismML は Qualcomm の Snapdragon Summit にて、スマートフォンに続く新たな展開先としてスマートグラスを発表した。1 ビットに量子化した新モデル「Bonsai LLM」を、Snapdragon AR1 Gen 1 プラットフォーム搭載のスマートグラス上で実行できることを実証した。
このスマートグラス版は 20 億パラメータと、iPhone 向けの Bonsai 27B・Bonsai 2 27B よりもさらに小型のモデルだ。元モデルに対して 4 倍の圧縮を適用しつつ、視覚・言語タスク向けに最適化されており、クラウドに依存せずデバイス単体で完結する点は従来のシリーズと同じ設計思想を踏襲している。なお、発表時点では PrismML のモデルを搭載した市販のスマートグラス製品はまだ発表されていない。
iPhone・MacBook に続きウェアラブル端末への展開が示されたことで、PrismML の圧縮技術がスマートフォン以外のエッジデバイスでも通用することが裏付けられた形だ。バッテリーと処理能力の制約がより厳しいスマートグラスでの動作実証は、オンデバイス AI の適用範囲がさらに広がっていることを示している。