— Blog
キーワードは「盆栽」。次にひっそりとくる「三値化」とは?~名前にaiがつくのがみそ~
この記事は、PrismML社の公式発表・技術文書と第三者の公開ベンチマークをもとに AI(Claude)で記事を生成し、人が内容を確認したうえで公開しています。数値は出典元の公表値です(弊社の実測ではありません)。
2026年9月17日、「27B(270億パラメータ)のAIモデルが5.9GB」というモデルが静かに公開されました。ふつうに動かせば54GB必要なものが、約9分の1。それでいて元のモデルの性能の98%を保っていると発表されています。名前は Bonsai(盆栽)。大きな木を小さく剪定して、形も生命も保つ──あの盆栽です。綴りをよく見ると bons-ai。名前にaiが入っているのが、みそです。
この記事の結論(3行)
- 三値化とは、AIの重みを「-1・0・+1」の3つの値だけで表す技術。メモリが約9分の1になり、しかも掛け算が要らなくなる。
- Bonsaiの新しさは「既存の強いモデルを盆栽のように剪定する」こと。ゼロから学習する従来方式(BitNet)と違い、元モデルが強くなればそのまま自分も強くなる。
- ローカルAIの技術を「土台/削る/作り変える」の三段階で見ると、三値化は第3段階。第3段階の技術が、第2段階の主力(4bit量子化)に肉薄する品質を初めて出したのが今回の出来事。
先にことわり:「三値」と「三段階」は別の話です
この記事には似た言葉が2つ出てきます。混ざらないよう先に整理しておきます。
- 三値(さんち) ─ AIの重みを「-1, 0, +1」の3つの値で表す技術用語。Bonsaiの中身の話
- 三段階 ─ ローカルAIの技術を整理するために本記事で使う分類。後半で出てきます
三値化とは何か
AIモデルの中身は、巨大な数の表(「重み」と呼びます)です。27Bモデルなら270億個の数が入っています。ふつうは1つの数を16bit、つまり65,536通りの細かさで持っています。
三値化は、これを「-1 か 0 か +1」の3通りだけにしてしまう技術です。3通りの情報量は log2(3) ≒ 1.58bit なので、「1.58bit LLM」とも呼ばれます。16bit → 1.58bit ですから、理論上はメモリが約10分の1で済みます。
もう一つ、地味に大きいのが掛け算が消えることです。重みが ±1 か 0 なら「掛ける」必要がなく、足すか・引くか・無視するかだけで済みます。AIの計算の大半は掛け算なので、GPUがなくてもCPUやスマホでそこそこ速く、しかも省電力で動きます。
盆栽(Bonsai)の何が新しいのか
三値のLLM自体は、2024年にMicrosoftの研究チームが「BitNet b1.58」として示しています。ただBitNetは最初から三値でモデルを学習する方式でした。学習コストが莫大なので、公開されたのは2Bクラスまで。研究としては正しいのですが、実用の主戦場(8B〜30B)には届いていませんでした。
Bonsaiを作ったのはPrismMLという米国のスタートアップ(Caltech=カリフォルニア工科大学の研究者が創業、CEOは同大のBabak Hassibi教授)。発想はBitNetの逆で、すでに強い既存モデル(AlibabaのQwen3系)を三値に「剪定」する方式です。だから最初から実用サイズで出せました。
- Microsoft「BitNet b1.58」論文。三値LLMの元祖(2Bまで)
- PrismMLがステルス解除。1-bit Bonsai 8B(Qwen3-8B由来、1.15GB)
- 三値版 Bonsai 8B / 4B / 1.7B(8Bで1.75GB)
- Bonsai 27B(Qwen3.6-27B由来)。三値 5.9GB、性能保持 94.7%
- Bonsai 2 27B(Qwen3.8-27B由来)。三値 5.9GB、性能保持 98.2%
半年で「8B → 27B」「保持率 95% → 98%」と伸びています。元モデルが強くなれば、そのままBonsaiも強くなるのがこの方式の強みです。大手が出したわけでも、新しい基盤モデルでもないのでニュースにはなりにくい。だから「ひっそり」なのです。
中身をもう少しだけ
重み1つを {-1, 0, +1} のコードにし、128個ごとに1つの倍率(16bitの小数)を共有します。「実際の重み = 倍率 × コード」という形です。実装上のビット数は三値で 1.71bit、1-bit版で 1.125bit(倍率のぶんが上乗せされます)。埋め込み層から出力層まで全層を低ビット化していて、PrismMLは「高精度の逃げ道なし」と表現しています。
ただし、どうやって品質を保ったまま変換しているか(学習方法・コスト)は非公開です。ここは後述の注意点にも関わります。
ローカルAI特化で見る:各技術の位置
「AIの最新技術」といっても、ローカルAI(自分のPCでAIを動かす人)にとって効く技術と、そうでもない技術があります。前回の記事で書いたとおり、ローカルAIの評価軸は突き詰めると「メモリに載るか」「速いか」「品質が落ちないか」の3つです。この軸で主要技術を並べてみます。
| 技術 | 代表例 | メモリ削減 | 速度 | 品質保持 | ローカルでの成熟度 |
|---|---|---|---|---|---|
| Transformer | すべての土台(2017〜) | ─ | ─ | ─ | 前提 |
| 8bit量子化 | GGUF Q8_0 | 約2倍 | ○ | ほぼ100% | ◎ |
| 4bit量子化 | GGUF Q4_K_M | 約3.5倍 | ○ | 97〜99% | ◎ デファクト |
| 2bit量子化 | IQ2_XXS | 約6倍 | ○ | 大きく劣化 | △ |
| 蒸留 | DeepSeek-R1-Distill | (別の小型モデルになる) | ◎ | 元とは別物 | ◎ |
| MoE | DeepSeek-V3、Qwen3-30B-A3B | 減らない(全部載せる) | ◎ | ─ | ○ |
| KVキャッシュ圧縮 | DeepSeek MLA、KV 4bit | 長文のときだけ | ○ | ほぼ100% | ○ |
| 三値化 | Bonsai(三値)、BitNet | 約9倍 | ◎ | 95〜98%(公式) | △ 2026年4月〜 |
| 1-bit化 | Bonsai(1-bit) | 約14倍 | ◎ | 約90%(公式) | △ |
見てほしいのは、「メモリ削減 約9倍」と「品質保持 95〜98%」が同じ行にあることです。これまでは、2bitまで削ると品質がガタ落ちするのが常識でした。それが1.58bitで4bit量子化に近い品質、というのがBonsaiの主張です。
DeepSeekの技術(MoE、MLA、蒸留)はどれも優秀ですが、ローカルAIの「載るか載らないか」には直接効きません。MoEは速いけれど全パラメータをメモリに置く必要がある。MLAは長文のときだけ効く。蒸留は小さい別モデルを作る話。三値化は「同じモデルをそのまま9分の1にする」ので、効き方が違います。
三段階で分類する(ここが「三段階」の話)
ローカルAIの視点で、技術を3つの段階に分けてみます。
第1段階:土台
Transformer、Attention、RoPE、GQA。全モデルが乗っている基盤で、ここではローカルの差はつきません。
第2段階:削る
できたモデルを後から軽くする。量子化(Q4/Q8)、蒸留、MoE、KVキャッシュ圧縮。今のローカルAIの常識はここで、llama.cpp+Q4_K_Mがデファクトのまま2023年からほぼ変わっていません。
第3段階:作り変える
数の表し方そのものを変える。1-bit/三値。掛け算が消え、計算の性質が変わります。専用カーネル(llama.cppのQ1_0、TQ系、MLX)が必要で、将来は専用ハードウェアの話にもつながります。
三値化は第3段階の技術です。そして今回の見どころは、第3段階の技術が「第2段階の主力(4bit量子化)に肉薄する品質」を初めて出したこと。2024年にBitNetが研究として示し、2026年にBonsaiが実用サイズ(27B)で持ってきました。段階が一つ上がる瞬間は、だいたいこういう「ひっそり」から始まります。
数字で見る:27Bが8GBのGPUに載る
前回の記事では「16GBのGPUでやっと20Bが丸ごと載る」という話をしました。三値のBonsai 27Bは5.9GBなので、8GBのGPUに27Bが丸ごと載ります。1-bit版(3.9GB)なら、メモリ6GB制限のiPhoneでも動くとPrismMLは公表しています(実際にiPhone 17 Proで11 tok/s)。
速度(公式公表値)
| モデル | デバイス | 三値版 | 1-bit版 |
|---|---|---|---|
| Bonsai 27B | GeForce RTX 5090 | 134 tok/s | 163 tok/s |
| Bonsai 27B | Mac(M5 Max) | 58 tok/s | 87 tok/s |
| Bonsai 27B | iPhone 17 Pro | ─ | 11 tok/s |
| Bonsai 2 27B | GeForce RTX 5090 | 最大 143 tok/s | ─ |
| Bonsai 8B | Mac(M4 Pro) | 82 tok/s | 131 tok/s |
| Bonsai 8B | iPhone 17 Pro Max | 27 tok/s | 44 tok/s |
人が読む速さの目安が15〜20 tok/sなので、8Bはスマホでも「待たされない」水準です。電力効率はFP16比で3〜5倍とされています。
品質(公式公表値)
Bonsai 27B(Qwen3.6-27B由来)のカテゴリ別スコアです。全体平均は元モデル85.0に対して三値80.5(94.7%)、1-bit 76.1(89.5%)。
落ち方が均一でないのがポイントです。数学は1-bitでも −3.6 で済むのに、ツール呼び出しは −14.0。文章を「それっぽく生成する」タスクは低ビットに強く、「正確な1つの答えを選ぶ」タスクは弱い、という傾向です。エージェント用途(ツールを呼ぶ、関数を選ぶ)なら三値版を選ぶべき、とPrismML自身も案内しています。
参考までに、最初に出た8Bの数字も置いておきます(三値 8B は 1.75GB、元のQwen3 8B は 16GB)。
| モデル | 平均 | MMLU Redux | GSM8K | HumanEval+ | IFEval | BFCLv3(ツール) |
|---|---|---|---|---|---|---|
| Qwen3 8B(16GB) | 79.3 | 83.0 | 93.0 | 82.3 | 81.5 | 81.0 |
| 三値 Bonsai 8B(1.75GB) | 75.5 | 72.6 | 91.0 | 77.4 | 81.8 | 73.9 |
| 1-bit Bonsai 8B(1.15GB) | 70.5 | 65.7 | 88.0 | 73.8 | 79.8 | 65.7 |
冷静に見ておく点
ここまでは公式の数字が中心です。使う側として、割り引いて見るべき点も並べておきます。
① 第三者の計測は公式より落ちる
NVIDIA Jetson Orin上でQwen3.5/3.6系と横並びにした独立ベンチマークでは、三値Bonsai 27Bは86.2%、1-bitは82.9%(4bit版Qwen3.6-27Bは94.2%)。公式の「95%保持」よりも落ち幅が大きめです。ただしメモリは6.7GB対15.7GBで、速度は逆に1.4倍でした。
② 落ちる分野が偏る。日本語は未検証
同じ第三者計測で、一般知識・コーディングは97〜100%維持だった一方、数学と多言語が弱く、ペルシャ語では79.8→45.2まで落ちた例があります。日本語での品質は公式・第三者とも未検証。日本語で使うなら、自分の業務データで試してから判断すべきです。
③ 1-bit版はツール呼び出しに弱い
図4のとおり、ツール呼び出しは80→66。「チャットや要約なら1-bit、エージェントや関数呼び出しなら三値」という使い分けが現時点の答えです。
④ 変換手法が非公開、27Bは要トークン
「どうやって98%を保ったか」はホワイトペーパー待ちで、再現性は今のところPrismML頼み。ライセンスはApache 2.0ですが、27BのモデルファイルはHugging Faceでゲート付き(ダウンロードにアカウントのトークンが必要)です。
動かすには
- llama.cpp: 1-bit形式(Q1_0)が本家に取り込み済み。CPU/Metal/CUDA/Vulkanで動く。三値は TQ系の形式
- MLX/MLX Swift: Mac、iPhone、iPad向け。PrismMLの公式配布はこちらが中心
- OpenAI互換サーバ/Open WebUI: 公式デモ(GitHub: PrismML-Eng/Bonsai-demo)にセットアップ手順あり
- OpenRouter: ローカルで動かす前に試すなら、クラウド経由でも提供されています(prism-ml/ternary-bonsai-2-27b)
まとめ:盆栽は「小さいのに本物」を狙っている
- 三値化 = 重みを -1/0/+1 の3値にして、メモリ約9分の1、掛け算なし
- 盆栽(Bonsai)= 既存の強いモデル(Qwen3系)を剪定して三値にする。BitNetの「ゼロから学習」と違い、元モデルの進化にそのまま乗れる
- ローカルAIの技術を三段階で見ると、量子化・蒸留・MoEは第2段階、三値化は第3段階
- 第3段階の技術が、第2段階の主力(4bit量子化)に肉薄する品質を初めて出した。それが2026年4月〜9月の半年で起きた
- ただし日本語・数学・ツール呼び出しは要確認。公式数値は少し盛り気味に見ておく
名前にaiが入っているモデルは、たいてい狙って付けられています。盆栽が「小さいのに本物」であるように、Bonsaiも「小さいのに本物」を狙っている。前回の記事で「VRAMが天井を決める」と書きましたが、天井を上げるのではなく、モデルのほうを縮めて天井をくぐる──次にひっそりくるのは、この方向だと思っています。
弊社では、業務データを外に出さないローカルAI環境の構築や、モデル選定のご相談を承っています。「三値モデルをうちの業務データで試してみたい」といったご相談も歓迎です。お気軽にお問い合わせください。
参考・出典
- PrismML「Introducing Ternary Bonsai: Top Intelligence at 1.58 Bits」(2026-04-16) https://prismml.com/news/ternary-bonsai
- PrismML「Bonsai 27B」(2026-07-14) https://prismml.com/news/bonsai-27b
- PrismML「PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet」(2026-09-17) https://prismml.com/news/prismml-launches-bonsai-2-27b
- PrismML Docs「Introduction – Bonsai」 https://docs.prismml.com/get-started/introduction
- Hugging Face「prism-ml/Bonsai-8B-mlx-1bit」モデルカード https://huggingface.co/prism-ml/Bonsai-8B-mlx-1bit
- GitHub「PrismML-Eng/Bonsai-demo」 https://github.com/PrismML-Eng/Bonsai-demo/
- The Register「PrismML debuts 1-bit LLM in bid to free AI from the cloud」(2026-04-04) https://www.theregister.com/2026/04/04/prismml_1bit_llm/
- MarkTechPost「PrismML Releases Bonsai 27B」(2026-07-14) https://www.marktechpost.com/2026/07/14/prismml-releases-bonsai-27b-1-bit-and-ternary-builds-of-qwen3-6-27b-that-run-on-laptops-and-phones/
- 第三者ベンチマーク: ArmanJR「PrismML-Bonsai-vs-Qwen3.5-Benchmark」(NVIDIA Jetson Orin) https://github.com/ArmanJR/PrismML-Bonsai-vs-Qwen3.5-Benchmark
- Ma, S. et al.「The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits」(2024) https://arxiv.org/abs/2402.17764
- Wikipedia「1.58-bit large language model」 https://en.wikipedia.org/wiki/1.58-bit_large_language_model
- 図1のQ8_0/Q4_K_Mの保持率、図3のQ8_0の容量は、GGUF量子化の一般的な経験則にもとづく目安であり、特定モデルの実測値ではありません。Q4_K_Mの容量15.7GBは上記第三者ベンチマークでの計測値です。