モデルがあなたの端末で動くのは、ほかのものと一緒にファイルが余裕をもってメモリに収まるときです。実際には、4ビットのモデルなら約0.5 GBが3 GBのスマホ、約1.3 GBが6 GBのスマホ、約2.7 GBが8 GBで余裕をもって収まります。大きいほど推論は得意になり、それ以外、つまり速度、バッテリー、発熱は悪くなります。実際に使う気になるだけの速さで答えるもののうち、いちばん大きいものを選んでください。
3つの数字
パラメータ数(0.8B、2B、4B)は、モデルが学習した重みの大きさです。パラメータが多いほど、たいていは推論が得意になり、世界についての知識が広がり、英語以外の言語もうまく扱えるようになります。回答の質をいちばんよく予測する数字です。
量子化(Q4_K_M、Q8など)は、重み1つを何ビットで保存するかです。フル精度は16ビット、Q4はおよそ4ビットです。4ビットまで落とすとファイルは約4分の1になり、品質の低下はチャットではわずか、数学とコードでははっきり出ます。スマホで動かすものはほぼすべてQ4で、それが正しい既定値です。
バイト単位のファイルサイズは、そもそも動くかどうかを決める数字です。動作中はファイル全体をメモリに載せておく必要があるからです。ファイルサイズに会話のコンテキスト分の余裕を足し、端末の総メモリではなく、空きメモリと比べてください。
期待できる速度
推定より実測です。ベンチマーク表からではなく、私たち自身のハードウェアで計測した数字を挙げます。
| モデル | サイズ | 2018年のAndroidフラッグシップ | iPhone 13 Pro | デスクトップブラウザ |
|---|---|---|---|---|
| Instant、0.8B | 0.53 GB | 12-15 tok/s | ~36 tok/s | 33 tok/s |
| Fast、2B | 1.28 GB | 5-6 tok/s | 未計測 | 未計測 |
| Sharp、4B | 2.74 GB | 1 tok/s未満 | 未計測 | 未計測 |
| Sharp (Phi)、3.8B | 2.49 GB | 2-3 tok/s | 未計測 | 未計測 |
毎秒およそ10トークンを超えると、読むのに心地よい速さになります。5を下回ると、一語ごとに待たされる感じがします。上の表でいちばん分かりやすいのは、2018年のスマホでの4Bモデルです。技術的にはインストールできて、インストールする価値はありません。だからInbornは、ダウンロードしたあとで気づかせるのではなく、カードの上で遅すぎると示します。
最初のトークンまでの時間も、スループットと同じくらい大事です。長い文書を小さいモデルに通すと、最初の一語が出るまで何秒もかかることがあります。モデルは何かを書き出す前に、全体を読まなければならないからです。
サイズごとに本当に得意なこと
0.8Bは短い回答、書き直し、要約のためのサイズで、すぐに動き出し、バッテリーもほとんど使いません。コード、数学、長い文書は苦手で、ごく一部の言語を除けば、2、3文を超えたあたりから怪しくなります。
2Bは日常のアシスタントです。文章作成、一般的な質問、主要言語への翻訳、文書についての質問。メモリ6 GBのスマホなら、これが正しい既定値です。
4Bは分析、コード、長い文書のためのものです。遅く、端末が熱くなり、スマホではそれを体感します。待つ時間より答えのほうが大事なときに、選ぶ価値があります。
サイズの先には学習があります。Phi-4-miniのように推論と数学に合わせて調整されたモデルは、同じサイズの汎用モデルより論理パズルに強く、翻訳では負けます。どのサイズにも唯一の最良モデルはなく、これから聞こうとしていることに対する最良のモデルがあるだけです。
実際の選び方
いちばん小さいモデルから始めて、1週間使い、どこで力不足になるかを見てください。言語や長い文書で足りなければ、1つ上のサイズへ。数学やコードで足りなければ、サイズではなくモデルの系統を変えてください。まったく困らなければ、数ギガバイトと熱いスマホを節約できたということです。
Inbornは、インストールする前に、あなたの端末での各モデルの想定速度の幅を示します。そして、いま答えたモデルより、まだ入れていないモデルのほうがうまく答えられるときは、そう伝えます。どんなベンチマーク表よりよい手引きです。意味のあるベンチマークは、手の中のハードウェアで動いているものだけだからです。
次の記事OllamaやLM StudioとInbornの比較 · AIがあなたの端末で動くべき理由 · AIアプリが何も送っていないことを証明する方法