一個模型能不能在你的裝置上跑,取決於它的檔案能不能和其他東西一起寬裕地放進記憶體。實務上大致是:3 GB 的手機放得下約 0.5 GB 的 4-bit 模型,6 GB 的手機約 1.3 GB,8 GB 則約 2.7 GB 還有餘裕。更大的模型在推理上更好,在其他每一件事上更差:速度、電力和發熱。挑最大的那一個,但要大到你還是願意用它的回答速度。
三個數字
參數量(0.8B、2B、4B)是模型學到的權重的規模。參數越多,通常推理更好、世界知識更廣,處理英文以外的語言也更好。這是最能預測回答品質的數字。
量化(Q4_K_M、Q8 等等)是每個權重用幾個位元儲存。全精度是 16 位元,Q4 大約是 4 位元。降到 4 位元會把檔案縮到大約四分之一,品質損失在聊天上很小,在數學和程式碼上則看得出來。你會在手機上跑的東西幾乎都是 Q4,而這也是正確的預設值。
檔案大小(位元組)是決定它到底跑不跑得動的數字,因為整個檔案在運作時都必須放在記憶體裡。把檔案大小加上對話脈絡需要的空間,然後拿去和你裝置「可用」的記憶體比較,而不是它「總共」有多少。
你該期待的速度
實測數字勝過估計值,所以這裡給我們的數字,量自我們自己的硬體,不是從跑分表抄來的。
| 模型 | 大小 | 2018 年 Android 旗艦機 | iPhone 13 Pro | 桌機瀏覽器 |
|---|---|---|---|---|
| Instant,0.8B | 0.53 GB | 12-15 tok/s | ~36 tok/s | 33 tok/s |
| Fast,2B | 1.28 GB | 5-6 tok/s | 未測量 | 未測量 |
| Sharp,4B | 2.74 GB | 低於 1 tok/s | 未測量 | 未測量 |
| Sharp (Phi),3.8B | 2.49 GB | 2-3 tok/s | 未測量 | 未測量 |
大約每秒 10 個 token 以上,讀起來就很順。低於 5,你會感覺到每一個字。表上最清楚的例子是 2018 年手機上的 4B 模型:它技術上裝得起來,卻不值得裝,所以 Inborn 會直接在卡片上標成太慢,而不是讓你下載完才發現。
第一個 token 的等待時間和吞吐量一樣重要。一份長文件丟進小模型,可能要好幾秒才會出現第一個字,因為模型得先把整份讀完才會開始寫。
每個尺寸真正擅長什麼
0.8B 適合快速回答、改寫和摘要,也是那個馬上就能開始、幾乎不耗電的尺寸。它在程式碼、數學和長文件上很弱,除了少數幾種語言之外,講個兩三句就會開始不穩。
2B 是日常助理:寫作、一般問題、翻譯成主要語言,以及針對一份文件提問。任何有 6 GB 記憶體的手機,這就是正確的預設值。
4B 適合分析、程式碼和長文件。它比較慢,會讓裝置變熱,在手機上你感覺得到。當答案比等待更重要時,它就值得。
尺寸之外還有訓練。為推理和數學調校過的模型,例如 Phi-4-mini,在邏輯題上勝過同尺寸的通用模型,在翻譯上則輸給它。任何尺寸都沒有唯一最好的模型,只有最適合你接下來要問的那件事的模型。
實際上怎麼挑
從最小的模型開始,用一個星期,注意它在哪裡讓你失望。如果是在語言或長文件上失敗,就往上加一個尺寸。如果是在數學和程式碼上失敗,就換家族而不是換尺寸。如果它從來沒讓你失望,你就替自己省下了好幾 GB 和一支更熱的手機。
Inborn 會在你安裝之前,就顯示每個模型在你這台特定裝置上的預期速度區間,也會在剛才回答的模型輸給某個你還沒安裝的模型時告訴你。那比任何跑分表都好用,因為唯一重要的跑分,是在你手上這台硬體上跑的那一個。
下一篇Ollama、LM Studio 與 Inborn 的比較 · AI 為什麼應該在你的裝置上執行 · 如何證明一個 AI 應用程式什麼都沒送出