Inborn
ZH-HANT
取得 Inborn

如何挑選裝置內 AI 模型

一個模型能不能在你的裝置上跑,取決於它的檔案能不能和其他東西一起寬裕地放進記憶體。實務上大致是:3 GB 的手機放得下約 0.5 GB 的 4-bit 模型,6 GB 的手機約 1.3 GB,8 GB 則約 2.7 GB 還有餘裕。更大的模型在推理上更好,在其他每一件事上更差:速度、電力和發熱。挑最大的那一個,但要大到你還是願意用它的回答速度。

三個數字

參數量(0.8B、2B、4B)是模型學到的權重的規模。參數越多,通常推理更好、世界知識更廣,處理英文以外的語言也更好。這是最能預測回答品質的數字。

量化(Q4_K_M、Q8 等等)是每個權重用幾個位元儲存。全精度是 16 位元,Q4 大約是 4 位元。降到 4 位元會把檔案縮到大約四分之一,品質損失在聊天上很小,在數學和程式碼上則看得出來。你會在手機上跑的東西幾乎都是 Q4,而這也是正確的預設值。

檔案大小(位元組)是決定它到底跑不跑得動的數字,因為整個檔案在運作時都必須放在記憶體裡。把檔案大小加上對話脈絡需要的空間,然後拿去和你裝置「可用」的記憶體比較,而不是它「總共」有多少。

你該期待的速度

實測數字勝過估計值,所以這裡給我們的數字,量自我們自己的硬體,不是從跑分表抄來的。

依模型與裝置實測的生成速度
模型大小2018 年 Android 旗艦機iPhone 13 Pro桌機瀏覽器
Instant,0.8B0.53 GB12-15 tok/s~36 tok/s33 tok/s
Fast,2B1.28 GB5-6 tok/s未測量未測量
Sharp,4B2.74 GB低於 1 tok/s未測量未測量
Sharp (Phi),3.8B2.49 GB2-3 tok/s未測量未測量

大約每秒 10 個 token 以上,讀起來就很順。低於 5,你會感覺到每一個字。表上最清楚的例子是 2018 年手機上的 4B 模型:它技術上裝得起來,卻不值得裝,所以 Inborn 會直接在卡片上標成太慢,而不是讓你下載完才發現。

第一個 token 的等待時間和吞吐量一樣重要。一份長文件丟進小模型,可能要好幾秒才會出現第一個字,因為模型得先把整份讀完才會開始寫。

每個尺寸真正擅長什麼

0.8B 適合快速回答、改寫和摘要,也是那個馬上就能開始、幾乎不耗電的尺寸。它在程式碼、數學和長文件上很弱,除了少數幾種語言之外,講個兩三句就會開始不穩。

2B 是日常助理:寫作、一般問題、翻譯成主要語言,以及針對一份文件提問。任何有 6 GB 記憶體的手機,這就是正確的預設值。

4B 適合分析、程式碼和長文件。它比較慢,會讓裝置變熱,在手機上你感覺得到。當答案比等待更重要時,它就值得。

尺寸之外還有訓練。為推理和數學調校過的模型,例如 Phi-4-mini,在邏輯題上勝過同尺寸的通用模型,在翻譯上則輸給它。任何尺寸都沒有唯一最好的模型,只有最適合你接下來要問的那件事的模型。

實際上怎麼挑

從最小的模型開始,用一個星期,注意它在哪裡讓你失望。如果是在語言或長文件上失敗,就往上加一個尺寸。如果是在數學和程式碼上失敗,就換家族而不是換尺寸。如果它從來沒讓你失望,你就替自己省下了好幾 GB 和一支更熱的手機。

Inborn 會在你安裝之前,就顯示每個模型在你這台特定裝置上的預期速度區間,也會在剛才回答的模型輸給某個你還沒安裝的模型時告訴你。那比任何跑分表都好用,因為唯一重要的跑分,是在你手上這台硬體上跑的那一個。

下一篇Ollama、LM Studio 與 Inborn 的比較 · AI 為什麼應該在你的裝置上執行 · 如何證明一個 AI 應用程式什麼都沒送出