在你自己的裝置上執行模型,代表你的提示永遠不會被傳送、不會被任何人保存、不會受制於一份你沒讀過的政策變更,也不會躺在一場不是你造成的外洩裡。你為此付出的代價是模型大小:塞得進手機記憶體的模型,在困難推理、長程式碼和當下事實上,比住在資料中心的模型弱。對大多數人真正打進聊天機器人的內容來說,這個取捨是划算的。
提示在雲端會發生什麼事
當你在雲端助理裡打字,文字在任何東西開始思考之前,就已經離開你的機器。它會傳到一台你無法掌控的伺服器,在那裡被處理,通常還會依一份隨時可能改變的政策保存一段時間。那樣的保存本身不見得有惡意。它只是多了一個存放你話語的地方,由別人擁有,他們的員工依他們的規則可以取用,法院依它的規則可以取用,攻擊者只要進得去也可以取用。
對一個圍繞客戶案件擬稿的律師、一個打病歷摘要的臨床人員、一個查證姓名的記者,或任何曾經把打到一半的問題刪掉而不是送出的人來說,這些一點都不抽象。更有意思的是,一般使用者多常在不把它叫做隱私的情況下做同樣的事。人們在雲端助理面前不斷自我審查,也因此得到更差的答案。
你換回什麼
第一件事是,問題不再是一次傳輸。除了你自己的硬碟,任何地方都沒有它的副本,所以沒有東西可以保存、可以傳票調取、可以外洩。第二是可用性:裝置上的模型不在乎訊號、漫遊、強制登入頁、速率限制或服務中斷,所以它在隧道裡和飛機上回答的樣子,和在你桌前完全一樣。第三是計費表停了。在你自己的晶片上推論沒有邊際成本,這也是為什麼 Inborn 可以是一次買斷,而不是一份帶著訊息額度的訂閱。
你付出什麼
大多數本機 AI 的行銷到這裡就安靜了,所以這裡給數字。一個量化到 4 位元的 2B 參數模型佔 1.28 GB,在 2018 年的 Android 旗艦機上大約每秒 5 到 6 個 token,在任何當代裝置上都快得多。前沿的雲端模型則大上兩到三個數量級。這個差距會出現在你預期的地方:多步推理、長程式碼、數學、冷門事實,以及訓練資料稀少的語言。而在人們最常做的事情上,它出現得少得多:改寫一封電子郵件、摘要一頁內容、解釋一個詞、翻譯一個段落、擬一份大綱,把筆記變成文章。
雲端助理用它們自己的話說它們保存了什麼,和 Inborn 保存的東西並排放在Inborn 與 ChatGPT、Gemini、Claude 的比較裡。所以老實的規則不是「本機比較好」。而是:任何私密的、任何離線的、任何例行的事,本機比較好;困難的那條長尾,雲端比較好。知道自己正在做哪一種,就是全部的功夫。
Inborn 怎麼做
Inborn 把一個 0.8B 的模型放進應用程式裡,533 MB,所以在任何下載完成之前,第一次對話就能用。它會側寫你的裝置,在你安裝之前而不是之後,告訴你每個更大的模型該期待的速度。當一個問題超出目前模型擅長的範圍,它會直說而不是硬掰,並提供那個會做得更好的模型。
驗證這一面和工程一樣重要。在 Android 上,正式版不宣告 INTERNET 權限,所以作業系統不會讓它開啟 socket。在 iPhone 上,App 隱私權報告那一列是空的。你不必相信上面這段話:你可以在一分鐘內從應用程式外面查證,而下一篇就是怎麼查的清單。
下一篇如何挑選裝置內 AI 模型 · 自己驗證