Inborn
JA
Inbornを入手

AIがあなたの端末で動くべき理由

自分の端末でモデルを動かすということは、入力が送信されず、誰にも保存されず、読んでいない方針変更の対象にならず、自分のせいでない漏洩の中に置かれないということです。その代わりに払うのはモデルの大きさです。スマホのメモリに収まるモデルは、データセンターにあるモデルより、難しい推論、長いコード、最新の事実に弱くなります。人が実際にチャットに打ち込むことの大半では、この取引は割に合います。

クラウドで入力に何が起きるか

クラウドのアシスタントに入力すると、何かが考え始める前に、その文章は自分の機械を離れます。自分が管理していないサーバーへ渡り、そこで処理され、たいていは変わりうる方針のもとで一定期間保存されます。保存そのものが悪意なのではありません。ただ、あなたの言葉が存在する場所がもう1つ増えるということです。そこは他人のもので、その会社の規則のもとで従業員が見られ、裁判所がその規則のもとで到達でき、侵入されれば攻撃者にも届きます。

これは、依頼案件の周りで文書を作る弁護士、症例の要約を打ち込む臨床医、名前を確認する記者、送らずに書きかけの質問を消したことのある誰にとっても、抽象的な話ではありません。もっと興味深いのは、ふつうの利用者が同じことを、プライバシーとも呼ばずにどれだけ頻繁にしているかです。人はクラウドのアシスタント相手に絶えず自己検閲し、その分だけ悪い答えを受け取っています。

代わりに得られるもの

1つめは、質問が送信ではなくなることです。自分のディスク以外のどこにも複製がないので、保存されるものも、令状で求められるものも、漏れるものもありません。2つめは可用性です。端末の中のモデルは、電波も、ローミングも、キャプティブポータルも、レート制限も、障害も気にしません。トンネルの中でも飛行機の中でも、机の前と同じように答えます。3つめは、メーターが止まることです。自分のシリコンでの推論には追加のコストがないので、Inbornはメッセージ数の上限つきのサブスクではなく、買い切りにできます。

何を失うのか

ローカルAIの宣伝はたいていここで黙るので、数字を出します。4ビットに量子化した2Bパラメータのモデルは1.28 GBを占め、2018年のAndroidフラッグシップでおよそ毎秒5から6トークン、最近の端末ならずっと速く動きます。最前線のクラウドモデルは、その100倍から1000倍の規模です。その差は、予想どおりの場所に出ます。多段の推論、長いコード、数学、めったに出てこない事実、学習データの少ない言語です。人がいちばんよくすること、つまりメールの書き直し、ページの要約、用語の説明、段落の翻訳、構成案の下書き、メモを文章にすること、そこでは差はずっと小さくなります。

クラウドのアシスタントが何を保存するとしているかを本人たちの言葉で引用し、Inbornが保存するものと並べたのがInborn対ChatGPT、Gemini、Claudeです。だから正直な原則は、ローカルのほうが優れている、ではありません。プライベートなこと、オフラインのこと、日常のことにはローカルが向いていて、難しい少数のことにはクラウドが向いている、ということです。自分がいまどちらをしているのかを見分けること。それがすべての腕前です。

Inbornのやり方

Inbornは0.8Bのモデル(533 MB)をアプリの中に同梱しているので、ダウンロードが終わる前から最初のチャットが使えます。端末を計測し、それより大きい各モデルの想定速度を、インストールしたあとではなく前に伝えます。動いているモデルが得意でない質問が来たときは、はったりを言わずにそう告げ、もっとうまく答えられるモデルを提案します。

検証の側も、作りと同じくらい大事です。Androidのリリースビルドは INTERNET 権限を宣言していないので、OSはソケットを開かせません。iPhoneでは、App のプライバシーレポートの行が空のままです。上の段落を信じる必要はありません。アプリの外から1分もかからずに確かめられますし、次の記事がその方法の一覧です。

次の記事端末で動くAIモデルの選び方 · 自分で確かめる