Das Modell auf deinem eigenen Gerät laufen zu lassen heißt: Deine Eingabe wird nie übertragen, von niemandem aufbewahrt, keiner Richtlinienänderung unterworfen, die du nicht gelesen hast, und liegt nie in einem Datenleck, das du nicht verursacht hast. Bezahlt wird das mit der Modellgröße: Ein Modell, das in den Speicher eines Telefons passt, ist bei hartem Denken, langem Code und aktuellen Fakten schwächer als eines, das in einem Rechenzentrum lebt. Für das meiste, was Menschen tatsächlich in einen Chatbot tippen, lohnt sich diese Abwägung.
Was in der Cloud mit einer Eingabe passiert
Wenn du in einen Cloud-Assistenten tippst, verlässt der Text deine Maschine, bevor irgendetwas darüber nachdenkt. Er reist zu einem Server, den du nicht kontrollierst, wird dort verarbeitet und meist für eine gewisse Zeit aufbewahrt, unter einer Richtlinie, die sich ändern kann. Diese Aufbewahrung ist für sich genommen nicht finster. Sie ist schlicht ein weiterer Ort, an dem deine Worte existieren, im Besitz von jemand anderem, erreichbar für dessen Personal nach dessen Regeln, erreichbar für ein Gericht nach dessen Regeln und erreichbar für einen Angreifer, wenn einer hineinkommt.
Für eine Anwältin, die rund um ein Mandat formuliert, einen Arzt, der eine Fallzusammenfassung tippt, eine Journalistin, die einen Namen prüft, oder jeden, der je eine halb getippte Frage gelöscht hat, statt sie abzuschicken, ist daran nichts abstrakt. Der interessantere Teil ist, wie oft ganz normale Nutzer dasselbe tun, ohne es Privatsphäre zu nennen. Menschen zensieren sich bei Cloud-Assistenten ständig selbst, und sie bekommen deshalb schlechtere Antworten.
Was du dafür bekommst
Das Erste ist, dass die Frage aufhört, eine Übertragung zu sein. Es gibt keine Kopie davon außer auf deiner eigenen Festplatte, also gibt es nichts aufzubewahren, nichts vorzuladen und nichts zu leaken. Das Zweite ist Verfügbarkeit: Ein Modell auf deinem Gerät kümmert sich nicht um Empfang, Roaming, ein Captive Portal, ein Ratenlimit oder eine Störung, es antwortet im Tunnel und im Flugzeug genauso wie an deinem Schreibtisch. Das Dritte ist, dass die Uhr aufhört zu laufen. Inferenz auf deinem eigenen Silizium hat keine Grenzkosten, und deshalb kann Inborn ein einmaliger Kauf sein statt ein Abo mit Nachrichtenkontingent.
Was es dich kostet
Hier wird das meiste Marketing für lokale KI still, also hier die Zahlen. Ein Modell mit 2B Parametern, auf vier Bit quantisiert, belegt 1.28 GB und läuft auf einem Android-Flaggschiff von 2018 mit etwa 5 bis 6 Token pro Sekunde, auf allem Aktuellen deutlich schneller. Ein Spitzenmodell in der Cloud ist zwei bis drei Größenordnungen größer. Dieser Abstand zeigt sich genau dort, wo man es erwartet: mehrstufiges Denken, langer Code, Mathematik, entlegene Fakten und Sprachen mit wenig Trainingsdaten. Deutlich weniger zeigt er sich bei dem, was Menschen am häufigsten tun: eine E-Mail umschreiben, eine Seite zusammenfassen, einen Begriff erklären, einen Absatz übersetzen, eine Gliederung entwerfen und Notizen in Prosa verwandeln.
Was die Cloud-Assistenten nach eigenen Worten speichern, steht neben dem, was Inborn speichert, in Inborn vs. ChatGPT, Gemini und Claude. Die ehrliche Regel lautet also nicht, dass lokal besser ist. Sie lautet, dass lokal besser ist für alles Private, alles Offline und alles Routinemäßige, während die Cloud besser ist für den schweren Rest. Zu wissen, was von beidem du gerade tust, ist die ganze Kunst.
Wie Inborn es macht
Inborn liefert ein 0.8B-Modell in der App mit, 533 MB, damit der erste Chat funktioniert, bevor irgendein Download fertig ist. Es vermisst dein Gerät und sagt dir vor der Installation statt danach, welches Tempo von jedem größeren Modell zu erwarten ist. Wenn eine Frage außerhalb dessen liegt, was das laufende Modell gut kann, sagt es das, statt zu bluffen, und bietet das Modell an, das es besser könnte.
Die Nachweisseite zählt genauso viel wie die Technik. Unter Android deklariert der Release-Build die INTERNET-Berechtigung nicht, das Betriebssystem lässt ihn also keinen Socket öffnen. Auf dem iPhone zeigt der App-Datenschutzbericht eine leere Zeile. Du musst den Absatz oben nicht glauben: Du kannst ihn in unter einer Minute von außerhalb der App prüfen, und der nächste Beitrag ist die Liste, wie.
WeiterSo wählst du ein KI-Modell für dein Gerät · Prüf es selbst