Ein Modell läuft auf deinem Gerät, wenn seine Datei bequem neben allem anderen in den Speicher passt, was in der Praxis heißt: ein 4-Bit-Modell von etwa 0.5 GB auf einem Telefon mit 3 GB, etwa 1.3 GB auf einem mit 6 GB und etwa 2.7 GB auf 8 GB mit Luft nach oben. Größer ist besser beim Denken und schlechter in allem anderen: Tempo, Akku und Hitze. Nimm das größte, das noch schnell genug antwortet, dass du es tatsächlich benutzt.
Die drei Zahlen
Parameter (0.8B, 2B, 4B) sind die Größe der gelernten Gewichte des Modells. Mehr Parameter bedeuten in der Regel besseres Denken, breiteres Weltwissen und besseren Umgang mit Sprachen außerhalb des Englischen. Diese Zahl sagt am meisten über die Antwortqualität.
Quantisierung (Q4_K_M, Q8 und so weiter) ist, mit wie vielen Bit jedes Gewicht gespeichert wird. Volle Präzision sind 16 Bit; Q4 sind etwa vier. Der Sprung auf vier Bit schrumpft die Datei auf ungefähr ein Viertel, mit einem Qualitätsverlust, der beim Chatten klein und bei Mathe und Code spürbar ist. Fast alles, was du auf einem Telefon ausführst, ist Q4, und das ist die richtige Voreinstellung.
Dateigröße in Bytes ist die Zahl, die entscheidet, ob es überhaupt läuft, denn die ganze Datei muss während der Arbeit im Speicher liegen. Nimm die Dateigröße, rechne Platz für den Gesprächskontext dazu und vergleiche das mit dem Speicher, den dein Gerät frei hat, nicht mit dem, den es insgesamt hat.
Das Tempo, mit dem du rechnen solltest
Gemessene Zahlen schlagen Schätzungen, hier sind also unsere, auf unserer eigenen Hardware erhoben statt aus einer Benchmark-Tabelle übernommen.
| Modell | Größe | Android-Flaggschiff, 2018 | iPhone 13 Pro | Desktop-Browser |
|---|---|---|---|---|
| Instant, 0.8B | 0.53 GB | 12-15 tok/s | ~36 tok/s | 33 tok/s |
| Fast, 2B | 1.28 GB | 5-6 tok/s | nicht gemessen | nicht gemessen |
| Sharp, 4B | 2.74 GB | unter 1 tok/s | nicht gemessen | nicht gemessen |
| Sharp (Phi), 3.8B | 2.49 GB | 2-3 tok/s | nicht gemessen | nicht gemessen |
Alles über etwa 10 Token pro Sekunde liest sich in angenehmem Tempo. Unter 5 spürst du jedes Wort. Das 4B-Modell auf einem Telefon von 2018 ist der klarste Fall in dieser Tabelle: Es lässt sich technisch installieren und es lohnt sich nicht, weshalb Inborn es auf der Karte als zu langsam kennzeichnet, statt dich das nach dem Download herausfinden zu lassen.
Die Zeit bis zum ersten Token zählt genauso viel wie der Durchsatz. Ein langes Dokument durch ein kleines Modell kann viele Sekunden brauchen, bevor das erste Wort erscheint, weil das Modell alles lesen muss, bevor es etwas schreibt.
Wofür jede Größe wirklich taugt
0.8B ist für schnelle Antworten, Umformulierungen und Zusammenfassungen, und es ist die Größe, die sofort startet und den Akku kaum berührt. Sie ist schwach bei Code, Mathe und langen Dokumenten, und außerhalb einer Handvoll Sprachen wird sie nach ein paar Sätzen wacklig.
2B ist der Assistent für den Alltag: schreiben, allgemeine Fragen, Übersetzung in die großen Sprachen und Fragen zu einem Dokument. Das ist die richtige Voreinstellung auf jedem Telefon mit 6 GB Speicher.
4B ist für Analyse, Code und lange Dokumente. Es ist langsamer, es wärmt das Gerät, und auf einem Telefon spürst du das. Es lohnt sich, wenn die Antwort mehr zählt als das Warten.
Jenseits der Größe steht das Training. Ein Modell, das auf Logik und Mathe getrimmt ist, etwa Phi-4-mini, schlägt ein allgemeines Modell derselben Größe bei einem Logikrätsel und verliert gegen es beim Übersetzen. Es gibt in keiner Größe ein einzelnes bestes Modell, nur ein bestes Modell für das, was du gleich fragst.
So wählst du in der Praxis
Fang mit dem kleinsten Modell an, nutz es eine Woche und achte darauf, wo es dich im Stich lässt. Versagt es bei Sprachen oder langen Dokumenten, geh eine Größe hoch. Versagt es bei Mathe und Code, wechsle die Familie statt der Größe. Versagt es nie, hast du dir mehrere Gigabyte und ein wärmeres Telefon gespart.
Inborn zeigt für jedes Modell die erwartete Geschwindigkeit auf genau deinem Gerät, bevor du es installierst, und sagt dir, wenn ein Modell, das du nicht installiert hast, die gerade gegebene Antwort besser hinbekommen hätte. Das ist ein besserer Wegweiser als jede Benchmark-Tabelle, denn der einzige Benchmark, der zählt, ist der auf der Hardware in deiner Hand.
WeiterOllama und LM Studio im Vergleich mit Inborn · Warum die KI auf deinem Gerät laufen sollte · So beweist du, dass eine KI-App nichts sendet