Un modèle tourne sur votre appareil si son fichier tient confortablement en mémoire à côté de tout le reste, ce qui veut dire en pratique un modèle en 4 bits d'environ 0.5 GB sur un téléphone de 3 GB, environ 1.3 GB sur un téléphone de 6 GB, et environ 2.7 GB sur 8 GB avec de la marge. Plus grand veut dire meilleur en raisonnement et moins bon sur tout le reste : vitesse, batterie et chaleur. Prenez le plus grand qui répond encore assez vite pour que vous l'utilisiez vraiment.
Les trois chiffres
Les paramètres (0.8B, 2B, 4B) sont la taille des poids appris par le modèle. Plus de paramètres veut généralement dire un meilleur raisonnement, une culture générale plus large et un meilleur traitement des langues autres que l'anglais. C'est le chiffre qui prédit le mieux la qualité des réponses.
La quantification (Q4_K_M, Q8, etc.) est le nombre de bits sur lequel chaque poids est stocké. La pleine précision fait 16 bits ; Q4 en fait environ quatre. Descendre à quatre bits réduit le fichier au quart environ, avec une perte de qualité faible pour le chat et perceptible pour les maths et le code. Presque tout ce que vous ferez tourner sur un téléphone est en Q4, et c'est le bon choix par défaut.
La taille du fichier en octets est le chiffre qui décide s'il tourne tout court, parce que le fichier entier doit être gardé en mémoire pendant qu'il travaille. Prenez la taille du fichier, ajoutez de la place pour le contexte de la conversation, et comparez avec la mémoire libre de votre appareil plutôt qu'avec sa mémoire totale.
La vitesse à laquelle vous attendre
Des chiffres mesurés valent mieux que des estimations, alors voici les nôtres, pris sur notre propre matériel plutôt que dans un tableau de benchmarks.
| Modèle | Taille | Haut de gamme Android 2018 | iPhone 13 Pro | Navigateur de bureau |
|---|---|---|---|---|
| Instant, 0.8B | 0.53 GB | 12-15 tok/s | ~36 tok/s | 33 tok/s |
| Fast, 2B | 1.28 GB | 5-6 tok/s | non mesuré | non mesuré |
| Sharp, 4B | 2.74 GB | moins de 1 tok/s | non mesuré | non mesuré |
| Sharp (Phi), 3.8B | 2.49 GB | 2-3 tok/s | non mesuré | non mesuré |
Au-dessus d'environ 10 tokens par seconde, la lecture se fait à un rythme confortable. En dessous de 5, vous sentez chaque mot. Le modèle 4B sur un téléphone de 2018 est le cas le plus net de ce tableau : il s'installe techniquement et il ne vaut pas la peine d'être installé, et c'est pourquoi Inborn le marque comme trop lent sur la fiche au lieu de vous le faire découvrir après le téléchargement.
Le temps jusqu'au premier token compte autant que le débit. Un long document poussé dans un petit modèle peut demander de longues secondes avant que le premier mot apparaisse, parce que le modèle doit tout lire avant d'écrire quoi que ce soit.
Ce que chaque taille sait vraiment faire
0.8B sert aux réponses rapides, aux réécritures et aux résumés, et c'est la taille qui démarre instantanément et touche à peine à la batterie. Elle est faible en code, en maths et sur les longs documents, et en dehors d'une poignée de langues elle devient bancale après deux ou trois phrases.
2B est l'assistant du quotidien : rédaction, questions générales, traduction vers les grandes langues, et questions sur un document. C'est le bon choix par défaut sur tout téléphone doté de 6 GB de mémoire.
4B sert à l'analyse, au code et aux longs documents. Il est plus lent, il réchauffe l'appareil, et sur un téléphone vous le sentez. Il en vaut la peine quand la réponse compte plus que l'attente.
Au-delà de la taille, il y a l'entraînement. Un modèle réglé pour le raisonnement et les maths, comme Phi-4-mini, bat un modèle généraliste de même taille sur une énigme logique et perd contre lui en traduction. Il n'existe pas de meilleur modèle absolu à une taille donnée, seulement un meilleur modèle pour ce que vous vous apprêtez à demander.
Comment choisir en pratique
Commencez par le plus petit modèle, utilisez-le pendant une semaine, et repérez où il vous lâche. S'il lâche sur les langues ou les longs documents, montez d'une taille. S'il lâche sur les maths et le code, changez de famille plutôt que de taille. S'il ne lâche jamais, vous vous êtes épargné plusieurs gigaoctets et un téléphone plus chaud.
Inborn affiche la plage de vitesse attendue pour chaque modèle sur votre appareil précis avant que vous l'installiez, et vous dit quand le modèle qui vient de répondre serait battu par un modèle que vous n'avez pas installé. C'est un meilleur guide que n'importe quel tableau de benchmarks, parce que le seul benchmark qui compte est celui qui tourne sur le matériel que vous avez en main.
À lire ensuiteOllama et LM Studio comparés à Inborn · Pourquoi l'IA devrait tourner sur votre appareil · Comment prouver qu'une app d'IA n'envoie rien