Faire tourner le modèle sur votre propre appareil signifie que votre question n'est jamais transmise, jamais conservée par qui que ce soit, jamais soumise à un changement de politique que vous n'avez pas lu, et jamais présente dans une fuite dont vous n'êtes pas responsable. Vous payez cela en taille de modèle : un modèle qui tient dans la mémoire d'un téléphone est plus faible sur le raisonnement difficile, le code long et l'actualité qu'un modèle installé dans un centre de données. Pour l'essentiel de ce que les gens tapent vraiment dans un assistant, ce compromis vaut la peine.
Ce qui arrive à une question dans le cloud
Quand vous écrivez dans un assistant en ligne, le texte quitte votre machine avant que quoi que ce soit y réfléchisse. Il voyage vers un serveur que vous ne contrôlez pas, y est traité, et il est généralement conservé un certain temps selon une politique qui peut changer. Cette conservation n'est pas sinistre en soi. C'est simplement un endroit de plus où vos mots existent, détenu par quelqu'un d'autre, accessible à son personnel selon ses règles, accessible à un tribunal selon les siennes, et accessible à un attaquant s'il parvient à entrer.
Rien de tout cela n'est abstrait pour un avocat qui rédige autour d'un dossier client, un clinicien qui tape un résumé de cas, un journaliste qui vérifie un nom, ou quiconque a déjà effacé une question à moitié tapée plutôt que de l'envoyer. Le plus intéressant, c'est la fréquence à laquelle des utilisateurs ordinaires font la même chose sans appeler cela de la confidentialité. Les gens s'autocensurent en permanence face aux assistants en ligne, et ils obtiennent de moins bonnes réponses à cause de cela.
Ce que vous récupérez
La première chose, c'est que la question cesse d'être une transmission. Il n'en existe aucune copie ailleurs que sur votre propre disque : il n'y a rien à conserver, à réquisitionner ni à faire fuiter. La deuxième, c'est la disponibilité : un modèle sur votre appareil se moque du réseau, de l'itinérance, d'un portail captif, d'une limite de débit ou d'une panne, donc il répond dans un tunnel et dans un avion exactement comme il répond à votre bureau. La troisième, c'est que le compteur s'arrête. L'inférence sur votre propre silicium n'a aucun coût marginal, et c'est pourquoi Inborn peut être un achat unique au lieu d'un abonnement avec un quota de messages.
Ce que cela vous coûte
C'est là que le marketing de l'IA locale devient silencieux, alors voici les chiffres. Un modèle de 2 milliards de paramètres quantifié en quatre bits occupe 1.28 GB et tourne à environ 5 à 6 tokens par seconde sur un haut de gamme Android de 2018, et nettement plus vite sur n'importe quel appareil actuel. Un modèle en ligne de pointe est deux à trois ordres de grandeur plus gros. Cet écart se voit exactement là où on l'attend : raisonnement en plusieurs étapes, code long, mathématiques, faits obscurs et langues peu dotées. Il se voit beaucoup moins sur ce que les gens font le plus souvent : réécrire un e-mail, résumer une page, expliquer un terme, traduire un paragraphe, esquisser un plan et transformer des notes en texte.
Ce que les assistants dans le cloud disent conserver, avec leurs propres mots, est présenté à côté de ce que conserve Inborn dans Inborn face à ChatGPT, Gemini et Claude. La règle honnête n'est donc pas que le local est meilleur. C'est que le local est meilleur pour tout ce qui est privé, tout ce qui est hors ligne et tout ce qui est courant, tandis que le cloud est meilleur pour la queue difficile. Savoir dans lequel des deux cas vous êtes, c'est là tout le savoir-faire.
Comment Inborn s'y prend
Inborn embarque un modèle de 0.8B dans l'app, 533 MB, pour que le premier chat fonctionne avant la fin du moindre téléchargement. Il profile votre appareil et vous indique la vitesse à attendre de chaque modèle plus grand avant que vous l'installiez plutôt qu'après. Quand une question sort de ce que le modèle en cours sait faire, il le dit au lieu de bluffer, et propose le modèle qui ferait mieux.
Le versant vérification compte autant que l'ingénierie. Sur Android, la version publiée ne déclare pas la permission INTERNET, donc le système d'exploitation ne la laissera pas ouvrir de socket. Sur iPhone, le Rapport de confidentialité des apps affiche une ligne vide. Vous n'avez pas à croire le paragraphe ci-dessus : vous pouvez le vérifier depuis l'extérieur de l'app en moins d'une minute, et l'article suivant en donne la liste.
À lire ensuiteComment choisir un modèle d'IA local · Vérifiez par vous-même