Rodar o modelo no seu próprio aparelho significa que a sua pergunta nunca é transmitida, nunca é guardada por ninguém, nunca fica sujeita a uma mudança de política que você não leu e nunca aparece em um vazamento que você não causou. Você paga por isso com o tamanho do modelo: um modelo que cabe na memória de um celular é mais fraco em raciocínio difícil, código longo e fatos atuais que um modelo que vive em um data center. Para a maior parte do que as pessoas realmente escrevem em um chat, essa troca vale a pena.
O que acontece com uma pergunta na nuvem
Quando você escreve em um assistente na nuvem, o texto sai da sua máquina antes de qualquer coisa pensar sobre ele. Ele viaja até um servidor que você não controla, é processado lá e costuma ser guardado por algum tempo sob uma política que pode mudar. Essa retenção não é sinistra por si só. É simplesmente mais um lugar onde as suas palavras existem, sob o domínio de outra pessoa, ao alcance da equipe dela pelas regras dela, ao alcance de um tribunal pelas regras dele, e ao alcance de um invasor, se algum entrar.
Nada disso é abstrato para um advogado redigindo sobre o caso de um cliente, um médico digitando um resumo clínico, um jornalista checando um nome, ou qualquer pessoa que já apagou uma pergunta pela metade em vez de enviá-la. A parte mais interessante é com que frequência usuários comuns fazem o mesmo sem chamar isso de privacidade. As pessoas se autocensuram o tempo todo com assistentes na nuvem, e recebem respostas piores por causa disso.
O que você ganha em troca
A primeira coisa é que a pergunta deixa de ser uma transmissão. Não existe cópia dela em lugar nenhum além do seu próprio disco, então não há o que reter, intimar ou vazar. A segunda é a disponibilidade: um modelo no seu aparelho não se importa com sinal, roaming, portal de acesso, limite de requisições ou queda de serviço, então ele responde em um túnel e em um avião exatamente como responde na sua mesa. A terceira é que o taxímetro para de correr. A inferência no seu próprio silício não tem custo marginal, e é por isso que o Inborn pode ser um pagamento único em vez de uma assinatura com cota de mensagens.
O que isso custa a você
É aqui que a maior parte do marketing de IA local fica quieta, então aqui estão os números. Um modelo de 2B parâmetros quantizado em quatro bits ocupa 1.28 GB e roda a mais ou menos 5 a 6 tokens por segundo em um top de linha Android de 2018, e bem mais rápido em qualquer aparelho atual. Um modelo de fronteira na nuvem é duas a três ordens de grandeza maior. Essa diferença aparece exatamente onde você esperaria: raciocínio de vários passos, código longo, matemática, fatos obscuros e idiomas com poucos dados de treinamento. Ela aparece bem menos nas coisas que as pessoas mais fazem, que são reescrever um e-mail, resumir uma página, explicar um termo, traduzir um parágrafo, esboçar um roteiro e transformar anotações em texto.
O que os assistentes na nuvem dizem que guardam, com as palavras deles, está lado a lado com o que o Inborn guarda em Inborn vs ChatGPT, Gemini e Claude. Então a regra honesta não é que o local é melhor. É que o local é melhor para tudo que é privado, tudo que é offline e tudo que é rotineiro, enquanto a nuvem é melhor para a ponta difícil. Saber em qual dos dois você está é a habilidade inteira.
Como o Inborn faz isso
O Inborn traz um modelo de 0.8B dentro do app, 533 MB, então a primeira conversa funciona antes de qualquer download terminar. Ele mede o seu aparelho e diz a velocidade a esperar de cada modelo maior antes de você instalar, não depois. Quando uma pergunta está fora do que o modelo em uso faz bem, ele avisa em vez de blefar, e oferece o modelo que se sairia melhor.
O lado da verificação importa tanto quanto a engenharia. No Android, a build de lançamento não declara a permissão INTERNET, então o sistema operacional não deixa o app abrir um socket. No iPhone, o Relatório de Privacidade do App mostra uma linha vazia. Você não precisa acreditar no parágrafo acima: dá para conferir de fora do app em menos de um minuto, e o próximo texto é a lista de como fazer isso.
A seguirComo escolher um modelo de IA no aparelho · Confira você mesmo