Inborn
PT-BR
Baixar

Como escolher um modelo de IA no aparelho

Um modelo roda no seu aparelho se o arquivo dele couber com folga na memória junto com todo o resto, o que na prática quer dizer um modelo de 4 bits de cerca de 0.5 GB em um celular de 3 GB, cerca de 1.3 GB em um de 6 GB e cerca de 2.7 GB em um de 8 GB com espaço sobrando. Maior é melhor em raciocínio e pior em todo o resto: velocidade, bateria e calor. Escolha o maior que ainda responda rápido o bastante para você realmente usar.

Os três números

Parâmetros (0.8B, 2B, 4B) são o tamanho dos pesos que o modelo aprendeu. Mais parâmetros geralmente significa melhor raciocínio, mais conhecimento de mundo e melhor desempenho em idiomas além do inglês. É o número que mais prevê a qualidade da resposta.

Quantização (Q4_K_M, Q8 e assim por diante) é em quantos bits cada peso é guardado. A precisão total são 16 bits; Q4 são cerca de quatro. Cair para quatro bits reduz o arquivo para mais ou menos um quarto, com uma perda de qualidade pequena para chat e perceptível em matemática e código. Quase tudo o que você vai rodar em um celular é Q4, e esse é o padrão certo.

O tamanho do arquivo em bytes é o número que decide se ele roda ou não, porque o arquivo inteiro precisa ficar na memória enquanto trabalha. Pegue o tamanho do arquivo, some espaço para o contexto da conversa e compare com a memória livre do seu aparelho, não com a memória total dele.

A velocidade que você deve esperar

Números medidos valem mais que estimativas, então aqui estão os nossos, feitos no nosso próprio hardware e não tirados de uma tabela de benchmark.

Velocidade de geração medida, por modelo e por aparelho
ModeloTamanhoTop de linha Android 2018iPhone 13 ProNavegador no computador
Instant, 0.8B0.53 GB12-15 tok/s~36 tok/s33 tok/s
Fast, 2B1.28 GB5-6 tok/snão medidonão medido
Sharp, 4B2.74 GBabaixo de 1 tok/snão medidonão medido
Sharp (Phi), 3.8B2.49 GB2-3 tok/snão medidonão medido

Acima de uns 10 tokens por segundo, a leitura corre em um ritmo confortável. Abaixo de 5, você sente cada palavra. O modelo de 4B em um celular de 2018 é o caso mais claro dessa tabela: ele tecnicamente instala e não vale a pena instalar, e é por isso que o Inborn o marca como lento demais no card em vez de deixar você descobrir depois do download.

O tempo até o primeiro token importa tanto quanto a taxa de geração. Um documento longo passado por um modelo pequeno pode levar muitos segundos até a primeira palavra aparecer, porque o modelo precisa ler tudo antes de escrever qualquer coisa.

Para que cada tamanho é realmente bom

0.8B serve para respostas rápidas, reescritas e resumos, e é o tamanho que começa na hora e quase não mexe na bateria. É fraco em código, matemática e documentos longos e, fora de alguns poucos idiomas, fica instável depois de duas ou três frases.

2B é o assistente do dia a dia: escrita, perguntas gerais, tradução para os principais idiomas e perguntas sobre um documento. É o padrão certo em qualquer celular com 6 GB de memória.

4B serve para análise, código e documentos longos. É mais lento, esquenta o aparelho, e no celular você sente. Vale a pena quando a resposta importa mais que a espera.

Além do tamanho existe o treinamento. Um modelo afinado para raciocínio e matemática, como o Phi-4-mini, ganha de um modelo geral do mesmo tamanho em um desafio de lógica e perde para ele em tradução. Não existe um melhor modelo em cada tamanho, só o melhor modelo para o que você está a ponto de perguntar.

Como escolher na prática

Comece pelo modelo menor, use por uma semana e repare onde ele deixa a desejar. Se falhar em idiomas ou documentos longos, suba um tamanho. Se falhar em matemática e código, troque de família em vez de tamanho. Se nunca falhar, você economizou vários gigabytes e um celular mais quente.

O Inborn mostra a faixa de velocidade esperada de cada modelo no seu aparelho específico antes de você instalar, e avisa quando o modelo que acabou de responder seria superado por um que você ainda não instalou. Isso guia melhor que qualquer tabela de benchmark, porque o único benchmark que importa é o que roda no aparelho que está na sua mão.

A seguirOllama e LM Studio comparados com o Inborn · Por que a IA deve rodar no seu aparelho · Como provar que um app de IA não envia nada