Um modelo roda no seu aparelho se o arquivo dele couber com folga na memória junto com todo o resto, o que na prática quer dizer um modelo de 4 bits de cerca de 0.5 GB em um celular de 3 GB, cerca de 1.3 GB em um de 6 GB e cerca de 2.7 GB em um de 8 GB com espaço sobrando. Maior é melhor em raciocínio e pior em todo o resto: velocidade, bateria e calor. Escolha o maior que ainda responda rápido o bastante para você realmente usar.
Os três números
Parâmetros (0.8B, 2B, 4B) são o tamanho dos pesos que o modelo aprendeu. Mais parâmetros geralmente significa melhor raciocínio, mais conhecimento de mundo e melhor desempenho em idiomas além do inglês. É o número que mais prevê a qualidade da resposta.
Quantização (Q4_K_M, Q8 e assim por diante) é em quantos bits cada peso é guardado. A precisão total são 16 bits; Q4 são cerca de quatro. Cair para quatro bits reduz o arquivo para mais ou menos um quarto, com uma perda de qualidade pequena para chat e perceptível em matemática e código. Quase tudo o que você vai rodar em um celular é Q4, e esse é o padrão certo.
O tamanho do arquivo em bytes é o número que decide se ele roda ou não, porque o arquivo inteiro precisa ficar na memória enquanto trabalha. Pegue o tamanho do arquivo, some espaço para o contexto da conversa e compare com a memória livre do seu aparelho, não com a memória total dele.
A velocidade que você deve esperar
Números medidos valem mais que estimativas, então aqui estão os nossos, feitos no nosso próprio hardware e não tirados de uma tabela de benchmark.
| Modelo | Tamanho | Top de linha Android 2018 | iPhone 13 Pro | Navegador no computador |
|---|---|---|---|---|
| Instant, 0.8B | 0.53 GB | 12-15 tok/s | ~36 tok/s | 33 tok/s |
| Fast, 2B | 1.28 GB | 5-6 tok/s | não medido | não medido |
| Sharp, 4B | 2.74 GB | abaixo de 1 tok/s | não medido | não medido |
| Sharp (Phi), 3.8B | 2.49 GB | 2-3 tok/s | não medido | não medido |
Acima de uns 10 tokens por segundo, a leitura corre em um ritmo confortável. Abaixo de 5, você sente cada palavra. O modelo de 4B em um celular de 2018 é o caso mais claro dessa tabela: ele tecnicamente instala e não vale a pena instalar, e é por isso que o Inborn o marca como lento demais no card em vez de deixar você descobrir depois do download.
O tempo até o primeiro token importa tanto quanto a taxa de geração. Um documento longo passado por um modelo pequeno pode levar muitos segundos até a primeira palavra aparecer, porque o modelo precisa ler tudo antes de escrever qualquer coisa.
Para que cada tamanho é realmente bom
0.8B serve para respostas rápidas, reescritas e resumos, e é o tamanho que começa na hora e quase não mexe na bateria. É fraco em código, matemática e documentos longos e, fora de alguns poucos idiomas, fica instável depois de duas ou três frases.
2B é o assistente do dia a dia: escrita, perguntas gerais, tradução para os principais idiomas e perguntas sobre um documento. É o padrão certo em qualquer celular com 6 GB de memória.
4B serve para análise, código e documentos longos. É mais lento, esquenta o aparelho, e no celular você sente. Vale a pena quando a resposta importa mais que a espera.
Além do tamanho existe o treinamento. Um modelo afinado para raciocínio e matemática, como o Phi-4-mini, ganha de um modelo geral do mesmo tamanho em um desafio de lógica e perde para ele em tradução. Não existe um melhor modelo em cada tamanho, só o melhor modelo para o que você está a ponto de perguntar.
Como escolher na prática
Comece pelo modelo menor, use por uma semana e repare onde ele deixa a desejar. Se falhar em idiomas ou documentos longos, suba um tamanho. Se falhar em matemática e código, troque de família em vez de tamanho. Se nunca falhar, você economizou vários gigabytes e um celular mais quente.
O Inborn mostra a faixa de velocidade esperada de cada modelo no seu aparelho específico antes de você instalar, e avisa quando o modelo que acabou de responder seria superado por um que você ainda não instalou. Isso guia melhor que qualquer tabela de benchmark, porque o único benchmark que importa é o que roda no aparelho que está na sua mão.
A seguirOllama e LM Studio comparados com o Inborn · Por que a IA deve rodar no seu aparelho · Como provar que um app de IA não envia nada