Inborn
ES
Consíguelo

Cómo elegir un modelo de IA para tu dispositivo

Un modelo funciona en tu dispositivo si su archivo cabe con holgura en memoria junto a todo lo demás, lo que en la práctica quiere decir un modelo de 4 bits de unos 0.5 GB en un teléfono de 3 GB, unos 1.3 GB en uno de 6 GB y unos 2.7 GB en uno de 8 GB con sitio de sobra. Más grande es mejor razonando y peor en todo el resto: velocidad, batería y calor. Elige el más grande que aún responda lo bastante rápido para que lo uses de verdad.

Los tres números

Los parámetros (0.8B, 2B, 4B) son el tamaño de los pesos que el modelo aprendió. Más parámetros suele significar mejor razonamiento, más conocimiento del mundo y mejor manejo de los idiomas que no son el inglés. Es el número que más predice la calidad de las respuestas.

La cuantización (Q4_K_M, Q8 y demás) es en cuántos bits se guarda cada peso. La precisión completa son 16 bits; Q4 son unos cuatro. Bajar a cuatro bits reduce el archivo a cerca de la cuarta parte, con una pérdida de calidad pequeña para el chat y notable para matemáticas y código. Casi todo lo que vas a ejecutar en un teléfono es Q4, y ese es el valor correcto por defecto.

El tamaño del archivo en bytes es el número que decide si funciona o no, porque el archivo entero tiene que estar en memoria mientras trabaja. Toma el tamaño del archivo, añade sitio para el contexto de la conversación y compáralo con la memoria que tu dispositivo tiene libre, no con la que tiene en total.

La velocidad que puedes esperar

Los números medidos valen más que las estimaciones, así que aquí están los nuestros, tomados en nuestro propio hardware y no de una tabla de pruebas ajena.

Velocidad de generación medida por modelo y dispositivo
ModeloTamañoAndroid tope de gama de 2018iPhone 13 ProNavegador de escritorio
Instant, 0.8B0.53 GB12-15 tok/s~36 tok/s33 tok/s
Fast, 2B1.28 GB5-6 tok/ssin medirsin medir
Sharp, 4B2.74 GBmenos de 1 tok/ssin medirsin medir
Sharp (Phi), 3.8B2.49 GB2-3 tok/ssin medirsin medir

Cualquier cosa por encima de unos 10 tokens por segundo se lee a un ritmo cómodo. Por debajo de 5, notas cada palabra. El modelo de 4B en un teléfono de 2018 es el caso más claro de esa tabla: técnicamente se instala y no vale la pena instalarlo, y por eso Inborn lo marca como demasiado lento en la ficha en vez de dejar que lo descubras después de la descarga.

El tiempo hasta el primer token importa tanto como el ritmo. Un documento largo pasado por un modelo pequeño puede tardar muchos segundos en sacar la primera palabra, porque el modelo tiene que leerlo entero antes de escribir nada.

Para qué sirve de verdad cada tamaño

0.8B es para respuestas rápidas, reescrituras y resúmenes, y es el tamaño que arranca al instante y apenas toca la batería. Es flojo en código, matemáticas y documentos largos, y fuera de un puñado de idiomas se tambalea después de un par de frases.

2B es el asistente del día a día: escritura, preguntas generales, traducción a los idiomas principales y preguntas sobre un documento. Es la opción correcta por defecto en cualquier teléfono con 6 GB de memoria.

4B es para análisis, código y documentos largos. Es más lento, calienta el dispositivo y en un teléfono se nota. Vale la pena cuando la respuesta importa más que la espera.

Más allá del tamaño está el entrenamiento. Un modelo ajustado para razonar y para matemáticas, como Phi-4-mini, gana a un modelo general del mismo tamaño en un acertijo de lógica y pierde con él en traducción. No hay un único mejor modelo para cada tamaño, solo el mejor modelo para lo que estás a punto de preguntar.

Cómo elegir en la práctica

Empieza por el modelo más pequeño, úsalo una semana y fíjate en dónde te falla. Si falla en idiomas o en documentos largos, sube un tamaño. Si falla en matemáticas y código, cambia de familia en vez de tamaño. Si nunca te falla, te has ahorrado varios gigabytes y un teléfono más caliente.

Inborn muestra el rango de velocidad que puedes esperar de cada modelo en tu dispositivo concreto antes de instalarlo, y te avisa cuando el modelo que acaba de responder sería superado por uno que no tienes instalado. Es una guía mejor que cualquier tabla de pruebas, porque la única prueba que importa es la que corre en el hardware que tienes en la mano.

SiguienteOllama y LM Studio comparados con Inborn · Por qué la IA debería funcionar en tu dispositivo · Cómo comprobar que una app de IA no envía nada