Recientemente, el panorama de la inteligencia artificial ha tomado un giro significativo, no solo en centros de procesamiento masivos, sino también en desarrollos que permiten ejecutar modelos más pequeños en dispositivos modestos. Empresas chinas como Qwen y MiniCPM están liderando esta tendencia, enfocándose en hacer que la IA sea más accesible y utilizable en dispositivos personales. Este avance tiene el potencial de transformar la forma en que los usuarios interactúan con la tecnología en su vida diaria.
Las cifras que respaldan esta evolución son notables. DeepSeek-V3 ha alcanzado los 671,000 millones de parámetros, y Moonshot AI ha llevado su modelo Kimi K2 a la asombrosa cifra de un billón de parámetros. Además, el nuevo Kimi K3 ha incrementado esta cifra a 2.8 billones, mientras que el Qwen3.8-Max de Alibaba se sitúa en 2.4 billones de parámetros. Es crucial entender que no todos estos parámetros se utilizan simultáneamente en cada proceso, lo que plantea preguntas sobre la eficacia de estos modelos.
La arquitectura de inteligencia artificial está experimentando innovaciones que buscan optimizar el uso de estos parámetros. Se ha sugerido que GPT-4 de OpenAI podría operar bajo un esquema de Mixture of Experts, activando solo una parte de sus parámetros en cada paso, lo que permite una gestión más eficiente. Por ejemplo, Qwen3.8-Max, aunque cuenta con 2.4 billones de parámetros, emplea aproximadamente 95,000 millones en cada operación.
Sin embargo, tener un mayor número de parámetros no siempre se traduce en una mejor calidad. DeepMind, en un estudio de 2022, demostró que su modelo Chinchilla, con 70,000 millones de parámetros, superó a Gopher, que tiene 280,000 millones, en varias tareas. Este resultado resalta la importancia de la arquitectura y la calidad de los datos durante el entrenamiento.
La próxima frontera en este campo es la creación de modelos que superen los 10 billones de parámetros. Alibaba ha anunciado que ya está trabajando en Qwen 4, con planes para desarrollar modelos en torno a esta cifra. Aunque ByteDance también parece estar en la misma dirección, no se han dado detalles concretos. Por otro lado, OpenAI y Anthropic aún no han revelado información específica sobre los parámetros de sus próximos modelos, lo que complica cualquier comparación directa.
Es importante destacar que no todos los modelos de IA son adecuados para las mismas tareas. Los modelos más pequeños son ideales para ambientes con limitaciones de memoria y coste, mientras que los modelos a gran escala buscan enfrentar tareas más sofisticadas que requieren infraestructura robusta. Las actuales estrategias chinas buscan balancear ambos extremos, desarrollando soluciones compactas y potentes al mismo tiempo.
