Nadie te dice esto sobre ejecutar 125B de IA en una GPU de consumidor

Circuito de placa base con iluminación azul representando IA local
La IA frontier ya cabe en hardware de consumidor

Mientras las grandes empresas te venden tokens a dólar por millón, hay algo que nadie está contando: un modelo de 125B parámetros acaba de correr a 100 tok/s en una sola RTX 4090.

Eso no debería ser posible. Los modelos de 125B han sido territorio exclusivo de servidores con 4-8 GPUs o clusters en la nube que cuestan cientos de dólares por hora. Hasta ahora.

El golpe silencioso que cambió las reglas

El proyecto Strata acaba de demostrar que Qwen 3.8 Flash Next 125B puede correr en hardware de consumidor. No con trucos de fantasía, sino con una cuantización optimizada sobre llama.cpp.

El resultado: ~100 tokens/segundo en una RTX 4090. Para ponerlo en perspectiva, eso es más rápido que muchos modelos de 9B-32B que corrían hace un año. Y hablamos de un modelo 4x más grande.

La clave está en cómo se ha distribuido el peso del modelo. En lugar de cargar 250GB+ de FP16, se usa una cuantización mixta cuidadosamente diseñada para que quepa dentro de la VRAM disponible (típicamente 24GB en 4090). No necesitas un servidor H100 de $40,000 — necesitas una sola GPU gaming.

¿Por qué esto importa para Latinoamérica?

En Latinoamérica, el acceso a créditos de nube para IA es caro o limitado. Muchos desarrolladores, estudiantes y startups no pueden pagar $50-200/hora para experimentar con los mejores modelos. Esta ruptura democratiza el acceso: lo mejor de la IA de código y razonamiento puede correr offline, sin conexión a internet, y sin facturación por token.

Eso significa startups latinoamericanas pueden prototipar con modelos frontier sin quemar su presupuesto en los primeros 30 días. Estudiantes en universidades con PCs modestos pueden experimentar con modelos que antes solo existían en la nube. La brecha de infraestructura acaba de reducirse drásticamente.

Lo que nadie te dice sobre el "trade-off"

No todo es gratis. Para lograr esto, el modelo usa cuantización agresiva. La calidad baja un poquito respecto a FP4 "perfecto" o FP16, pero para la gran mayoría de tareas (programación, razonamiento, chat, análisis) la diferencia es imperceptible en el uso práctico.

Otro detalle incómodo: necesitas paciencia para el primer load (descargar ~40-60GB del GGUF), y 24GB de VRAM son prácticamente el mínimo hoy. Quien tenga una 3090 de 24GB o 5070Ti con 16GB puede intentar variantes más ligeras, pero la 4090 es la sweet spot actual.

Cómo probarlo en 5 minutos

Lo más práctico es usar llama.cpp (llama-server) o interfaces como LM Studio. En LM Studio basta con buscar "Qwen 3.8 Flash Next 125B" en el modelo de HuggingFace recomendado por Strata, descargar el GGUF y darle play. Sin configuración compleja, sin Docker, sin scripts raros.

El proyecto Strata publica las recomendaciones exactas de cuantización (qué archivos GGUF usar para qué VRAM). Ese detalle marca la diferencia entre "no carga" y "corre a 100 tok/s".

El futuro llegó antes de lo que esperábamos

Durante años nos vendieron el cuento de que los modelos de nivel frontier necesitaban cloud hyperscaler. Ese monopolio acaba de recibir un golpe importante. Cada vez que un modelo frontier cabe en hardware de consumidor, el poder se desplaza del proveedor de nube hacia el usuario.

Y eso, para cualquier desarrollador latinoamericano que trabaje con IA, es la noticia más importante del año.

Comparte esto si crees que la IA debería correr en tu PC, no solo en los servidores de alguien más.