⚡ Tecnología
Ejecuta una IA de 125B en una RTX 4090: gratis y en tu propio PC
Hasta hace unos meses, ejecutar un modelo de IA de 125 mil millones de parámetros solo era posible en servidores con docenas de GPUs. Hoy puedes hacerlo gratis en tu RTX 4090.
Lo que nadie te decía sobre modelos gigantes
Durante años nos vendieron la idea de que los mejores modelos de IA necesitaban nubes infinitas y facturas que subían cada minuto. Los gigantes tecnológicos invirtieron miles de millones para convencerte de que la única forma de usar IA potente era pagando por tokens en la nube.
Ese discurso empieza a romperse. Cada vez más proyectos demuestran que con compresión inteligente, puedes ejecutar modelos muchísimo más grandes en tarjetas gráficas de consumo, sin enviar ni un byte a servidores ajenos.
Qwen 3.8 Flash Next: 125B corriendo en tu PC
El proyecto Strata acaba de hacer algo que parecía imposible: ejecutar Qwen 3.8 Flash Next (125B parámetros) en hardware doméstico. Lo posteó en Hacker News con 208 puntos y casi 100 comentarios, y sus propios benchmarks miden alrededor de 100 tokens por segundo en una RTX 4090 de 24 GB.
Ojo con ese número: significa que el modelo escribe la respuesta más rápido de lo que tú puedes leerla. No es una maqueta, es producción.
Lo más importante no es la velocidad: es la soberanía de tus datos. Todo corre localmente. Tus conversaciones, tus prompts, tu código, nunca abandonan tu PC.
Qué necesitas para probarlo
Los requisitos son sorprendentemente razonables para lo que ofrece:
- GPU: NVIDIA RTX 20/30/40/50 series o AMD Radeon RX 7900 XT/XTX, 7800 XT, 9070 — mínimo 12 GB de VRAM
- RAM: 32 GB mínimo, 64 GB recomendado para los tamaños más grandes
- Disco: unos 80 GB libres (el modelo ocupa ~70 GB)
- Sistema: Windows 10/11 o Linux
Con 24 GB de VRAM consigues el mejor rendimiento. Con 12 GB igual ejecutas versiones más comprimidas, a velocidades que siguen siendo usables. También documenta tarjetas viejas (Tesla P40, GTX 10, Radeon VII) y Arc de Intel, aunque ahí va lento.
Gratis, abierto y sin cuotas por uso
A diferencia de los servicios de nube, con Strata pagas una sola vez: la electricidad de tu PC. Ni suscripciones, ni límites de tokens, ni facturas sorpresa a las 3 AM porque un agente se volvió loco en un loop.
Es software libre y multiplataforma. El instalador detecta tu tarjeta, te recomienda el modelo que cabe en tu RAM y arranca. Y lo mejor: le puedes pegar el prompt "instálame esto" a tu asistente de código (Claude Code, Cursor, Codex, Copilot) y hace todo solo, porque Strata expone un servidor MCP.
El futuro de la IA ya no es solo en la nube
Estamos viendo un punto de inflexión: los modelos más potentes dejan de estar encerrados detrás de APIs de pago. Correr IA de nivel servidor dentro de tu PC de gaming era ciencia ficción hace 12 meses. Hoy es una realidad que cualquiera con una GPU de 2020 en adelante puede probar en diez minutos.
Y sí, se pone pesado tu equipo mientras arranca. Eso también es el costo de la independencia. Me parece un precio justo.
Comparte esto si crees que la IA potente debería ser accesible para todos, no solo para quien puede pagar facturas millonarias en la nube.