Gaming
Le dio 15-1 al campeón mundial de Stratego con 16 GPUs: Google gastó 4 millones y perdió
Le pagaron 100 dólares por cada partida y de 20 solo ganó una. Pim Niemeijer lleva cuatro campeonatos del mundo y más de 600 semanas como el jugador más ranked de la historia de Stratego, y en octubre de 2026 se sentó frente a una máquina que le aplastó 15-1 con cuatro empates. Lo más insultante no es el marcador: es lo que costó. La IA que humilló al mejor jugador del planeta entero se entrenó con 16 GPUs durante una semana. DeepMind gastó entre 3 y 4.5 millones de dólares en su intento anterior y no logró nada.
En Stratego conoces DONDE está la pieza enemiga, pero no QUÉ es. Esa diferencia lo convierte en el problema más difícil de la IA en juegos de mesa.
Por qué Stratego le rompió la cabeza a la IA durante 30 años
En ajedrez, Go o poker, la máquina gana por fuerza bruta de búsqueda: enumera todas las jugadas posibles y elige la mejor. En Stratego eso es imposible por una razón simple.
Cada jugador coloca 40 piezas de rango militar (mariscal, espía, minas, bandera). Tu oponente ve dónde está cada pieza tuya, pero no qué es. La identidad solo se revela cuando dos piezas chocan y la más débil muere. Hay más de un decillón de disposiciones posibles para un solo tablero.
A eso sómale la duración: una partida de ajedrez dura 40 movimientos. Una de Stratego puede llegar a 2.000. Y sómale el bluff: mueves un espía como si fuera mariscal para asustar al rival. Si mientes mucho, nadie te cree; si nunca mientes, te leen en dos movimientos. Ese equilibrio es justo lo que hizo fracasar a DeepNash en 2022.
"Hay algo muy distintivo en Stratego: es una cantidad masiva de información oculta que se despliega en una escala de tiempo muy larga." — Eugene Vinitsky, NYU
El truco: 163 millones de partidas y una segunda red neuronal
Ataraxos — el nombre viene del griego ataraxia, la calma total — aprendió jugando contra sí mismo 163 millones de partidas. La idea base no es nueva: refuerza las jugadas que ganaban y castiga las que perdían. Lo nuevo es cuánto ajusta después de cada partida. Con información oculta, el self-play tiende a dar vueltas en círculo, así que el equipo hizo que la IA hiciera cambios grandes y agresivos al principio, y ajustes pequeños y cuidadosos al final.
La innovación de verdad fue otra: pensar antes de mover. Un modelo de beliefs, una segunda red neuronal entrenada para adivinar qué piezas ocultas tiene el rival según cómo se han movido. En vez de recorrer todas las disposiciones posibles, Ataraxos muestrea las que parecen plausibles, simula jugadas en cada una y elige según el resultado. Eso es exactamente lo que DeepMind no logró resolver.
El resultado fue un estilo que los investigadores describen como calmo y sin entrar en pánico. Un humano al que le va perdiendo intenta jugadas desesperadas para volver. Ataraxos no: vuelve partido a partido, método a método. Y cuando su modelo cree que el rival no sospecha de un punto débil, lo deja intacto, aunque desde fuera parezca un desastre a punto de pasar.
Según Vinitsky, el equipo llegó a ver al bot "bluffeando su regreso desde un dos por ciento de probabilidad de victoria, muy, muy casual".
Lo que rompió el metagame
En el Campeonato Mundial de Stratego de 2025, quienes desafiaron a Ataraxos la pasaron peor: 38 victorias en 40 partidas. Los jugadores quedaron desconcertados por una apertura casi imposible: esconder la bandera en una esquina con solo dos bombas, un acomodo raramente usado.
El mismo método funcionó en otros juegos: batió a tres campeones de Barrage Stratego, dominó Hanabi (el cooperativo de cartas) y le ganó a los mejores bots del juego chino dou dizhu.
Lo que esto significa (y lo que no)
Mi opinión: lo importante aquí no es que una máquina gane un juego. Es que la barrera económica cayó. Durante años, "vencer a un campeón mundial" fue cosa de organizaciones con cientos de millones de dólares en presupuesto. Si 16 GPUs y un simulador bien escrito bastan para replicar lo que Google no pudo, la pregunta deja de ser "cuándo llegan las máquinas a este nivel" y pasa a ser "cuánto cuesta contratar a alguien que sepa hacerlo".
El próximo objetivo del equipo son los mercados financieros y los conflictos armados, donde no hay reglas fijas ni ganador claro. "El war gaming es algo común", dice Vinitsky. "Puedes usar las técnicas derivadas aquí para jugarlo hacia adelante y ver cómo respondería un oponente fuerte."
La trampa, admiten los propios autores: Ataraxos no sabe explicar por qué hace lo que hace. Juega fuerte, pero es una caja negra. Para un inversionista eso es un riesgo. Para el mundo de las apuestas y el análisis de riesgo, es un problema más serio que perder una sola partida.
Lo que hago con esto
Si jugabas Stratego online, el consejo es simple: contra Ataraxos se juega distinto. Ese ángulo de bandera en la esquina es un ajuste real, no un meme. Y si estabas pensando en meterte a los juegos de estrategia, Stratego acaba de volverse el mejor entrenador de lectura de rivales que existe, y es gratis.
Comparte esto con alguien que todavía cree que Stratego es "suerte". No lo es: es matemática con piezas escondidas, y las matemáticas ya nos ganaron.