⚡ Tecnología
Un truco de 2 llamadas roba los 'pensamientos secretos' de ChatGPT y Claude — y ya hay 6,700 agentes expuestos
Tu agente de IA piensa en secreto. Y ese secreto acaba de dejar de serlo.
Un equipo de investigadores de Tübingen (Max Planck Institute) demostró algo que las empresas de IA no quieren que sepas: el razonamiento oculto de GPT-5, Claude y Gemini se puede extraer en texto plano con solo 2 llamadas a la API. Sin hackear al modelo fuerte. Sin activar sus salvaguardas. Solo con un truco de reutilización.
Y lo peor: ya hay 6,708 agentes públicos en GitHub y Hugging Face cuyos "pensamientos" filtran secretos reales. API keys. Credenciales. Datos personales. Todo a la vista de cualquiera que sepa mirar.
El espejismo del chain-of-thought encriptado
Cuando le preguntas algo a ChatGPT o Claude, el modelo no solo te da la respuesta: piensa antes de responder. Ese proceso interno se llama chain-of-thought y es la parte más valiosa de un modelo moderno.
Las empresas saben que ese razonamiento es oro puro — y que copiarlo es la forma más barata de entrenar a la competencia. Por eso lo devuelven encriptado, supuestamente ilegible.
El paper Stealing Reasoning Traces from Proprietary LLM APIs demuestra que esa encriptación es un candado de cartón.
Cómo funciona el ataque en 2 pasos
El truco es elegante y aterrador a la vez:
Paso 1. Tomas un "trace" (bloque de razonamiento encriptado) generado por un modelo frontier, como Claude Opus 4.8. Esos bloques son portables: se pueden reutilizar fuera de su contexto original, entre sesiones, usuarios y modelos.
Paso 2. Lo inyectas en un modelo hermano más débil (Claude Haiku, por ejemplo) ya "jailbreakeado", y le pides que transcriba el razonamiento adjunto palabra por palabra. El modelo débil descifra lo que el fuerte intentó ocultar.
Así, sin atacar jamás al modelo fuerte ni disparar sus alarmas anti-distillation, los investigadores recuperaron el pensamiento oculto verbatim en los tres grandes: OpenAI, Anthropic y Google.
6,700 agentes con secretos a la vista
Aquí es donde la historia deja de ser académica.
El equipo escaneó 6,708 trayectorias de agentes públicos en GitHub y Hugging Face, producidas por Claude, GPT y Gemini, que aún contenían bloques encriptados. Aplicaron su pipeline de descifrado y reconstruyeron 315,320 bloques de razonamiento.
El resultado: 704 secretos reales — 351 identificadores técnicos, 204 datos personales (PII), 126 credenciales y 23 otros. API keys que el modelo "pensó" mientras resolvía una tarea y quedaron grabadas en el trace.
¿El detalle más incómodo? Esos traces son tuyos. La API te los devuelve por diseño. Si tu agente maneja una key o un dato sensible, su pensamiento lo contiene — y si ese trace llega a GitHub, cualquiera puede descifrarlo.
Qué significa esto para los devs de LATAM
Si construyes agentes con APIs de OpenAI, Anthropic o Google, esto te toca directamente:
1. Nunca loguees traces como "debug". Ese JSON que guardas para depurar es un cofre de secretos. 2. No subas agentes con bloques de razonamiento a repos públicos. GitHub ya tiene 6,700 ejemplos de lo que pasa. 3. Rota tus keys con frecuencia y revísalas si publicaste código recientemente. 4. Usa redacción server-side donde la ofrezcan (Anthropic ya respondió con guías anti-distillation) y trata los traces como datos sensibles, porque lo son.
La ironía: mientras las empresas venden "razonamiento privado" como su mayor ventaja competitiva, ese mismo razonamiento es extraíble con un prompt bien construido. Los secretos comerciales más custodiados de la industria de la IA estuvieron circulando en texto plano todo este tiempo.
La conclusión incómoda
El chain-of-thought nunca fue un secreto bien guardado: era un secreto que esperaba a alguien con una buena idea. Y la idea llegó.
Esto no mata a la IA. Pero debería matar la costumbre de confiar en que "está encriptado" significa "está seguro". Si la IA pensó un secreto, asume que se puede leer.
Comparte esto con alguien que sube agentes a GitHub sin mirar los logs. 📤
¿Crees que las empresas deberían dejar de devolver los traces de razonamiento al cliente, o eso rompería los agentes que ya dependen de ellos? Déjalo en los comentarios.