Cloudflare acaba de matar al LLM para tomar decisiones — y los números son brutales

Modelos de decisión de IA corriendo en servidores en el edge
Los modelos de decisión prometen clasificar en milisegundos. ¿Están o no Commoditizando la decisión?

Cloudflare acaba de poner una IA en su lugar. No una IA mejor, no una IA más grande: una IA que ni siquiera es una IA como las conocemos. Cloudflare lanzó Clef, una familia de modelos de decisión open-weight que hace una sola cosa — clasificar y decidir — y en su prueba interna le gana a un LLM gigante.

El dato lo tira Cloudflare sin rodeos: en su equipo de inteligencia de amenazas, Clef clasificó un dominio en 2.2 segundos. gpt-oss-120b, su LLM rápido, tardó 4.7 segundos en el mismo flujo — y devolvió solo dos clasificaciones en vez de varias. Mitad de latencia, más información.

Eso no es una mejora de benchmarks. Es un cambio de categoría.

Modelos de decisión de IA corriendo en servidores en el edge

Qué es un "decision model" (y por qué no es un LLM)

Un LLM general predice texto. Un modelo de decisión devuelve respuestas tipadas con probabilidades: "urgent: sí, 94%", "equipo: billing, 88%", "severidad: critic". Tu código lee eso y enruta, escala o difiere a un humano.

La diferencia es brutal en la práctica. No te pide que "razone" sobre una cadena de instrucciones: te da un campo estructurado que un if/else puede consumir directamente.

Cloudflare lo probó con un caso real: pasas un dominio y Clef devuelve "95% sitio de moda, 85% ecommerce, menos de 1% phishing". Todo en 2.2 segundos. Ese es exactamente el workload que hoy te hace llamar a un LLM carísimo para parsear una respuesta y parsear su salida.

Los benchmarks: 43 pruebas y los números reales

Cloudflare publicó resultados en 43 evaluaciones contra modelos de decisión de la competencia. Los más jugosos:

Y la latencia, que es donde se gana el presupuesto:

Clef-flash responde en 38 milisegundos. Eso ya no es una llamada a una API — es una función. Si eso va al hot path de un agente, cada decisión deja de ser un cuello de botella.

¿Por qué importa más de lo que parece?

Porque hasta ahora, cada vez que un agente de IA necesitaba "decidir", llamabas a un LLM de 120B. Eso significa: costo por token, GPU alquilada en région lejana, 2-5 segundos de espera, y una factura que escala mal.

Clef corre sobre Workers AI, en el edge de Cloudflare. La GPU está físicamente cerca del usuario. Un modelo de decisión en el edge significa que puedes ponerlo en el hot path sin que nadie note la latencia.

Mi opinión fuerte: esto es el final de "usar un LLM para todo". El diseño correcto ya no es un modelo más inteligente, es el modelo correcto para cada capa. Un LLM razona, un modelo de decisión clasifica. Forzar un LLM a hacer de clasificador es como usar tu laptop para abrir una puerta.

Las advantage (y el asterisk) que nadie menciona

El punto débil honesto: en Agent trace observability, Clef saca 68.5 contra 71.6 de Jev. En PhishNChips, Jev 85.35 le gana a Clef 79.60. No es dominación absoluta — es un modelo que gana 3 de 4 áreas de la suite de Typesafe y pierde en algunos nichos.

Además, being open-weight significa que tú puedes hostearlo, auditarlo, o correrlo en tu propia infra. Eso en 2026 ya no es un extra: es lo que hace que un equipo de finanzas o un hospital se atreva a meter IA en producción.

Y ojo: un modelo de decisión mal entrenado es un riesgo de seguridad. Un clasificador de phishing con 79% de acierta deja pasar el 21%. Cloudflare lo pone en su propio pipeline de amenazas precisamente porque allí un falso negativo cuesta dinero real.

¿Qué significa para ti como dev?

La respuesta corta: deja de pagar por LLM para tareas de clasificación. Si estás clasificando tickets, enrurando solicitudes, detectando spam, etiquetando tickets de soporte o validando dependencias, ya tienes una solución que es más rápida, más barata y más precisa que el LLM que estabas usando.

La respuesta larga: las skills de "cuándo llamar a un LLM" que aprendiste en 2023 se quedaron obsoletas en 2026. El skill que importa ahora es saber dónde termina el LLM y empieza el clasificador.

Cloudflare lo dejó disponible en Workers AI con una llamada curl y un JSON con el estado y las preguntas. No es un producto de pago esperando un contrato: es una línea de código. Pruébalo esta semana antes de que alguien else lo ponga en un benchmark y lo imponga como estándar.

Mi veredicto

Clef no va a matar a los LLM. Pero va a robarles el 40% de los workloads donde hoy se desperdicia presupuesto. Y eso, en un mercado de infraestructura, es más peligroso que perder una pelea de benchmarks.

El mejor chiste del lanzamiento es que el modelo se llama Clef, como el símbolo musical que le dice al músico qué nota es cada línea. Clef hace exactamente eso: no toca la música, solo le quita la ambigñedad al resto del sistema. El LLM es el músico. Clef es el pentagrama. Ya era hora de que alguien lo dijera en voz alta.

Comparte esto con el dev que sigue pagando un LLM de 120B para clasificar un formulario de soporte. Le estás dando su primer argumento en la próxima reunión de presupuesto.

Y dime: ¿qué tarea de tu trabajo actual crees que estás usando un LLM cuando un clasificador de 40 milisegundos haría lo mismo, mejor y gratis?