Claude Sonnet 5.5: 70.6% en Terminal-Bench y ya jugó Pokémon Red a ciegas

Claude Sonnet 5.5 de Anthropic
Anthropic lanzó Claude Sonnet 5.5 el 28 de septiembre de 2026 con 70.6% en Terminal-Bench 4.0.

El modelo de Anthropic pasó del 10.3% al 70.6% en una sola generación. No hubo salto gradual: hubo un abismo. Así arranca Claude Sonnet 5.5, el segundo miembro de la familia 5.5, y el número que está generando 551 comentarios en Hacker News no es el de un benchmark más: es el de una factura que bajó.

El 28 de septiembre de 2026, Anthropic soltó Sonnet 5.5 con tres promesas concretas: 30%+ más rápido que Sonnet 5, hasta 30% más barato por tarea (no por token, ojo) y un salto de capacidad que la propia empresa llama "clear upgrade". Lo que sigue es lo que creo que de verdad te afecta como dev.

El 70.6% que no te vas a creer

Terminal-Bench 4.0 es la evaluación más dura de coding agentic que existe hoy: máquina, terminal, sin IDE. Un modelo que sabe abrir un repo no vale nada si no puede sobrevivir a 40 pasos de shell sin que nadie lo guíe.

Sonnet 5.5 saca 70.6%. Sonnet 5 sacaba 10.3%. Eso no es una mejora, es un cambio de generación con el mismo nombre de la familia. Para ponerlo en perspectiva: pasó de "no sabe usar una terminal" a "supera a la mitad de los humanos que lo intenta".

Y en GDPval-AA, que evalúa trabajo real de oficios distintos, queda a dos puntos de Opus 5.5. Dos puntos. El modelo que cuesta como el flagship hace el trabajo del flagship.

El detalle que nadie titulará: Pokémon Red a ciegas

Es el primer modelo Sonnet que supera Pokémon Red trabajando solo con capturas de pantalla. Sin acceso al código, sin estado interno, sin API del juego. Solo mira la pantalla y pulsa botones como un jugador humano.

Sí, esto es el benchmark de moda de los benchmarks de problemas más duro. Pero explica por qué los números de GDPval suben: los modelos están aprendiendo percepción + acción, no solo completitud de texto. Y eso es exactamente lo que necesita un agente que corrige bugs en un repo que nunca ha visto.

La parte que importa: el precio real

Aquí está la jugada de marketing que nadie menciona en el announcement. Sonnet 5.5 cuesta lo mismo por token que Sonnet 5:

El "hasta 30% menos por tarea" no viene de que bajen el precio. Viene de que el modelo necesita muchos menos tokens para hacer lo mismo. Es la diferencia entreEs como reducir el precio de un producto de cosas que te vendemos: al final el cliente paga menos, pero no porque le demos un descuento, sino porque es más eficiente.

Para un equipo que corre agentes en un bucle de 20 llamadas por tarea, esto es la diferencia entre un piloto y producción. Mi opinión fuerte: este es el número que debería haber salido en el título, no el 70.6%.

Dos cosas que te van a doler

1. Los safeguards de ciberseguridad. Sonnet 5.5 es el primer Sonnet que sale con las mismas protecciones que Opus 5, porque sus capacidades ofensivas de ciberseguridad ya son comparables a las del flagship. Anthropic dice que el desarrollo de software rutinario y la mayoría de las ciencias de la vida no se ven afectados. Lo que significa esto en la práctica: si veníaas Claude 5.5 para escribir un script de pentesting, prepárate para preguntas extra.

2. Hay un bug, y Anthropic lo admitió. Artificial Analysis corrió GDPval-AA sobre un despliegue pre-release de Sonnet 5.5 que tenía un bug degradando respuestas con structured outputs. Anthropic lo reconoció públicamente, dijo que ya está arreglado y que el efecto en los puntajes fue "pequeño o ninguno" y que además subestima el rendimiento real. Poca gente escribe eso. Me genera más confianza que el marketing.

Bonus: en FrontierCode, Sonnet 5.5 puntú más bajo en esfuerzo Max que en Xhigh. Explicación oficial: en Max el modelo dispara la skill de code-review de Claude Code, que reparte la revisión en muchos subagentes, y en dos casos eso provocó timeouts o ediciones fuera del alcance. A veces más esfuerzo es peor esfuerzo.

Opus 5.5 o Sonnet 5.5?

Regla práctica que te llevas:

Sonnet 5.5 para el día a día: arreglar bugs, escribir documentos y slides pulidos, iterar rápido, análisis de imágenes, tareas bien delimitadas. Es tu caballo de batalla.

Opus 5.5 para el trabajo abierto que exige juicio sostenido: arquitectura, decisiónes con contexto polimórfico, donde el error cuesta más que el tiempo.

Y Haiku 5.5 — el de volumen alto y sensibilidad al costo — llega en las próximas semanas. Si tu app hace 500 llamadas al día, ese es el que te va a decidir el presupuesto.

Mi veredicto (con reservas)

Anthropic ganó algo raro:lanz00f3 un upgrade donde el número grande es económico, no técnico. El 10.3% → 70.6% es impresionante, pero lo que te va a cambiar el mes es que por la primera vez un flagship-clase cuesta lo mismo que el anterior por token y hasta 30% menos por tarea completada.

Mi postura: si estabas guardándote para el "modelo que ya vale la pena", este es el año. Si estabas probando Claude para coding agentic y te frustró, vuelve a probarlo — el salto del 10% al 70% no es incremental, es otro producto.

¿Vas a migrar tu flujo de Claude Code a Sonnet 5.5 o el precio de $10/M de salida te sigue dando” lo que te cobran? Cuéntame en los comentarios qué tarea automatizaste y cuánto te ahorra al mes. Y comparte esto con alguien que todavía paga Opus para todo — se va a sentir tonto en 24 horas.