🔥 Polémica
Ember-1 hace lo que Kimi K3 tardaba 3 veces: la misma respuesta con 40% menos tokens
Hay un número flotando en el announcement de Fireworks Research que resume por qué la industria de la IA está nerviosa: 40% menos tokens con la misma respuesta. No es un modelo nuevo con más potencia. Es lo contrario: un modelo que aprendió a hacer exactamente lo mismo pensando menos.
Si eso te suena como una mejora menor, te estás durmiendo. Cuando el 90% de lo que pagas a un modelo de razonamiento es reflexión interna que el usuario nunca ve, cortar esa basura no es una optimización. Es un recorte de precio disfrazado de nota de prensa.
El problema: los modelos razonadores piensan de más
Los modelos de razonamiento como Kimi K3 gastan la mayor parte de sus tokens generados en lo que la industria llama thinking tokens: bloques internos de reflexión que el modelo produce para pensar antes de emitir la respuesta. En algunos casos más del 90% de todo lo que genera el modelo es eso.
En una petición sola eso es caro pero tolerable. El problema real llega con los agentes: cada turno reproduce toda la reflexión anterior, así que el contexto crece de forma más o menos cuadrática con el número de turnos. Los bloques largos de reflexión de los primeros turnos se releen y se vuelven a facturar en cada llamada posterior.
Fireworks midió algo que hoy casi nadie admite en voz alta: gran parte de ese razonamiento es puro relleno. Los experimentos internos de Fireworks encontraron que la reflexión de K3 es mucho más larga de lo que la tarea requiere, y que ese exceso se puede quitar sin tocar la respuesta final.
La técnica: recorte con entrenamiento
Bajar el esfuerzo de razonamiento de K3 no funcionó. Bajarlo da mala calidad. Ese es el problema de siempre en estos modelos: el razonamiento no es una perilla sino un todo-o-nada.
La solución de Fireworks fue entrenar al modelo para que aprenda a razonar bien, pero corto. Reportan más de 50 experimentos de entrenamiento y más de 200 evaluaciones para llegar ahí, con algoritmos nuevos que recortan la reflexión sin perder exactitud.
La idea de fondo es interesante desde el punto de vista técnico: no todo el razonamiento es basura. Una parte es autorreflexión útil: volver sobre una suposición, responder a feedback, rastrear un resultado hasta una decisión anterior. Esa parte se preserva. El resto, el bucle improductivo, se elimina.
El resultado: en siete benchmarks públicos y en el tráfico de producción de dos clientes, el razonamiento de K3 se pudo acortar 35-50% sin sacrificar precisión. En pruebas A/B reales sobre cargas de trabajo de programación, la reducción fue de alrededor de 35% de tokens por tarea a calidad comparable.
La prueba que más importa: nadie se enteró
Antes de que lo vieran los clientes, los propios desarrolladores de Fireworks usaron Ember-1 internamente para código del día a día. El resultado del que más se enorgullecen no es un número: es que no pasó nada.
No news is good news, dice el announcement. Los devs siguieron con su carga de trabajo sin notar el cambio, consumiendo substancialmente menos tokens.
Y eso es exactamente lo que un buen rollout se ve en producción: invisible. El mejor test de un modelo no es un benchmark, es un martes cualquiera en el que nadie reporta un ticket.
La polémica que nadie menciona en el blog post
El título oficial habla de eficiencia. Los comentarios de Hacker News, 244 de ellos, hablan de otra cosa: marketing.
Varios investigadores se quejan de que la frontera de Pareto es la palabra de moda ahora. Apenas un par de semanas atrás Fireworks presentó su Specialized Intelligence Index, y todo el mundo, incluyendo críticos, lo está usando como métrica. Un comentario se burla de si existe una frontera de Pareto para el número de veces que los artículos mencionan la frontera de Pareto.
La crítica de fondo es válida: Ember-1 no es el modelo más inteligente. Es el más barato en una frontera que la propia Fireworks dibuja. Es un buen negocio, y un poquitón poco emocionante como innovación, pero sigue siendo un negocio.
Otro comentario, este más raro, señala que algunos modelos chinos imprimen la respuesta completa dentro del thinking trace y luego la repiten al usuario. Redundancia pura. Si eso ocurre, el ahorro de tokens de Ember-1 es solo la superficie de un problema más grande.
Por qué importa más allá de la IA
El cambio de fondo es económico, no técnico. Si hoy un agente con 20 turnos gasta 500 mil tokens, la mitad de eso es reflexión que se vuelve a facturar. Un modelo con la mitad del costo por tarea no baja un poco el precio: cambia la ecuación de si un agente de largo recorrido es viable o no.
Fireworks también lanza soporte de entrenamiento de Ember-1 para que las empresas lo ajusten con sus propios datos. El mensaje es claro: el futuro no es un modelo único y gigantesco, sino modelos especializados entrenados para tu carga específica.
Y ojo con el detalle final: Ember-1 sale como Research Preview en Serverless, con dos semanas de acceso gratuito para la comunidad open-source, y se vuelve permanente según la demanda. El ecosistema open-source está dejando de pedir permiso.
La conclusión: nadie te lo dice sobre la carrera de los tokens
Nadie te dice que la próxima guerra de la IA no es por el modelo más inteligente, sino por quién cobra menos por tarea. La inteligencia máxima se está volviendo commodity, y el margen se está moviendo al que gasta menos por respuesta correcta.
Si hoy pagas API de un modelo razonador para automatizar código o clientes, este es el número que deberías tener en la cabeza: 40%. No es un ahorro menor. Es el 40% de tu factura que estabas dejando en la basura cada mes.
Comparte esto con alguien que está pagando APIs de razonamiento sin saber que está pagando por reflexión repetida. Y dime en los comentarios: ¿te han medido qué porcentaje de lo que pagas es realmente thinking tokens, o solo te llega la factura?