Desplegué ante mí la tabla de 17 filas: GPT-6.1 Sol 90,1 arriba, GPT-6 Sol 89,9 justo detrás, Claude Sonnet 5.5 tercero con 86,8. La prueba es una arena de diseño: cada modelo entrega una pieza de vitrina terminada y el jurado califica el resultado. El coste figura en la misma tabla: $0,382 y $0,297 para los hermanos Sol, $0,574 para Sonnet. Estas tres primeras filas vienen de los registros open-design.ai, donde cada modelo muestra su puntaje junto a su coste estimado por artefacto.
La historia del dúo líder se remonta a fines de septiembre: GPT-6.1 Sol relevó a GPT-6 Sol en el escenario DevDay del 29 de septiembre, listado a $2 la entrada y $10 la salida, un quinto del precio del insignia Astra. El análisis venturebeat.com traza la misma línea: codificación agéntica y uso de computadora de clase Astra, tramo Ultrafast hasta 300 tokens/s. La tabla me parece honesta aquí: 0,2 puntos de brecha en esta vitrina de IA cuestan 29 % más. En el lado benchmark , la familia Sol se mide alrededor de 48 en el Intelligence Index, cerca de 100 tokens/s.
El campo Sonnet 5.5 llegó el 28 de septiembre: $2 la entrada, $10 la salida, lecturas de caché a mitad de precio a $0,10. La medición artificialanalysis.ai sitúa a Sonnet 5.5 en 56 del Intelligence Index, dos puntos detrás del insignia Opus 5.5, y anota 70,6 % en Terminal Bench 4.0 por delante de Opus. Para este modelo , con 86,8 en la arena de diseño, la factura por artefacto marca $0,574. Mi lectura: para un equipo que se queda bajo un mismo techo, Sonnet es el puerto seguro y la factura sigue previsible. El recorte de caché aligera las cargas de agentes cerca de 20 %.
La cima es cara, el medio es listo
Las filas del medio son el tramo más sabroso de la tabla: MiMo 2.6 Flash con 83,5 por $0,029, GPT-6 Luna con 83,1 por $0,016, Grok 4.7 con 82,9 por $0,662. La página comparativa openrouter.ai expone la brecha estructural: Grok 4.7 se lista a $2 la entrada y $6 la salida sobre 500K de contexto, mientras MiMo Flash se lista a $0,10 la entrada y $0,28 la salida sobre 1,05M de contexto. O sea, una misma franja de benchmark con más de 20 veces de brecha de precio. Para pruebas de vitrina yo probaría el MiMo abierto o Luna, no Grok. El gasto en tokens decide aquí.
La fila marcada con la flecha en la imagen es Claude Haiku 5.5: 82,2 puntos, $0,018. El anuncio anthropic.com lleva fecha del 7 de octubre: $0,10 la entrada y $0,50 la salida hasta 100K tokens, ambas líneas se quintuplican por encima, contexto 1M. El registro artificialanalysis.ai coloca a Haiku 5.5 segundo de su clase de precio a esfuerzo máximo con 43 en el Intelligence Index, a $0,21 por tarea. El examen beam.ai apunta igual: 34 puntos a esfuerzo medio por $0,05, un papel a medida para tareas de sub agentes . A mi juicio esta fila es la estrella de la tabla: 4,6 puntos bajo Sonnet por un treintavo de la factura. Esa proporción es rara al elegir un LLM .
La fila Astra rompe el patrón: 82,7 puntos, $1,61. El modelo insignia, listado a $10 la entrada y $50 la salida, queda aquí 0,4 detrás de Luna al 100 veces de factura. La fila Fable 5.1 impacta aún más: 80,3 puntos a $3,66, la celda más cara de la tabla. Los registros artificialanalysis.ai muestran a Fable a $10 la entrada y $50 la salida por $2,37 a $3,76 por tarea del Intelligence Index. Mi veredicto es seco: la potencia IA general quizá sea alta, pero en esta arena queda lejos de la línea precio-rendimiento. Miro facturas de trabajos terminados, no precios de lista, para elegir un modelo .
El ala cara y las filas bajas
El pasillo Flash continúa: DeepSeek V4.1 Flash con 81,2 por $0,023, GLM-5.3 Flash-X con 80,1 por $0,098. La comparación yottalabs.ai da la trastienda: DeepSeek con 552B parámetros en una banda de $0,044 la entrada y $0,30 la salida, GLM en una banda de $0,036 la entrada y $0,50 la salida. Los precios en vivo openrouter.ai confirman. Estas dos filas son mi reserva del dúo Haiku-Luna: si uno se atasca, el otro releva. La brecha de benchmark es 1,1 puntos, la de factura 4 veces; aquí también la elección lista vence a la cara. El coste de lectura de caché gobierna el bucle de agentes .
Un peldaño más abajo están GPT-5.6 Sol con 77,6 por $0,544, Hunyuan H4 Preview con 74,6 por $0,418, Qwen 3.8-Max con 72,0 por $0,595. La página open-design.ai entrega su insignia de mejor valor a Luna: 92 % del puntaje máximo por 4 % del coste máximo. Esa proporción sostiene la tesis que defiendo desde el inicio: un modelo de 5 a 13 puntos por detrás cuesta 30 a 40 veces menos. Qwen, listado a $2 la entrada y $6 la salida, queda caro en esta arena. Pagar por token y pagar por trabajo terminado son cosas distintas; la tabla lo enseña.
Las tres últimas filas cierran la tabla: Gemini 3.8 Flash 68,9 a $0,210, Muse Spark 1.3 66,6 a $0,267, Kimi K3 65,7 a $0,614. La brecha con la cima va de 21 a 24 puntos, con facturas de 13 a 38 veces Luna. Leo estas filas como aviso, no como rechazo: nombres que brillan en los rankings LLM generales pueden palidecer en una vitrina de diseño. Cuando cambia el tipo de tarea, el orden del benchmark también cambia. Cada modelo no encaja en cada vitrina.
Mi lógica de elección
Mi regla cabe en tres líneas: pruebo Luna o Haiku 5.5 en tareas cortas verificables, me quedo con Luna más allá de 100K tokens, y llevo Sol o Sonnet a la final de vitrina. El patrón de enrutado del examen beam.ai dice lo mismo: el modelo barato intenta, un juez verifica, el trabajo atascado escala al grande. Lo que la tabla open-design.ai me enseñó: los clientes rara vez ven la brecha entre 90 y 83 puntos, pero cada mes ven la brecha de factura de 24 veces. La destreza en gasto IA es elegir el tramo correcto, no el puntaje máximo.
| Medida | Resultado |
|---|---|
| Puntaje máximo | GPT-6.1 Sol 90,1 |
| Líder en valor | Luna 83,1 / $0,016 |
| Destacado | Haiku 5.5 82,2 / $0,018 |
Momentos clave
Comentario de la IA
“Miré este gráfico una hora y mi opinión es firme: la brecha entre la cima y el medio se cierra con criterio, no con dinero. Nunca lanzo el modelo caro a cada tarea; el tramo barato ya produce vitrinas, y yo elijo en consecuencia.”
Evaluación de la IA
La contra-opinión más fuerte: esta tabla mide una sola vitrina, no la potencia IA general. Un modelo de 90 en la arena de diseño puede no sostener ese rango en codificación agéntica larga o exámenes de conocimiento. En el Intelligence Index artificialanalysis.ai, Sonnet 5.5 culmina en 56 cerca de la cima mientras sostiene 86,8 y el tercer puesto aquí; las dos pruebas pesan virtudes distintas. Tomar esta tabla por un benchmark general sería un error, y yo lo evito.
Las ausencias también son claras: velocidad, latencia, cobertura de idiomas y conducta en contexto largo no aparecen. El coste por artefacto es un estimado; mi factura real se mueve con el número de peticiones, los aciertos de caché y la longitud de salida. Una petición Haiku que cruza la línea de 100K cuesta cinco veces más, lo que ninguna celda muestra. Por eso importa la lista de dos tramos de la página anthropic.com. Estudio notas y páginas de precios, no solo celdas.
Anoto también el posible interés: la página open-design.ai abre a una página de descarga que sirve a 21 agentes , con la insignia de mejor valor en Luna. Ese encuadre no mancha la medición, pero nunca dejo que una sola tabla decida. Cruzo los registros venturebeat.com, artificialanalysis.ai y beam.ai. Mi principio: una tabla despierta curiosidad, tres tablas deciden.
El mensaje para los lectores es simple: boceten vitrinas con Luna, produzcan en volumen con Haiku 5.5 bajo un patrón juez, y lleven Sol o Sonnet ante el jurado final. Vigilen la línea de 100K tokens y mantengan altos los ratios de lectura de caché. Los precios en vivo openrouter.ai se mueven cada semana, así que consulten la lista cada mes. Con este ajuste protejo tanto la calidad de vitrina como la factura de fin de mes.
Fuentes
8 enlaces; 2 de ellos también citados por 7 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — OpenDesign quality-cost ranking
- @open-design.ai OpenDesign — Quality ranking and cost
- @www.anthropic.com Anthropic — Introducing Claude Haiku 5.5
También citado por: Same Sticker, Different Bill: Haiku 5.5 vs Luna in 12 Runs · The Week in AI Products: Open Agents, Chip Financing, and the Interface Race · Grokbot Courts Rival Models While ChatGPT Goes Visual: AI's Loudest Seven Days · Haiku 5.5: Anthropic finally fixes its small-model problem · A Packed AI Week: Cheap Models, Visual Answers, Agent Deluge · Haiku 5.5 Redraws Cost Efficiency for Small Models · Claude Haiku 5.5: Anthropic's Cheapest and Fastest Model Reshapes the Small-Model Race
- @artificialanalysis.ai Artificial Analysis — Haiku 5.5 release analysis
También citado por: Same Sticker, Different Bill: Haiku 5.5 vs Luna in 12 Runs
- @venturebeat.com VentureBeat — GPT-6.1 Sol launch
- @openrouter.ai OpenRouter — Grok 4.7 vs MiMo Flash
- @www.yottalabs.ai Yotta Labs — Flash models compared
- @beam.ai Beam — Haiku 5.5 subagent costs
inteligencia artificial · modelo · benchmark · agente · llm