Anthropic domina la cima de los modelos de código. Desde Fable y Opus hasta la era Sonnet 3.5, sus llamadas a herramientas convirtieron el desarrollo asistido por inteligencia artificial en la rutina diaria de los programadores. Pero la gama tenía un eslabón débil: los modelos pequeños. Haiku 4.5, lanzado en octubre pasado, ya era caro entonces y hoy parece un chiste. Theo llegó a ordenar a todas sus herramientas, agentes y archivos de reglas que evitaran Haiku 4.5 a toda costa. Hace unas semanas lo escribió sin rodeos: Anthropic no tiene ningún modelo pequeño que merezca la pena.
La crítica es histórica: Anthropic concentra casi todo en el modelo insignia y destila mal hacia los niveles baratos, de ahí el bajón de Opus durante las versiones intermedias y un apagado Opus 5. La maldición se rompió con Opus 5.5 y Sonnet 5.5, y la expectativa pasó al Haiku 5.5 de hoy. El trabajo del modelo pequeño está claro: buscar archivos, revisar cambios por triplicado, todo lo que no debe quemar tokens de un modelo caro. Theo había perdido tanta confianza que hacía que su Claude llamara a un modelo rival Sol para ahorrar. La pregunta: ¿borró Haiku 5.5 la vergüenza?
Precio y la barrera de los 100 000
Haiku 5.5 responde con claridad: precio justo, rendimiento sólido y algún truco que favorece a un modelo tan pequeño. Hasta 100 000 tokens, la entrada cuesta 0,10 $ por millón y la salida 0,50 $; por encima, ambas se quintuplican. Cerca del 90 % de las peticiones del Haiku anterior quedaba bajo la barrera. Las tarifas caen 90 % en peticiones cortas y 50 % en largas, un 75 % de media contando el apetito del nuevo tokenizador. Esta tabla viene del anuncio de Anthropic , que destina el modelo a tareas repetitivas sensibles al coste.
La barrera cumple dos funciones. Por un lado abarata hasta lo ridículo la lectura rápida y la clasificación, plantando cara a las herramientas de edición de texto; por otro orienta el uso en Claude Code hacia respuestas cortas para no arruinar la facturación en contexto largo. Calendario: Opus 5.5 el 22 de septiembre, Sonnet 5.5 el 28, y ahora Haiku 5.5 completa la familia. Lydia, desde Anthropic, aconseja fijar la ventana de resumen automático en 100 000, ajuste por modelo que cubre también a los subagentes. Este calendario figura asimismo en el informe de SiliconAngle .
La comparación que importa es Luna. En contexto corto, Haiku 5.5 iguala a Luna al céntimo (0,10 $/0,50 $); más allá de 100 000 todo cambia, porque Luna solo endurece precios en 272 000 (0,20 $/0,75 $). Súmese el nuevo tokenizador, que convierte el mismo texto en un 25 % más de tokens, y el precio anunciado diverge de la factura real. Dentro de 100 000, Haiku lidera; fuera, Luna gana de sobra. SimonWillison subraya este reparto: paridad abajo, Luna mucho más barata arriba.
La cuenta a escala decide: en un turno tipo que lee 80 000 tokens en caché más 2 000 nuevos y genera 1 000, Haiku y Luna cuestan 0,15 centavos frente a 2,2 de Sonnet; mil turnos salen por 1,50 $ contra 22 $. Cuando verificar es barato, el reintento gana: con 39,2 % de éxito para Haiku, 16,4 % para Luna y 70,6 % para Sonnet, el éxito verificado sale por 0,4, 0,9 y 3,1 centavos. Misma etiqueta, distinta puntería. Esta cuenta viene del análisis de CTOL , que recomienda el enrutado: el modelo barato intenta, un verificador juzga, el fallo escala.
Mediciones y la curva de rentabilidad
El salto en mediciones es brutal. El trabajo de conocimiento GDPval se duplica de 735 a 1620; el examen de la humanidad sube de 10,2 % a 45,9 % sin herramientas y de 18,7 % a 57,4 % con ellas; el uso de ordenador OSWorld salta de 15,7 % a 72,4 %; la codificación agéntica Terminal-Bench pasa de cero a 39,2 %. Luna se queda en 16,4 %, menos de la mitad. El razonamiento visual salta de 6,4 % a 46,4 %. Estas cifras son la tabla oficial de Anthropic ; un índice independiente también coloca al recién llegado primero entre los pequeños con 43 puntos, aunque señala su sed de tokens.
OpenAI lideró el uso de ordenador durante mucho tiempo; la brecha se cierra, pero la codificación agéntica dura sigue siendo de Sonnet y Opus 5.5. Haiku 5.5 estrena ajuste de esfuerzo en un modelo pequeño, de bajo a máximo, dejando que la tarea fije el equilibrio entre agudeza y coste. El contexto crece de 200 000 a un millón de tokens. Soporte en vivo, agentes de voz, ayudantes integrados y navegación: todo lo que exige velocidad está en la mira. Este cuadro también lo resume la síntesis de Technology.org .
El tramo más divertido es la curva agudeza-precio: la frontera de Pareto corre por Luna, Haiku, Sonnet y Opus hasta que 6.1 Sol la tuerce, ofreciendo un salto de agudeza por una décima de centavo más. Luna siempre es más barata y, con estos números, siempre menos fina. La joya discreta es Mimo de pesos abiertos, sorprendentemente fuerte para su precio. Para quien se queda con un solo proveedor, Haiku ya es una parada sensata: una suscripción, modelos que se entienden.
El caso de proveedor único es práctico: un equipo calibrado en Anthropic lo hace todo bajo el mismo techo, una factura, una ventanilla, sin duplicar suscripciones. Que Opus instruyendo a Haiku supere a Opus instruyendo a Sol no está medido pero se nota en el campo. Los equipos con objetivo de coste juzgarán por coste por éxito verificado, no por precio anunciado, manteniendo la opción Luna sobre la mesa.
Demos y gusto por el diseño
La arquitectura de subagentes se mueve: Theo quiere suavizar la regla que lo manda todo a Opus en su archivo de reglas, dejando que Opus decida qué subconjunto estrecho encarga barato a Haiku. Aún no la ha forzado pero reescribirá la regla. La misma dirección aparece en el registro de AICoder : Claude Code 2.1.293 convierte a Haiku 5.5 en el modelo pequeño por defecto, ventana de un millón, para resúmenes, compactación, consultas y clasificación.
Luego llegan las demos. Un vídeo comunitario de Arshan, generado por unos sesenta centavos en menos de veinte minutos, impresiona para lo que cuesta. Theo atribuye parte del secreto al gusto por el diseño infundido en los modelos de Anthropic : datos de diseño elegidos con obsesión que dejan al modelo buenas referencias. El estudio frontal whichAI de Dara lleva el mismo pulido.
La comparativa whichAI entierra a Grok: mejores tipografías, trucos de animación inéditos, panel blueprint cuyo vuelo remodela el contenido. Al apagar la escala de diseño se vuelve a la fealdad clásica de los modelos de lenguaje: la brecha viene del complemento de diseño. Theo lo había desinstalado y piensa recuperarlo. Con el complemento apagado, Grok empeora aún más, y el tramo termina en carcajadas.
El punto negro es una lección de cuota en directo: un script que aspira 181 peticiones de retirada en paralelo estrella contra el techo GitHub de 5 000 peticiones por hora, guarda el cuerpo del error como dato y revienta al analizar JSON. Nada rearma la espera, el hilo queda muerto hasta la reanudación manual, y Theo pierde sus integraciones casi una hora. Los modelos pequeños se acorralan solos y dan trabajo al usuario: la prueba viviente de la desconfianza del presentador.
Pruebas de campo y veredicto
Los informes de campo son fuertes. Asana mide tareas un 30 % más rápidas con inferencia por turno hasta 2,5 veces más viva; el ingeniero Aaron Vinh habla de una fluidez visible. La batería CRM de HubSpot firma su mejor nota con 92,8, lo más rápido, con más aciertos y menos falsas alarmas. AlphaSense, con ocho millones de llamadas semanales, sube de 0,76 a 0,84 en 400 consultas. Estos resultados de clientes se publican en el anuncio de Anthropic .
Box completa el cuadro con once puntos de ventaja a mitad de latencia. La seguridad se aprieta: la alineación muestra muchas menos desviaciones que Haiku 4.5, lo defensivo respira más que con Sonnet 5.5, la prueba de intrusión sigue prohibida y el acceso amplio pasa por el programa de verificación cibernética. Este marco lo confirma el informe de SiliconAngle , que lista además la distribución por la plataforma Claude, AWS, Google Cloud y Azure.
El día del lanzamiento trae dos regalos. La lectura en caché de Sonnet 5.5 baja de 0,20 $ a 0,10 $ por millón, aliviando un quinto la mayoría de facturas agénticas. Llegan créditos API mensuales: 100 $ en Max 5x, 200 $ en Max 20x, hasta 500 $ compartidos en Team; sin arrastre, fuera de Claude Code interactivo. El contexto también lo cuenta el registro de TechCrunch : Sonnet 5.5 del 28 de septiembre va 30 % más rápido, vence a Opus en multitarea agéntica y porta blindaje cibernético de nivel Fable.
Veredicto: Haiku 5.5 es el modelo de las tareas estrechas, verificables y repetitivas, del resumen a la compactación, de la clasificación a las consultas y los subagentes. El grande planifica, el barato intenta, el verificador decide. La cuenta por éxito verificado asiente: intentos baratos más escalado selectivo. El trabajo pesado queda en los insignia. La maldición del modelo pequeño parece rota por primera vez, y Theo va a reescribir su archivo de reglas.
| Métrica | Resultado |
|---|---|
| OSWorld 72,4 % | Antes 15,7 % |
| Terminal 39,2 % | Antes 0 |
| Entrada corta | 0,10 $ por millón |
Momentos clave
Comentario de la IA
"La carrera de los modelos pequeños acaba de cambiar: el precio ya no es la excusa, la medición habla. Pero el enrutado manda; apostarlo todo al barato agranda la desilusión, no el ahorro."
Evaluación de la IA
El contraargumento más fuerte es el apetito de tokens: al máximo, el recién llegado quema unos 162 000 tokens por tarea cuando Luna iguala con 50 000. Etiqueta igual, factura desigual. Pasados 100 000, el escalón de Luna es suave, así que el contexto largo la favorece. Paridad de precio no es paridad de capacidad, y el reintento no resuelve lo imposible.
Faltan piezas: la codificación agéntica dura sigue en Sonnet y Opus, y el proveedor lo escribe. Las alucinaciones caen frente a Luna (40 % contra 77 %) con mejor confesión de ignorancia, pero el saber factual va detrás (36 % contra 44 %). Permisos cibernéticos amplios en defensa, cerrados en ataque: equilibrio razonable, muro duro para equipos rojos.
Un posible interés merece nota: el vídeo lleva patrocinio de Coderabbit, y el elogio del modelo pequeño favorece a una herramienta patrocinada. Las demos comunitarias son un escaparate elegido; los fallos nunca se emiten. Aun así la tabla es oficial, los clientes tienen nombre y las cifras cuadran con fuentes independientes.
Para el lector es práctico: dar a Haiku lo que quepa bajo 100 000 con verificación barata, fijar la ventana de resumen en 100 000, vigilar la facturación. Guardar el insignia para contexto largo y trabajo pesado. Un solo proveedor simplifica la factura, pero la opción Luna sigue sobre la mesa.
Fuentes
8 enlaces; 5 de ellos también citados por 4 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Theo - t3.gg
- @anthropic.com Anthropic — Introducing Claude Haiku 5.5
También citado por: Same Sticker, Different Bill: Haiku 5.5 vs Luna in 12 Runs · Haiku 5.5 Redraws Cost Efficiency for Small Models · Claude Haiku 5.5: Anthropic's Cheapest and Fastest Model Reshapes the Small-Model Race
- @siliconangle.com SiliconAngle — Haiku 5.5 release and Sonnet cache cut
También citado por: Claude Haiku 5.5: Anthropic's Cheapest and Fastest Model Reshapes the Small-Model Race
- @simonwillison.net SimonWillison — Claude Haiku 5.5 notes
También citado por: Haiku 5.5 Redraws Cost Efficiency for Small Models · Claude Haiku 5.5: Anthropic's Cheapest and Fastest Model Reshapes the Small-Model Race
- @techcrunch.com TechCrunch — Sonnet 5.5 launch
También citado por: Dots, Gemini 4 Argon and Sonnet 5.5: What Happened in AI's DevDay Week
- @technology.org Technology.org — Haiku 5.5 price and benchmarks
También citado por: Claude Haiku 5.5: Anthropic's Cheapest and Fastest Model Reshapes the Small-Model Race
- @aicoder.com AICoder — Haiku 5.5 launch details
- @ctol.digital CTOL — Haiku pricing parity and cost per success
inteligencia artificial · claude · anthropic · llm · agentes