Volver al inicio

Haiku 5.5 redibuja el coste de los modelos pequeños

Anthropic lanzó Haiku 5.5 a 10 centavos de entrada por millón de tokens hasta 100.000 tokens, con 72,4 puntos en OSWorld 2.1 por delante de su rival Luna.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — PVe-ibLRLaw
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Anthropic presentó Haiku 5.5 el 7 de octubre de 2026, y la lista de precios es lo primero que llama la atención. Hasta 100.000 tokens, el millón de tokens de entrada cuesta 10 centavos y el de salida 50 centavos. Superado el umbral, la tarifa se quintuplica y sube a 50 centavos y 2,50 $. Los gráficos del vídeo cuentan así dos historias: en eficiencia por token , Haiku parece más inteligente que su rival GPT-6 Luna, mientras que en eficiencia por coste , Luna toma la delantera. El ejemplo numérico impacta: la misma tarea cuesta 21 centavos vía Haiku frente a 7 centavos vía Luna. La prima compra mayor inteligencia y una generación algo más veloz.

¿Por qué hace falta un modelo tan barato y rápido? La respuesta se esconde en el trabajo de alto volumen. Resúmenes, condensaciones, clasificaciones y consultas a bases de datos se repiten sin fin y no deberían cansar a los buques insignia. Haiku 5.5 entra aquí como subagente al servicio de sus hermanos mayores Opus 5.5 y Sonnet 5.5. La atención en directo y la navegación web, sensibles a la velocidad, también están en la lista. El presentador Caleb muestra un ejemplo vivo: Atticus, un agente personal instalado en su hogar.

Atticus: un agente personal en casa

Atticus obedece a la voz y cumple dos misiones en la demostración. Mientras Caleb lee un artículo de investigación, habla, y Atticus reúne los trabajos afines en segundo plano sin romper el hilo de lectura. Luego mira el escritorio, lee el trabajo abierto en la ventana de VS Code, encuentra la documentación de PyTorch y la fija a la izquierda de la pantalla. Caleb sigue escribiendo mientras la referencia espera al lado. Cada interacción cuesta unos 0,001 $, así que el agente personal sale casi gratis. Esa cuenta mudó a Caleb de lo local a la nube: ejecutaba una versión Qwen en su red doméstica y ahora llama a la gama Haiku vía la interfaz. Su motivo, la factura eléctrica de Michigan a 0,23 $ el kilovatio hora. El vídeo trae un patrocinio de Micro Center, que reparte memorias flash de 128 GB en la apertura de Austin.

La cifra más comentada llega del uso del ordenador . Haiku 5.5 logra 72,4 puntos en el subconjunto sin conexión de OSWorld 2.1, por delante de Luna con 48,9 y lejos del viejo Haiku 4.5 con 15,7. Hasta el hermano mayor Sonnet 5.5 culmina en 83,9, así que el pequeño se ha acercado de forma notable. Las demás filas también impresionan: 1620 puntos en la prueba de trabajo experto GDPval-AA v2.1 frente a 1437 de Luna, y 39,2 puntos en la prueba de código agéntico Terminal-Bench 4.0, más del doble de los 16,4 de Luna. En la prueba principal FrontierCode, 46,4 puntos superan los 42,4 de Luna.

Qué mide la prueba OSWorld

La prueba OSWorld comprueba si un modelo sabe manejar un ordenador real con ratón y teclado. Se montan entornos virtuales y se le piden tareas de largo recorrido como dar formato a una presentación o reservar un viaje. El entorno devuelve capturas frescas en cada paso, el modelo lee cada imagen y planifica el gesto siguiente. El bucle gira hasta el final; el ejemplo de presentación exige 62 pasos, y la lista supera el centenar de tareas.

Las pruebas en casa muestran la doble cara de ese bucle. Cara luminosa: Caleb habla, Haiku encuentra la hoja Excel y activa el modo oscuro, pulsando menús mientras las capturas circulan hasta la meta. Cara áspera: el presentador pide un filtrado en el sitio ArtificialAnalysis, con los modelos de más de 1 $ desactivados. El modelo desmarca primero las filas Opus 5.5 y GPT-6, luego abandona a mitad de camino. Tras una réplica avanza algo sin concluir jamás, y la operación entera dura 33 segundos. Pese a 173 tokens por segundo, el presentador admite que queda camino en velocidad y razonamiento, añadiendo que su pantalla 4K quizá ralentizó el asunto. Estos tropiezos prueban que la instrucción hablada unida al control aún es un oficio sin pulir.

La velocidad sola no basta

La conclusión golpea nítida: modelos más baratos, inteligentes y veloces abren usos inéditos. Anthropic anuncia costes medios un 75 por ciento menores, con un descuento de 90 puntos en tareas dentro del límite de 100.000 tokens. Un nuevo ajuste de esfuerzo permite elegir la intensidad de inferencia de baja a máxima; ensayos independientes dibujaron un pelícano por 0,09 centavos en el nivel bajo frente a 3,38 en el alto. Pero el nuevo tokenizador parte el mismo texto en 1,25 veces más tokens, ocultando un alza. Pasado el umbral, Luna parece más barato, pues el rival solo sube a 20 y 75 centavos tras su marca de 272.000 tokens.

Visualization: nodesdaily AI
IndicadorValor
Entrada hasta 100.000 tokens10 centavos por millón de tokens
Nota OSWorld 2.172,4 puntos, delante de Luna
Coste por intercambio0,001 $ vía Atticus

Momentos clave

  1. Tabla de precios en dos niveles
  2. Por qué un modelo pequeño
  3. Mensaje del patrocinador
  4. Nota de uso del ordenador
  5. Prueba doméstica del agente
  6. Veredicto final

Comentario de la IA

"Los modelos pequeños ganan inteligencia mientras sus facturas se encogen, abriendo paso a los agentes personales. El salto tras el umbral y las tareas a medias forman el flanco prudente del relato."

Evaluación de la IA

La réplica más fuerte nace de los contextos largos. Pasada la línea de 100.000 tokens, Haiku se quintuplica mientras Luna conserva sus 10 centavos hasta 272.000 tokens, y aun después se queda en 20 y 75 centavos. Sumen la inflación de 1,25 del tokenizador y el cuadro se invierte para documentos extensos. Además, los 72,4 puntos pertenecen al subconjunto sin conexión; nada prueba aún el mismo éxito en recorridos completos que llevan 1,6 horas a los humanos. La brecha entre el banco virtual ordenado y los sitios reales enredados exige una lectura prudente de la cifra estrella.

La lista de ausencias se alarga. Nada concreto sobre seguridad, conservación de datos o auditoría empresarial, mientras un agente que mira las pantallas del hogar deja abierta la pregunta de la privacidad. El arbitraje entre intimidad y velocidad locales por un lado y coste de la nube por otro varía según cada cual, sin fórmula única. El relato material patrocinado enturbia el cuadro, alineando en el mismo vídeo estaciones costosas y llamadas de un centavo. El lector medirá por tanto su propia carga antes de decidir.

El consejo práctico cabe en tres gestos. Primero cortar la carga por la línea de 100.000 tokens: Haiku por debajo, el rival o un hermano mayor por encima. Luego jugar con el ajuste de esfuerzo , esbozando rápido en el nivel bajo y razonando fino en el alto. Por fin adoptar el patrón del subagente, donde el insigne planifica y el pequeño desbroza los pasos repetitivos. Cifras como 0,001 $ por intercambio seducen, pero el total mensual merece vigilancia, porque el alto volumen engorda rápido las monedas menudas.

Fuentes

6 enlaces; 2 de ellos también citados por 3 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

haiku 5.5 · anthropic · osworld · agente ia · eficiencia de coste

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes de las fuentes, sus versiones y su origen.

LEE CON LAS FUENTES

Entiende esta noticia.

Comprobando tu cuenta…