Volver al inicio

Probe Opus 5.5 en 24 tareas de codigo: calidad Fable en la mitad de tiempo y coste

En un benchmark independiente de 24 tareas de codigo, Claude Opus 5.5 supero claramente a Opus 5 en calidad, velocidad y coste — el ajuste medio termino en unos dos minutos por menos de un dolar.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — dLHFC-mumsA
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Fue una semana intensa para los modelos frontera. Claude Opus 5.5 llego mientras OpenAI hablaba de GPT-6 Sol y Luna, y Mimo 2.6 se aparco por ser demasiado lento. La pregunta central era si 5.5 es un incremento menor como 5.1 o un salto real. Habia rumores internos sobre 5.2, y Fable habia salido como 5.1 sin gran impacto. En la clasificacion privada del autor, Opus 5 seguia detras de Astro medium e incluso Solve high por fracciones — cerca, pero no primero.

Metodo: un bucle Bash, cuatro proyectos

El metodo se mantuvo deliberadamente simple. Un script Bash llama a la CLI de Claude Code para 24 prompts de codigo. Veinte tareas se puntuan hasta 20 puntos por casos limite y rutas imperfectas, dos en PHP, una en Dart Flutter y una en Go. Ademas, un frontend en React TypeScript y un backend en PHP Laravel son evaluados por GPT 5.6 hasta 20 puntos por calidad de codigo. La primera ejecucion termino todas las pruebas en unos dos minutos, la segunda aun mas rapido. La varianza con un solo intento es alta, el autor considera promediar tres intentos en el futuro pero por ahora reporta una sola carrera por coste.

La velocidad y el coste sorprendieron de inmediato. Con Opus 5, tanto medium como high superaban un dolar por prompt incluso con el plan Anthropic de 20 dolares; con Opus 5.5 los 24 prompts completos quedaron por debajo de un dolar. El autor solia gastar tres o cuatro ventanas de cinco horas para probar ambas variantes de Opus 5. Esta vez basto una sola ventana. En redes el modelo se presentaba como nivel Fable pero mas rapido y barato que Opus 5; la primera impresion y los numeros detallados apuntaron en la misma direccion.

Marcador: 20 de 20 en front y back

El detalle de puntuaciones mostro un giro curioso. En la hoja de calculo ambas variantes de Opus 5.5 lado a lado tenian a medium ligeramente por encima de high en calidad de codigo — plausible con un solo intento. Aun asi ambas estaban claramente por encima del techo de 100 puntos de otros; se vieron tres 100 perfectos en seis carreras, promediados y divididos entre cinco para la escala de 20. En promedio de tres intentos medium seguia un poco por delante pero la diferencia era minima, high recuperando ventaja en otros ejes.

La actualizacion del marcador general dejo dos nuevos lideres por encima de GPT-6 Astra. High logro 20 de 20 en los cuatro proyectos. Medium fallo una prueba y firmo 18 de 19 en otra, aun ligeramente por delante en calidad pero detras en total. Comparado con Opus 5 el salto es notable, mucho mas cerca del techo de 60 sobre 60. Es el segundo modelo en superar 20 de 20 tras Astra medium, pero precio y tiempo importan mas. Un post viral defendia que no necesitamos modelos mejores que Fable o Astra sino modelos normales mas baratos — Opus 5.5 encaja justo ahi. Medium promedio 56 centimos por llamada API frente a mas de un dolar por cada variante de Opus 5, e incluso Opus 5.5 high resulto mas barato que Opus 5 medium.

¿Por que mucho mas rapido y barato?

El precio oficial de API es solo un poco mas bajo; el ahorro principal viene de necesitar menos computo, un modelo optimizado para velocidad y coste en conjunto. Fue corroborado por usuarios intensivos que dicen exigir mucho sin apenas afectar limites — se cita a Theo. En tiempos, medium roza dos minutos por peticion, high unos tres, aproximadamente el doble de rapido que Opus 5 y mas veloz que Astra medium; no hay otra entrada por debajo de dos minutos en toda la tabla, salvo Luna low, fuera de clasificacion. El uso en el plan de 20 dolares tambien se aligio: un pico por encima del 100% fue absorbido por un nuevo reinicio en cache, la semana de prueba se quedo en 91% y luego basto con 58% de una segunda ventana, frente a tres o cuatro ventanas para Opus 5. Anthropic tambien elevo oficialmente un 20% los limites de ventana de cinco horas.

La senal de la comunidad coincidio. El autor dice confiar ahora mas en el feedback comunitario que en suites genericas porque arreglar repositorios reales refleja el trabajo diario. Opus 5.5 roza la cima alli, mas barato que Fable, y las redes se llenaron de elogios tipo Halleluja sobre por fin ignorar el tope de uso en Fable. ¿Que papel queda para Fable a su precio premium, o para Sonnet 5 supuestamente mas barato? Sonnet 5 esta mas abajo en la tabla y ni es mucho mas barato ni mucho mejor. La nota de Anthropic es clara: Opus 5.5 es el primero de la familia Claude 5.5, por lo que Sonnet y quizas Haiku o incluso Fable 5.5 podrian llegar pronto. El autor seguira alimentando su benchmark y cubrira GPT-6 Sol y Luna a continuacion, con analisis mas profundos en su sitio AI Coding Dealer.

Visualization: nodesdaily AI
DimensionHallazgo
CalidadHigh 20/20, medium cerca
Velocidad2-3 min/pet., mitad de Opus 5
CosteMedio $0.56, una ventana 5h
ModeloCoste API medioTiempo / Peticion
Opus 5.5 Medium$0.56~2 min
Opus 5.5 High~$0.90~3 min
Opus 5 Medium/High>$1.00~5-6 min

Momentos clave

  1. Apertura — por que 5.5 no 5.1, rumor 5.2 y Fable 5.1
  2. Metodo — 24 tareas, Bash via Cloud Code CLI, reparto 20+2+1+1
  3. Sorpresa — primera vuelta ~2 min, segunda mas rapida, bajo $1
  4. Calidad — React y Laravel juzgados por GPT 5.6 cerca de 100/100
  5. Tabla — high 20/20, doble cima por encima de Astra
  6. Cuenta — 56c vs >$1, prueba Theo y subida 20%
  7. Comunidad — senal de arreglar repos, primera familia 5.5 y que sigue

Comentario de la IA

"Lo que me llama la atencion es que no buscabamos un modelo aun mas caro, sino uno rapido y barato para el dia a dia — Opus 5.5 parece llenar ese hueco."

Evaluación de la IA

En su mejor version, Opus 5.5 ofrece calidad cercana a Fable con velocidad y coste para el dia a dia. Veinticuatro tareas caben en una ventana de cinco horas, por debajo de un dolar, a dos o tres minutos por peticion. La idea no es un modelo mejor sino la misma calidad hecha accesible — y convence.

Los limites son claros. Un solo intento infla la varianza; que medium supere a high probablemente sea azar. El juez es solo GPT 5.6, sin revision humana. La familia sigue incompleta — Sonnet 5 puntua mas bajo, el valor de Fable con prima sigue incierto. Anecdotas como 680.000 lineas migradas en un dia no se generalizan y los tipos de proyecto probados son limitados.

La leccion es eficiencia operativa mas que capacidad bruta. Una pequena rebaja de precio API importa menos que necesitar menos computo en total. Eso se traduce en limites de cinco horas que se sienten mas amplios en uso en equipo. La confianza de la comunidad se desplaza hacia pruebas practicas de arreglar repos en vez de suites genericas; la posicion alta de Opus 5.5 alli es una senal mas fuerte que puntuaciones teoricas.

En la practica, empiece con Opus 5.5 medium para codigo diario y agentes, pruebe high para trabajos criticos. Controle el consumo por ventana; con la subida de limites y el reinicio en cache, espere tres o cuatro veces menos ventanas que con Opus 5. Para decidir sobre Fable, espere a Sonnet y Haiku 5.5; justificar la prima de Fable es dificil ahora.

Fuentes

6 enlaces; 3 de ellos también citados por 10 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

opus 5.5 · claude code · benchmark codigo · precio rendimiento · anthropic

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

Probe Opus 5.5 en 24 tareas de codigo | Nodesdaily