Volver al inicio

Reset del tier list de IA: GPT-6 Astra toma la corona mientras el cálculo de suscripciones reescribe los puestos

Avenox actualiza su tier list de IA con GPT-6 Astra en la cima, el cálculo de suscripciones decidiendo la mayoría de los tiers, y los modelos locales abiertos más los harnesses obteniendo sus propias escalas.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — djlec83pVoU
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Avenox presenta esto como un video de actualización, no un ranking frío. El formato mezcla orden con notas de contexto y juicios personales, lo que importa porque docenas de modelos nuevos llegaron de golpe y un simple tablero de S a D escondería el razonamiento.

GPT-5.6 Luna mantiene el tier S en precio-rendimiento. Una membresía de 20 dólares se comporta como uso casi ilimitado, valiendo cientos de dólares en gasto medido, así que los usuarios sensibles al presupuesto obtienen la mejor oferta aquí. Un GPT-6 Luna en camino solo refuerza el argumento de quedarse en esta vía.

Terra baja a C mientras Sol sube a S, con una corrección adjunta. Terra cuesta unas diez veces Luna sin justificar esa brecha, mientras que el precio mostrado de Sol estaba mal y ronda los 30 dólares en salida. El camino de actualización esperado de Sol junto a Astra lo devuelve al tier superior.

Claude Fable 5.1, es decir la última línea Fable, sigue en S pese a las quejas de coste y cuota. Toda la serie se lee consistente de arriba abajo, y la calidad del modelo supera el dolor de precios en este relato.

DeepSeek 4.1 Flash aterriza en A tras una subida de precio. La tarificación en horas pico toca la banda de 1,2 dólares y la baratura de la era Pro se acabó. Frente a una suscripción Luna que vale 300 a 400 dólares de uso de API, DeepSeek puede costar a su público base hasta treinta veces más, aunque el laboratorio sigue mereciendo respeto.

GLM 5.3 Flash toma S por precio más lógica de suscripción. Los créditos de API medidos rara vez deciden los costes reales, y una vía de suscripción lo hace mucho más barato en la práctica. MiMo cae a C por anticuado incluso para limpieza masiva barata, mientras que Gemini 3.8 Flash conserva B por velocidad y visualización de video frente a un tool calling débil y alucinaciones frecuentes.

MiniMax M3 se asienta en B como adecuado sin emoción. Un tier gratuito en OpenRouter más apps baratas y un ecosistema creciente ayudan a estudiantes y trabajo diario ligero. La duda es prospectiva, con las líneas Claude y GPT esperadas para crecer más, más una revelación de que ninguna empresa patrocina el canal salvo una conversación en curso con Kimi. Meta Muse Spark 1.3 Contributor sigue como la opción de API barata a diez o veinte centavos con compartición de datos, sensato sobre todo bajo 20 dólares de uso mensual, exactamente como se predijo dos meses antes.

Sonnet 5 pasa de B a A con un recorte hacia el nivel de 10 dólares. A seis o siete dólares sería S, porque el modelo en sí está bien y solo el precio estaba mal. A precio de Terra, Sonnet gana siempre. Opus 5 sigue siendo una S permanente como serie diaria favorita por rango y modales, mientras que Kimi K3 entra en S por pesos abiertos, autoalojamiento empresarial sin fuga de datos, un plan de 200 dólares bien valorado y tres billones de parámetros. La pieza que falta es una línea Kimi más pequeña para agentes subordinados en la banda de uno a dos dólares.

Grok 4.6 toma A por precio, ecosistema y ventajas del lado de Cursor. Las ejecuciones largas sin supervisión aún no inspiran la misma confianza que Astra, Fable o Kimi. Hy4 Preview es un C sin historia, Nemotron una D directa, y GLM 5.3 repite en S. El problema de DeepSeek es ahora una competencia saturada de Luna, Muse Spark a un sexto de su precio, y GLM Flash hasta que lance su propia suscripción.

GPT-6 Astra reclama el asiento superior y, en este relato, el título de mejor modelo hasta ahora. La lectura de escenas tridimensionales, la detección de detalles finos, el seguimiento de reglas, un razonamiento sólido y ningún recorte de cuota a mitad de plan sostienen el argumento. Los estilos de trabajo difieren, así que algunos usuarios pueden discrepar, y chatear sigue siendo más agradable en Fable. El lanzamiento se lee incluso como un daño para la IPO de Anthropic, con un nuevo Opus o un Fable más grande esperados pronto.

Los modelos locales abiertos obtienen su propia escala. Qwen Max se sitúa en B mientras los pequeños Qwen locales 35B y 27B saltan a S para uso sin conexión, fine-tuning de bancos y aseguradoras, y trabajo que no debe filtrar datos. Gemma 4 31B sube por calidad ajustada al tamaño, muy por delante del propio Gemini. Gemini 3.1 Pro es C, y Mistral es A solo porque Europa no tiene otro comprador para los bancos; los pesos solos serían D.

El ranking de harnesses empieza con Antigravity en B, subido desde D por el acceso gratuito y la disponibilidad de Opus antiguos pese a los renombrados constantes. Claude Code sube de B a A por control remoto, mensajería agente-a-agente y cambios de esfuerzo a mitad de tarea que ya no revientan la caché, con una buena relación precio-cupo hasta que bajen los límites. Codex es una S directa en un plan cerrado de 200 dólares con cupos generosos y reinicios, usable dentro de Hermes Agent y otros agentes, más un navegador y uso de computadora que configuró Cloudflare y el correo de Workspace y construyó un sitio con arrastrar y soltar. Cursor pasa a A por infraestructura sólida y cupos crecientes tras el acuerdo con SpaceX, con calidad Grok y un equipo que entiende los harnesses.

Hermes Agent es S como asistente personal más que codificador puro, ejecutado en un servidor y manejado desde Telegram, presentado como capaz de automatizar gran parte del trabajo de servicios de startups. Pi agent comparte la zona alta por simplicidad y adaptabilidad, con OMP como su gemelo del lado cliente de un desarrollador turco que resuelve problemas similares. OpenCode es B porque el harness se siente como una app pretendiendo ser una terminal, Kilo Code y Cline son tiers C envejecidos, Devin es D, Windsurf queda sin clasificar por falta de uso, y GitHub Copilot es D con cupos en contracción.

Los modelos de medios cierran el tablero. ElevenLabs es S sin rival real, Veo 3 es B porque Seedance abrió una brecha visible, aunque Veo aún puede liderar en prompts turcos y cuesta menos; una anécdota de e-commerce tiene a un usuario cambiando a Seedance y quedándose ahí. Nano Banana 2 baja a B mientras GPT Image 2.5 toma la delantera en calidad, precio y actualizaciones, usado aquí dentro de Codex bajo control de Astra. GPT Image 2.5 es S, Suno es S como el creador de música sin igual, Seedance 2.5 es S en una liga de campeones propia, Gemini Embedding 2 es S por la indexación conjunta de video, audio y texto que simplifica el RAG, y los embeddings de Qwen están en B. El cálculo final es personal: 400 dólares al mes en Claude Code más Codex podrían reducirse a un tercio o un cuarto con 95 a 97 por ciento de calidad, pero el trabajo de orquestación más una brecha de calidad de cinco a diez por ciento hace que pagar más sea la elección racional para producción intensiva y la equivocada para estudiantes.

Visualization: nodesdaily AI

Comentario de la IA

""Veo esta actualización como un registro precio-rendimiento más que un ranking de capacidades, y en ese registro el cálculo de suscripciones ahora supera las puntuaciones brutas de benchmark.""

Evaluación de la IA

La objeción más fuerte a este tier list es que pone precio a la pila de suscripciones de una sola persona, no a los modelos en el vacío. Los planes de IA de tarifa plana ya se doblan bajo las cargas de agentes, con proveedores recortando cupos en silencio y GitHub Copilot pasando a uso medido. Si el cálculo de todo-lo-que-quieras a 20 dólares se rompe, varios tiers S fijados por la generosidad de las suscripciones necesitarían un recuento.

Lo que el video no muestra es el método: sin conjunto de pruebas fijo, sin duraciones, sin ejecuciones repetidas. Los precios citados aquí cambian cada hora, desde las ventanas pico de DeepSeek hasta un recorte del 75 por ciento en lecturas de caché de Fable y una cifra por tarea cercana a nueve centavos en GLM Flash. Trato cada número de abajo como una instantánea de septiembre y lo verifico antes de cualquier decisión de compra.

La procedencia importa en dos afirmaciones. La conversación de patrocinio con Kimi se revela como una conversación, no un acuerdo, y la afirmación de 2,8 billones de parámetros en pesos abiertos necesita pruebas independientes; las reseñas externas llaman a K3 la opción de pesos abiertos más capaz pero también la más cara y lenta de ellas. El veredicto de Seedance llega mientras los estudios amenazan abiertamente con demandas por las imágenes de entrenamiento, así que mantengo el elogio a la calidad de video separado del riesgo legal.

Para mi propia pila, la división es simple. Si facturara menos de 20 dólares al mes de uso medido, viviría de suscripciones tipo Luna más modelos locales Qwen o Gemma para datos privados. Como mi trabajo paga ejecuciones sostenidas de agentes, Codex más Claude Code se justifica, con Kimi K3 como puerta de escape de pesos abiertos y Seedance más ElevenLabs solo para trabajos de video pagados.

Fuentes

10 enlaces; 5 de ellos también citados por 24 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

tier list · astra · precio/rendimiento

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…