Volver al inicio

La guerra de precios de la IA: Opus 5.5, GPT-6 Sol y el silencioso cuello de botella de los agentes

El 22 de septiembre, Anthropic y OpenAI publicaron sus nuevos modelos con cerca de una hora de diferencia. Opus 5.5 cuesta alrededor de un 40 % menos por tarea, y GPT-6 Sol y Luna llegan a la mitad de precio que sus predecesores. Esa misma semana, Gemini Notebook_sumó la conversación en directo, xAI publicó Grok 4.7 y Meta anunció que Muse llega a sus gafas. Los precios se desploman; el cuello de botella real es la confianza y la supervisión en los flujos de agentes.

Importado a Nodesdaily: (UTC+03:00)
Visualization: nodesdaily AI
Ver en YouTube — Q6uuvZmb0t8
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

El 22 de septiembre, dos de los mayores laboratorios de IA publicaron el mismo dia. Anthropic presento Claude Opus 5.5 y OpenAI lanzo GPT-6 Sol y GPT-6 Luna aproximadamente una hora despues. El calendario no fue casual: ambas companias persiguen a los mismos compradores, los profesionales querograman e investigan a diario. Cuatro modelos con precios mas bajos en una sola semana es la senal mas clara de que este mercado ya compite por coste unitario y no por inteligencia bruta.

Empecemos por las cifras. Anthropic afirma que Opus 5.5 cuesta alrededor de un 40 % menos por tarea que Opus 5, y hay dos componentes. Los tokens de entrada y salida bajan de 5 y 25 dolares por millon a 4 y 20 dolares, y el precio de lectura de cache cae de 0,50 a 0,20 dolares. Esta ultima linea es la mas importante, porque la lectura de cache representa la mayor parte del coste en cargas largas de agentes y programacion.

La medida de OpenAI fue un recorte directo de precio. Frente a GPT-5.6 Sol, GPT-6 Sol baja la entrada de 4 a 2 dolares y la salida de 20 a 10 dolares por millon de tokens. GPT-6 Luna pasa de 0,20 a 0,10 dolares en entrada y de 1,20 a 0,50 en salida, una reduccion del 50 % en ambos modelos. La empresa precisa que GPT-6 Astra sigue siendo su modelo mas potente y situa Sol y Luna en cargas de alto volumen sensibles al precio.

El contexto importa mas que cualquiera de los anuncios. Anthropic redujo el precio de su propia gama insignia el mismo dia en que su rival reducia el suyo a la mitad. Simon Willison, observador independiente, describio la secuencia como una guerra de precios clasica, y la llegada de Grok 4.7 a 2 y 6 dolares por millon muestra que la presion es general. Cuando la oferta sigue compitiendo, el comprador gana poder de negociacion y el coste efectivo de la inteligencia baja para todos.

Mas alla del precio, la promesa real de estos modelos no es que sean mas inteligentes, sino que hagan el mismo trabajo con menos computo. Anthropic atribuye la mejora a una menor necesidad de cómputo al servirlo y anuncia una generacion de salida mas de un 30 % mas rapida que Opus 5. OpenAI asocia GPT-6 con una mejor cache de instrucciones, pensada para agentes persistentes que repetirian las mismas llamadas. Aqui la eficiencia deja de ser un eslogan y pasa a ser una decision de infraestructura.

Hay una contrapartida. Un modelo mas pequeño y mas rapido tambien transporta menos contexto. En pruebas descritas por la fuente, Opus 5.5 navegaba por la web con una rapidez inusual pero se mostraba mas debil en ciertas tareas de investigacion. La misma fuente lo considera el mejor modelo para reproducir un tono de escritura, aunque senala que otro modelo se mantuvo ligeramente mejor en diseno. No hay un unico ganador: la tarea decide.

Las pruebas practicas de la misma fuente apuntan en la misma direccion. Al limpiar imagenes en bruto, ambos modelos consumieron alrededor del uno por ciento de una cuota semanal, pero los tiempos se separaron con claridad: unos siete minutos y medio frente a quince minutos y medio. La calidad y la latencia se arbitran modelo a modelo, y una simple tabla de benchmark no refleja bien esa diferencia.

El segundo gran hilo de la semana es Gemini Notebook. Google anuncio conversacion en tiempo real con los cuadernos en su aplicacion movil y resumenes interactivos dentro de los informes. Esos resumenes no son texto plano: combinan infografias, cuestionarios, tarjetas de repaso, mapas mentales y presentaciones en un solo flujo. Los limites de uso tambien pasaron a un sistema basado en computacion el 2 de septiembre, con la opcion de programar la generacion para mas tarde cuando se agota la cuota.

La fuente tambien describe el uso de cuadernos como fuente dentro de Google Docs. Esa capacidad no aparecia en los anuncios oficiales de Google en el momento de preparar este articulo, asi que conviene leerla como una observacion de la fuente y no como una Actualizacion confirmada. Varias funciones de lectura estan igualmente repartidas entre distintos planes y periodos. Las herramientas cambian rapido y las listas de funciones envejecen aun mas rapido.

El tercer hilo viene de xAI. Grok 4.7 salio al mismo precio y a la misma velocidad que su predecesor, con un modelo base mayor y un aprendizaje por refuerzo mas largo. La empresa indica que el modelo fue entrenado para entender de forma nativa su propio arnes de agente y ofrece una ventana de contexto de 500 000 tokens. Las memos de voz y las llamadas de voz para los agentes llegaron la misma semana, tras el anuncio previo de xAI sobre agentes que trabajan en su propio ordenador en la nube.

El cuarto hilo se desplaza al hardware. En su evento Connect, Meta dijo que su agente Muse llegara a sus gafas, con activacion por su nombre y preguntas sobre lo que estas mirando. Tambien presento un modelo solo de audio sin camara, un pequeno dispositivo autonomo para el agente y el objetivo de superar cien estilos de gafas antes de que acabe el ano. Un detalle merece atencion: el dispositivo de bolsillo sigue en desarrollo y sus materiales no son definitivos.

Detras de todo esto hay un hecho economico: los agentes cuestan dinero. Un modelo que razona mejor no aumenta la factura, pero un modelo que da mas pasos si. En tareas largas, las llamadas repetidas, la memoria y el uso de herramientas multiplican el coste de forma horizontal. Por eso estos recortes de precio importan menos como promocion que como cambio de estructura de margen. Un token barato es lo que hace viable el uso intensivo de agentes.

La preocupacion va en sentido contrario. Los modelos mas pequenos y rapidos tambien abaratan una decision equivocada. Si un agente envia el correo equivocado, borra el archivo equivocado o confirma una accion inadecuada, una llamada mas barata no reduce el dano. La unidad de medida relevante ya no es el token sino el coste de verificar una decision. Una cadena que se salta ese paso automatiza un riesgo, no un proceso.

Que conviene hacer en la practica? Evitaria apostar todo a un solo modelo y construiria capas por tipo de tarea. La clasificacion, el enrutamiento y la puntuacion cortas y de alto volumen funcionan bien con modelos rapidos y economicos. El trabajo largo y sensible exige un modelo potente, un registro de auditoria y la posibilidad de revertir. La otra leccion de la semana es metodologica: comparar precio y velocidad sin medir calidad induce a error. Ejecutar la misma tarea en tres modelos y comparar los resultados a ciegas deja al menos un registro transparente.

La semana no designa un unico ganador: produce un mercado en el que tres empresas recortan precios en la misma direccion. Opus 5.5 reduce el coste por tarea y lidera en contexto largo, GPT-6 Sol y Luna apuntan a volumenes sensibles al precio, y Grok 4.7 se integra en su propio arnes de agentes. La bajada del precio de los tokens es una condicion de la economia de agentes. Por si sola no justifica una automatizacion que nadie verifica.

Precio de salida por millon de tokens

  • Grok 4.76 $
  • GPT-6 Sol10 $
  • GPT-5.6 Sol20 $
  • Opus 5.520 $
  • Opus 525 $
Tarifa de salida; con la misma carga, el coste escala con el volumen de salida.
CriterioOpus 5.5GPT-6 SolGrok 4.7
Entrada ($/M tokens)422
Salida ($/M tokens)20106
Ventana de contextoFoco en contexto largo1,05 M tokens500 mil tokens
PosicionamientoTareas largasUso generalSu propio arnes de agente
Cambio frente a la version previa40 % mas barato50 % mas baratoMismo precio y velocidad

Momentos clave

  1. Dos lanzamientos el mismo dia
  2. Prueba grafica con tres modelos
  3. Tiempos de edicion comparados
  4. Pequeno dispositivo autonomo

Comentario de la IA

"La verdadera noticia de la semana no es el numero de modelos sino la caida a la mitad del coste unitario. Conseguir la misma capacidad con menos tokens cambia directamente los presupuestos de infraestructura. Pero abaratar no basta: en los flujos de agentes la pregunta decisiva es quien paga cuando una decision es erronea."

Evaluación de la IA

La afirmacion mas fuerte es la de la guerra de precios, y resiste la verificacion: la tabla de tarifas de Anthropic, el recorte del 50 % de OpenAI y la lectura de un observador independiente apuntan en la misma direccion. Pero la cifra del 40 % es una medicion de la empresa en sus propias condiciones. La investigacion con contexto largo, el codigo sobre varios archivos y el uso intensivo de herramientas pueden dar otra razon, asi que conviene leerla como un escenario del proveedor y no como una ley general.

Lo que falta es la confirmacion independiente de que los modelos hacen el mismo trabajo con la misma calidad. Las comparaciones descritas son mediciones de una sola persona sobre un unico flujo de trabajo. Contextos de distinta longitud, distintos idiomas y proyectos largos pueden invertir el resultado. Un modelo que gana en tareas cortas puede perder en las largas, asi que la eleccion debe apoyarse en mediciones propias.

Tambien cabe una contraargumentacion equitable. Los recortes pueden venir de una competencia real, pero su duracion se desconoce. Las empresas pueden absorber perdidas unitarias mediante depreciacion acelerada o precios temporales. Revisar las paginas de precios y los contratos en el momento de decidir importa mas que cualquier cifra de este articulo. Para equipos comprometidos a largo plazo, las cuotas y las garantias de latencia son un criterio mas seguro que el precio de escaparate.

Mi Conclusion practica es sencilla: clasifica primero el trabajo. Da las decisiones cortas y repetitivas a modelos rapidos y economicos. Ejecuta el trabajo largo y dificil de revertir con modelos mas potentes, registra cada paso y mantén la validacion humana. Lee la bajada de precios como un presupuesto de verificacion y no como un regalo: una llamada mas barata no hace mas barato un error, solo hace que quepan mas errores.

Fuentes

9 enlaces; 6 de ellos también citados por 20 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

inteligencia artificial · precios de modelos · agentes · coste de tokens · nodedaily

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…