Volver al inicio

Grok 4.7 ha llegado: ¿Cumplió Elon? A mitad de precio, a un paso de la frontera

Publicado en silencio el 21 de septiembre al **mismo precio y velocidad**, **Grok 4.7** de xAI se somete en el análisis de Matthew Berman a la predicción de Elon Musk de paridad con Opus 5; el salto del **33% al 46,3% en CursorBench 4.0**, **71% en DeepSWE**, **38% en Terminal-Bench 4.0** y **19,6% en Legal** explica su **quinto puesto** tras Fable 5.1 y Astra, mientras rompe el **coste por tarea** a **$2 / $6**.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — MJllZbpvrAc
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Una predicción de Elon Musk de hace una semana — Grok 4.7 debería estar a la par de Opus 5, no de 5.1 — se encontró con la realidad el 21 de septiembre en un lanzamiento silencioso a igual precio y velocidad que Matthew Berman disecciona. El blog de xAI presenta a Grok 4.7 como su modelo más capaz para código y trabajo de conocimiento : permanece más tiempo en tareas difíciles, revisa mejor su propio trabajo y llega con el stack de salvaguardas mejor calibrado hasta la fecha. Debajo: base más grande , ciclo de refuerzo más largo centrado en tareas de varias horas y comprensión nativa del harness Grok Bot , más mejora en documentos y presentaciones. Tarifa congelada: $2 entrada, $0,50 caché, $6 salida por millón — el doble en variante rápida — y un retraso asumido: el equipo habría penalizado demasiado la longitud de respuesta en RL , el modelo abandona pronto y no se verifica con rigor .

Costo y densidad de inteligencia: cómo leer CursorBench

CursorBench 4.0 mide agentes IDE de largo horizonte y que xAI ahora posea Cursor pesa sobre el gráfico. Berman traza puntaje en Y, costo promedio por tarea en X ; lo ideal está arriba a la derecha. Grok 4.7 pasa de 33% a 46,3% entre low y xhigh , uno de los mayores saltos fuera de GPT-5.6 Soul . En la frontera queda justo detrás de Opus 5 en thinking máximo , pero a cerca de la mitad del costo . Una segunda vista cambia costo por tokens de salida promedio por tarea ; menos es mejor , señal de densidad de inteligencia . Ahí Grok 4.7 casi solapa a Opus 5 ; Fable 5.1 gana en puntaje con presupuesto similar de tokens, pero su precio por token varias veces mayor infla el costo por tarea completada . Mensaje: el puntaje solo no decide; puntaje dividido por factura sí .

El tercer corte del mismo gráfico cuenta pasos por tarea , donde GPT-5.6 Soul luce más eficiente — la impresión vivida de Berman de un modelo que va directo a la solución. Fable 5.1 sigue arriba. La familia Grok es consistente justo detrás de la frontera en pasos y tokens: barata en low, más cara pero más precisa en xhigh. La ficha y la doc de Cursor formalizan la elección: 256k estándar, 500k largo , con x2 en estándar y x3 en rápido por encima de 256k , disparado solo por longitud de entrada . Esa regla convierte una decisión de arquitectura en económica .

En código, DeepSWE v1.1 (DeepSuite) — el mejor proxy del sentimiento ingenieril en producción — muestra Grok 4.7 71%, Soul 72,7%, Fable 5.1 70% ; Grok parece liderar. Berman señala la curaduría : el blog de xAI omite a Astra . Cuando Astra se re-añade, Astra Max 74,1% toma la delantera y la cima real cambia. AA Briefcase (trabajo de oficina multihoras) deja a Grok 4.7 y Fable 5.1 Max empatados, mientras Terminal-Bench 4.0 separa : Grok 38% frente a Fable 57,9% y Astra 58,2% — la destreza en terminal marca la velocidad del agente. Legal invierte la jerarquía: Grok 19,6% domina , sobre herencia familiar ( 4.6 en 15,8% ); Soul 2,5%, Fable 6,7%, Astra 5,4% caen, pero Muse Spark 1.2 con 42% los supera a todos . HealthBench empatado, Electrical Engineering Bench con 66% deja a Grok segundo tras Astra — sin Astra, Grok ganaría. Patrón: cerca de la frontera en oficina y legal, un escalón detrás en terminal y código pesado .

Precio, ventana de contexto y economía de la carrera

xAI construye el precio como un paso por debajo de la frontera más oferta abundante . Grok 4.7 a $2/$6 frente a Opus 5 $5/$25 y Fable 5.1 $10/$50 — ~2× Soul, 5× Fable y Astra . La ficha y Cursor explicitan el multiplicador de ventana larga, pero la lógica es la sobrecapacidad de GPU : xAI sobreinvirtió sin demanda frontera suficiente, así que bajar el precio crea uso . Berman lo enlaza con la nota Gavin Baker : 62% de tokens empresariales en pesos abiertos vs 38% cerrados , porque lo abierto es más barato, más controlable, más privado . Aun así el valor se acumula en OpenAI y Anthropic — un token consume los mismos flops, memoria y watts , el margen migra a la infraestructura . Lección: sin respuesta frontera no hay precio frontera ; algunas industrias pagarán 5× por la mejor respuesta, otras quieren automatización suficiente, barata .

GDPval, Briefcase y el nuevo escudo de seguridad

La prueba de realidad del trabajo de conocimiento son dos tablas Elo: GDPval-AA Fable 1735, Grok 1695, Astra 1542 ; Briefcase Fable 1678, Grok 1657 . Por qué xAI muestra a Astra en GDPval y lo silencia en DeepSWE resulta elocuente — transparente donde fuerte, callado donde débil . El otro titular del blog es la pila de seguridad totalmente nueva : resistencia más fuerte a rechazos y jailbreaks , Q* prompter y liderazgo en doble uso (ciber, bio) para utilidad benigna y rechazo seguro . Cifras: LatchBio biosafety 62,4% arriba , Capabilities 44,5% en xhigh , HackerBench v0.3 deja pasar solo 3,3% de pedidos de riesgo . xAI abre acceso por invitación para socios ciber al red-team. Mecanismo: 11 benches de capacidad (expresión de ARN, epigenómica, variantes, descubrimiento terapéutico) promediados, con BioSecBench-Refusal/Surveillance/Function . Resultado: Grok conserva el saber bio general mientras da un salto capacitivo de doble uso , pero son medidas sin salvaguardas — los filtros de producto van aparte.

La nota de lanzamiento pone a prueba la gran promesa. El post de Elon del 12 de agosto ‘Grok 4.7 superará a todos los modelos actuales’ hoy se lee — cerca de Fable 5 pero no 5.1 — y Berman ve lo muy típico de Elon: plazos agresivos, pronósticos agresivos , sin apostar en su contra a largo plazo. La nota sobre el retraso mantiene el tono: Grok 4.7 necesita unos días más al horno, quizá penalizamos demasiado la longitud u otra cosa en RL — el ‘u otra cosa’ arranca sonrisa, pero el diagnóstico queda: abandono temprano, autoverificación insuficiente . Disponibilidad inmediata: Cursor y Grok Build, más API Grok, harnesses de terceros y routers , identidad grok-4.7 . El hilo de Berman es la competencia: más contendientes, mejor para el usuario ; Grok 4.7 quizá alcance la frontera en 4.8/4.9, pero por ahora está bastante cerca y es notablemente rentable .

La validación externa llega con Artificial Analysis Intelligence Index v4.3.2 : Fable 1º, Astra 2º (empate), Opus 3º, Muse Spark 1.3 Max 48 4º, Grok 4.7 (xhigh) 46 5º — GLM-4.7 y Kimi K3 justo detrás en pesos abiertos. El índice combina diez evaluaciones: Briefcase, GDPval, AutomationBench, Terminal-Bench, SciCode, HLE y más. +2 puntos sobre 4.6 parece modesto, pero +111 Elo en Briefcase a 1657 y +90 en GDPval a 1695 marcan el trabajo agente de largo horizonte. El matiz confirmado: las ganancias llegan con más tokens — ~81k de salida por tarea para 4.7 vs 38k para 4.6, 60k para Muse 1.3, 27k para Astra . Así que el índice solo no cuenta el costo; costo por tarea y velocidad deben leerse juntos . Que 4.7 seleccionado no aparezca en costo por inteligencia mientras 4.6 ronda ~$2.300 para el índice ancla la expectativa de una franja de bajo costo similar para 4.7 .

El apunte de ventana de contexto también pesa: 256k estándar, 500k largo para 4.6/4.7 , 1M para casi toda otra frontera . Invisible por debajo de 250k, decisivo para repos enormes, dosieres legales largos o informes de cientos de páginas . Facturación: hasta 256k a tarifa base, por encima x2 (estándar) o x3 (rápido) — el largo solo depende de la longitud de entrada . Eso liga aritmética de costos y estrategia de contexto : comprimir, trocear o cachear abarata. Ahí la arquitectura se vuelve economía .

Las primeras señales de campo son mixtas pero instructivas. El post de Musk ‘hace una hora xAI queda tercera tras Anthropic y OpenAI en código agéntico’ marca el tono; la demo de Bobby Grok 4.7 vs Kimi K3, tildada de ‘terriblemente mala’ en el video, es matizada por Berman con ajustes y harness . Puentes como Zapier (9.000+ apps, servidor MCP, refs Cursor/Nvidia/Samsung/Dropbox/Shopify, flujo Gmail→Asana) muestran dónde brilla el modelo como palanca precio/rendimiento para el trabajo de conocimiento , no como hype. Balance sobrio: Grok 4.7 no es la frontera absoluta, un peldaño detrás; pero a mitad de precio y misma velocidad convierte el ‘suficientemente bueno’ en ‘altamente racional’ para equipos que automatizan.

Visualization: nodesdaily AI

Costo por tarea: cima de código

  • Grok 4.7$3 avg
  • Opus 5$10 avg
  • Fable 5.1$15 avg
  • Muse 1.3 open~$1.5
Promedio $/MTok; factura real según tokens y pasos.
TemaEstado
Precio Grok 4.7$2 / $6 misma velocidad, 500K largo
Cima de códigoDeepSWE 71%, Terminal 38%: detrás
Oficina y legalGDPval 1695, legal 19,6%: cerca frontera
ModeloEntrada / SalidaCursorBench
Grok 4.7$2 / $646,3% xhigh
Opus 5$5 / $25~47–48%
Fable 5.1$10 / $50~52%+
Muse Spark 1.2peso abierto42% legal

Momentos clave

  1. Apuesta Elon: paridad Opus 5
  2. CursorBench 46,3% vs 33% salto
  3. DeepSWE 71% y regreso Astra
  4. Terminal 38% vs 58% brecha
  5. Legal 19,6% y Muse Spark 42%
  6. Precio y abierto 62%
  7. GDPval 1695 y escudo

Comentario de la IA

"Mi primer reflejo fue no dejarme engañar por la esquina superior derecha. Que Grok 4.7 casi alcance a Opus 5 parece una victoria; decidí filtrar cada gráfico por **coste, densidad de tokens y ventana de contexto**, porque mirar solo el puntaje sin el precio confunde cualquier decisión práctica."

Evaluación de la IA

Defendamos primero el caso alcista: congelar precio y estirar el RL de largo horizonte desplaza de verdad la frontera costo-rendimiento , sobre todo para producción de oficina y legal donde domina la generación larga; para un comprador que optimiza costo por tarea , pagar 5× por ~5 puntos extra de Fable 5.1 puede no ser racional, y el LatchBio 62,4% / HackerBench 3,3% suma filtro de riesgo corporativo.

El límite aparece en método y presentación. xAI posee Cursor — sesgo de selección percibido; quitar a Astra de la tabla DeepSWE refuerza la lectura de selección; la brecha Terminal-Bench de 38% a ~58% pesa para codeo agéntico pesado, y el salto de 38k a 81k tokens infla la factura; el techo 500k vs 1M pesa en dosieres enormes. Algunos puntajes son específicos del harness Grok Build y esperan replicación.

En verificación es mixto pero comprobable: blog x.ai y ficha coherentes en precio, contexto y RL; Artificial Analysis confirma ELO y tokens en medición independiente ( Briefcase 1657, GDPval 1695, ~81k ); llm-stats advierte sobre comparaciones cruzando esfuerzos . Aun así el ‘mejor’ depende de benchmark y harness , y el atípico Muse Spark 42% en legal muestra que un triunfo de nicho no se generaliza.

Lectura práctica selectiva: para equipos con alto volumen de automatización, tolerancia media al error y contextos 256–500k , Grok 4.7 es una palanca notable , quizá campeón precio/rendimiento para legal y documentos . Para codeo agéntico pesado en terminal y profundidad 1M , Fable/Astra/Opus siguen un escalón arriba ; quien necesite la mejor respuesta seguirá pagando 5×. Decida en dólares y densidad de tokens por tarea, no en el marcador .

Fuentes

8 enlaces; 3 de ellos también citados por 6 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

grok 4.7 · xai · cursorbench · deepswe · terminal-bench · precio ia · ventana de contexto

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

Grok 4.7 ha llegado: ¿Cumplió Elon? | Nodesdaily