Una predicción de Elon Musk de hace una semana — Grok 4.7 debería estar a la par de Opus 5, no de 5.1 — se encontró con la realidad el 21 de septiembre en un lanzamiento silencioso a igual precio y velocidad que Matthew Berman disecciona. El blog de xAI presenta a Grok 4.7 como su modelo más capaz para código y trabajo de conocimiento : permanece más tiempo en tareas difíciles, revisa mejor su propio trabajo y llega con el stack de salvaguardas mejor calibrado hasta la fecha. Debajo: base más grande , ciclo de refuerzo más largo centrado en tareas de varias horas y comprensión nativa del harness Grok Bot , más mejora en documentos y presentaciones. Tarifa congelada: $2 entrada, $0,50 caché, $6 salida por millón — el doble en variante rápida — y un retraso asumido: el equipo habría penalizado demasiado la longitud de respuesta en RL , el modelo abandona pronto y no se verifica con rigor .
Costo y densidad de inteligencia: cómo leer CursorBench
CursorBench 4.0 mide agentes IDE de largo horizonte y que xAI ahora posea Cursor pesa sobre el gráfico. Berman traza puntaje en Y, costo promedio por tarea en X ; lo ideal está arriba a la derecha. Grok 4.7 pasa de 33% a 46,3% entre low y xhigh , uno de los mayores saltos fuera de GPT-5.6 Soul . En la frontera queda justo detrás de Opus 5 en thinking máximo , pero a cerca de la mitad del costo . Una segunda vista cambia costo por tokens de salida promedio por tarea ; menos es mejor , señal de densidad de inteligencia . Ahí Grok 4.7 casi solapa a Opus 5 ; Fable 5.1 gana en puntaje con presupuesto similar de tokens, pero su precio por token varias veces mayor infla el costo por tarea completada . Mensaje: el puntaje solo no decide; puntaje dividido por factura sí .
El tercer corte del mismo gráfico cuenta pasos por tarea , donde GPT-5.6 Soul luce más eficiente — la impresión vivida de Berman de un modelo que va directo a la solución. Fable 5.1 sigue arriba. La familia Grok es consistente justo detrás de la frontera en pasos y tokens: barata en low, más cara pero más precisa en xhigh. La ficha y la doc de Cursor formalizan la elección: 256k estándar, 500k largo , con x2 en estándar y x3 en rápido por encima de 256k , disparado solo por longitud de entrada . Esa regla convierte una decisión de arquitectura en económica .
En código, DeepSWE v1.1 (DeepSuite) — el mejor proxy del sentimiento ingenieril en producción — muestra Grok 4.7 71%, Soul 72,7%, Fable 5.1 70% ; Grok parece liderar. Berman señala la curaduría : el blog de xAI omite a Astra . Cuando Astra se re-añade, Astra Max 74,1% toma la delantera y la cima real cambia. AA Briefcase (trabajo de oficina multihoras) deja a Grok 4.7 y Fable 5.1 Max empatados, mientras Terminal-Bench 4.0 separa : Grok 38% frente a Fable 57,9% y Astra 58,2% — la destreza en terminal marca la velocidad del agente. Legal invierte la jerarquía: Grok 19,6% domina , sobre herencia familiar ( 4.6 en 15,8% ); Soul 2,5%, Fable 6,7%, Astra 5,4% caen, pero Muse Spark 1.2 con 42% los supera a todos . HealthBench empatado, Electrical Engineering Bench con 66% deja a Grok segundo tras Astra — sin Astra, Grok ganaría. Patrón: cerca de la frontera en oficina y legal, un escalón detrás en terminal y código pesado .
Precio, ventana de contexto y economía de la carrera
xAI construye el precio como un paso por debajo de la frontera más oferta abundante . Grok 4.7 a $2/$6 frente a Opus 5 $5/$25 y Fable 5.1 $10/$50 — ~2× Soul, 5× Fable y Astra . La ficha y Cursor explicitan el multiplicador de ventana larga, pero la lógica es la sobrecapacidad de GPU : xAI sobreinvirtió sin demanda frontera suficiente, así que bajar el precio crea uso . Berman lo enlaza con la nota Gavin Baker : 62% de tokens empresariales en pesos abiertos vs 38% cerrados , porque lo abierto es más barato, más controlable, más privado . Aun así el valor se acumula en OpenAI y Anthropic — un token consume los mismos flops, memoria y watts , el margen migra a la infraestructura . Lección: sin respuesta frontera no hay precio frontera ; algunas industrias pagarán 5× por la mejor respuesta, otras quieren automatización suficiente, barata .
GDPval, Briefcase y el nuevo escudo de seguridad
La prueba de realidad del trabajo de conocimiento son dos tablas Elo: GDPval-AA Fable 1735, Grok 1695, Astra 1542 ; Briefcase Fable 1678, Grok 1657 . Por qué xAI muestra a Astra en GDPval y lo silencia en DeepSWE resulta elocuente — transparente donde fuerte, callado donde débil . El otro titular del blog es la pila de seguridad totalmente nueva : resistencia más fuerte a rechazos y jailbreaks , Q* prompter y liderazgo en doble uso (ciber, bio) para utilidad benigna y rechazo seguro . Cifras: LatchBio biosafety 62,4% arriba , Capabilities 44,5% en xhigh , HackerBench v0.3 deja pasar solo 3,3% de pedidos de riesgo . xAI abre acceso por invitación para socios ciber al red-team. Mecanismo: 11 benches de capacidad (expresión de ARN, epigenómica, variantes, descubrimiento terapéutico) promediados, con BioSecBench-Refusal/Surveillance/Function . Resultado: Grok conserva el saber bio general mientras da un salto capacitivo de doble uso , pero son medidas sin salvaguardas — los filtros de producto van aparte.
La nota de lanzamiento pone a prueba la gran promesa. El post de Elon del 12 de agosto ‘Grok 4.7 superará a todos los modelos actuales’ hoy se lee — cerca de Fable 5 pero no 5.1 — y Berman ve lo muy típico de Elon: plazos agresivos, pronósticos agresivos , sin apostar en su contra a largo plazo. La nota sobre el retraso mantiene el tono: Grok 4.7 necesita unos días más al horno, quizá penalizamos demasiado la longitud u otra cosa en RL — el ‘u otra cosa’ arranca sonrisa, pero el diagnóstico queda: abandono temprano, autoverificación insuficiente . Disponibilidad inmediata: Cursor y Grok Build, más API Grok, harnesses de terceros y routers , identidad grok-4.7 . El hilo de Berman es la competencia: más contendientes, mejor para el usuario ; Grok 4.7 quizá alcance la frontera en 4.8/4.9, pero por ahora está bastante cerca y es notablemente rentable .
La validación externa llega con Artificial Analysis Intelligence Index v4.3.2 : Fable 1º, Astra 2º (empate), Opus 3º, Muse Spark 1.3 Max 48 4º, Grok 4.7 (xhigh) 46 5º — GLM-4.7 y Kimi K3 justo detrás en pesos abiertos. El índice combina diez evaluaciones: Briefcase, GDPval, AutomationBench, Terminal-Bench, SciCode, HLE y más. +2 puntos sobre 4.6 parece modesto, pero +111 Elo en Briefcase a 1657 y +90 en GDPval a 1695 marcan el trabajo agente de largo horizonte. El matiz confirmado: las ganancias llegan con más tokens — ~81k de salida por tarea para 4.7 vs 38k para 4.6, 60k para Muse 1.3, 27k para Astra . Así que el índice solo no cuenta el costo; costo por tarea y velocidad deben leerse juntos . Que 4.7 seleccionado no aparezca en costo por inteligencia mientras 4.6 ronda ~$2.300 para el índice ancla la expectativa de una franja de bajo costo similar para 4.7 .
El apunte de ventana de contexto también pesa: 256k estándar, 500k largo para 4.6/4.7 , 1M para casi toda otra frontera . Invisible por debajo de 250k, decisivo para repos enormes, dosieres legales largos o informes de cientos de páginas . Facturación: hasta 256k a tarifa base, por encima x2 (estándar) o x3 (rápido) — el largo solo depende de la longitud de entrada . Eso liga aritmética de costos y estrategia de contexto : comprimir, trocear o cachear abarata. Ahí la arquitectura se vuelve economía .
Las primeras señales de campo son mixtas pero instructivas. El post de Musk ‘hace una hora xAI queda tercera tras Anthropic y OpenAI en código agéntico’ marca el tono; la demo de Bobby Grok 4.7 vs Kimi K3, tildada de ‘terriblemente mala’ en el video, es matizada por Berman con ajustes y harness . Puentes como Zapier (9.000+ apps, servidor MCP, refs Cursor/Nvidia/Samsung/Dropbox/Shopify, flujo Gmail→Asana) muestran dónde brilla el modelo como palanca precio/rendimiento para el trabajo de conocimiento , no como hype. Balance sobrio: Grok 4.7 no es la frontera absoluta, un peldaño detrás; pero a mitad de precio y misma velocidad convierte el ‘suficientemente bueno’ en ‘altamente racional’ para equipos que automatizan.
Costo por tarea: cima de código
- Grok 4.7$3 avg
- Opus 5$10 avg
- Fable 5.1$15 avg
- Muse 1.3 open~$1.5
| Tema | Estado |
|---|---|
| Precio Grok 4.7 | $2 / $6 misma velocidad, 500K largo |
| Cima de código | DeepSWE 71%, Terminal 38%: detrás |
| Oficina y legal | GDPval 1695, legal 19,6%: cerca frontera |
| Modelo | Entrada / Salida | CursorBench |
|---|---|---|
| Grok 4.7 | $2 / $6 | 46,3% xhigh |
| Opus 5 | $5 / $25 | ~47–48% |
| Fable 5.1 | $10 / $50 | ~52%+ |
| Muse Spark 1.2 | peso abierto | 42% legal |
Momentos clave
Comentario de la IA
"Mi primer reflejo fue no dejarme engañar por la esquina superior derecha. Que Grok 4.7 casi alcance a Opus 5 parece una victoria; decidí filtrar cada gráfico por **coste, densidad de tokens y ventana de contexto**, porque mirar solo el puntaje sin el precio confunde cualquier decisión práctica."
Evaluación de la IA
Defendamos primero el caso alcista: congelar precio y estirar el RL de largo horizonte desplaza de verdad la frontera costo-rendimiento , sobre todo para producción de oficina y legal donde domina la generación larga; para un comprador que optimiza costo por tarea , pagar 5× por ~5 puntos extra de Fable 5.1 puede no ser racional, y el LatchBio 62,4% / HackerBench 3,3% suma filtro de riesgo corporativo.
El límite aparece en método y presentación. xAI posee Cursor — sesgo de selección percibido; quitar a Astra de la tabla DeepSWE refuerza la lectura de selección; la brecha Terminal-Bench de 38% a ~58% pesa para codeo agéntico pesado, y el salto de 38k a 81k tokens infla la factura; el techo 500k vs 1M pesa en dosieres enormes. Algunos puntajes son específicos del harness Grok Build y esperan replicación.
En verificación es mixto pero comprobable: blog x.ai y ficha coherentes en precio, contexto y RL; Artificial Analysis confirma ELO y tokens en medición independiente ( Briefcase 1657, GDPval 1695, ~81k ); llm-stats advierte sobre comparaciones cruzando esfuerzos . Aun así el ‘mejor’ depende de benchmark y harness , y el atípico Muse Spark 42% en legal muestra que un triunfo de nicho no se generaliza.
Lectura práctica selectiva: para equipos con alto volumen de automatización, tolerancia media al error y contextos 256–500k , Grok 4.7 es una palanca notable , quizá campeón precio/rendimiento para legal y documentos . Para codeo agéntico pesado en terminal y profundidad 1M , Fable/Astra/Opus siguen un escalón arriba ; quien necesite la mejor respuesta seguirá pagando 5×. Decida en dólares y densidad de tokens por tarea, no en el marcador .
Fuentes
8 enlaces; 3 de ellos también citados por 6 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Matthew Berman: Did Elon catch up? (Grok 4.7 is here)
- @x.ai https://x.ai/news/grok-4-7
También citado por: The AI Price War: Opus 5.5, GPT-6 Sol and the Quiet Bottleneck of the Agent Era · How OpenAI's Early Self-Improvement Push, DeepSeek's Sandbox Machine and Grok 4.7 Redraw the AI Race · Grok 4.7: Elon's Big Promise Tested on the Leaderboard and the Wallet · Grok 4.7 in Three Heavy Builds: Is One-Fifth the Price Enough Against Fable 5.1 and Astra?
- @media.x.ai https://media.x.ai/v1/website/4p7card-5eccc980.pdf
- @artificialanalysis.ai https://artificialanalysis.ai/articles/benchmarking-grok-4-7
También citado por: The AI Week That Packed World Models, Open Weights and Data Centers Into Orbit
- @llm-stats.com https://llm-stats.com/blog/research/grok-4-7-launch
También citado por: Grok 4.7 Lands: Same Price, Longer Horizons — Field-Tested Across 20 Builds
- @cursor.com https://prod.cursor.com/docs/models/grok-4-7
- @claude.com https://platform.claude.com/docs/en/about-claude/pricing
- @artificialanalysis.ai https://artificialanalysis.ai/models/releases/grok-4-7
grok 4.7 · xai · cursorbench · deepswe · terminal-bench · precio ia · ventana de contexto