Volver al inicio

Grok 4.7 en tres builds exigentes: ¿basta un quinto del precio frente a Fable 5.1 y Astra?

La prueba en un solo intento de Pat Simmons (**4474 palabras**) pone a prueba la promesa de **Grok 4.7** — rival real de Fable 5.1 y Astra mucho más barato — con tres builds pesados: **clon píxel Awwwards, página 3D de teclado con scroll y Mario Kart Rainbow Road**. Con **46% vs 51,6% en CursorBench**, **71% vs 70% / 72,7% en DeepSuite**, **$2 / $6 vs $10 / $50** por millón y **$7 vs $123 / $97** por build, la hoja revela dónde lo barato no alcanza en código pesado.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — x48xbDO6fKo
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

xAI abre con que Grok 4.7 es un rival real de Fable y Astra por mucho menos dinero , y Pat Simmons decide verificarlo en un solo cuadro con tres builds pesados. El montaje es directo: los mismos tres prompts se disparan a la vez en tres modelos — clonar un ganador de Awwwards píxel a píxel, levantar una página de producto 3D con scroll para un teclado mecánico y clonar Mario Kart en Rainbow Road — y el marcador es triple: cuánto tardó, cuánto costó y cuántos tokens quemó . La promesa del video es mostrar si una brecha de cinco veces en precio realmente cierra la calidad de build o solo abarata la tabla. Regla de un solo intento desde el inicio; ningún modelo recibe revisión.

De la nota de prensa a los tableros: qué dicen CursorBench y la factura

El primer acto recapitula la escueta nota de prensa. En el gráfico CursorBench 4.0 el eje Y es éxito, el X costo promedio por tarea; la esquina ideal es arriba a la derecha. Fable 5.1 en extra-high 51,6%, Grok 4.7 en su máximo esfuerzo ~46% — dentro de cuatro puntos — pero el carril precio se invierte: Grok 4.7 extra-high $2 entrada / $6 salida por millón, Fable y Astra $10 / $50 . Simmons subraya que, aun con puntajes cercanos, el costo por tarea completada se inclina claramente hacia Grok, de ahí la etiqueta de ‘con mucho el más barato’. Queda a pie de gráfico una nota honesta: xAI ahora posee Cursor , así que la tabla carga una percepción de sesgo ; y GBT6 Astra falta en la tabla CursorBench 4.0 , la comparación se presenta selectiva.

La segunda capa alinea puntajes titulares. En DeepSuite Grok 4.7 71%, Fable 5.1 70%, GPT-5.6 Soul 72,7% — Grok luce un poco por delante en sensación de ingeniería, al menos en el recorte que elige la nota. Luego el trabajo de oficina multihoras (tipo AA Briefcase) corre parejo entre Fable, Soul y Grok; el benchmark de agente legal Harvey muestra a Grok sólido, y el razonamiento clínico también coloca a Grok 4.7 por encima de su predecesor 4.6 y cerca de la línea Soul/5.1 . Simmons lee la nota como deliberadamente brillante en trabajo de conocimiento fuera de código mientras esconde el reverso: tablas pesadas en terminal como Terminal-Bench invierten la imagen , lo que su slide de cierre hace explícito — muchas filas donde Grok supera a Fable/Astra en oficina y legal conviven con la nota de que solo AutomationBench deja a Astra unos puntos por delante .

Método: tres prompts, un intento y el banco clone-app pro

El método de Simmons es deliberadamente escueto: un solo comando bash lanza los tres builds en tres modelos a la vez . Cada texto de prompt se compartirá en el post. La pista común es one-shot — sin segundo intento — lo que excluye la realidad de que la iteración cerraría brechas en uso diario , pero captura la foto cruda de la frontera . La cadena de herramientas es estándar: para el clon Awwwards se carga la skill clone-app-pro — recorrer el código, tomar capturas, bucles de QA — de modo que gusto, navegación, visión y seguimiento de instrucciones se prueban juntos. El final es una revelación a ciegas : las columnas A/B/C se abren una por una y se emparejan con sus dueños, con costo y tiempo escritos al lado.

El prompt del primer build es corto pero exigente: ve a Awwwards, elige un sitio ganador que genuinamente te parezca impresionante y reconstrúyelo píxel por píxel; carga la skill clone-app-pro, haz QA de tu propio trabajo con capturas. Simmons dice que esto sondea directamente el gusto — qué encuentra impresionante el modelo, si la elección es genérica o distintiva — seguido de navegar el sitio, percibir lo visual, cargar correctamente la skill y construir la web . Los requisitos son mínimos; el arte está en cuán fielmente el modelo restituye un lenguaje premiado existente en lugar de inventar desde el vacío. Cada modelo recibe el mismo brief; la divergencia nace en la generación de assets y el acarreo de animación .

Clon Awwwards: tres gustos distintos, del ASI al grid mínimo

La columna ciega A se abre como sitio corporativo de reclutamiento ASI : encabezado ‘ reclutando ingenieros, investigadores cuantitativos y científicos de ML para firmas que mueven mercados ’, lema ‘construyendo herramientas desde 2006’ , logos aleatorios dispersos, caja de búsqueda muerta, bloques construidos en SVG y reveals escalonados al scroll — desordenado pero con paleta equilibrada. La columna B elige el lenguaje portfolio-agencia Boach Studio / Club Road Coco : filtros Art direction / Brand identity / Campaign , tarjetas como Post Code Football Club , pesados placeholders SVG , a veces una sola línea que recuerda año/idioma en lugar de consent — Simmons anota ‘ habría querido skills de generación de imagen ’. La columna C rompe la rutina de agencia con el experimento tipográfico de grilla Minimal de Wim Crouwel — relato ‘ empezar con un cuadrado, programar un alfabeto entero en una grilla mínima ’, grillas que siguen moviéndose al hacer scroll , una larga lección en página única. Esta tercera es la favorita de Simmons; su longitud y arco pedagógico ganan puntos extra.

El cruce con referencias afila la tabla. Para la página ASI Grok eligió el video ‘Visit site’ de Box Studio en Awwwards — parecido lejano más allá del acarreo de animación de scroll; donde faltaban assets se esperaba que los generara , se queda confinado a bloques en movimiento. Para Aspen Search la salida de Fable cae muy cerca del sitio real — faltan animaciones parciales pero lo bastante cerca para confundir real y clon , entradas de bloque y franja de partners casi idénticas. Para la grilla Minimal , la elección de Astra es la ganadora neta : acarrear movimiento y grilla desde capturas supera a los rellenos SVG de los otros dos. La factura cifra el gusto: Fable 5.1 $123 (cerca de 90M de entrada / 1M de salida, ~4000 s), Astra $97, Grok 4.7 $7 (~300 s) — la etiqueta al final del primer build se pega a Grok: barato pero rezagado en gusto y fidelidad de píxel .

Escena teclado: un 3D que se arma y explota al hacer scroll

El segundo build es la variante teclado de la página anterior de reloj premium : página de producto de lujo en un solo scroll para teclado mecánico con modelo 3D en tiempo real al centro — al hacer scroll el modelo se arma, explota en piezas y se anota , además debe responder al tecleo . El brief es breve: teclado mecánico premium, 3D en tiempo real, todo pilotado por scroll, interacción de tecleo, test a página completa . Simmons recorre cada salida con prueba de tecleo y prueba de scroll ; sonido del plano de tecleo, tono y textura entran en notas. La expectativa no es solo el 3D sino cómo el 3D se siente incrustado en la web — la animación de scroll haciéndolo pertenecer a la página.

La columna uno abre con blueprint azul y fase de explosión ; las etiquetas se solapan por momentos pero las piezas se juntan a medida que el scroll acelera, detalles resorte y lámina de contacto dorada en su sitio, con ocasionales glitches de transición rápida y una tecla que atraviesa el tablero . La textura resorte de acero y oro funciona, nota ‘ 4 mm abajo, listo ’ y línea ‘ Less clutter, more character ’ acompañan, con sonido de tecleo generado y añadir al carrito cerrando la página. La columna dos toma delantera con mejor 3D, scroll fluido y etiquetas colocadas correctamente : interacción ‘ escribe con tu teclado — escribe algo ’, capa spec Physical Vapor Deposition (no laca, no se destiñe ni se astilla) y presentación más controlada del detalle de tecla ; ninguna pieza se mueve cuando el modelo se recompone al final. La columna tres intenta una lectura distinta con una textura de periódico dibujada a mano ; el 3D llega tarde, más ralo y menos complejo , etiquetas correctas pero ralas , la tecla brota agresiva y el componente carrito falta .

Poner costo y carga lado a lado endurece la tabla. Fable 5.1: $58 (24M de entrada, 692k de salida, ~869 s) — referencia para puntaje y fluidez. Grok 4.7: ~$5 pero carrera mucho más larga y más tokens , salida 3D simple y menos fluida . Astra: ~$5 y calidad cercana a Fable pero mucho más eficiente — de ahí la línea de Simmons ‘ Astra, no tan bueno como Fable pero increíblemente eficiente ’. El ganador aquí sigue siendo la línea Fable/Astra , el perdedor Grok ; la brecha está en la incapacidad del modelo para cargar 3D pesado en un intento y dominar la física de scroll . La etiqueta barata se queda en Grok, la calidad se reparte entre Fable y Astra .

Prism Kart y Rainbow Road: el examen de física

El tercer build es un clon de Mario Kart ; el mapa se actualiza a Rainbow Road y el brief se articula en torno a la física . La columna A es Prism Kart : flujo elige cualquier borrador → iniciar carrera muestra ilustraciones básicas y generación genérica , pero pista tipo Rainbow Road y física fantástica — control fácil, sensación de boost , rareza puntual en borde de pista aunque reproducible y jugable . La suerte de las columnas B y C se tuerce de entrada: la columna B gira a la izquierda cuando presionas derecha — el eje horizontal invertido ya visto por Simmons en un test anterior Astra/Fable — dejando impresión de ausencia de QA ; la frase ‘ tengo que presionar derecha para ir a la izquierda ’ se repite tres veces. La columna C está totalmente dispersa : debería mostrar primero los karts rivales y luego spawnear al azar , injugable con física errática más el mismo eje invertido, aterrizando en el cajón de lo peor .

La factura por una vez se vuelve contra Grok. Fable 5.1: $52, ~3000 s , Astra: $11, ~2000 s , Grok 4.7: $16 — carrera más larga, más tokens de entrada/salida para el peor juego . La revelación de Simmons sella la tabla: mejor física Fable , el bug de eje invertido se repite en Astra , y Grok 4.7 el eslabón más débil . En tres builds es dos derrotas claras, una por margen para Grok; la ventaja en costo no cubre la necesidad de revisión porque para el tercer build la nota permanece — ‘ no importa cuántas carreras, trepar a la línea Astra/Fable es duro ’ — el precio de lo barato se vuelve jugabilidad perdida .

Apilados, los tres builds dibujan un patrón nítido: Grok 4.7 se queda atrás en código pesado y generación de agentes en one-shot, Fable 5.1 y Astra delante . El recap de la segunda mitad conecta la nota con el terreno: $2 / $6 contra $10 / $50 — cinco veces en entrada, ocho en salida — y ese delta es una palanca real en escenarios de oficina y conocimiento ; la vía Grokbot o Grok 4.7 en lugar de chat work / co-work cierra tareas diarias más barato , y la tabla de prensa tiene filas donde Grok supera a Fable/Astra . En cambio en Terminal-Bench y código pesado Fable 5 (de 26% a 42%) y Astra (~59%) abren brecha clara sobre la banda ~26% de Grok ; aunque DeepSuite muestre 71% con encuadre selectivo , el cuadro general mantiene a Grok un escalón por debajo de la frontera . De ahí la nota de Simmons: ‘ solo test de código pesado, limitado ’ — trabajo de conocimiento, automatización y cadenas de agentes diarios ausentes del video.

El cierre sostiene dos salvedades en la misma página. Primero alcance : tres builds, código pesado, conocimiento/automatización fuera de cuadro ; así el plus de automatización de oficina de Grok destacado en benchmarks no aparece en este escenario. Segundo la naturaleza one-shot : ningún segundo pase para ningún modelo; una página 3D o un clon que se recuperaría iterando se juzga por su primera salida . El nudo económico se ata ahí: a un quinto del precio puedes correr Grok cuatro o cinco veces por un Fable , sin embargo la factura creciente de Mario Kart y jugabilidad aún distante sugiere que incluso revisiones pueden no cerrar la brecha . Simmons añade un aparte personal: maneja dos suscripciones separadas max 20x en Chachi y Fable y golpea los límites constantemente ; un rival serio a un quinto del precio es buena noticia para todo usuario final — ‘ ojalá fuera un poco mejor ’. La lectura final es material: xAI posee el cómputo, así que Grok mejorará y se acercará a la línea Fable/OpenAI ; hasta entonces la regla es rotar modelos y experimentar . El llamado a comentarios refleja esto: qué construir después , déjalo abajo.

Visualization: nodesdaily AI

Puntaje CursorBench (más = mejor)

  • Fable 5.151,6%
  • Grok 4.746%
  • Fable 5 (old)26%
  • Astra (falta)—
Grok 4 pts detrás a un quinto del precio; Astra omitido en este gráfico.
TemaEstado
Palanca precio$2/$6 vs $10/$50; 5× entrada, 8× salida
Awwwards 1er intentoGrok $7 barato pero gusto/fidelidad detrás
Muro builds pesadosGrok rezagado en one-shot 3D y Kart
BuildFable 5.1AstraGrok 4.7
Clon Awwwards$123 / 4000s$97$7 / 300s
Teclado 3D$58 / 869s~$5~$5 largo
Mario Kart$52 / 3000s$11 / 2000s$16 largo

Momentos clave

  1. Tesis: paridad Fable/Astra a 1/5 del precio
  2. CursorBench 46% vs 51,6% y $2/$6
  3. DeepSuite 71% y filas oficina/legal
  4. Método: un bash para tres one-shot
  5. Prompt clon Awwwards y skill
  6. Reveal ciego A — reclutamiento ASI
  7. Reveal ciego B — Boach Studio / Coco
  8. Reveal ciego C — grid Minimal Crouwel

Comentario de la IA

"Revisando el video mantuve un solo filtro: **factura dividida por puntaje**. Sin poner el gráfico de xAI y las tres facturas en la misma ecuación, la etiqueta $5 vs $58 contaría sola la historia; escribo cada párrafo por el **costo de un intento**, probando el ‘cinco veces más barato’ contra velocidad, tokens y jugabilidad."

Evaluación de la IA

Defendamos primero el caso alcista: mantener $2 / $6 quedando a cuatro puntos en CursorBench y superar a Fable/Astra fila por fila en oficina, legal y automatización baja de verdad el costo por tarea completada ; para equipos que viven en Grokbot y trabajo de conocimiento multihoras , pagar 5× por unos puntos no es racional en todas partes, y la palanca velocidad + precio hace a Grok sensato.

El límite se ve en el banco de builds. La regla one-shot pide a Grok cargar 3D pesado y fidelidad de píxel al primer intento, y cae en elección de gusto en Awwwards, madurez 3D en teclado y física jugable en Kart ; $5 vs $58 en teclado es barato pero los solapes de etiquetas, glitches y carrito ausente , el eje invertido + física errática en Kart y el relleno SVG tras $7 vs $123 en el primer build pueden borrar el ahorro. xAI posee Cursor y omite a Astra de CursorBench , reforzando la lectura de curaduría.

En verificación la tabla es comprobable: $2/$6 vs $10/$50 es consistente en ficha, 46% / 51,6% / 71% / 72,7% / 70% se leen directo del gráfico en video y la etiqueta ‘el más barato’ con Fable $123 / Astra $97 / Grok $7 y las facturas teclado/Kart se verifican con contadores en pantalla . Aun así, ‘mejor’ es sensible a benchmark y a one-shot ; Terminal-Bench en torno a 26% y el código pesado fuera de oficina mantiene a Grok detrás.

Lectura práctica selectiva: para equipos con alto volumen de automatización, contexto medio y cadenas diarias en Grokbot/harness , Grok 4.7 es una palanca fuerte y candidato a campeón precio/rendimiento; para trabajo front-facing como clones Awwwards pixel-perfect, páginas 3D pesadas o juegos con física , Fable 5.1 / Astra siguen un escalón arriba . Decida en dólares por tarea y necesidad de revisión, no solo en el marcador ; rotar modelos y experimentar es el consejo de cierre.

Fuentes

6 enlaces; 1 de ellos también citados por 4 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

grok 4.7 · xai · fable 5.1 · astra · cursorbench · deepsuite · clon awwwards

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…