Volver al inicio

36 Billones de Operaciones por Segundo: Anatomía Secreta de la GPU

De Mario 64 a Cyberpunk 2077, la potencia gráfica se ha multiplicado por cientos de miles. Esta exploración desmonta una tarjeta de 28300 millones de transistores para explicar cómo miles de núcleos sencillos superan a los procesadores clásicos.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — h9Z4oGN89MU
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Imagina a ocho mil millones de personas resolviendo cada una una multiplicación por segundo, sin pausas ni errores. Harían falta aun así unas 4400 Tierras pobladas para igualar la potencia de una tarjeta gráfica moderna. El salto impresiona: Mario 64 se conformaba con cien millones de operaciones por segundo, Minecraft exigía cien mil millones, mientras que Cyberpunk 2077 reclama cerca de 36 billones de operaciones cada segundo. Semejante diluvio cabe en una caja de pocos litros gracias a una arquitectura masivamente paralela , una memoria voraz y una planificación milimétrica.

Carguero o Avión Jumbo

La pastilla gráfica alinea 10752 núcleos frente a los 24 núcleos de un procesador clásico, pero la comparación cruda engaña. La imagen del carguero frente al avión de línea aclara el compromiso: el barco mueve un volumen inmenso despacio, el avión entrega poco pero rápido. Igual ocurre aquí: el procesador gestiona tareas variadas, rápidas e imprevisibles, mientras la tarjeta repite cálculos sencillos sobre montañas de cifras. No ejecuta ningún sistema operativo , no atiende ni teclado ni red , y asume esa especialización radical.

En el centro de la tarjeta reina una pastilla llamada GA102, grabada con 28300 millones de transistores. Su plano se organiza en 7 grupos llamados GPC, cada uno con 12 multiprocesadores de flujo. Cada multiprocesador combina haces de 32 núcleos CUDA , un núcleo Tensor y un núcleo de trazado de rayos , es decir 10752 unidades de cálculo clásico, 336 unidades matriciales y 84 unidades de trazado luminoso. Las primeras sostienen el sombreado de los juegos, las segundas aceleran las transformaciones geométricas y la inteligencia artificial , las terceras trazan la luz.

Los Chips Defectuosos no se Desechan

Las tarjetas 3090 Ti, 3090, 3080 Ti y 3080 comparten el mismo diseño de pastilla, pese a precios y rendimientos distintos. La explicación está en la fabricación: el polvo y los fallos de grabado dañan a veces zonas del silicio. En vez de tirar la oblea, los ingenieros aíslan y desactivan el multiprocesador defectuoso, gracias a un diseño repetitivo que confina la avería. Luego las pastillas se clasifican: intactas para la gama alta, parcialmente desactivadas hacia abajo. La frecuencia de reloj y la memoria integrada diferencian los modelos.

Un núcleo CUDA se parece a una calculadora de unos 410000 transistores. Su circuito principal, de 50000 transistores, ejecuta la operación A multiplicado por B más C, bautizada como multiplicación-suma fusionada . La mitad maneja flotantes de 32 bits y la otra alterna entre enteros y flotantes, mientras secciones vecinas gestionan signos, desplazamientos y colas de instrucciones. Cada núcleo encadena una multiplicación y una suma por ciclo: con 10496 unidades a 1,7 gigahercios se alcanzan 35,6 billones de operaciones por segundo. Las divisiones y raíces cuadradas quedan para unas unidades especiales .

Hambre de Memoria y Trucos de Señal

Alrededor de la pastilla, la tarjeta parece una central en miniatura atornillada sobre un circuito impreso . Un módulo regulador convierte los 12 voltios en 1,1 voltios y vuelca cientos de vatios sobre la pastilla. Cuatro tubos de calor llevan ese calor a unas aletas ventiladas, lo que explica el peso del aparato. Los 24 gigabytes de GDDR6X acogen el decorado: al cargar, los modelos migran del SSD a la memoria de vídeo . El bus de 384 bits entrega 1,15 terabytes por segundo, frente a 64 gigabytes en el procesador.

Transmitir tantos datos obliga a jugar con la señal eléctrica. La GDDR6X codifica dos bits por nivel con cuatro tensiones, un esquema llamado PAM-4. La generación siguiente adopta una codificación ternaria: tres bits binarios se vuelven dos cifras de tres estados, con tensiones positiva, nula y negativa. Este PAM-3 simplifica el codificador, aclara la relación señal-ruido y ahorra energía. Para los aceleradores de inteligencia artificial , la memoria HBM apila capas de DRAM unidas por vías de silicio, con hasta 192 gigabytes de gran velocidad alrededor de la pastilla.

Una Instrucción para Millones de Datos

Algunos cálculos se reparten solos, y el renderizado 3D es uno de ellos. Piensa en un sombrero vaquero: unos 28000 triángulos nacidos de 14000 vértices marcados en X, Y y Z dentro del espacio del modelo. Para instalarlo en el mundo virtual basta sumar la posición del objeto a cada coordenada, una instrucción repetida sobre millones de números. Con 5629 objetos y 8,3 millones de vértices, la escena pide 25 millones de sumas independientes, repartidas entre miles de núcleos. Es el paralelismo vergonzante , o una instrucción, múltiples datos .

Cada instrucción la porta un hilo de ejecución ; 32 hilos forman un haz llamado warp. Los haces forman bloques confiados a los multiprocesadores, reunidos en mallas que pilota el motor Gigathread . Antes, los 32 hilos marchaban al paso como falange; desde 2016, la arquitectura SIMT deja que cada hilo avance a su ritmo con su contador de programa . Los hilos comparten una caché L1 de 128 kilobytes, pero las ramificaciones divergentes imponen resincronizaciones costosas. La palabra warp vendría del telar de Jacquard, no de los viajes espaciales.

La misma maquinaria brilla más allá del juego. Para validar un bloque de bitcóin, el algoritmo SHA-256 mezcla transacciones, marca temporal y un número aleatorio llamado nonce, como una lotería de boletos al azar. Una tarjeta produce unos 95 millones de boletos por segundo, pero los circuitos dedicados ASIC alinean 250 billones de jugadas, 2600 tarjetas. Los núcleos Tensor multiplican matrices enteras de una vez, pan cotidiano de las redes neuronales . Los núcleos de trazado de rayos simulan los rayos de luz para unos reflejos creíbles.

Visualization: nodesdaily AI

Momentos clave

  1. 4400 Tierras para una tarjeta gráfica
  2. El carguero y el avión jumbo
  3. Anatomía de un núcleo CUDA
  4. 1,15 TB/s: alimentar a la bestia
  5. El sombrero vaquero en 28000 triángulos
  6. Lotería bitcóin y matrices de IA

Comentario de la IA

"La pedagogía visual vuelve nítido lo que suele quedarse en abstracto: la jerarquía de núcleos, la memoria hambrienta y el paralelismo masivo. El desvío por la minería y la inteligencia artificial muestra por qué esta arquitectura va mucho más allá de los videojuegos. Una mención única al fabricante de la memoria invita, eso sí, a mirar con distancia crítica el tramo dedicado a la GDDR y a la HBM."

Evaluación de la IA

La objeción más seria apunta a la propia comparación: alinear 10752 núcleos gráficos frente a 24 núcleos de propósito general impresiona, pero ambos no hacen el mismo trabajo. Cuando la tarea exige pocos datos, decisiones rápidas o ramificaciones imprevisibles, el procesador recupera la ventaja y la tarjeta vuelve a ser un simple acelerador dependiente. Presentar la GPU como absolutamente más potente borra esa complementariedad.

El relato también queda incompleto en dos puntos: el consumo de varios cientos de vatios y el papel del software, controladores y motores de juego, apenas se mencionan. Sobre todo, el tramo sobre la memoria lleva la marca del patrocinador, fabricante de los chips GDDR y HBM: el elogio de la GDDR7, de la HBM3E y del treinta por ciento de ahorro energético suena a argumentario comercial, concentrado en una sola secuencia que conviene mirar con distancia.

Para el lector, el aporte duradero no es el catálogo de cifras sino la gramática del paralelismo: una instrucción repetida sobre millones de datos, haces de treinta y dos hilos y un planificador que reparte los bloques. Retener el carguero y el avión, la selección de chips imperfectos y el telar mecánico basta para entender por qué el juego, la minería y las redes neuronales comparten la misma maquinaria.

Fuentes

6 enlaces; 1 de ellos también citados por 1 otra noticia. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

tarjeta gráfica · arquitectura gpu · núcleos cuda · memoria gddr · trazado de rayos · inteligencia artificial

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…