Ninguna empresa ha llevado todavía al mercado un chip diseñado específicamente para grandes modelos de lenguaje. En el podcast Tech Surge de Celestia Capital, el analista de semiconductores Austin Lyons lo explica como pura lógica de mercado: si el beneficio no es claro, nadie cambia la línea de producción. Los números ahora cuentan una historia diferente. Cerca del dos por ciento del producto interior bruto de Estados Unidos se destinará este año a infraestructura de inteligencia artificial, casi el doble del nivel de 2025. La ruptura silenciosa ocurrió el año pasado, cuando el gasto en ejecutar modelos en producción superó al del entrenamiento, y ese punto de inflexión está transformando cada eslabón, del comprador al diseñador y al proveedor.
La forma en que los compradores de nube adquieren hardware se ha invertido. Lyons recuerda que hace una década las nubes impulsaban la estandarización a través de organismos de normalización, negociando componente por componente para bajar los precios. Hoy la tendencia es la opuesta: los clientes prefieren un rack totalmente integrado de un solo proveedor en lugar de ensamblar las piezas ellos mismos. La razón es la velocidad y la simplicidad. En un auge, el ganador no es el que tiene la lista de materiales más barata, sino el sistema más rápido de poner en marcha y llevar a producción.
El argumento para vender sistemas empieza con la escala de los modelos. Un modelo frontera de más de dos billones de parámetros todavía necesita uno o varios terabytes de almacenamiento de pesos incluso tras la cuantización. Un solo acelerador, sin embargo, solo contiene unos 288 gigabytes de memoria de alto ancho de banda. Eso obliga a fragmentar el modelo entre cuatro u ocho aceleradores, y una vez fragmentado, pensar en racks se vuelve inevitable. El Grace Blackwell NVL72 de Nvidia encarna la respuesta: 72 procesadores gráficos y 36 procesadores centrales funcionando como un solo sistema, con red, alimentación y refrigeración.
La ventaja de Nvidia es que llegó primero a la escala de rack. Según Lyons, la empresa unió el diseño completo, la pila de software y la cadena de herramientas de compilación, y convirtió el rack complejo en una solución llave en mano. Un equipo de modelos puede escribir código y ejecutarlo, con la complejidad del rack oculta. La industria siempre quiere competencia y estandarización, pero cuando el dolor de integración es tan alto, el proveedor que entrega primero un rack funcional fija las condiciones.
¿Por qué un comprador de nube aceptaría márgenes altos en cada capa en lugar de mezclar proveedores? La respuesta es el tiempo de salida al mercado. Lyons señala a Elon Musk y xAI levantando centros de datos en tiempo récord sobre racks integrados, donde la velocidad para obtener tokens útiles importaba más que apretar los costos. El rack Helios de AMD muestra la misma atracción. Todos saben que una construcción mixta podría ser más barata sobre el papel, pero cuando las ventanas de despliegue se miden en días, un rack integrado vale el margen.
Eso eleva el listón para las startups. Lyons señala que lo que antes requería unos pocos millones de dólares en rondas de prueba de concepto ahora requiere cientos de millones para una startup de chips que apunta a un producto a nivel de rack. Los incumbentes agravan la ventaja con fusiones como Mellanox y décadas de conocimiento de sistemas. Sin embargo, la ventana no se ha cerrado. A medida que las interfaces maduran, empiezan a abrirse nichos estrechos donde una startup puede sobrevivir sin clonar un rack completo, especialmente donde la carga de trabajo tiene un cuello de botella distintivo.
La propia carga de inferencia se está dividiendo, y esa división moldea la elección del silicio. En la conversación, las dos fases se describen como prefill y decodificación. El prefill es la lectura paralela de un prompt largo, hambriento de cómputo. La decodificación es la generación secuencial de tokens, dominada por la rapidez con que se pueden mover los datos, lo que convierte el ancho de banda de memoria en el factor decisivo. La ingeniería natural dice ejecutar el prefill en grupos ricos en cómputo y la decodificación en grupos centrados en memoria, y desagregarlos cuando convenga.
Nvidia codificó esa división en software con una capa de orquestación llamada Dynamo que gestiona los grupos de prefill y decodificación sobre la misma flota de procesadores gráficos. Curiosamente, las apuestas anteriores de Groq y Cerebras ahora tienen sentido. Ambas construyeron arquitecturas en torno a abundante memoria estática de acceso aleatorio en el chip en lugar de memoria dinámica basada en condensadores. Esa elección les da un ancho de banda muy alto en el chip, un encaje casi perfecto para el lado de la decodificación, donde mover datos rápido importa más.
La restricción determinante en los centros de datos es la energía. Una vez que a un campus se le otorgan cien megavatios, la pregunta de negocio se convierte en cómo obtener los mayores ingresos por megavatio. Lyons plantea las decisiones de diseño como preguntas financieras bajo un envase fijo de energía, espacio y refrigeración: qué mezcla de silicio produce la mayor salida de inferencia. Las matemáticas incluso permiten que antiguos sitios de minería de bitcoin se reinventen como capacidad de nube, donde la energía barata y el capital respaldado por activos les permiten moverse más rápido que los hyperscalers de construcción lenta.
De ese hueco creció una nueva capa intermedia llamada neocloud. La conversación explica por qué incluso Microsoft alquila procesadores gráficos a neoclouds mientras construye sus propios campus: la energía es escasa, el alquiler fuera de balance es flexible, y los calendarios de demanda no perdonan. Los neoclouds aportan experiencia en financiar activos y levantan capacidad rápidamente, los hyperscalers usan esa capacidad alquilada como amortiguador mientras expanden sus campus propios, y el resultado es un nivel intermedio que ahora vale más de cien mil millones de dólares.
Si los neoclouds pueden ser duraderos es la pregunta abierta. Sirven a clientes de hiperescala mientras compiten indirectamente con ellos. Lyons espera consolidación, pero no una simple adquisición por parte de los vendedores de chips, en parte por la fricción regulatoria. Los neoclouds pueden en cambio agregar ellos mismos silicio diverso y ocultar la complejidad vendiendo tokens como servicio, emparejando cada trabajo con el hardware adecuado. Si eso funciona, crea una ruta al mercado para el silicio novedoso, porque la capa de nube dispuesta a asumir la heterogeneidad reduce el costo de adopción para los clientes.
¿Terminarán las nubes con un solo tipo de chip o con un portafolio amplio? Lyons señala los procesadores centrales como precedente: ninguna nube ofrece hoy un solo procesador central, y la misma lógica se aplicará a la inferencia. Imagina una curva donde el eje horizontal es la interactividad en tokens por segundo por usuario y el eje vertical el rendimiento total. Cada punto de la curva es un producto diferente, desde el chat de baja latencia hasta el resumen por lotes y el servicio de modelos pequeños más barato, y cada punto es el más barato con una mezcla de hardware distinta.
La oportunidad del billón de dólares puede estar en el medio de esa curva, no en la frontera. El debate está obsesionado con el mayor modelo de dos billones de parámetros, pero el mayor volumen puede estar en los modelos abiertos de setenta mil millones de parámetros. Lyons observa que las tarjetas Hopper y Ampere más antiguas siguen siendo competitivas ahí, así que un nuevo acelerador que apunte a ese medio congestionado con un diseño centrado en la memoria puede capturar volumen real a mejor precio sin necesitar la mayor inteligencia.
El dilema de construir o comprar para el silicio también se está aclarando. Los principales proveedores de modelos compran procesadores gráficos comerciales a gran escala mientras codiseñan chips personalizados con socios como Broadcom y Marvell, con los equipos de chips y software trabajando juntos en cargas específicas. Los vendedores comerciales, mientras tanto, no inventan para un solo cliente sino para el mercado amplio, dejando que las ideas de arquitectura impulsen la hoja de ruta. Como con OpenAI, ambos caminos avanzan en paralelo en lugar de excluirse.
El diseño de chips en sí se está acelerando con ayuda de la inteligencia artificial. El escenario esbozado en el programa es llamativo: un diseño que antes requería tres años y cien ingenieros podría hacerse en un año con el mismo equipo o uno menor, reduciendo el costo a un tercio. Un adicional de dos mil dólares en la lista de materiales que un director financiero habría vetado se vuelve viable a setecientos dólares. A medida que la barrera baja, equipos que nunca consideraron un chip personalizado empiezan a encontrar viable la matemática.
La misma aceleración ayuda a las casas de silicio comercial. Un ingeniero experimentado usa las herramientas de aceleración con más eficacia que un equipo primerizo, así que los incumbentes pueden multiplicar variantes bajo el mismo techo. Mercados considerados antes demasiado pequeños para justificar una línea de producto pueden cruzar la tasa interna de retorno una vez que el costo se reduce a la mitad, y las empresas empiezan a añadir ofertas semipersonalizadas a sus catálogos. Los nichos se multiplican mientras el mercado general ofrece opciones más a medida.
Para las startups el panorama es de doble filo. Competir de frente a escala de rack es difícil, pero el menor costo de diseño abre nuevos espacios de variantes. Incluso los grandes vendedores ahora darán luz verde a líneas de producto que antes archivaron como antieconómicas. La competencia se desplaza de un único mejor chip hacia quién puede colocar el silicio correcto en la fase correcta al precio correcto, con una orquestación que haga la heterogeneidad invisible para el cliente.
La frase final de la conversación es el mejor resumen: mucho sigue sin resolverse, y ese estado de incertidumbre no está frenando en absoluto el gasto. Donde se cruzan los límites de energía, la arquitectura de memoria y la orquestación de software, quién ganará la corona del billón de dólares sigue siendo incierto. Sin embargo, el auge del trabajo de inferencia, la normalización de los sistemas a escala de rack y el modelo de capital de los neoclouds ya parecen consolidados. En esta carrera, el ganador no será quien espere claridad, sino quien construya el sistema bajo la incertidumbre y maximice los ingresos por megavatio.
Comentario de la IA
""Lo que más me impactó es cómo el chip deja de ser el héroe solitario y el modelo que vende un sistema en la intersección de la energía, la memoria y la orquestación de software toma protagonismo. Incluso desde una óptica de hardware, la pregunta financiera se ha vuelto decisiva.""
Evaluación de la IA
La fortaleza es la reformulación de la infraestructura de inteligencia artificial como una competencia de sistemas y modelos de negocio, no solo de chips. Situar la división prefill/decodificación en los ejes de cómputo y memoria, explicar el financiamiento de los neoclouds mediante la lógica de la energía y el balance, y vincular la escala de rack a una pregunta financiera sobre ingresos por megavatio le da al análisis una columna vertebral coherente que también sostiene los argumentos del portafolio y la multiplicación de variantes.
Los límites se muestran en cómo se presentan y datan las cifras titulares. Afirmaciones como el dos por ciento del producto interior bruto o el gasto en inferencia superando al de entrenamiento por primera vez llegan redondeadas y de una única fuente conversacional, con un alcance poco claro sobre si son anuales o trimestrales y qué partidas de costos se incluyen. Las cuatro condiciones prometidas para la próxima empresa de chips de un billón de dólares se anuncian de entrada pero nunca se desglosan como una lista comprobable, dejando el umbral vago.
La conclusión pragmática es comprar racks integrados en lugar de componentes sueltos, priorizar los ingresos por unidad de energía, y planificar la inferencia no sobre una sola familia de chips sino sobre un portafolio. Mantener tarjetas de generación anterior para el nivel medio de unos setenta mil millones de parámetros, respaldar la fase de decodificación con aceleradores centrados en memoria, y orquestar grupos separados de prefill y decodificación con una capa como Dynamo mejora el equilibrio entre costo y velocidad en el próximo año.
Para las startups y los equipos de nube, el camino práctico es definir el nicho en torno a un cuello de botella sensible a la memoria en lugar de desafiar de frente la escala de rack. El ejemplo del minero de bitcoin convertido en neocloud muestra que donde existen la energía y el acceso al capital, la velocidad se convierte en una ventaja, y ejecutar silicio comercial y personalizado en paralelo distribuye el riesgo. Incluso cuando la asistencia de la inteligencia artificial reduce el costo de diseño, la disciplina de fabricación y de portafolio sigue siendo esencial, o las ganancias de velocidad simplemente inflarán la proliferación de variantes.
Fuentes
6 enlaces; 1 de ellos también citados por 2 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=bXNJU3RhW1I
- @nvidia https://www.nvidia.com/en-us/data-center/gb200-nvl72
También citado por: IonQ's quantum computer moves into Nvidia's supercomputer: the hybrid era begins · NVIDIA Dynamo: The Distributed Serving Layer Around Inference Engines
- @nvidia https://www.nvidia.com/en-us/data-center/gb300-nvl72
- @techedgeai https://techedgeai.com/gartner-forecasts-worldwide-ai-optimized-iaas-spending-to-grow-96-through-2026
- @finance https://finance.yahoo.com/technology/ai/articles/ai-infrastructure-spending-soars-latest-151632604.html
- @coreweave https://coreweave.com/blog/a-defining-year-for-the-essential-cloud-for-ai
infraestructura ia · chip · inferencia · sistema rack · nvl72 · neocloud · memoria