Volver al inicio

TiDAR: el híbrido de NVIDIA que redacta con difusión y habla autorregresivamente

TiDAR de NVIDIA redacta tokens con difusión y los muestrea autorregresivamente en una sola pasada, convirtiendo la capacidad GPU inactiva en 4,71x-5,91x más tokens por segundo sin pérdida de calidad.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — taCVT5vDAk0
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

El vídeo abre con una observación simple a la que vuelvo una y otra vez: cuando un modelo de lenguaje grande escribe token a token, la GPU a menudo espera a la memoria en lugar de computar a pleno rendimiento. Los pesos y las claves en caché deben cargarse antes de poder producir un solo token nuevo. Eso deja capacidad aritmética de reserva inactiva en cada paso.

La pregunta que plantea el equipo de NVIDIA es de un pragmatismo desconcertante: ¿qué trabajo útil podría llenar esos huecos inactivos sin las penalizaciones habituales? Las respuestas anteriores exigían todas algo a cambio. Un modelo borrador más pequeño cuesta tiempo extra y vive o muere según su precisión. Los escritores paralelos tipo difusión son rápidos pero su calidad se resiente. Este trabajo quiere la aceleración sin impuesto sobre la calidad, solo un mayor consumo eléctrico.

Antes del método, el narrador reconstruye dos fundamentos desde cero. El primero es el escritor clásico del siguiente token. Lee todo el prefijo y predice exactamente un token, y luego repite. El entrenamiento parece rápido porque la respuesta completa ya se conoce, así que cada posición puede supervisarse a la vez tras una máscara triangular. Pero la escritura en vivo no puede asomarse al futuro, así que permanece tercamente secuencial.

El segundo fundamento es el escritor por difusión. Parte de una fila de blancos tras el prefijo y llena muchas posiciones de una vez. La trampa es que cada posición se extrae de su propia suposición separada, ciega a lo que sus vecinos llegarán a ser. Un verbo aquí cambia lo que pertenece allá, y sin embargo las dos extracciones nunca se consultan. Esa independencia es la razón por la que los borradores paralelos se leen con fluidez pero razonan con flojedad.

El puente entre los dos mundos es un viejo truco que el vídeo explica con una historia de oráculo. Supongamos que alguien susurra tres tokens próximos. No tienes que fiarte del susurro: puedes verificar los tres a la vez, porque comprobar una cadena conocida se paraleliza exactamente como el entrenamiento. Si el susurro coincide con lo que una escritura cuidadosa habría producido, has ganado tres tokens por el precio de una pasada hacia adelante.

La decodificación especulativa estándar convierte esa historia en un sistema: un modelo pequeño y rápido susurra, el modelo grande verifica. Las matemáticas solo ganan cuando el susurrador es a la vez rápido y normalmente acertado. Un ayudante lento o descuidado borra la ganancia e incluso puede costar tiempo. Todo depende de la tasa de aceptación, por eso los equipos de servicio obsesionan con emparejar al ayudante adecuado con el gigante adecuado.

TiDAR elimina por completo al ayudante. Hay un solo backbone que desempeña ambos papeles dentro de una única pasada. Cada paso divide la secuencia en tres zonas: tokens de prefijo asentados, tokens candidatos arrastrados del paso anterior, y huecos en blanco reservados para la siguiente ronda de suposiciones. La caché asentada se reutiliza, las entradas rechazadas se expulsan, y nada necesita un segundo modelo.

Aquí está la parte ingeniosa que encontré más fácil de imaginar como apostar por todos los desenlaces. En la misma pasada que verifica los candidatos arrastrados con puntuación estricta de izquierda a derecha, el modelo también prepara suposiciones frescas para cada futuro posible: el futuro donde solo sobrevive el primer candidato, el donde sobreviven dos, el donde sobreviven todos. Sea cual sea el futuro que confirme la verificación, ya espera una suposición correspondiente. Una pasada, dos trabajos.

Hacer que eso funcione es sobre todo un rompecabezas de enmascaramiento. Los tokens asentados mantienen visibilidad causal estricta, exactamente lo que necesita el muestreo cuidadoso. Cada bloque de suposiciones obtiene visibilidad interna completa, exactamente lo que necesita la redacción paralela, mientras sigue viendo todo el pasado asentado. Los prefijos se colocan para que la misma máscara pueda deslizarse hacia adelante a medida que crece el texto. Los bloques extra multiplican el trabajo por un pequeño factor constante, y con la atención fusionada moderna que intercambia memoria por aritmética, el costo cae precisamente sobre la capacidad inactiva.

El entrenamiento refleja la misma dualidad sin calendarios exóticos. Cada ejemplo aparece dos veces en una larga secuencia: una vez como supervisión ordinaria del siguiente token, y otra como un bloque completamente enmascarado que se rellena en paralelo. Las dos pérdidas simplemente se suman con el mismo peso. No hay perilla de decodificación que ajustar después, aunque los autores señalan que calendarios de desenmascaramiento más sofisticados podrían superponerse para equipos dispuestos a gastar pasadas extra en mejores suposiciones.

Las cifras reportadas son lo que me hizo incorporarme. En tamaños de 1,5B y 8B, en tareas generativas y de verosimilitud, el sistema produce aproximadamente 4,71x a 5,91x más tokens por segundo que el escritor cuidadoso equivalente, con el soporte exacto de caché intacto. Como el texto aceptado se repuntúa bajo la distribución estricta, la calidad de salida coincide con la línea base autorregresiva por construcción, mientras supera claramente a los sistemas de difusión pura como Dream y LLaDA tanto en velocidad como en calidad. Los autores lo presentan como un modelo autónomo, apto para servicio, sin ayudante que desplegar.

Comentario de la IA

""Mi opinión tras trabajar en este tema: TiDAR es el primer truco de aceleración en mucho tiempo que no me pide aceptar un texto peor. Solo pide más electricidad.""

Evaluación de la IA

Para defender al otro bando: un escéptico diría que una configuración de decodificación especulativa bien afinada con un buen modelo borrador pequeño ya captura la mayor parte de esta ganancia con mucha menos complejidad. Tienen un punto, y en mi lectura ese argumento acota a TiDAR en lugar de refutarlo. Donde existe un modelo borrador sólido y los lotes de servicio son pequeños, la maquinaria extra puede no compensar.

Lo que el vídeo no prueba es exactamente lo que yo comprobaría antes de adoptar cualquier cosa: pilas de servicio reales, contextos largos, y regímenes donde la decodificación no está limitada por la memoria. El entrenamiento duplica la secuencia con una copia causal más una copia enmascarada, así que el preentrenamiento cuesta más, y el argumento de los huecos libres se debilita a medida que crece el tamaño de lote o en hardware con un equilibrio distinto. El enfoque energético también merece honestidad: la computación no utilizada solo es gratis si ignoras la potencia y la térmica.

Sobre la verificabilidad: las cifras principales provienen de los propios autores, un informe técnico de NVIDIA a escalas de 1,5B y 8B en tareas generativas y de verosimilitud seleccionadas. Los 4,71x a 5,91x de tokens por segundo reportados y la afirmación de igualar la calidad autorregresiva necesitan reproducción independiente en frameworks de servicio abiertos antes de que los considere garantizados. La cobertura de Tomshardware lleva la misma cautela en su titular: grandes ganancias de rendimiento, pero quedan limitaciones.

Mi lectura práctica es esta: si sirves tus propios modelos y el rendimiento por GPU es tu cuello de botella, TiDAR merece seguirse de cerca y probarse en cuanto lleguen el código y los checkpoints. Si eres un usuario único conversando con una API alojada, nada de esto cambia tu vida todavía. Revisaría cada cifra al momento de decidir, y lo pilotaría en mi propia carga de trabajo en lugar de fiarme de una sola tabla de benchmarks.

Fuentes

6 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

tidar · nvidia · lm-difusion · decodificacion-especulativa · inferenciallm · rendimiento-gpu · nodesdaily

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

TiDAR: el híbrido de NVIDIA que redacta con difusión y…