Volver al inicio

La curva después de ReLU: por qué GELU, SiLU y SwiGLU prometen una mejor generalización

Este episodio de StatQuest explica cómo tres funciones de activación modernas difieren de ReLU y cómo todas pueden derivarse de la idea de dropout dependiente de la entrada; convertí la narrativa en un artículo y la puse a prueba con fuentes independientes.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — 2FaI2Fen1mQ
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Josh Starmer, presentador de StatQuest, se propone explicar tres funciones de activación, GELU, SiLU y SwiGLU, a cualquiera que ya conozca ReLU, y el titular es simple: las dos primeras difieren de ReLU solo sutilmente, la tercera puede transformarse en formas mucho más salvajes, sin embargo, las tres comparten un rasgo familiar de resistir la tentación de memorizar los datos de entrenamiento.

Las diferencias visibles son pequeñas pero precisas: donde ReLU se aplana a cero para cada entrada negativa y se dobla bruscamente en el origen, GELU y SiLU descienden ligeramente por debajo de cero entre aproximadamente menos dos y cero, redondean la esquina en una curva suave y diferenciable, y devuelven valores un poco más pequeños que la entrada en el lado positivo.

SwiGLU juega un juego diferente: puede imitar una ReLU suavizada, pero sus parámetros adicionales le permiten doblarse en formas que sus primas no pueden alcanzar, que es exactamente por lo que el episodio la trata como el peso pesado flexible del trío en lugar de una mera variante.

La recompensa que promete el episodio es la generalización: una gran red ReLU extendida sobre puntos de entrenamiento dispersos abraza cada punto, incluido el ruido, mientras que la misma capacidad construida sobre las nuevas activaciones traza un camino intermedio más tranquilo que es más probable que prediga bien los puntos no vistos.

La historia se remonta a antes de 2010, cuando la sigmoide dominaba: su salida de cero a uno hacía eco de una neurona que se disparaba o estaba en silencio, su curva en S imitaba la transición entre esos estados, y su suavidad en todas partes hacía que la retropropagación fuera sencilla, por lo que las redes poco profundas se entrenaban felizmente.

La profundidad rompió el hechizo: lejos de cero, la pendiente sigmoide se colapsa hacia la nada, los gradientes se reducen a susurros, cada paso de optimización se arrastra, y una red que debería haber trazado el ajuste ondulado ideal se estanca en una curva tímida que pierde los datos, el clásico subajuste.

Alrededor de 2010, ReLU tomó el relevo con una línea doblada casi sospechosamente simple: los negativos se convierten en cero, los positivos pasan sin cambios, la pendiente es cero o uno, por lo que las entradas grandes mantienen los gradientes vivos y las pilas profundas finalmente se vuelven entrenables, una carrera coronada en 2017 dentro del primer Transformer.

Pero la capacidad se convirtió en la nueva trampa: una red ReLU gigante ya no subajusta, sobreajusta, envolviendo cada peculiaridad de la muestra, y reducir la red no es una respuesta real ya que nadie puede probar cien mil tamaños una unidad a la vez para encontrar el punto óptimo.

El dropout fue la primera solución sistemática que el episodio recuerda: durante el entrenamiento, subconjuntos aleatorios de unidades son silenciados, cada paso entrena efectivamente una red más delgada, y en el momento de la predicción, el modelo completo se comporta como un promedio de todas esas redes delgadas, acercando el ajuste inestable de ReLU al ideal; pero la solución tiene dos costos, maquinaria atornillada al entrenamiento y ceguera a la fuerza de la señal, ya que el dropout mata unidades sin preguntar si su entrada es grande o pequeña, lo que motiva a hacer que las probabilidades de supervivencia dependan de la propia entrada.

La derivación comienza con una red de juguete de una entrada con un cincuenta por ciento de dropout, donde una entrada de menos dos promedia a menos uno, luego reemplaza el lanzamiento de moneda con una curva: la curva acumulativa gaussiana mapea menos dos a una probabilidad de supervivencia del dos por ciento para un promedio de menos cero punto cero cuatro, menos uno al dieciséis por ciento para menos cero punto uno seis, con cero, cero punto ocho cuatro en uno, y uno punto nueve seis en dos cayendo sobre la forma GELU emergente, escrita de forma compacta como la entrada multiplicada por su propia probabilidad de supervivencia.

Intercambiar el mapeo de campana por la sigmoide familiar produce SiLU, un casi gemelo de GELU que prospera en entornos similares y deja a los profesionales eligiendo principalmente por ecosistema, mientras que SwiGLU añade un peso aprendido, una rama tipo Swish y una segunda proyección multiplicadas juntas a través de una unión de compuerta, un diseño cuyo propio artículo no ofrece una historia causal, solo resultados, además de las dos intuiciones del anfitrión de que las unidades más costosas fuerzan redes más delgadas y que las formas entrenables permiten que la red decida por sí misma, una apuesta que la familia de modelos de Meta tomó visiblemente.

Visualization: nodesdaily AI

Comentario de la IA

""Solía tratar las funciones de activación como tuberías entre capas, pero este episodio me hizo cambiar de opinión: ver cómo el dropout se convertía en una curva, y esa curva en GELU, hizo que todo el stack moderno de LLM pareciera menos magia y más una cadena de apuestas razonables.""

Evaluación de la IA

El argumento más sólido para la vieja guardia es el costo y la suficiencia, y me lo tomo en serio: los estudios de ReLU escaladas muestran que las variantes de ReLU ajustadas aún pueden entrenar transformadores de visión de manera competitiva, y el trabajo de inferencia que elimina GELU de los modelos existe precisamente porque las activaciones suaves son más costosas en el momento de la entrega, por lo que la actualización no es gratuita.

Lo que el episodio no puede darme es un número: su historia de sobreajuste se cuenta con nubes de puntos y curvas dibujadas a mano, mientras que la evidencia sólida vive en los artículos, donde el estudio GELU informa ganancias en tareas de visión, lenguaje y habla y los profesionales señalan que la brecha SiLU-versus-GELU suele ser lo suficientemente pequeña como para que la conveniencia de ingeniería decida.

Para la verificabilidad, peso el ecosistema sobre la anécdota: el propio artículo de SwiGLU se niega a explicar por qué funciona el diseño, por lo que considero la adopción por parte de la industria, desde Llama y Mistral hasta Qwen y DeepSeek estandarizando en bloques SiLU con compuerta, como la verdadera confirmación, y cualquier afirmación de sobreajuste como algo que debe volver a probarse antes de decidir.

Mi lectura práctica es esta: por defecto usaría bloques estilo SwiGLU para un nuevo transformador, mantendría GELU donde una base de código ya funciona bien con él, y solo recurriría a ReLU simple cuando el presupuesto de inferencia o el hardware lo dicten, porque la familia suave compra robustez mientras que la factura recae en el cómputo.

Fuentes

10 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

gelu · silu · swiglu · función de activación · relu · dropout · statquest

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…