Josh Starmer, l'hôte de StatQuest, se propose d'expliquer trois fonctions d'activation, GELU, SiLU et SwiGLU, à quiconque connaît déjà ReLU, et le titre est simple : les deux premières ne diffèrent de ReLU que subtilement, la troisième peut prendre des formes bien plus sauvages, mais toutes trois partagent un trait de famille : elles résistent à l'envie de mémoriser les données d'entraînement.
Les différences visibles sont petites mais précises : là où ReLU s'aplatit à zéro pour chaque entrée négative et forme un coude prononcé à l'origine, GELU et SiLU plongent légèrement en dessous de zéro entre environ moins deux et zéro, arrondissent le coin en une courbe lisse et différentiable, et renvoient des valeurs un peu plus petites que l'entrée du côté positif.
SwiGLU joue un jeu différent : elle peut imiter une ReLU lissée, mais ses paramètres supplémentaires lui permettent de se plier en des formes que ses cousines ne peuvent atteindre, ce qui explique précisément pourquoi l'épisode la traite comme le poids lourd flexible du trio plutôt que comme une simple variante.
Le bénéfice promis par l'épisode est la généralisation : un grand réseau ReLU drapé sur des points d'entraînement dispersés épouse chaque point, y compris le bruit, tandis que la même capacité construite sur les nouvelles activations trace un chemin médian plus calme qui est plus susceptible de bien prédire les points non vus.
L'histoire remonte à avant 2010, lorsque la sigmoïde régnait : sa sortie de zéro à un faisait écho à un neurone soit actif soit silencieux, sa courbe en S imitait la transition entre ces états, et sa douceur partout rendait la rétropropagation simple, de sorte que les réseaux peu profonds s'entraînaient avec bonheur.
La profondeur a brisé le charme : loin de zéro, la pente sigmoïde s'effondre vers le néant, les gradients se réduisent à des murmures, chaque étape d'optimisation rampe, et un réseau qui aurait dû tracer l'ajustement ondulé idéal s'enlise dans une courbe timide qui manque les données, le sous-ajustement classique.
Vers 2010, ReLU a pris le relais avec une ligne brisée presque suspectement simple : les négatifs deviennent zéro, les positifs passent inchangés, la pente est soit zéro soit un, de sorte que les grandes entrées maintiennent les gradients en vie et les piles profondes deviennent enfin entraînables, une course couronnée en 2017 au sein du premier Transformer.
Mais la capacité est devenue le nouveau piège : un réseau ReLU géant ne sous-ajuste plus, il sur-ajuste, enveloppant chaque bizarrerie de l'échantillon, et réduire le réseau n'est pas une vraie réponse puisque personne ne peut tester cent mille tailles une unité à la fois pour trouver le point idéal.
Le dropout a été la première solution systématique que l'épisode rappelle : pendant l'entraînement, des sous-ensembles aléatoires d'unités sont mis au silence, chaque étape entraîne effectivement un réseau plus mince, et au moment de la prédiction, le modèle complet se comporte comme une moyenne de tous ces réseaux minces, rapprochant l'ajustement ReLU instable de l'idéal ; mais la solution a deux coûts, des mécanismes ajoutés à l'entraînement et une cécité à la force du signal, puisque le dropout tue des unités sans demander si leur entrée est grande ou petite, ce qui motive à faire dépendre les chances de survie de l'entrée elle-même.
La dérivation commence par un réseau jouet à une entrée avec cinquante pour cent de dropout, où une entrée de moins deux donne en moyenne moins un, puis remplace le tirage au sort par une courbe : la courbe cumulative gaussienne mappe moins deux à une chance de survie de deux pour cent pour une moyenne de moins zéro virgule zéro quatre, moins un à seize pour cent pour moins zéro virgule un six, avec zéro, zéro virgule huit quatre à un, et un virgule neuf six à deux tombant sur la forme GELU émergente, écrite de manière compacte comme l'entrée multipliée par sa propre probabilité de survie.
L'échange de la cartographie en cloche pour la sigmoïde familière donne SiLU, un quasi-jumeau de GELU qui prospère dans des contextes similaires et laisse les praticiens choisir principalement par écosystème, tandis que SwiGLU ajoute un poids appris, une branche de type Swish et une seconde projection multipliées ensemble via une jonction de gating, une conception dont le propre article n'offre aucune histoire causale, seulement des résultats, plus les deux intuitions de l'hôte selon lesquelles des unités plus coûteuses forcent des réseaux plus minces et que des formes entraînables permettent au réseau de décider par lui-même, un pari que la famille de modèles de Meta a visiblement pris.
Commentaire de l’IA
"« Je traitais les fonctions d'activation comme de la plomberie entre les couches, mais cet épisode a changé mon point de vue : voir le dropout se transformer en courbe, et cette courbe se transformer en GELU, a rendu l'ensemble de la pile LLM moderne moins magique et plus comme une chaîne de paris raisonnables. »"
Évaluation de l’IA
Le meilleur argument en faveur de l'ancienne garde est le coût et la suffisance, et je le prends au sérieux : des études sur les ReLU à l'échelle montrent que les variantes de ReLU ajustées peuvent encore entraîner des transformeurs de vision de manière compétitive, et les travaux d'inférence qui retirent GELU des modèles existent précisément parce que les activations lisses sont plus coûteuses au moment du service, donc la mise à niveau n'est pas gratuite.
Ce que l'épisode ne peut pas me donner, c'est un chiffre : son histoire de surapprentissage est racontée avec des nuages de points et des courbes dessinées à la main, tandis que les preuves concrètes se trouvent dans les articles, où l'étude GELU rapporte des gains dans les tâches de vision, de langage et de parole et les praticiens notent que l'écart SiLU-versus-GELU est généralement suffisamment faible pour que la commodité d'ingénierie décide.
Pour la vérifiabilité, je privilégie l'écosystème à l'anecdote : l'article de SwiGLU lui-même refuse d'expliquer pourquoi la conception fonctionne, donc je considère l'adoption par l'industrie, de Llama et Mistral à Qwen et DeepSeek standardisant sur les blocs SiLU à gating, comme la vraie confirmation, et toute affirmation de surapprentissage comme quelque chose à re-tester avant de décider.
Ma lecture pratique est la suivante : je choisirais par défaut les blocs de style SwiGLU pour un nouveau transformeur, je garderais GELU là où une base de code fonctionne déjà bien avec elle, et je n'utiliserais la simple ReLU que lorsque le budget d'inférence ou le matériel l'exige, car la famille lisse apporte de la robustesse tandis que la facture arrive en calcul.
Sources
10 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=2FaI2Fen1mQ
- @arxiv https://arxiv.org/abs/1606.08415
- @arxiv https://arxiv.org/abs/2002.05202
- @sebastianraschka https://sebastianraschka.com/llms-from-scratch/ch04/11_silu/
- @docs https://docs.cognisoc.com/zigllm/transformers/feed-forward-networks/
- @github https://github.com/hendrycks/GELUs
- @arxiv https://arxiv.org/pdf/2109.03810v2.pdf
- @doi https://doi.org/10.48550/arxiv.2402.01169
- @zeroentropy https://zeroentropy.dev/concepts/silu/
- @jytan https://jytan.io/blog/transformer-architectures
gelu · silu · swiglu · fonction d'activation · relu · dropout · statquest