Retour au fil

Le tunnel du temps de l'apprentissage profond : les 40 ans de Hinton, des machines de Boltzmann au Forward-Forward en PyTorch

Le cours pratique de 27 heures de freeCodeCamp transforme les articles fondateurs de Geoffrey Hinton en un voyage chronologique. Le formateur Mohammed Abrah explique la motivation, le problème et l'idée centrale de chaque travail, puis relie la théorie à une implémentation PyTorch compacte, retraçant comment les machines de Boltzmann, la rétropropagation, les réseaux de croyance profonde, AlexNet, le dropout, la distillation, les capsules, la normalisation de couche et l'algorithme Forward-Forward ont façonné les réseaux de neurones modernes.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — BMYvfVk8Ar0
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Appeler Geoffrey Hinton le parrain de l'IA est un raccourci pour une histoire plus longue, et le cours pratique de 27 heures de freeCodeCamp la raconte pas à pas. Il enchaîne les articles clés de Hinton sur plusieurs décennies en un seul récit et associe chacun à une implémentation PyTorch pédagogique. Le formateur Mohammed Abrah encadre chaque chapitre par la motivation, le problème abordé et l'idée centrale introduite, puis rend l'idée exécutable grâce à des visualisations et de petites expériences. L'objectif n'est pas de mémoriser des architectures mais de les reconstruire et de ressentir pourquoi les réseaux modernes ont la forme qu'ils ont.

Apprendre avec l'énergie : les machines de Boltzmann et l'idée de Helmholtz

L'histoire s'ouvre dans les années 1980 avec les machines de Boltzmann. Formulées par Ackley, Hinton et Sejnowski en 1985, ces réseaux empruntent l'énergie à la mécanique statistique : les unités s'activent et se désactivent de manière probabiliste et les poids encodent la force avec laquelle deux hypothèses se soutiennent mutuellement. La répartition des unités en groupes visibles et cachés permet de réduire les contraintes d'ordre supérieur entre pixels ou mots à des interactions par paires via des explications cachées. L'entraînement était lent et exigeait une convergence vers l'équilibre thermique, mais la règle d'apprentissage qui rapproche les statistiques de co-occurrence de la distribution des données constituait une première recette claire pour choisir automatiquement des représentations internes.

La forme moderne de la rétropropagation suit de près. L'article de 1986 de Rumelhart, Hinton et Williams a rendu pratique l'attribution du crédit pour les réseaux multicouches en propageant les dérivées de l'erreur vers l'arrière grâce à la règle de la chaîne. L'accompagnait un engagement envers les représentations distribuées et les mélanges adaptatifs d'experts locaux, où le savoir réside dans des motifs d'activité plutôt que dans des cases uniques et où des spécialistes se disputent pour traiter différentes régions de l'espace d'entrée. Cette position explique pourquoi les réseaux de neurones peuvent généraliser à partir d'exemples au lieu de simplement les mémoriser.

La modélisation générative des années 1990 pousse la même intuition plus loin. La machine de Helmholtz et son algorithme wake-sleep entraînent les poids de reconnaissance et de génération en phases séparées : inférer les causes cachées à partir de données réelles pendant l'éveil, puis rêver des données à partir de ces causes pendant le sommeil. Comme l'apprentissage de Boltzmann, il utilise deux régimes avec des conditions aux limites différentes sur les unités visibles, mais il remplace la coûteuse convergence stochastique par une inférence approximative feed-forward. Les résultats étaient limités, mais la tentative d'apprendre à la fois un modèle et une procédure d'inférence préfigure les méthodes variationnelles utilisées aujourd'hui.

De la visualisation à la croyance profonde : t-SNE, pré-entraînement glouton et ReLU

Rendre lisibles les données de grande dimension a conduit à l'algorithme d'incorporation de voisins stochastiques. Le SNE de Hinton et Roweis et l'extension t-SNE de 2008 avec van der Maaten préservent les probabilités de voisinage afin que les points proches en grande dimension restent proches en deux dimensions. La technique est devenue un outil par défaut pour l'analyse exploratoire car elle rend les variétés et les modes de défaillance visibles d'un coup d'œil — un rappel qu'une bonne incorporation peut valoir autant qu'un bon classifieur.

2006 a ravivé la foi dans la profondeur. La recette du réseau de croyance profonde empilait des machines de Boltzmann restreintes et les entraînait gloutonnement une couche à la fois, puis affinait l'ensemble de la pile. Avec peu de données étiquetées, il apprenait quand même des caractéristiques hiérarchisées car chaque RBM capturait d'abord la distribution de son entrée. Des améliorations montrant que les unités linéaires rectifiées aident les RBM, ainsi que l'extension en machine de Boltzmann profonde, ont contribué à ramener la profondeur de l'étagère au centre de la recherche. Ce qui semblait inentraînable est soudain apparu entraînable.

ImageNet en 2012 a rendu le point incontestable. AlexNet de Krizhevsky, Sutskever et Hinton fonctionnait comme un réseau convolutif de huit couches avec 60 millions de paramètres sur deux GTX 580 dans une chambre, atteignait 15,3 % d'erreur top-5 et battait le deuxième de plus de dix points. ReLU, dropout, normalisation locale de réponse et augmentation agressive travaillaient ensemble ; la leçon plus large était que de grandes données étiquetées plus le calcul GPU plus la convolution profonde pouvaient passer à l'échelle. La vision par ordinateur est ensuite devenue un problème d'apprentissage profond.

Mieux généraliser : dropout, distillation, normalisation et capsules

L'une des astuces les plus portables d'AlexNet est devenue un article à part entière. Le dropout, systématisé par Srivastava et Hinton en 2014, met aléatoirement en sourdine environ la moitié des unités cachées à chaque étape d'entraînement, brisant la co-adaptation et approximant un ensemble au sein d'un seul réseau. Sa simplicité et sa réduction constante du surapprentissage en ont fait une recette de régularisation par défaut bien au-delà de la vision.

Deux idées complémentaires ont simplifié le transfert de connaissances et la stabilité de l'entraînement. La distillation des connaissances de 2015 propose d'apprendre à un petit élève à imiter les distributions de probabilités douces d'un enseignant encombrant, transportant un savoir obscur sur les similarités entre classes que les étiquettes dures cachent. La normalisation de couche de Ba et Hinton en 2016 normalise au sein d'une couche par exemple au lieu de le faire sur un mini-lot, stabilisant l'entraînement récurrent et à petits lots où la normalisation par lot peine, et elle est devenue par la suite courante dans les modèles de séquences.

Les capsules offraient une intuition géométrique différente. L'article de routage dynamique de 2017 de Sabour, Frosst et Hinton encode la présence et la pose d'une entité dans un vecteur et laisse les parties de bas niveau voter pour des touts de haut niveau par accord itératif ; l'objectif est de transformer les changements de point de vue en multiplications matricielles dans l'espace des poses plutôt qu'en augmentation par force brute. Peu après, l'apprentissage contrastif de représentations visuelles a montré que des caractéristiques solides peuvent émerger sans étiquettes en rapprochant des vues augmentées d'une même image et en écartant les autres.

Le cours se termine par une alternative à la rétropropagation elle-même. L'algorithme Forward-Forward de Hinton de 2022 remplace le schéma avant-plus-arrière par deux passes avant : une sur des données réelles où chaque couche augmente un score de qualité et une sur des données négatives où elle le diminue. La qualité peut être aussi simple qu'une somme d'activités au carré et chaque couche apprend avec son propre objectif, si bien que les dérivées ne circulent jamais vers l'arrière et que les activations n'ont pas besoin d'être stockées pour une passe arrière. La méthode gère les boîtes noires où les dérivées exactes sont inconnues, permet le pipelining de données en flux et laisse entrevoir du matériel plus proche du cortex ou compatible analogique, même si sur les grands benchmarks elle reste en retrait par rapport à la rétropropagation. Reconstruire chaque jalon en PyTorch exécutable rend l'arc historique tangible et montre comment des idées incrémentales se composent en la pile moderne.

Commentaire de l’IA

""Mon avis est que ce n'est pas une visite nostalgique : sa valeur réside dans le fait de montrer comment chaque idée historique transpire encore dans la pratique d'aujourd'hui. La vision énergétique derrière les machines de Boltzmann, l'intuition de régularisation derrière le dropout, ou l'invariance au point de vue recherchée par les capsules continuent de façonner les choix architecturaux ; les réimplémenter en PyTorch rend cette continuité visible.""

Évaluation de l’IA

Renforcer la contre-argumentation : un fil historique peut sur-attribuer le succès moderne à une seule figure et masquer le réseau plus large des contributions ; AlexNet devait aussi ses données à l'ImageNet de Fei-Fei Li, son calcul à CUDA et sa recette à des astuces d'augmentation et de réglage. Cette critique a du mérite car l'apprentissage profond est collectif, mais le cours l'atténue en séparant motivation, problème et idée centrale pour chaque article, ce qui fait lire la lignée de Hinton comme une continuité de choix de conception plutôt que comme un culte de la personnalité.

Les limites comptent : le récit de 27 heures s'appuie sur des simplifications pédagogiques en PyTorch, laissant de côté l'échelle, la curation des données et l'ingénierie de production qui dominent les déploiements réels. La vidéo source étant longue et le texte construit par synthèse web à partir du titre oembed, de la description et des articles d'appui, les dates, les listes d'auteurs et les taux d'erreur devraient être vérifiés par recoupement avec les articles originaux ; des chiffres comme les 15,3 % d'erreur top-5 d'AlexNet ou ses 60 millions de paramètres méritent une vérification à la source primaire.

Les incitations autour du récit méritent une note : freeCodeCamp optimise l'accès libre et l'achèvement, tandis qu'une rétrospective sur Hinton après la visibilité du Nobel met naturellement l'accent sur la cohérence ; il n'y a pas de révision par les pairs indépendante dans la leçon. Cela n'invalide pas le matériel, mais signifie que les chapitres plus spéculatifs sur les capsules ou le Forward-Forward devraient être lus comme des propositions avec des preuves plutôt que comme des pratiques établies.

En pratique, le geste utile est de reconstruire petit et de capitaliser : réimplémenter la vision énergétique des machines de Boltzmann, l'habitude de régularisation du dropout, la tactique de compression de la distillation et l'astuce de stabilité de la normalisation de couche sur une tâche jouet, puis faire correspondre chacune à une décision d'un projet en cours. Les capsules et le Forward-Forward servent alors de laboratoire d'inspiration et de prudence, montrant comment l'intuition géométrique et un apprentissage proche du cortex pourraient compter même s'ils ne remplacent pas encore la pile standard.

Sources

8 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

apprentissage profond · hinton · pytorch · intelligence artificielle

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…