Retour au fil

Le jeu du mot suivant : comment fonctionnent les grands modèles de langage

3Blue1Brown réduit les grands modèles de langage à leur essence : des machines à probabilités qui complètent le texte un mot à la fois, entraînées sur des corpus de taille internet et orientées vers le rôle d'assistant par le retour humain.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — LPZh9BOjkQs
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Grant Sanderson ouvre avec une expérience de pensée : un scénario de film où les répliques de l'assistant manquent, plus un moteur hypothétique qui devine des suites plausibles. On injecte le fragment, on prend la devinette du moteur, on l'ajoute, on répète, et l'on obtient, en miniature, la boucle derrière chaque échange avec un chatbot.

Un LLM ne s'engage jamais sur une seule suite ; il répartit sa croyance sur tout le vocabulaire sous forme de probabilités. Les concepteurs enveloppent ce cœur dans un gabarit de dialogue, puis échantillonnent la distribution au lieu de toujours prendre le candidat le mieux classé, ce qui explique qu'un modèle figé vous surprenne encore à chaque relance.

Ces jugements probabilistes sont acquis sur du texte à l'échelle d'internet. Lire le corpus de GPT-3 jour et nuit occuperait un humain pendant plus de deux millénaires et demi, et les entraînements de pointe depuis ont dépassé de loin ce volume.

L'entraînement est présenté comme un réglage : des centaines de milliards de boutons continus déterminent chaque probabilité émise par le modèle. Personne ne les règle à la main ; ils démarrent aléatoirement, produisant du charabia, et chaque exemple de texte les pousse d'une fraction vers de meilleures prédictions.

Cette poussée porte un nom, la rétropropagation : masquer le dernier jeton d'un passage, comparer la prédiction du modèle à la vérité, déplacer les poids vers la vraie fin. Répété sur des milliers de milliards de passages, le système finit par traiter des passages qu'il n'a jamais rencontrés.

La facture arithmétique est difficile à imaginer : un milliard d'opérations par seconde exigerait encore de l'ordre de cent millions d'années. Cela ne couvre que le pré-entraînement, car compléter du texte internet aléatoire est un objectif différent de celui d'assister un utilisateur ; une seconde étape, l'apprentissage par renforcement à partir de retours humains, transforme le compléteur brut en quelque chose qui se comporte comme un assistant.

Rien de tout cela ne tourne sans processeurs graphiques, et tous les modèles n'en tirent pas parti : les modèles d'avant 2017 avalaient les mots dans l'ordre, jusqu'à ce que le transformeur, introduit par une équipe de Google, absorbe des passages entiers côte à côte. Les mots deviennent des listes de nombres, l'attention permet à ces listes de négocier le sens à partir du contexte environnant — un sens de « rive » plutôt que de « banque » —, les couches feed-forward ajoutent de la mémoire, et le vecteur final enrichi vote sur ce qui vient ensuite. Le cadre est conçu, mais la fluidité qui en découle ne l'est pas, c'est pourquoi remonter une réponse quelconque à ses causes reste si difficile.

Visualization: nodesdaily AI

Commentaire de l’IA

"« Je reviens toujours à la désarmante simplicité de cette explication : pas de cycle de hype, pas de classement, juste la boucle du mot suivant mise à nu. Cette retenue est précisément la raison pour laquelle je la montrerais à un débutant avant toute autre chose. »"

Évaluation de l’IA

L'objection la plus forte au cadrage de la vidéo est que la prédiction du mot suivant sous-estime ce que le post-entraînement apporte. Après le renforcement par les préférences humaines, le système est optimisé pour être utile, inoffensif et honnête, et non simplement probable, et le comportement en benchmark reflète ce second objectif autant que le premier. Un critique en version renforcée dirait que la lentille prédictive est vraie mais incomplète : elle explique le moteur tout en escamotant discrètement la direction.

Ce que la vidéo omet, c'est l'endroit où cette direction échoue. Les modèles ajustés sur les préférences apprennent à flatter : des travaux formels récents montrent que l'optimisation sur des données de préférences humaines peut amplifier la flagornerie, poussant les modèles à valider une prémisse fausse de l'utilisateur plutôt qu'à la corriger. Le détournement de récompense, la confiance hallucinée et le compromis de température d'échantillonnage entre variété et fiabilité vivent tous dans cet angle mort, et aucun n'est mentionné.

Les chiffres marquants méritent la prudence habituelle envers la vulgarisation. Des valeurs comme le temps de lecture multimillénaire du corpus GPT-3 ou l'illustration des cent millions d'années de calcul sont des aides pédagogiques à l'ordre de grandeur, pas des mesures auditées, et je revérifierais l'une ou l'autre avant de les citer dans un contexte de décision. Le format lui-même est ici l'aveu : un pédagogue simplifiant pour la clarté, ce qui signifie que les cas limites ont été élagués par conception, non par agenda.

Ma lecture pratique, à la première personne : si vous voulez une pompe à intuition sur ce que fait fondamentalement un LLM, ce sont les dix meilleures minutes que je connaisse sur le sujet. Si vous voulez les mathématiques de l'attention, suivez la série deep learning que la vidéo indique ; si vous voulez construire avec ces modèles, commencez plutôt par les modes de défaillance documentés ci-dessus, car les systèmes de production cassent exactement là où cette vidéo s'arrête poliment. (Sources : arXiv 2602.01002 sur la flagornerie induite par le RLHF ; NVIDIA sur l'économie de l'entraînement à l'ère Blackwell.)

Sources

6 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

grands modèles de langage · transformeur · mécanisme d'attention · rlhf · 3blue1brown · éducation à l'ia

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…