Existe-t-il une limite fondamentale à la quantité de données dans laquelle un texte peut être comprimé ? L'ASCII dépense 8 bits par caractère ; donner des codes courts aux lettres fréquentes ramène la moyenne vers 4 bits, et des méthodes plus astucieuses qui exploitent les motifs sur de longs passages font encore mieux. Mais où se trouve le plancher ? La question remonte aux années 1940, aux travaux fondateurs de Claude Shannon qui ont lancé la théorie de l'information, et les mêmes mathématiques apparaissent aujourd'hui dans la façon dont les modèles de langage sont entraînés.
Dans les modèles de langage actuels, le pré-entraînement est décrit comme une prédiction du prochain jeton avec une perte appelée entropie croisée, un terme issu de la théorie de l'information. L'une des conclusions de cette théorie est que prédire et comprimer sont mathématiquement le même problème : bien prédire, c'est bien comprimer. Cette équivalence me fait reformuler l'objectif d'entraînement : il ne s'agit pas vraiment de deviner des jetons, mais de construire le compresseur de texte le plus efficace possible.
L'expression « la compression est l'intelligence » est provocante, mais l'intelligence est un mot si élastique et si mal défini que le slogan seul ne peut être jugé avec précision ; l'énoncé plus prudent est que les mathématiques de la compression sont étrangement liées à l'intelligence artificielle. Néanmoins, la courte formule fait réfléchir, si bien que la série la prend au sérieux et consacre trois vidéos à examiner ce qu'elle signifie réellement. Le rôle de la première partie est de comprendre les limites de la compression et de conduire le spectateur à réinventer l'idée centrale du théorème de codage sans bruit de Shannon.
L'exemple d'échauffement est le suivant : un rover sur une lune lointaine reçoit quatre commandes de mouvement — haut, bas, gauche, droite — chacune d'un pas de taille fixe. Les commandes n'arrivent pas aussi souvent les unes que les autres : la moitié sont « haut », un quart « bas », un huitième « gauche » et un huitième « droite ». Par simplicité, chaque commande est supposée indépendante, tirée de cette distribution quel que soit le contexte. La question : quand le flux de bits est lent et coûteux, quelle est la manière la plus efficace d'encoder ces commandes en bits ?
L'étudiant direct assigne deux bits par commande, ce qui se décode facilement mais n'exploite jamais la fréquence de la commande « haut ». L'étudiant astucieux propose des longueurs variables : « haut » devient 0, « bas » 10, « gauche » 110, « droite » 111. La moyenne pondérée donne : la moitié du temps 1 bit, un quart du temps 2 bits, un huitième chacun 3 bits, soit 1,75 bit par commande au total. C'est une nette victoire sur le schéma uniforme à 2 bits.
Les longueurs variables soulèvent une énigme de décodage : comment le robot sait-il où tombent les frontières ? Dans le code proposé, aucun mot de code ne commence un autre, une propriété dite « sans préfixe ». Le robot lit les bits et n'enregistre une commande qu'une fois un mot de code complet formé. Sur le diagramme de toutes les chaînes binaires, chaque choix consomme une part de l'espace de code : 0 prend la moitié, 10 un quart, 110 et 111 un huitième chacun. Les parts correspondent exactement aux probabilités des commandes, sans rien laisser de reste.
L'étudiant théoricien n'écrit aucun code réel et réfléchit plutôt aux propriétés qu'un code idéal doit posséder. L'idée astucieuse : le bruit aléatoire devrait être incomprimable, donc un compresseur parfait doit produire un flux de bits indiscernable d'un bruit aléatoire. Un message comprimé de n bits est l'une des 2 puissance n possibilités, toutes également probables sous l'apparence de bruit, donc chaque message source porte la probabilité 2 puissance moins n. Encoder un message en moins de bits le fait descendre d'un étage du diagramme ; un bit économisé ici en coûte deux ailleurs, comme appuyer une bosse dans un tapis pour la voir se relever pire ailleurs.
Ce raisonnement rend l'expression logarithmique inévitable : un message utilisant n bits dans un schéma idéal a la probabilité 2 puissance moins n, donc prendre le logarithme en base 2 et le nier équivaut le nombre de bits au logarithme négatif de la probabilité. Shannon a nommé cette quantité l'information d'un événement : la colonne s'élève quand la probabilité se resserre vers zéro et se rétracte quand la probabilité approche la certitude. Quand les probabilités ne sont pas des puissances de 2 exactes, la valeur sort fractionnaire, et les bits fractionnaires ont du sens comme borne inférieure sur la longueur de code d'un message entier plutôt que sur un symbole isolé.
Le langage diffère du cas du robot de deux façons : la probabilité de chaque nouvelle lettre dépend fortement de tout ce qui la précède, et les probabilités ne sont jamais de belles puissances de 2. Une petite démo de modèle de langage embarqué dans la vidéo produit une distribution différente à chaque position, avec la réserve que les chiffres du modèle peuvent ne pas égaler les vraies probabilités du langage. La probabilité d'une phrase entière est le produit des probabilités conditionnelles successives, la règle de la chaîne, et comme les logarithmes transforment les produits en sommes, l'information du message entier se scinde élégamment en termes par symbole. La troisième partie promet un algorithme concret qui comprime le texte jusqu'à près de cette valeur sommée.
Une façon d'estimer les probabilités est de parcourir des livres et de compter ce qui tend à suivre de courts groupes de lettres, mais cela s'effondre sur de longs contextes inédits. Shannon a plutôt joué à un jeu de devinettes avec sa femme Betty : elle devinait un passage lettre par lettre pendant qu'il écrivait la bonne lettre en cas d'erreur et un tiret en cas de succès. La copie abrégée portait la même information, puisque son double pouvait régénérer l'original en rejouant le jeu. L'article de 1950 a amplifié l'expérience, enregistrant combien de devinettes chaque lettre exigeait et convertissant ce compte en probabilité implicite.
La note philosophique est que Shannon ne faisait pas de l'analyse de données pure ; il sondait des boîtes noires intelligentes, traitant les cerveaux interrogés comme des modèles de langage indescriptibles mais sophistiqués. Aujourd'hui, nous construisons les boîtes noires au lieu de les interroger. L'entropie est définie à ce point : l'information moyenne par symbole d'une distribution, la somme pondérée de chaque probabilité multipliée par sa valeur d'information. L'anecdote sur le nom crédite von Neumann, bien que la vidéo elle-même note que la documentation est fragile.
L'intuition se présente ainsi : plus une distribution s'étale uniformément, plus l'entropie totale est élevée, tandis qu'un événement dominant la tire vers le bas puisque l'issue probable porte peu d'information ; répartir la probabilité sur davantage de symboles l'augmente. C'est essentiellement le théorème de codage sans bruit de l'article de 1948 : aucun code ne bat cette borne, et la borne peut toujours être approchée aussi près que voulu. Pour les processus dépendants du contexte comme le langage, la version généralisée demande le taux d'entropie, moyenné sur tous les messages possibles. Avec au moins une centaine de lettres de contexte, Shannon estimait l'anglais à environ un bit par caractère, comme si le langage pouvait se comprimer en une seule réponse oui-non par lettre.
La deuxième partie s'ouvre sur un article frappant de 2002 : Benedetto, Caglioti et Loreto ont montré dans Physical Review Letters que gzip peut retrouver la structure entre langues. La méthode ajoute un petit extrait du document B au document A et comprime le résultat, puis compare avec la compression de A seul. La différence mesure la qualité de compression de l'extrait de B sous un dictionnaire réglé pour A : petite quand les langues se ressemblent, grande quand elles diffèrent. La reconnaissance de langue, l'attribution d'auteur et l'arbre des familles de langues auraient tous été retrouvés avec cette distance de co-compression.
La scène revient alors au robot : le centre de contrôle change le plan si bien que « haut » et « bas » tombent chacun à un huitième, « gauche » monte à un quart et « droite » à une moitié, tandis que les décodeurs restent codés en dur sur l'ancien schéma. En pondérant les anciennes longueurs de code par les nouvelles fréquences, on obtient un huitième du temps 1 bit, un huitième 2 bits, trois quarts 3 bits, soit une moyenne de 2,625 bits par commande. Ce nombre est l'entropie croisée de l'ancienne distribution relativement à la nouvelle, demandant comment un code réglé pour un contexte se comporte dans un autre. Formellement, un code réglé sur Q dépense moins log2(q_i) bits par symbole, donc sous la réalité P la moyenne est la somme des p_i fois moins log2(q_i). Dans le diagramme en barres, les largeurs portent P tandis que les hauteurs portent les valeurs d'information de Q.
Des distributions-jouets à deux issues aiguisent l'intuition : avec Q uniforme et P déséquilibrée, chaque symbole porte un bit d'information, donc les poids ne changent rien et l'entropie croisée reste à 1 bit. Inversé, l'entropie de Q tombe sous un bit, pourtant le même code face à une réalité uniforme dépense environ 1,74 bit ; l'ordre compte car P et Q jouent des rôles différents dans la formule. En fixant P et en faisant varier Q, on trace une courbe minimisée exactement là où Q égale P, et cette valeur minimale est l'entropie de P. La courbe verte tracée par ces minima est, dans le cas à deux issues, la courbe d'entropie de P elle-même.
L'astuce de compression se relit sous cet angle : comprimer un extrait de B avec un compresseur réglé sur A est une estimation empirique de l'entropie croisée. Pas littéralement : les documents tiennent lieu de distributions, et gzip est loin de la compression à la limite de Shannon, remplaçant les répétitions par des pointeurs via LZ77 avant le codage de Huffman. Même ainsi, la mesure de distance fait un vrai travail en langage naturel, comme l'attribution d'auteur. La leçon se généralise : l'entropie croisée apparaît partout où les motifs d'un cadre doivent être mesurés à l'aune d'un autre.
L'application est l'entraînement des modèles de langage : le texte est découpé en jetons, le modèle produit une distribution du prochain jeton par contexte, et la perte moyenne les logarithmes négatifs des probabilités des vrais jetons. L'apprentissage automatique utilise le logarithme naturel, qui diffère de la base 2 d'un facteur constant absorbé dans le taux d'apprentissage. Pourquoi le logarithme, au fait ? Un motif comme « mon nom est ___ » revient des milliers de fois avec des noms différents ; la distribution Q du modèle et les fréquences P des données définissent une perte totale inscriptible avec une fonction générique par exemple F de Q. Exiger que le total soit minimisé uniquement quand le modèle correspond aux données force, via l'optimisation par multiplicateurs de Lagrange, la dérivée de F à prendre une forme constante en q que seuls les logarithmes possèdent. La main est forcée : la perte n'est pas choisie, elle est impliquée.
La variante à cibles molles est la distillation : le petit modèle s'entraîne contre la distribution complète du grand modèle à chaque point plutôt que contre le seul vrai jeton, avec l'entropie croisée écrite explicitement. L'analogie est les échecs : regarder des parties en silence face à un joueur plus fort qui explique à quel point chaque coup candidat pèse à chaque tour. Une note de bas de page définit la divergence KL comme l'entropie croisée moins l'entropie, les bits par symbole gaspillés par un code mal réglé : zéro quand les distributions coïncident, croissant quand elles divergent, asymétrique. La troisième partie promet l'algorithme transformant un prédicteur en un véritable compresseur, assimilant le pré-entraînement à un entraînement par compression optimale.
Commentaire de l’IA
"« Regarder ces deux vidéos l'une après l'autre m'a laissé une seule impression : le logarithme n'est pas une fonction de perte à mémoriser, mais le terminus où tout le monde doit aboutir dès que la question de la compression est prise au sérieux. La série transforme les formules d'une liste à mémoriser en le résultat inévitable d'un raisonnement, et j'ai structuré cet article dans le même ordre. »"
Évaluation de l’IA
Renforcer l'argument adverse : la compression est passive, tandis que l'intelligence exige des buts, de l'action et des décisions séquentielles ; même une distribution prédictive parfaite ne choisit jamais quoi faire de ses prédictions. Un fichier zip n'est pas un agent, et cette objection pointe le volant décisionnel à l'intérieur de la définition même de l'intelligence de Hutter. Si je devais défendre le slogan, je concéderais que la compression fournit le moteur du modèle du monde, tandis que la direction doit être cherchée ailleurs.
Il y a des limites que la vidéo omet : les expériences rapportées ne comptent jamais la taille du compresseur lui-même, si bien que même quand un modèle à 70 milliards de paramètres comprime des modalités étrangères de façon impressionnante, l'ajout des paramètres rend la description en deux parties bien plus grande que le fichier brut. La série saute aussi la question de la mémorisation : les modèles mémorisent jusqu'à ce que la capacité se remplisse et ne généralisent qu'alors, tandis que gzip est loin de la limite de Shannon. Ces trois points complètent le cadre pour lire les chiffres de la vidéo.
À qui appartient l'affirmation et quel intérêt sert-elle, cela s'applique ici aussi : la page des talents et l'énigme KL à la fin de l'épisode se raccordent organiquement au contenu tout en restant une vitrine commerciale. Des chiffres comme les taux Chinchilla et la corrélation de moins 0,95 arrivent par des récits de seconde main, donc au moment de décider, le dispositif de l'article de DeepMind et l'étendue de l'étude de corrélation — 31 modèles sur 12 benchmarks — méritent des vérifications indépendantes. Dans cet article, j'ai utilisé ces chiffres comme des balises, non comme des fondations.
Mon bilan est le suivant : pour qui lit des courbes de perte, décide de la distillation, ou veut la théorie de l'information par l'intuition, cette série est un arrêt de premier ordre ; pour quiconque suppose qu'une perte plus basse signifie automatiquement un modèle plus intelligent, c'est un piège. La perte est une métrique proxy, pas un certificat de capacité. Je prends au sérieux le lien compression-intelligence, mais j'écris toujours le signe égal entre eux au crayon.
Sources
12 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=GlYgs6v2YfU
- @youtube https://www.youtube.com/watch?v=l6DKRf-fAAM
- @3blue1brown https://www.3blue1brown.com/lessons/cross-entropy/
- @3blue1brown https://3blue1brown.substack.com/p/reinventing-entropy
- @3blue1brown https://3blue1brown.substack.com/p/but-what-is-cross-entropy
- @pubmed https://pubmed.ncbi.nlm.nih.gov/11801178/
- @arxiv https://arxiv.org/pdf/cond-mat/0108530
- @math https://math.mit.edu/~shor/18.310/noiseless-coding.pdf
- @sebastianraschka https://sebastianraschka.com/faq/docs/next-token-prediction.html
- @arxiv https://arxiv.org/abs/2309.10668
- @arxiv https://arxiv.org/abs/2404.09937
- @shanakacdesoysa https://shanakacdesoysa.substack.com/p/compression-isnt-intelligence-so
entropie · entropie croisée · compression · théorie de l'information · shannon · 3blue1brown · modèles de langage