La vidéo s'ouvre sur une métaphore de tempête : un nouveau système qui, dit-on, fonctionne jusqu'à 200 fois plus vite et 400 fois moins cher que les grands modèles de langage ordinaires, sans perdre en intelligence — et ce n'est même pas son meilleur atout. L'animateur le présente comme une percée mondiale, puis passe le micro à Diogo Almeida, fondateur de TypeSafe AI, qui se souvient d'avoir co-créé ChatGPT et le RLHF chez OpenAI et d'avoir entraîné les premiers modèles à devenir surhumains dans le suivi des instructions. Son constat est brutal : être surhumain en discussion n'est pas l'AGI, et les modèles ajustés par préférences comportent des effets secondaires qui bloquent une véritable automatisation sans intervention humaine. La question du trillion de dollars qu'il pose : pourquoi les géants du chat ont-ils encore besoin d'un humain dans la boucle ?
Pourquoi le chat ne suffisait pas : le goulot d'étranglement de l'automatisation
Le diagnostic d'Almeida se concentre sur les défauts façonnés par le RLHF : abandons de modes, excès de confiance et fiabilité chronique défaillante. Quand une minuscule erreur casse une chaîne, l'automatisation reste en laisse. La réponse de TypeSafe, construite en deux ans de discrétion, est une nouvelle famille de fondations optimisée pour l'automatisation : les modèles System One. Le slogan qui suit — construire la prod, pas un dieu — signale le pari : au lieu d'un bavard plus éloquent, un exécutant plus fiable dont les sorties s'intègrent directement dans le logiciel.
Ce que signifie System One : un emprunt à Kahneman
Le nom s'appuie sur la distinction rapide/lent de Daniel Kahneman. Les modèles génératifs actuels fonctionnent comme le Système 2, épelant les réponses token par token dans une boucle autorégressive. Cette boucle est élégante pour la conversation et gaspilleuse pour les machines, comme siroter l'intelligence à travers une paille fine. Le contraste de la démo rend l'idée viscérale : posez à un modèle System One des dizaines de questions structurées et les réponses reviennent en parallèle, tandis qu'un modèle de langage les épelle séquentiellement. TypeSafe présente ce mouvement comme un changement du même ordre que celui apporté par les transformers face aux RNN : du séquentiel au parallèle par conception.
Échantillonneur parallèle et RLCD : comment c'est si rapide et bon marché
Jev ne génère pas de chaînes ; il note des choix. Une nouvelle architecture, un échantillonneur parallèle conscient du matériel et une recette d'entraînement appelée Reinforcement Learning for Calibrated Decisions se combinent pour qu'une seule requête puisse répondre à de nombreuses questions typées à la fois. Au lieu de mots, il émet des décisions avec des probabilités et une confiance calibrées, un contrat qui ressemble davantage au code : auto-cohérent, type-safe et sans place pour la prose parasite. La comparaison côte à côte dans la vidéo de lancement le souligne : le LLM raconte, Jev décide, et la décision arrive presque instantanément parce que rien n'est épelé.
La vitesse et le coût découlent de l'architecture. TypeSafe annonce Jev comme jusqu'à 100 fois plus rapide et environ 100 fois moins cher, à 42 $ par milliard de tokens d'entrée, avec des tokens de sortie trop bon marché pour être facturés, donc gratuits. Des vulgarisateurs indépendants traduisent la fourchette en 70 à 500 millisecondes par requête adaptée, et 40 à 200 fois plus rapide et 40 à 400 fois moins cher que des workflows frontière comparables. L'argumentaire de la vidéo le fait écho : l'IA en temps réel ne devient possible que lorsque la latence et le prix par décision passent de secondes et de centimes à des millisecondes et des fractions de centime.
Ce que « ne peut pas halluciner » signifie — et ce qu'il ne signifie pas
L'affirmation la plus citée — Jev ne peut pas halluciner — demande une lecture attentive. La garantie porte sur le type, pas sur la vérité : le modèle ne peut pas inventer une quatrième catégorie quand seulement trois sont définies, ni transformer une classification en dissertation. TypeSafe considère cela comme une erreur de type mathématiquement de 0 % et affirme qu'un seul contre-exemple la falsifierait. Pourtant, une valeur valide mais erronée reste possible, comme classer un ticket de facturation en support technique. Le remède est la calibration. RLCD est ajusté pour qu'une probabilité de 80 % soit correcte environ 80 % du temps, ce qui permet au logiciel de traiter l'incertitude comme un signal plutôt que comme du bruit et d'escalader les choix peu confiants vers un humain ou un modèle plus grand.
Test d'intelligence : quelques points de moins, deux ordres de grandeur moins cher
Sur le benchmark maison de TypeSafe à quatre workflows, Jev atteint 67,8 % de précision, à égalité avec GPT-5.6 Terra et à quelques points derrière GPT-5.6 Sol à 74,1 % et Claude Opus 5 à 73,1 %. Le choc, c'est le compromis derrière ces points : Jev paie environ 0,0004 $ par cas en 0,4 seconde, tandis que Claude Sonnet 5 nécessite 293 fois plus d'argent et 195 fois plus de temps pour le même 67,8 %. Le cadrage est honnête : sur la précision maximale pour des tâches à faible volume et enjeux élevés, les meilleurs LLM gardent l'avantage, mais sur les décisions bornées à fort volume, la frontière coût-latence penche fortement vers le spécialiste.
Preuve en 48 heures : Minecraft, conduite, Subway et drone
La seconde moitié de la vidéo délaisse la théorie et laisse parler les bâtisseurs. Le premier clip est Minecraft : Jev reçoit un état du monde compact — heure du jour, santé, ennemis, actions disponibles — et choisit le prochain mouvement à chaque tick, se retirant la nuit sans prompt de fuite sur mesure. Le bâtisseur a consommé environ 150 000 tokens en deux minutes pour environ un centime. Le second est une démo de conduite façon simulateur assemblée en moins d'une heure : Jev choisit entre accélérer, freiner, maintenir la vitesse ou tourner selon la situation courante pendant que le simulateur met à jour la route et repose la question. Le troisième est un jeu de réflexe façon Subway Surfers où Jev décide de se baisser, sauter, aller à gauche ou à droite image par image et semble déjà meilleur que la plupart des humains dès le premier essai, sans fine-tuning spécifique à la tâche. Le quatrième est un drone dans un parcours d'obstacles construit en environ 15 minutes pour environ 10 centimes, où Jev reçoit position, vitesse, distance des obstacles et cap de la cible et choisit répétitivement avancer, tourner, monter, descendre ou rester en vol stationnaire assez vite pour un vol apparemment en temps réel.
La leçon commune aux quatre démos est ce que Jev ne fait pas. Il ne remplace ni la perception ni les piles de vol ; les simulateurs fournissent déjà la physique et l'actionnement, et Jev n'apporte que le jugement sur un ensemble d'actions fixe. Les véhicules réels ont encore besoin de caméras, de capteurs et d'interverrouillages de sécurité, et les démos ne prouvent pas une autonomie prête pour la route. Ce qu'elles prouvent, c'est la rapidité avec laquelle l'intelligence peut être superposée à un logiciel existant sans collecter un jeu de données de conduite ni entraîner un pilote dédié. Pour les équipes produit qui ont besoin de personnages non-joueurs persistants, d'outils réactifs ou de prototypage robotique rapide, la boucle état en entrée, décision typée en sortie peut tourner à 10 décisions par seconde pour quelques dollars par heure, ce qui redéfinit la sensation du temps réel.
Limites et le bon sandwich : ce qu'il faut garder hors de Jev
Les limites de Jev font partie de son contrat. Il n'écrit ni prose, ni code, ni résumés, ni justifications ; il ne navigue pas et n'utilise pas d'outils ; il ne gère ni images ni audio au lancement ; et un choix unique est plafonné à 255 options. L'arithmétique, la logique des dates et les règles exactes appartiennent au code déterministe, pas au modèle. Le schéma le plus fort décrit dans les documents de lancement est une cascade : Jev trie, note et route, du code simple fait respecter les invariants, et un LLM frontière écrit ou raisonne sur la petite tranche dure restante. La confiance calibrée est le point de passage. En routant sous un seuil, les équipes gardent l'économie du cas courant tout en réservant le modèle coûteux là où il gagne sa vie.
La conclusion resserre l'arc : les LLM ont appris aux machines à parler, System One veut permettre aux logiciels de décider sans parler. L'invitation du fondateur est l'accès anticipé, le verdict de la chaîne est de vérifier les démos et de décider si c'est la vraie affaire. Si sa calibration et son prix à la frontière de Pareto survivent hors du laboratoire de TypeSafe et sur le trafic réel d'une équipe, Jev devient plus qu'une remise — une nouvelle primitive qui remplace le combat avec un JSON bavard par un appel de fonction typé pour les jugements. Sinon, il réinitialise quand même les attentes pour l'automatisation à fort volume en montrant que les décisions bornées n'ont pas besoin d'un conteur quand un décideur rapide, bon marché et type-safe suffit.
Moments clés
- Affirmation d'ouverture — 200x plus rapide, 400x moins cher
- Le fondateur sur scène — de ChatGPT au fossé de l'automatisation
Surhumain en discussion n'est pas automatisation
- Démo parallèle — des minutes réduites à des millisecondes
- Démo Minecraft — 2 minutes pour 1 centime
- Conduite en simulateur et Subway — jugement en temps réel
- Parcours de drone — 15 minutes, 10 centimes pour voler
Commentaire de l’IA
"« Mon avis : Jev inverse l'équation du coût et de la latence en abandonnant la génération de texte au profit de décisions typées ; son usage le plus intelligent n'est pas comme chatbot autonome, mais comme couche de décision rapide placée en cascade devant des LLM coûteux. »"
Évaluation de l’IA
La partie la plus forte de cette histoire est que le prix et la vitesse sont liés à une cause structurelle : remplacer la génération token par token par une notation parallèle. Des chiffres comme 70-500 ms et 42 $ par milliard de tokens peuvent sembler marketing jusqu'à ce que la calibration RLCD et l'impossibilité de sorties hors schéma les rendent testables. En associant la démo côte à côte du fondateur à des vulgarisateurs indépendants puis à des boucles fonctionnelles construites dans les 48 premières heures, la vidéo invite le spectateur à juger un cycle en fonctionnement plutôt qu'un classement.
Les limites sont les plus visibles sur la mesure. Le benchmark à quatre workflows est réalisé par le vendeur, et les fourchettes de 40-400x en coût et 40-200x en vitesse dépendent de la charge de travail, du modèle de base et du scaffolding de prompt. Les démos tournent sur un état simplifié dans des simulateurs ; une fois de vraies caméras, la physique et les interverrouillages de sécurité ajoutés, la latence et la fiabilité devront être remesurées. Le cadrage zéro-hallucination est correct pour les erreurs de type mais risque d'être entendu comme une garantie d'exactitude, tandis que le taux de valeurs valides mais erronées nécessite un suivi séparé et ne disparaît pas par construction.
Sur la vérification et les incitations, le tableau repose encore sur un seul écosystème : la pedigree du fondateur, le blog de l'entreprise et des bâtisseurs précoces enthousiastes. Cela n'invalide pas le travail, mais laisse ouvertes les questions de savoir si le prix initial est subventionné, si la calibration tient hors domaine, et quels baselines exacts se cachent derrière les multiples titres. Le filtre sobre pour une équipe est une évaluation figée sur son propre trafic avec des labels humains, mesurant précision, gain de routage par seuil et latence de bout en bout sur le même chemin avant de traiter les deltas du vendeur comme universels.
La lecture pratique converge vers une cascade. Les décisions répétées à fort volume avec un schéma clair — routage, triage, filtrage de pertinence, garde-fous et étiquetage de masse façon map-reduce — sont le terrain naturel de Jev ; les tâches nécessitant de la prose, du code, des explications ou un raisonnement ouvert restent du ressort des modèles génératifs. Le démarrage le moins risqué est de remplacer un classifieur étroit actuellement servi par un LLM coûteux par Jev, d'escalader les cas peu confiants vers un humain ou un modèle frontière, et de mesurer les économies sur le trafic réel ; si le gain tient, élargir la couche de décision plutôt que d'échanger toute la pile d'un coup.
Sources
6 liens ; 1 d’entre eux sont aussi cités par 3 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=LYveAOjtqqM
- @typesafe https://typesafe.ai/blog/introducing-system-one-models-and-jev
Également cité par : Not Billions of Tokens but Decisions: Jev and the NASA Lunar Model Ask the Same Question · The Model That Does Not Speak: 7 Free Repos That Speed Up Claude Code · Jev: The System 1 Model That 10x's Your Claude Code
- @newsbytesapp https://www.newsbytesapp.com/news/science/chatgpt-co-inventor-unveils-jev-a-new-kind-of-frontier-ai/story
- @meetcody https://meetcody.ai/blog/typesafe-jev-ai-system-one-model/
- @dev https://dev.to/valyuai/how-to-use-jev-a-practical-guide-to-typesafes-system-one-model-g5e
- @tao https://www.tao.media/jev-explained-the-ai-model-that-makes-decisions-instead-of-writing-answers/
jev · typesafe · system one · diogo almeida · intelligence artificielle · automatisation