Retour au fil

Qu'est-ce que Jev ? Le modèle de décision 200x plus rapide du co-créateur de ChatGPT expliqué

Diego Almeida, co-créateur de ChatGPT, a passé deux ans dans le secret pour lancer Jev — un moteur de décision non génératif. 20 à 200 fois plus rapide, jusqu'à 400 fois moins cher à 42 $ par milliard de tokens d'entrée et sortie gratuite, ce modèle System 1 classifie tout, des e-mails à l'automatisation de navigateur, en quelques millisecondes.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 2z-7pIj57f8
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Ce qu'est Jev et pourquoi il porte le nom de Jevons

Jev est le premier modèle System 1 de TypeSafe AI, nommé d'après William Stanley Jevons et son paradoxe : quand l'efficacité augmente, la consommation augmente. Le fondateur Diego Almeida a co-inventé ChatGPT chez Google Brain et OpenAI et affirme avoir passé deux ans dans le secret à se demander pourquoi des modèles de chat surhumains n'ont pas mené à l'AGI. Sa réponse est un changement d'entraînement qui produit un moteur de décision qui ne génère pas de texte.

L'architecture n'a pas de boucle autorégressive. Les modèles classiques génèrent le token suivant en continu ; Jev prend un état et un ensemble de questions et les évalue toutes en parallèle. L'équipe affirme une vitesse 20 à 200 fois supérieure et un coût 40 à 400 fois inférieur à celui des modèles de chat de pointe. Doom en temps réel, des courses wiki en une demi-seconde et des recherches de vol en 7 secondes sont présentés comme preuves visuelles de cette affirmation.

Le cadrage vient de Thinking, Fast and Slow de Daniel Kahneman. Le System 1 est rapide et intuitif, le System 2 lent et délibéré. Les modèles de pointe comme Claude et GPT se comportent comme un System 2 ; Jev est conçu pour être un System 1. L'idée est de faire passer une tâche du System 2 au System 1 par la pratique, comme apprendre à conduire puis le faire en pilote automatique.

RLCD et trois primitives : Choice, Score, Bool

Jev est entraîné avec RLCD, Reinforcement Learning for Calibrated Decisions, au lieu de RLHF. Là où RLHF optimise pour les préférences humaines et peut amplifier les hallucinations, RLCD optimise pour des probabilités bien calibrées. TypeSafe annonce zéro hallucination pour les tâches de décision, car chaque réponse renvoie une distribution avec un niveau de confiance plutôt qu'une phrase libre.

L'interaction repose sur trois primitives. Choice choisit l'une des 2 à 255 options prédéfinies et renvoie une distribution, par exemple fraude versus sain versus revue humaine, ou facturation versus technique versus ventes. Score place un cas sur une grille de 2 à 11 niveaux et renvoie une valeur entre 0 et 10, comme amateur à entreprise ou cosmétique à bloquant. Bool répond à une proposition oui/non avec une probabilité entre 0 et 1.

Chaque requête suit la même forme : un état à gauche, des questions à droite. L'état peut être un objet e-mail, une facture JSON, une description d'écran de jeu ou un diff de code. Les instructions, les choix et des exemples optionnels définissent chaque question. Comme il n'y a pas de génération de texte, la sortie est toujours un JSON type-safe qui alimente directement une instruction if, et plusieurs questions pour le même état s'exécutent en parallèle pour des milliers de décisions par seconde.

Prix, vitesse et limites : ce que disent les chiffres

La tarification casse les attentes. L'entrée coûte 42 $ par milliard de tokens, soit 0,042 $ par million. C'est environ trois fois et demie moins cher que DeepSeek V4.1 Flash à 0,15 $. Les tokens de sortie ne sont pas du tout facturés ; l'équipe dit qu'ils sont trop bon marché pour être mesurés. Une évaluation précoce de Vercel a noté qu'une charge de classification réalisée avec Gemini Flash s'exécutait 6 fois plus vite sur Jev et saturait l'évaluation.

La latence est le titre. La réponse typique du playground est de 100 à 200 millisecondes, souvent autour de 150. Pour beaucoup d'utilisateurs, la latence réseau dépasse la latence du modèle. Même les LLM les plus rapides à 250 à 300 tokens par seconde sont un ordre de grandeur plus lents pour produire le même JSON structuré. La fenêtre de contexte est de 64k tokens d'entrée, soit environ 6 % d'Astra ou Opus à 1 à 1,5 million ; Jev échange donc l'ampleur contre la vitesse.

Les limites sont explicites. Jev ne discute pas, n'écrit pas de code à partir de zéro et n'explique pas son raisonnement. Il a correctement étiqueté 9 857 comme premier avec 55 %, mais a échoué sur un très grand nombre premier. Il a reconnu une réplique de Shakespeare, mais a quand même répondu oui quand sweet est devenu honey. Il a choisi le mauvais élève dans l'énigme du jardin de fleurs. Aux échecs, il a perdu au matériel contre Fable avec plus 16 mais a gagné au temps ; Jev jouait en quelques secondes tandis que Fable passait 6 à 15 secondes par coup et a été signalé.

De la boîte de réception au navigateur : démos marquantes

La démo la plus répétée est le tri des e-mails. Riley Brown a classé 500 e-mails par catégorie, priorité, score de spam et besoin de réponse en quelques secondes. Ryan Vogle a fait passer 1 700 e-mails à travers 4,2 millions de tokens d'entrée pour 18 centimes, avec 500k tokens de sortie en JSON, et le tableau de bord montrait environ 10 % de spam. Un message laconique sur une double facturation penchait vers facturation à 63 % mais sans décision ferme ; une note positive « j'adore le service » s'est effondrée vers none avec 100 % de confiance.

Le même schéma aiguille les tickets de support : département, urgence et frustration comme trois questions parallèles. Une demande de remboursement en Hinglish mentionnant logiciel et argent a été correctement démêlée entre technique et facturation et notée 31 % d'urgence. Comme routeur de modèles, un agent Claude à un seul prompt a utilisé Jev pour choisir nano pour un simple bonjour, un modèle intermédiaire pour une idée d'application, et un modèle équilibré à 95 % pour une demande de code plus lourde.

L'automatisation de navigateur est la pièce maîtresse. Dans une course wiki de DNA à My Little Pony, Jev a terminé 5 sauts en 0,5 seconde contre 4 à 5 secondes pour Haiku et Sonnet. Une recherche de vol Zurich-Londres s'est terminée en 7,1 secondes pour 0,4 centime. Doom a tourné pendant une heure sur des décisions à la milliseconde pour environ 7 $. Une boucle de conduite autonome Tesla recréée en moins d'une heure s'est arrêtée à un stop et a navigué, tandis que Melee et StarCraft tournaient avec des décisions Jev en temps réel.

Les cas du quotidien comblent le reste. Une intention domotique d'éteindre toutes les lumières s'est exécutée en 185 millisecondes. Une facture de fraude fabriquée a d'abord été notée 85 % vraie, puis 94 % après l'ajout de signaux de fraude. Une boucle de trading décidant d'acheter, conserver ou vendre chaque seconde vit sur jevtrader.vercel.app, mais ses créateurs avertissent qu'elle n'est pas rentable. Un chercheur de clips YouTube a ingéré 1,1 million de tokens et noté 17 moments en 3 secondes.

Jev dans la boucle de code : linters, code smells et armées de navigateurs

En ingénierie, Jev brille comme couche de vérification bon marché. Une démo a construit un linter qualitatif pour les commentaires ; « multiplie la valeur par 2 » est exact mais inutile. Scanner 150 commentaires a pris 9,3 secondes pour 1 centime ; scanner un codebase entier pour 1 700 candidats était estimé à 57 centimes. Une autre passe a scanné 28 millions de tokens à la recherche de code smells pour 1,19 $.

Faire tourner des milliers de navigateurs en parallèle devient économique. L'équipe BrowserUse a montré une recherche de vol plus des suites adversariales qui rampent sur une version en essayant de la casser, pour quelques centimes. Une boutique exécute la vérification sur chaque pull request et ne renvoie que les échecs sérieux au System 2. Côté Claude Code, choisir la bonne compétence parmi 182 a fait chuter le taux de mauvaise compétence de 17 % à 7,3 % avec Jev, économisant environ 10k tokens de contexte.

Les réserves sont discutées ouvertement. Jev ne donne aucune trace de raisonnement, donc le score de confiance est le seul signal d'audit. Pour des boucles à enjeux élevés comme le trading, la vitesse sans actualités recoupées ne suffit pas. Pour le code, le scan bon marché fait émerger des candidats mais ne peut pas attraper chaque smell ; la valeur est le tri, pour que la revue coûteuse du System 2 se concentre uniquement sur les cas à forte probabilité.

Accès et où l'employer dans la vraie vie

L'accès se fait actuellement via la liste d'attente de typesafe.ai et instantanément par la Vercel AI Gateway. Les premiers testeurs signalent une approbation en quelques heures, avec 5 $ de crédit d'essai et un playground pour les trois primitives. L'installation comme compétence Claude Code ou Codex est documentée ; une seule commande avec une clé API permet aux agents d'utiliser Jev immédiatement, et le cookbook héberge des exemples à copier-coller.

La règle pratique issue des vidéos est simple : si vous regardez des données et prenez une décision, mettez Jev là. Notez les leads entrants d'un formulaire de contact, aiguillez un ticket de support vers la bonne équipe, faites passer une pull request dans un tamis de 100 questions, ou notez une ligne de log de 0 à 3 et alertez l'astreinte seulement au-dessus de 2,5. Un exemple a noté le formulaire d'une agence de design graphique comme probabilité de bon lead, permettant au fondateur de répondre aux leads de niveau Coca-Cola le jour même.

Visualization: nodesdaily AI

Moments clés

  1. Intro : moteur de décision 200x plus rapideLe co-créateur de ChatGPT Diego Almeida révèle deux ans dans le secret.
  2. RLCD vs RLHF : entraînement calibréOptimisé pour l'exactitude des probabilités, pas pour la préférence humaine.
  3. Trois primitives : choice, score, boolChaque décision se traduit en JSON type-safe.
  4. Tri d'e-mails : 500 et 1 700 e-mails en quelques secondes18 centimes classifient toute la boîte de réception ; part de spam révélée.
  5. Course de navigateurs : 5 sauts wiki en 0,5 sJev bat Haiku et Sonnet jusqu'à 10x.
  6. Jeux et pilote automatique : Doom, Minecraft, TeslaDes décisions en temps réel diffusées pendant des heures.
  7. Boucle de code : linters et armées de navigateursScans de commentaires et tests adversariaux pour quelques centimes.
  8. Limites : grand nombre premier et échecs de logiqueLa vitesse seule ne remplace pas le raisonnement ; le System 2 reste nécessaire.

Commentaire de l’IA

""La façon la plus courte de présenter Jev est celle-ci : pendant trois ans, nous avons traité les grands modèles comme des chatbots, mais le travail le plus coûteux et le plus lent était la classification. Jev arrache ce travail et nous offre un superpouvoir très bon marché, très rapide et très ennuyeux.""

Évaluation de l’IA

La force est de choisir le bon créneau. Au lieu d'entrer dans la course à la génération de texte, Jev accélère le travail invisible qui se répète des millions de fois par jour : classification, routage et vérification. À environ 150 millisecondes et un coût de quelques centimes, des flux auparavant trop chers à automatiser deviennent viables, notamment le tri du support, les e-mails et les vérifications de pull requests. Même le fait de battre un petit modèle dans le test de Vercel appuie l'affirmation de calibration.

La limite est que la calibration n'est pas l'explicabilité. Un score peut être exact sans vous donner de raison, ce qui complique l'audit dans des domaines réglementés ou à enjeux élevés comme la finance et le recrutement. Les échecs sur un grand nombre premier, une variante de Shakespeare et une énigme logique montrent de l'appariement de motifs plutôt que du raisonnement. Gagner aux échecs au temps démontre comment la vitesse exploite les règles du tournoi, pas une stratégie supérieure.

Au niveau de l'industrie, Jev affaiblit le récit du modèle unique pour tout. L'avenir semble hybride : le System 1 scanne vite, le System 2 pense en profondeur et réécrit les règles. Cela s'aligne avec la vague d'intelligence bon marché des modèles chinois open source : à mesure que l'intelligence devient moins chère, la consommation augmente, et le goulot d'étranglement se déplace des tokens vers le calcul et les opérations.

Sur le plan pragmatique, il vaut la peine d'être piloté avec des attentes maîtrisées. Commencez par des boucles à faible risque et fort volume — e-mails, formulaires, logs et commentaires de code — mesurez l'erreur par rapport à des seuils, et n'acheminez que les signaux forts vers un modèle coûteux. Ne branchez pas de décisions irréversibles comme le trading ou le recrutement directement sur l'automatisation ; gardez Jev comme conseiller et laissez un humain ou un System 2 décider.

Sources

10 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

jev · typesafe · modèle de décision · rlcd · system 1 · ia · automatisation

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…