Volver al inicio

¿Qué es Jev? El modelo de decisión 200 veces más rápido del cocreador de ChatGPT, explicado

Diego Almeida, cocreador de ChatGPT, pasó dos años en modo sigiloso para lanzar Jev, un motor de decisión no generativo. Entre 20 y 200 veces más rápido, hasta 400 veces más barato a 42 dólares por mil millones de tokens de entrada y salida gratuita, este modelo System 1 clasifica todo, desde correos hasta automatización de navegador, en milisegundos.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — 2z-7pIj57f8
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Qué es Jev y por qué lleva el nombre de Jevons

Jev es el primer modelo System 1 de TypeSafe AI, nombrado por William Stanley Jevons y su paradoja: cuando la eficiencia aumenta, el consumo aumenta. El fundador Diego Almeida co-inventó ChatGPT en Google Brain y OpenAI y dice que pasó dos años en modo sigiloso preguntándose por qué los modelos de chat sobrehumanos no llevaron a la AGI. Su respuesta es un cambio de entrenamiento que produce un motor de decisión que no genera texto.

La arquitectura no tiene bucle autorregresivo. Los modelos clásicos emiten el siguiente token en secuencia; Jev toma un estado y un conjunto de preguntas y los puntúa todos en paralelo. El equipo afirma ser entre 20 y 200 veces más rápido y entre 40 y 400 veces más barato que los modelos de chat de frontera. Doom en tiempo real, carreras wiki de medio segundo y búsquedas de vuelos en 7 segundos se presentan como prueba visual de esa afirmación.

El encuadre viene de Thinking, Fast and Slow de Daniel Kahneman. El System 1 es rápido e intuitivo, el System 2 lento y deliberado. Los modelos de frontera como Claude y GPT se comportan como System 2; Jev está construido para ser System 1. La idea es mover una tarea del System 2 al System 1 mediante la práctica, como aprender a conducir y luego hacerlo en piloto automático.

RLCD y tres primitivas: Choice, Score, Bool

Jev se entrena con RLCD, Reinforcement Learning for Calibrated Decisions, en lugar de RLHF. Mientras RLHF optimiza para preferencias humanas y puede amplificar alucinaciones, RLCD optimiza para probabilidades bien calibradas. TypeSafe anuncia cero alucinaciones en tareas de decisión porque cada respuesta devuelve una distribución con confianza en lugar de una frase libre.

La interacción se basa en tres primitivas. Choice elige una de entre 2 y 255 opciones predefinidas y devuelve una distribución, por ejemplo fraude frente a limpio frente a revisión humana, o facturación frente a técnico frente a ventas. Score ubica un caso en una rúbrica de 2 a 11 niveles y devuelve un valor entre 0 y 10, como aficionado a empresa o cosmético a bloqueante. Bool responde a una proposición de sí o no con una probabilidad entre 0 y 1.

Cada solicitud sigue la misma forma: un estado a la izquierda, preguntas a la derecha. El estado puede ser un objeto de correo, una factura JSON, una descripción de pantalla de juego o un diff de código. Las instrucciones, las opciones y ejemplos opcionales definen cada pregunta. Como no hay generación de texto, la salida siempre es un JSON type-safe que alimenta directamente una sentencia if, y varias preguntas para el mismo estado se ejecutan en paralelo para miles de decisiones por segundo.

Precio, velocidad y límites: lo que dicen los números

Los precios rompen expectativas. La entrada cuesta 42 dólares por mil millones de tokens, es decir, 0,042 dólares por millón. Eso es unas tres veces y media más barato que DeepSeek V4.1 Flash a 0,15 dólares. Los tokens de salida no se miden en absoluto; el equipo dice que son demasiado baratos para medirlos. Una evaluación temprana de Vercel señaló que una carga de clasificación hecha con Gemini Flash corría 6 veces más rápido en Jev y saturaba la evaluación.

La latencia es el titular. La respuesta típica del playground es de 100 a 200 milisegundos, a menudo alrededor de 150. Para muchos usuarios, la latencia de red supera la latencia del modelo. Incluso los LLM más rápidos a 250 o 300 tokens por segundo son un orden de magnitud más lentos al producir el mismo JSON estructurado. La ventana de contexto es de 64k tokens de entrada, aproximadamente el 6 % de Astra u Opus con 1 a 1,5 millones, así que Jev intercambia amplitud por velocidad.

Los límites son explícitos. Jev no conversa, no escribe código desde cero y no explica su razonamiento. Etiquetó correctamente 9.857 como primo con un 55 %, pero falló con un número primo muy grande. Reconoció una línea de Shakespeare, pero aun así dijo sí cuando sweet se convirtió en honey. Eligió al estudiante equivocado en la adivinanza del jardín de flores. En ajedrez perdió en material contra Fable por más 16 pero ganó por tiempo; Jev movía en segundos mientras Fable gastaba de 6 a 15 segundos por jugada y fue marcado.

De la bandeja de entrada al navegador: demos destacadas

La demo más repetida es el triaje de correos. Riley Brown clasificó 500 correos por categoría, prioridad, puntuación de spam y necesidad de respuesta en segundos. Ryan Vogle pasó 1.700 correos por 4,2 millones de tokens de entrada por 18 centavos, con 500k tokens de salida en JSON, y el panel mostraba alrededor del 10 % de spam. Un mensaje lacónico sobre un doble cobro se inclinaba hacia facturación con un 63 % pero sin ser decisivo; una nota positiva de «me encanta el servicio» colapsó a none con un 100 % de confianza.

El mismo patrón enruta tickets de soporte: departamento, urgencia y frustración como tres preguntas en paralelo. Una solicitud de reembolso en Hinglish que mencionaba software y dinero fue correctamente desglosada entre técnico y facturación y puntuada con un 31 % de urgencia. Como enrutador de modelos, un agente Claude de un solo prompt usó Jev para elegir nano para un simple hola, un modelo intermedio para una idea de app, y un modelo equilibrado con un 95 % para una solicitud de código más pesada.

La automatización de navegador es la pieza estrella. En una carrera wiki de DNA a My Little Pony, Jev terminó 5 saltos en 0,5 segundos frente a 4 o 5 segundos de Haiku y Sonnet. Una búsqueda de vuelo de Zúrich a Londres terminó en 7,1 segundos por 0,4 centavos. Doom corrió durante una hora con decisiones de milisegundos por unos 7 dólares. Un bucle de conducción autónoma de Tesla recreado en menos de una hora se detuvo en un stop y navegó, mientras Melee y StarCraft corrían con decisiones de Jev en tiempo real.

Los casos cotidianos llenan el resto. Una intención de hogar inteligente para apagar todas las luces se ejecutó en 185 milisegundos. Una factura de fraude fabricada primero se puntuó con un 85 % de verdad y luego un 94 % tras añadir señales de fraude. Un bucle de trading que decide comprar, mantener o vender cada segundo vive en jevtrader.vercel.app, pero sus creadores advierten que no es rentable. Un buscador de clips de YouTube ingirió 1,1 millones de tokens y puntuó 17 momentos en 3 segundos.

Jev en el bucle de código: linters, code smells y ejércitos de navegadores

En ingeniería, Jev brilla como capa de verificación barata. Una demo construyó un linter cualitativo para comentarios; «multiplica el valor por 2» es preciso pero inútil. Escanear 150 comentarios tomó 9,3 segundos por 1 centavo; escanear una base de código completa para 1.700 candidatos se estimó en 57 centavos. Otra pasada escaneó 28 millones de tokens en busca de code smells por 1,19 dólares.

Ejecutar miles de navegadores en paralelo se vuelve económico. El equipo de BrowserUse mostró búsqueda de vuelos más suites adversarias que rastrean un lanzamiento intentando romperlo por centavos. Un estudio ejecuta verificación en cada pull request y solo devuelve los fallos fuertes al System 2. Por el lado de Claude Code, elegir la habilidad correcta entre 182 redujo la tasa de habilidad equivocada del 17 % al 7,3 % con Jev, ahorrando unos 10k tokens de contexto.

Las advertencias se discuten abiertamente. Jev no da rastro de razonamiento, así que la puntuación de confianza es la única señal de auditoría. Para bucles de alto riesgo como el trading, la velocidad sin noticias contrastadas no basta. Para código, el escaneo barato saca a la luz candidatos pero no puede detectar cada smell; el valor está en el triaje, para que la revisión costosa del System 2 se concentre solo en los casos de alta probabilidad.

Acceso y dónde aplicarlo en la vida real

El acceso se realiza actualmente mediante la lista de espera de typesafe.ai e instantáneamente a través de Vercel AI Gateway. Los primeros probadores informan de aprobación en horas, con 5 dólares de crédito de prueba y un playground para las tres primitivas. La instalación como habilidad de Claude Code o Codex está documentada; un solo comando con una clave API permite a los agentes empezar a usar Jev de inmediato, y el cookbook aloja ejemplos para copiar y pegar.

La regla práctica de los vídeos es simple: si miras datos y tomas una decisión, pon Jev ahí. Puntúa los leads entrantes de un formulario de contacto, enruta un ticket de soporte al equipo correcto, pasa una pull request por un tamiz de 100 preguntas, o puntúa una línea de log de 0 a 3 y avisa al de guardia solo por encima de 2,5. Un ejemplo puntuó el formulario de una agencia de diseño gráfico como probabilidad de buen lead, permitiendo al fundador responder a leads de nivel Coca-Cola el mismo día.

Visualization: nodesdaily AI

Momentos clave

  1. Intro: motor de decisión 200 veces más rápidoEl cocreador de ChatGPT Diego Almeida revela dos años en modo sigiloso.
  2. RLCD vs RLHF: entrenamiento calibradoOptimizado para la precisión de probabilidad, no para la preferencia humana.
  3. Tres primitivas: choice, score, boolCada decisión se traduce en JSON type-safe.
  4. Triaje de correos: 500 y 1.700 correos en segundos18 centavos clasifican toda la bandeja de entrada; proporción de spam revelada.
  5. Carrera de navegadores: 5 saltos wiki en 0,5 sJev supera a Haiku y Sonnet hasta 10 veces.
  6. Juegos y piloto automático: Doom, Minecraft, TeslaDecisiones en tiempo real transmitidas durante horas.
  7. Bucle de código: linters y ejércitos de navegadoresEscaneos de comentarios y pruebas adversarias por centavos.
  8. Límites: primo grande y fallos de lógicaLa velocidad sola no reemplaza el razonamiento; el System 2 sigue siendo necesario.

Comentario de la IA

""La forma más corta de presentar Jev es esta: durante tres años tratamos a los grandes modelos como chatbots, pero el trabajo más caro y lento era la clasificación. Jev arranca ese trabajo y nos entrega un superpoder muy barato, muy rápido y muy aburrido.""

Evaluación de la IA

La fortaleza es elegir el carril correcto. En lugar de entrar en la carrera de generación de texto, Jev acelera el trabajo invisible que se repite millones de veces al día: clasificación, enrutamiento y verificación. A unos 150 milisegundos y un coste de centavos, flujos que antes eran demasiado caros de automatizar se vuelven viables, especialmente el triaje de soporte, los correos y las revisiones de pull requests. Incluso superar a un modelo pequeño en la prueba de Vercel respalda la afirmación de calibración.

El límite es que la calibración no es explicabilidad. Una puntuación puede ser precisa sin darte ninguna razón, lo que complica la auditoría en dominios regulados o de alto riesgo como las finanzas y la contratación. Los fallos con un primo grande, una variante de Shakespeare y una adivinanza lógica muestran coincidencia de patrones en lugar de razonamiento. Ganar al ajedrez por tiempo demuestra cómo la velocidad explota las reglas del torneo, no una estrategia superior.

A nivel de industria, Jev debilita la narrativa de un solo modelo para todo. El futuro parece híbrido: el System 1 escanea rápido, el System 2 piensa a fondo y reescribe las reglas. Eso encaja con la ola de inteligencia barata de los modelos chinos abiertos: a medida que la inteligencia se abarata, el consumo aumenta, y el cuello de botella se desplaza de los tokens al cómputo y las operaciones.

En términos pragmáticos, vale la pena hacer una prueba piloto con expectativas gestionadas. Empieza con bucles de bajo riesgo y alto volumen —correos, formularios, logs y comentarios de código—, mide el error contra umbrales y enruta solo las señales fuertes a un modelo caro. No conectes decisiones irreversibles como el trading o la contratación directamente a la automatización; mantén a Jev como asesor y deja que un humano o un System 2 decida.

Fuentes

10 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

jev · typesafe · modelo de decisión · rlcd · system 1 · ia · automatización

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

¿Qué es Jev? El modelo de decisión 200 veces más rápido del…