Volver al inicio

No todo e-mail necesita un gigante: Jev decide en 0,8 s con 97% de confianza

El modelo llamado ‘Cev’ en el vídeo es en realidad Jev — el motor de decisión System One de TypeSafe AI. Clasificó 50 correos en 42 segundos a 800 ms por veredicto, resolvió 7 preguntas en 6 segundos frente a 5 minutos de GPT 5.6 y superó una prueba de urgencia en vivo en 0,8 s al 97%.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — JfkcgcNsatc
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Durante años nuestra relación con la IA fue un ciclo prompt → texto . Doruk Yalçınsoy marca una ruptura: el modelo que en el vídeo suena como ‘Cev’ es en realidad Jev , primer miembro de la familia System One de TypeSafe AI, abierto en acceso anticipado el 15 de septiembre de 2026. Tras los modelos que escriben por instrucción, llega una capa que lee un estado y decide . Los ejemplos son deliberadamente cotidianos — cambiar una prenda al instante, conducir con flujos de sensores, clasificar correos — con un hilo común: no generar prosa sino filtrar entre opciones acotadas con confianza calibrada .

No es un redactor, es un motor de decisión

Lo que distingue a Jev es la arquitectura: tres tipos de preguntas — Noul (probabilidad sí/no 0–1), Choice (elegir en una lista) y Score (puntuación en escala) — evaluadas en paralelo y de forma aislada sobre el mismo estado. Hacer siete preguntas en una sola llamada apenas mueve la latencia porque no hay generación de texto, solo salidas tipadas con confianza calibrada . Por debajo, TypeSafe describe ‘Reinforcement Learning for Calibrated Decisions’ y un nuevo muestreador. En la práctica son 70–500 ms de extremo a extremo, a menudo ~100 ms, a 0,042 $ por millón de tokens de entrada, salida gratis , contexto 32K, solo texto, distribuido por lista de espera.

El argumento de velocidad y coste se concreta en dos cifras del vídeo. El ‘4 segundos para 1.000+ correos’ de marketing se mide como 6–7 segundos en las pruebas de Yalçınsoy, unos 300 ms por consulta . El mismo lote de siete preguntas en un modelo grande como GPT 5.6 Luna tarda unos 5 minutos . La evaluación propia de TypeSafe cita 193,6× más rápido y 444,6× más barato, aclarando que es una medida del proveedor y que las respuestas de referencia son el promedio de GPT-6 Astra y Fable 5.1. Aun así, una estimación — 500 millones de tokens de entrada ≈ 21 $ — y la salida gratis hacen muy tangible la idea de separar la capa de decisión en un motor más barato y rápido.

Del buzón al scoring de leads: dónde encaja

La demo más clara es la de los últimos 50 correos para relevancia de patrocinios: 42 segundos en total , 800 ms por veredicto , con distribución final sí/no en porcentaje. Generalizar es directo: ¿factura o recibo? , trato de marca o phishing, newsletter o prospección; triaje de tono en comentarios de YouTube y redes; comprobaciones post-reunión — ¿se decidió algo, hay acciones definidas, hace falta seguimiento?; en ventas, si un clip puede vivir solo y su fuerza de gancho para estimar viralidad ; revisión de contratos — cláusulas de riesgo, plazos de pago a más de 30 días, necesidad de revisión legal. El vídeo subraya el triaje de leads — ¿hay presupuesto, encaja con nuestro público, cuál es la urgencia? — recomendando preguntarlas por separado en lugar de un vago ‘¿es buen lead?’

El día a día de Yalçınsoy pasa por una consola que agrupa suscripciones — Cloud, ChatGPT, Gemini, Grok y modelos chinos — tras una sola superficie, con un harness que sirve todos los modelos juntos. El paso descrito como ‘elegir C y luego token más barato o calidad máxima’ es en realidad Jev como router: según la tarea, decide qué modelo toma el mando. En el ejemplo, un post sobre ‘GPT1 Live’ se enruta a GPT 5.6 Terra con 100% de confianza y se ejecuta allí. La señal proviene de tablas en arena.ee , descritas como rankings votados por humanos; Yalçınsoy señala que el turco falta allí y, según sus propias pruebas, mantiene GPT para turco. El mismo enrutamiento mono-pregunta Noul/Choice se replica para investigación, generación de imágenes o texto-a-vídeo.

La instalación se quiere rápida. Se compone un estado más preguntas en console.typesafe.ai/playground — Yalçınsoy incluso hace que otra IA redacte las preguntas por lo crítico de la formulación. Luego se genera una clave API , nombrada ‘YouTube’ en la demo, copiada con advertencia clara de no compartirla. Después se abre Codex (o VS Code, Hermes, la consola) y se adjunta la clave dentro del proyecto, idealmente como variable de entorno. El acceso anticipado trae 5 $ de crédito y un coste por decisión descrito como ~0,001 en el vídeo; el set de prueba cubre tres cubos — solicitudes de clientes, borradores de contenido, tareas de IA — en un pequeño job de harness. Nota práctica: descomponer un puntaje de lead y recombinar en código da resultados más calibrados que una sola pregunta monolítica.

Y la prueba en vivo: una sola frase — ‘nuestro checkout está roto, ningún cliente puede pedir, estamos perdiendo ventas’ — preguntada como ‘¿Es urgente este mensaje del cliente?’ devuelve Noul 0,97 sí en unos 0,8 segundos . La lección de Yalçınsoy es el patrón general: no hace falta un gigante para cada pequeño veredicto . La capa rápida e intuitiva System One (metáfora System 1 de Kahneman) asume los juicios rápidos y consistentes , y los grandes modelos generativos solo entran cuando el camino elegido exige realmente prosa, planificación o razonamiento profundo. Los límites también se dicen: Jev no acepta imagen/audio/vídeo , su precisión puede bajar en japonés y similares, un Noul cerca de 0,5 indica incertidumbre y puede tropezar con conteos o comparaciones de fechas. Aun así, para trabajo repetitivo y basado en umbrales — triaje de correo, scoring de leads, controles de contrato y de contenido — el tándem motor pequeño de decisión + gran redactor se presenta hoy como el patrón de automatización más pragmático.

Visualization: nodesdaily AI
TemaResumen
ModeloEl ‘Cev’ del vídeo es Jev — TypeSafe System One
Velocidad / Coste300 ms/consulta, 42s/50 correos, 0,042 $/MTok
UsoBuzón, leads, contratos, comentarios + enrutamiento
DimensiónJev (System One)LLM grande
EntradaSolo texto, 32KTexto+imagen/audio
SalidaVeredicto tipado + confianzaTexto libre
Velocidad~300 ms / consultaSegundos–minutos
Coste0,042 $/MTok entrada, salida gratis$/MTok entrada+salida
Mejor paraTriaje, enrutamiento, scoringEscritura, razonamiento

Momentos clave

  1. Intro — del prompt a decidir
  2. Las tres primitivas de Jev
  3. Velocidad — 6 s frente a 5 min por 7 preguntas
  4. Triaje del buzón — 50 correos en 42 s
  5. Enrutamiento en el harness
  6. Playground y clave API
  7. Prueba de urgencia — 97 % en 0,8 s

Comentario de la IA

"Para mí, la promesa de Jev no es escribir mejor sino escribir menos: donde basta un veredicto, un motor pequeño que devuelve sí/no/categoría con confianza calibrada ahorra tiempo y presupuesto."

Evaluación de la IA

En mi opinión, la afirmación más fuerte del vídeo es también la que más lectura cuidadosa exige: ‘no llames a un gigante para cada pequeño veredicto.’ Para defenderla al máximo: si realmente preguntas a un modelo grande correo por correo sobre 1.000 mensajes, pasar a un motor tipado y paralelo como Jev a ~300 ms por consulta y ~0,001 $ por decisión es una ventaja de escala decisiva, sobre todo donde no hace falta prosa.

Faltan método y riesgo. Una sola muestra de 50 correos, la medición de calentamiento y la columna turca vacía en las tablas de arena.ee debilitan la generalizabilidad. Los 193,6×/444,6× de parte no están verificados de forma independiente; amplitud de contexto, ajuste de umbrales y tratar un Noul cerca de 0,5 como ‘incierto, revisa humano’ se pasan por alto. La falta de entrada de imagen/audio/vídeo y la menor precisión en entradas CJK también estrechan el alcance en producción.

Verifiqué incentivos y verificabilidad con búsqueda web: el lanzamiento de TypeSafe del 15 de septiembre, 70–500 ms y 0,042 $/MTok, contexto 32K solo texto y acceso por lista de espera son coherentes en la documentación, y resúmenes independientes encuadran a Jev como ‘decisiones, no texto.’ La brecha entre ‘4 segundos’ de marketing y ‘6–7 segundos’ medidos es normal y se dice con transparencia. Precios, lista de espera y soporte de idiomas pueden cambiar mes a mes, así que console.typesafe.ai y docs.typesafe.ai requieren una comprobación en vivo al decidir.

Mi conclusión práctica: para equipos pequeños con trabajo repetitivo basado en umbrales, Jev con 5 $ de crédito de prueba y preguntas enseñables es hoy el camino de menor fricción; para quienes van a confiar datos de producción y puntos de contacto con clientes a la nube, no omitan puntos de revisión humana, umbrales en torno a 0,5 y una medición de dos semanas. Sí para aprender y clasificar, aún no como asistente general autónomo para todo.

Fuentes

7 enlaces; 2 de ellos también citados por 3 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

jev · typesafe ai · system one · motor de decisión · triaje correo

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…