Volver al inicio

¿El mayor avance desde ChatGPT? System One de TypeSafe presenta el modelo Jev

Mediante el recorrido de TheAIGRID sobre Jev, el modelo System One de acceso anticipado de TypeSafe del 15 de septiembre de 2026 se presenta como la apuesta sigilosa de dos años de Diogo Almeida, co-creador de ChatGPT: decisiones paralelas en 70-500 ms a 42 $ por mil millones de tokens, sin generación de texto, y una ruta type-safe y puntuada por probabilidades hacia la automatización real.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — LYveAOjtqqM
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

El video abre con una metáfora de tormenta: un nuevo sistema que, según dicen, funciona hasta 200 veces más rápido y 400 veces más barato que los grandes modelos de lenguaje ordinarios, sin perder inteligencia — y ni siquiera ese es su mejor truco. El presentador lo enmarca como un avance global, y luego le pasa el micrófono a Diogo Almeida, fundador de TypeSafe AI, quien recuerda haber co-creado ChatGPT y RLHF en OpenAI y haber entrenado a los primeros modelos para ser sobrehumanos en el seguimiento de instrucciones. Su giro es contundente: ser sobrehumano en el chat no es AGI, y los modelos ajustados por preferencias tienen efectos secundarios que bloquean la automatización verdadera sin intervención humana. La pregunta del billón de dólares que plantea: ¿por qué los gigantes del chat aún necesitan un humano en el bucle?

Por qué el chat no bastaba: el cuello de botella de la automatización

El diagnóstico de Almeida se centra en los defectos moldeados por RLHF: abandono de modos, sobreconfianza y fiabilidad crónicamente deficiente. Cuando un error minúsculo rompe una cadena, la automatización sigue atada. La respuesta de TypeSafe, construida en dos años de sigilo, es una familia de fundaciones diferente optimizada para la automatización: los modelos System One. El eslogan que sigue — construir prod, no un dios — señala la apuesta: en lugar de un conversador más elocuente, un ejecutor más fiable cuyas salidas encajan directamente en el software.

Qué significa System One: un préstamo de Kahneman

El nombre se apoya en la distinción rápido/lento de Daniel Kahneman. Los modelos generativos actuales funcionan como el Sistema 2, deletreando las respuestas token a token en un bucle autorregresivo. Ese bucle es elegante para la conversación y derrochador para las máquinas, como sorber inteligencia a través de una pajita diminuta. El contraste de la demo lo hace visceral: hazle a un modelo System One decenas de preguntas estructuradas y las respuestas vuelven en paralelo, mientras un modelo de lenguaje las deletrea secuencialmente. TypeSafe enmarca el movimiento como un cambio del mismo orden que el que los transformers trajeron frente a las RNN: de secuencial a paralelo por diseño.

Muestreador paralelo y RLCD: cómo es tan rápido y barato

Jev no genera cadenas; puntúa opciones. Una nueva arquitectura, un muestreador paralelo consciente del hardware y una receta de entrenamiento llamada Reinforcement Learning for Calibrated Decisions se combinan para que una sola petición pueda responder muchas preguntas tipadas a la vez. En lugar de palabras emite decisiones con probabilidades y confianza calibradas, un contrato que se siente más cercano al código: autoconsistente, type-safe y sin espacio para prosa suelta. La comparación lado a lado en el clip de lanzamiento lo subraya: el LLM narra, Jev decide, y la decisión llega casi al instante porque nada se está deletreando.

La velocidad y el costo siguen a la arquitectura. TypeSafe anuncia Jev como hasta 100 veces más rápido y aproximadamente 100 veces más barato, a 42 $ por mil millones de tokens de entrada, con tokens de salida demasiado baratos para medir y por tanto gratis. Explicadores independientes traducen el rango como 70 a 500 milisegundos por consulta adecuada, y 40 a 200 veces más rápido y 40 a 400 veces más barato que flujos frontera comparables. El argumento del video lo hace eco: la IA en tiempo real solo se vuelve posible cuando la latencia y el precio por decisión caen de segundos y centavos a milisegundos y fracciones de centavo.

Qué significa «no puede alucinar» — y qué no

La afirmación más citada — Jev no puede alucinar — requiere un análisis cuidadoso. La garantía es sobre el tipo, no la verdad: el modelo no puede inventar una cuarta categoría cuando solo se definieron tres, ni convertir una clasificación en un ensayo. TypeSafe lo trata como un 0 % matemático de error de tipo y dice que un solo contraejemplo lo falsificaría. Sin embargo, un valor válido pero incorrecto sigue siendo posible, como archivar un ticket de facturación como soporte técnico. El remedio es la calibración. RLCD está ajustado para que una probabilidad del 80 % sea correcta alrededor del 80 % de las veces, lo que permite al software tratar la incertidumbre como una señal en lugar de ruido y escalar las elecciones de baja confianza a un humano o a un modelo mayor.

Prueba de inteligencia: unos puntos menos, dos órdenes de magnitud más barato

En el benchmark propio de TypeSafe de cuatro flujos de trabajo, Jev alcanza un 67,8 % de precisión, empatado con GPT-5.6 Terra y a unos puntos de GPT-5.6 Sol con 74,1 % y Claude Opus 5 con 73,1 %. El golpe está en el compromiso detrás de esos puntos: Jev paga unos 0,0004 $ por caso en 0,4 segundos, mientras que Claude Sonnet 5 necesita 293 veces más dinero y 195 veces más tiempo para el mismo 67,8 %. El encuadre es honesto: en precisión máxima para tareas de bajo volumen y alto riesgo, los mejores LLMs aún van adelante, pero en decisiones acotadas de alto volumen la frontera costo-latencia se inclina fuertemente hacia el especialista.

Prueba en 48 horas: Minecraft, conducción, Subway y dron

La segunda mitad del video deja la teoría y deja hablar a los constructores. El primer clip es Minecraft: Jev recibe un estado del mundo compacto — hora del día, salud, enemigos, acciones disponibles — y elige el siguiente movimiento en cada tick, retirándose de noche sin un prompt de huida a medida. El constructor consumió unos 150.000 tokens en dos minutos por aproximadamente un centavo. El segundo es una demo de conducción estilo simulador montada en menos de una hora: Jev elige entre acelerar, frenar, mantener velocidad o girar según la situación actual mientras el simulador actualiza la carretera y vuelve a preguntar. El tercero es un juego de reflejos tipo Subway Surfers donde Jev decide agacharse, saltar, izquierda o derecha fotograma a fotograma y ya parece mejor que la mayoría de los humanos al primer intento, sin ajuste fino específico de la tarea. El cuarto es un dron en un circuito de obstáculos construido en unos 15 minutos por unos 10 centavos, donde Jev recibe posición, velocidad, distancia de obstáculos y rumbo del objetivo, y elige repetidamente avanzar, girar, subir, descender o mantenerse en vuelo estacionario lo bastante rápido para un vuelo aparentemente en tiempo real.

La lección compartida de los cuatro es lo que Jev no hace. No reemplaza la percepción ni las pilas de vuelo; los simuladores ya proveen la física y la actuación, y Jev solo aporta juicio sobre un conjunto fijo de acciones. Los vehículos reales aún necesitan cámaras, sensores e enclavamientos de seguridad, y las demos no prueban autonomía lista para la carretera. Lo que sí prueban es la rapidez con que la inteligencia puede superponerse a software existente sin recopilar un dataset de conducción ni entrenar un piloto dedicado. Para equipos de producto que necesitan personajes no jugables persistentes, herramientas responsivas o prototipado robótico rápido, el bucle de estado de entrada, decisión tipada de salida puede correr a 10 decisiones por segundo por dólares por hora, lo que reencuadra cómo se siente el tiempo real.

Límites y el sándwich correcto: qué mantener fuera de Jev

Los límites de Jev son parte de su contrato. No escribe prosa, código, resúmenes ni justificaciones; no navega ni usa herramientas; no maneja imágenes ni audio en el lanzamiento; y una sola elección se limita a 255 opciones. La aritmética, la lógica de fechas y las reglas exactas pertenecen al código determinista, no al modelo. El patrón más fuerte que describen los materiales de lanzamiento es una cascada: Jev triage, puntúa y enruta, código simple hace cumplir los invariantes, y un LLM frontera escribe o razona sobre la pequeña porción dura que queda. La confianza calibrada es el traspaso. Al enrutar por debajo de un umbral, los equipos conservan la economía del caso común mientras reservan el modelo costoso para donde gana su salario.

El cierre ajusta el arco: los LLMs enseñaron a las máquinas a hablar, System One quiere dejar que el software decida sin hablar. La invitación del fundador es el acceso anticipado, el veredicto del canal es revisar las demos y decidir si esto es la cosa real. Si su calibración y su precio en la frontera de Pareto sobreviven fuera del laboratorio de TypeSafe y sobre el tráfico propio de un equipo, Jev se convierte en más que un descuento — una nueva primitiva que reemplaza la pelea con JSON parlanchín por una llamada de función tipada para los juicios. Si no, aun así reinicia las expectativas para la automatización de alto volumen al mostrar que las decisiones acotadas no necesitan un narrador cuando basta un decisor rápido, barato y type-safe.

Momentos clave

  1. Afirmación de apertura — 200x más rápido, 400x más barato
  2. El fundador en escena — de ChatGPT a la brecha de automatizaciónSobrehumano en el chat no es automatización
  3. Demo paralela — minutos colapsan a milisegundos
  4. Demo de Minecraft — 2 minutos por 1 centavo
  5. Conducción en simulador y Subway — juicio en tiempo real
  6. Circuito de dron — 15 minutos, 10 centavos para volar

Comentario de la IA

""Mi opinión: Jev invierte la ecuación de costo y latencia al abandonar la generación de texto por decisiones tipadas; su uso más inteligente no es como chatbot independiente, sino como una capa de decisión rápida en cascada frente a LLMs costosos.""

Evaluación de la IA

La parte más fuerte de esta historia es que el precio y la velocidad están atados a una causa estructural: reemplazar la generación token a token por puntuación paralela. Cifras como 70-500 ms y 42 $ por mil millones de tokens pueden leerse como marketing hasta que la calibración RLCD y la imposibilidad de salidas fuera del esquema las hacen comprobables. Al emparejar la demo lado a lado del fundador con explicadores independientes y luego con bucles funcionales construidos en las primeras 48 horas, el video invita al espectador a juzgar un ciclo en funcionamiento en lugar de una tabla de clasificación.

Los límites son más visibles en la medición. El benchmark de cuatro flujos de trabajo lo corre el proveedor, y los rangos de 40-400x en costo y 40-200x en velocidad dependen de la carga de trabajo, el modelo base y el andamiaje del prompt. Las demos corren sobre estado simplificado en simuladores; una vez se añaden cámaras reales, física y enclavamientos de seguridad, la latencia y la fiabilidad deben remedirse. El encuadre de cero alucinaciones es correcto para errores de tipo pero corre el riesgo de escucharse como una garantía de corrección, mientras que la tasa de valores válidos incorrectos necesita seguimiento separado y no desaparece por construcción.

En verificación e incentivos, el panorama aún se apoya en un solo ecosistema: el pedigrí del fundador, el blog de la empresa y constructores tempranos entusiastas. Eso no invalida el trabajo, pero deja abiertas las preguntas de si el precio inicial está subvencionado, si la calibración se mantiene fuera de dominio, y qué baselines exactos hay detrás de los múltiplos del titular. El filtro sobrio para un equipo es una evaluación congelada de su propio tráfico con etiquetas humanas, midiendo precisión, ganancia de enrutamiento por umbral y latencia de extremo a extremo en el mismo camino antes de tratar los deltas del proveedor como universales.

La lectura práctica converge en una cascada. Las decisiones repetidas de alto volumen con un esquema claro — enrutamiento, triage, filtrado de relevancia, guardarraíles y etiquetado masivo estilo map-reduce — son el terreno natural de Jev; las tareas que necesitan prosa, código, explicación o razonamiento abierto siguen perteneciendo a los modelos generativos. El inicio de menor riesgo es reemplazar un clasificador estrecho atendido actualmente por un LLM costoso con Jev, escalar los casos de baja confianza a un humano o modelo frontera, y medir los ahorros en tráfico real; si la ganancia se sostiene, ampliar la capa de decisión en lugar de cambiar toda la pila de golpe.

Fuentes

6 enlaces; 1 de ellos también citados por 3 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

jev · typesafe · system one · diogo almeida · inteligencia artificial · automatización

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…