Volver al inicio

No son miles de millones de tokens, sino decisiones: Jev y el modelo lunar de la NASA]

En la tercera semana de septiembre, la misma pregunta aparecio a dos escalas muy distintas: ¿debe un modelo producir mas frases o menos? El modelo Jev de TypeSafe devuelve decisiones calibradas en lugar de texto generado, mientras que IBM y NASA han reunido los datos lunares en un unico modelo que estima mejor donde hay hielo polar. Donde convergen es en la idea de que la computacion debe gastarse en la verificabilidad y no en la elocuencia.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — O4n1jtWzt30
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

En la tercera semana de septiembre llegaron dos novedades en mundos muy distintos. Una vino de un laboratorio de IA en San Francisco; la otra, de equipos que trabajan con datos de observacion lunar. Las dos plantearon la misma pregunta: ¿debe un modelo producir mas frases, o menos frases y mejores decisiones? Ambos lados avanzaron hacia la segunda respuesta.

El producto del lado del software es Jev. La empresa lo presenta como un modelo de decision y no como un modelo de conversacion: se aporta la pregunta de la aplicacion y devuelve valores tipados con probabilidades asociadas. En lugar de generar prosa, el modelo debe emitir una forma que el codigo que la llama ya sabe consumir. El sitio de la empresa lo formula asi: las salidas posibles se definen de antemano, de modo que el modelo no puede producir un error de tipo.

La consecuencia tecnica importa. Un modelo de lenguaje convencional genera un token cada vez, cada uno condicionado por el anterior, lo que en el lado del hardware implica leer y reescribir el estado del modelo en cada paso. Jev produce sus salidas en paralelo en una sola consulta. Buena parte de la diferencia de velocidad y coste viene de ese cambio de arquitectura, no de una nueva forma de multiplicar matrices, sino de cambiar lo que se pide al hardware.

La segunda distincion es la calibracion. Si un modelo dice estar seguro al 60 %, ese numero deberia significar que la prediccion es correcta alrededor del 60 % de las veces. Un panel de profesionales insistio en que es una condicion de la automatizacion y no un detalle: un modelo que acierta una tarea el 95 % de las veces sin poder decir cuando cae en el 5 % restante no puede automatizar esa tarea. Una confianza calibrada hace ademas aflorar una pregunta: quien fija el umbral.

Esa distincion tiene una contraparte tecnica. La probabilidad es una definicion distribucional y matematica; la confianza se parece mas a una decision por umbral. Cuando una interfaz muestra un solo numero, en realidad muestra una distribucion con un corte aplicado, y es la aplicacion, no el modelo, quien decide donde situar ese corte. La revendicacion de Jev se refiere a la consistencia del orden relativo de sus salidas, promesa mas debil que una distribucion de probabilidad completamente especificada.

Los distintos panelists subrayaron limites diferentes. Un linea de razonamiento sostuvo que estos modelos encajan en un subconjunto concreto del trabajo de los LLM, la clasificacion, el enrutamiento y la puntuacion, y no en todo lo que hace un modelo generalista. Otra sostuvo que los modelos de programacion pueden relajar la logica secuencial y llamar a este tipo de modelo solo en los puntos de decision, dejando determinista el resto del programa. Juntos, estos argumentos sacan al modelo de la caja de chat y lo llevan al papel de componente.

El precio cuenta la misma historia en el plano comercial. Jev se Situa en 0,042 dolares por millon de tokens de entrada, con la salida facturada a un nivel tan bajo que no se mide. La magnitud de la diferencia en la tabla comparativa importa porque refleja un patron de uso: un modelo al que se llama cientos de veces dentro de un software. Un modelo disenado para mostrar texto a una persona es mas lento y mas caro en ese escenario.

Aqui sigue haciendo falta una medicion independiente. Las evaluaciones de flujo de trabajo de la empresa anuncian mejoras muy grandes, mientras que comprobaciones de terceros senalaban ventajas de velocidad y coste mas modestas pero reales frente a modelos base baratos. La distancia entre esos dos tipos de cifras depende de la base de comparacion que eligio el proveedor. Antes de comprometerse, conviene volver a medir sobre la propia carga de trabajo con las tarifas actuales.

La segunda gran novedad vino de IBM y NASA. El 10 de septiembre ambas organizaciones publicaron un modelo fundacional de codigo abierto para la ciencia lunar. Su conjunto de datos alinea mas de treinta capas de observaciones de nueve instrumentos y cuatro misiones en un marco espacial comun. Hasta ahora ningun conjunto de datos publico unico habia reunido material multimodal y multirresolucion en una forma utilizable para aprendizaje automatico.

El modelo produjo dos resultados concretos. Al identificar zonas con alto potencial de hielo, su tasa de error bajo hasta un 22 % frente al modelo de referencia. A una escala de contexto de unos cien metros, supero a la referencia en casi un 19 % usando solo la mitad de los datos de entrenamiento. La evaluacion de la NASA es mas matizada: los resultados son comparables en cartografia de crateres y algunas formaciones volcanicas, con una ventaja clara al estimar la estabilidad del hielo polar. Tambien senala que las condiciones de iluminacion variables entre orbitas afectan a la visibilidad de los crateres pequenos.

El valor real del modelo esta en la reutilizacion y no en una respuesta aislada. En lugar de entrenar un modelo aparte para cada pregunta, los equipos adaptaron una base comun, manteniendo la mayor parte de los pesos congelados y usando pequenos adaptadores para el ajuste. Eso reduce el coste de entrenamiento y ofrece a la comunidad un punto de partida utilizable. Es un ejemplo concreto de una idea recurrente: en ciencia, el cuello de botella suele ser la ingenieria de datos y no los algoritmos.

Los datos lunares son un caso exigente porque todo llega a escalas distintas. Una tarea trabaja a unos cien metros, otra a resolucion de metro, y algunas capas proceden de la superficie mientras otras vienen de debajo. Alinear esas capas en un unico marco es tan exigente como entrenar el modelo. El panel senalo esto directamente: emparejar resoluciones y condiciones de observacion puede importar tanto como anadir parametros. El trabajo real bajo un modelo fundacional es procedimental antes que conceptual.

Puestas una al lado de la otra, ambas novedades apuntan en la misma direccion. Una convierte la decision en algo estructurado y calibrado; la otra reduce datos heterogeneos a un lenguaje unico de aprendizaje automatico. En ambos casos el objetivo no es la riqueza del texto generado sino la auditabilidad de la salida. Eso define ademas una nueva unidad para la economia de los modelos: no frases producidas, sino decisiones verificables producidas.

Estas dos enfoques pueden combinarse. Construir un esqueleto de programa determinista para un flujo de trabajo largo y secuencial, y llamar a un modelo de decision calibrado solo en los puntos de bifurcacion, reduce el coste y estrecha la superficie donde los errores pueden esconderse. Es una idea familiar del software adaptada a la IA: escribe la regla en el codigo, deja la ambiguedad a la maquina, pero elige y registra el umbral tu mismo.

Tomadas en conjunto, las dos historias de este mes apuntan al mismo desplazamiento en el desarrollo de modelos. Una se ve en una pagina de producto y la otra dentro de un conjunto de datos cientifico. La pregunta abierta es si los modelos de decision estructurados, tan abiertos y verificables como los datos que los alimentan, reduccion el coste de infraestructura o tambien elevaran la fiabilidad de todo el sistema.

Reduccion del error en hielo polar

  • Modelo de referencia100
  • Modelo NASA-IBM78
  • 22 % menos de error22%
El valor de referencia es 100; el modelo IBM-NASA baja el error a 78.
CriterioJevModelo NASA-IBM
EnfoqueCalidad de la decisionAlineacion de datos
Forma de la salidaValores tipados y probabilidadesMapas y clasificaciones
Base tecnicaGeneracion paralelaMarco espacial comun
Limite principalNo sirve para creacionLa iluminacion afecta resultados
Idea comunPrimero la auditabilidadPrimero la auditabilidad

Momentos clave

  1. El debate sobre eficiencia
  2. Jev y los modelos de decision
  3. El modelo lunar de la NASA
  4. Ingenieria de datos y modelos fundacionales

Comentario de la IA

"Juntas, estas dos salidas muestran que la carrera de modelos se desplaza de la elocuencia a la calidad de las decisiones. La premisa de Jev es que la mayoria de las tareas no necesitan una frase, sino una eleccion y una probabilidad. El modelo NASA-IBM ilustra la misma logica en el lado cientifico: reunir datos es solo la mitad, y hacerlos comparables lleva casi tanto tiempo."

Evaluación de la IA

La afirmacion mas fuerte es el posicionamiento de Jev como modelo de decision dentro del software, junto con su justificacion arquitectonica. Una salida paralela en lugar de una generacion secuencial hace que las promesas de velocidad y coste sean fisicamente comprensibles. El modelo NASA-IBM aporta el mismo valor al decidir alinear primero el conjunto de datos: poner los datos en un marco comun precede al modelo.

Lo que falta es una confirmacion independiente amplia. Existe una diferencia real entre las evaluaciones de la empresa y las comprobaciones de terceros, y esa diferencia depende de la base de comparacion elegida. En el caso lunar, las condiciones de iluminacion variables entre orbitas pueden afectar a la visibilidad de los crateres pequenos y, con ello, a algunas mediciones. En ambos casos el resultado es sensible a la preparacion de los datos y al comparativo elegido.

Merece la pena una contraargumentacion. El enfoque tiene el limite justo en donde gana. Un modelo de decision no hace mejor una tarea: hace la misma tarea con menos coste y mayor control. La ganancia es grande para clasificacion y enrutamiento, pero eso no sustituye a los modelos generalistas en generacion abierta, escritura creativa o resolucion de problemas mal planteados. Son capas, no sustitucion.

Mi Conclusion practica es tomar la siguiente decision de arquitectura a traves de un esqueleto de programa. Construye los flujos largos y secuenciales en codigo determinista, llama a un modelo de decision calibrado solo donde haga falta una bifurcacion, y fija el umbral con tus propios datos dejando constancia. Ese patron convierte las dos novedades en una sola decision de ingenieria y convierte la auditabilidad en el valor por defecto.

Fuentes

7 enlaces; 1 de ellos también citados por 3 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

inteligencia artificial · jev · calibracion · modelos fundacionales · nodedaily

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…