Volver al inicio

La decisión como recuperación: CLM-8B, la arquitectura 13 veces más rápida

Desarrollado por Stanford y Nvidia Research, CLM-8B es un modelo abierto de 8000 millones de parámetros que lleva la decisión desde la generación de texto hasta la recuperación. Marcó 44 milisegundos frente a 570 con 1024 opciones y precisión similar, aunque el acierto cae con claridad cuando las opciones llegan a miles.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — eSuMmMMMrm0
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

La mayoría de las decisiones dentro del software real no necesita que un modelo piense treinta segundos. Si un ticket es urgente, qué herramienta debe correr después, qué enlace debe pulsar el agente: esas respuestas se quieren en milisegundos, no en segundos. Por eso crece la ola System One ; modelos rápidos, sin razonamiento, que devuelven decisiones tipadas en lugar de ensayos. La tesis inicial es exactamente esta: el corazón de los bucles de agentes ya no es la generación, es la velocidad de selección.

Esta semana la diferencia es arquitectónica. Un equipo conjunto de Stanford y Nvidia Research publicó CLM-8B, un modelo abierto de 8000 millones de parámetros llamado modelo de lenguaje contrastivo . La analogía más nítida es CLIP para decidir: la idea del espacio conjunto de incrustaciones descrita en el estudio CLIP de Arxiv se aplica aquí a situaciones y acciones. Un codificador de estado lee lo que ocurre, un codificador de acción lee lo que puede hacerse. Ejemplo Mario: la pantalla es el estado, izquierda, salto o carrera son las acciones; cada opción se codifica, se puntúa por cercanía al estado, se convierte en probabilidades con softmax , y el salto gana con ochenta por ciento.

CLIP para decidir: estado y acción en un mismo espacio

Lo ingenioso del diseño es que habla con fluidez el hábito instalado: el modelo usa la misma interfaz que Jev. Según la documentación de Jevapi existen tres primitivas; una pregunta de sí o no, una de opción múltiple y una puntuación. Según la documentación de System-One, las tres son lo mismo por debajo: un estado más una lista cerrada de candidatos. Ese cierre corta en dos direcciones. El modelo no puede inventar una respuesta fuera de la lista, eco de la promesa sin alucinaciones, pero la metodología de Jevals recuerda qué es por definición un modelo System One: ninguna generación fuera de lista, errores dentro de lista siempre posibles, y el modelo puede elegir la opción errónea con confianza.

¿Cómo se construye un espacio donde la acción correcta cae más cerca? La respuesta es el entrenamiento contrastivo . El entrenamiento parte de millones de ejemplos, cada uno un par de una situación y una acción realmente tomada; el modelo aprende a acercar cada situación a su propia acción y alejarla de las demás. El truco elegante es que nadie escribe las respuestas erróneas: en un lote de mil, si el salto vale para una pantalla de Mario, las otras 999 acciones cuentan automáticamente como erróneas para ella. El equilibrio de positivos y negativos sale gratis, y la frontera entre lo que suena bien y lo que es correcto queda grabada en la geometría.

El secreto de la velocidad se esconde en esa separación. En un modelo estilo Jev, el estado y todas las opciones se leen juntos en cada llamada; duplicar las opciones duplica la lectura, más la respuesta a decodificar token por token. CLM separa ambas y explota el bucle de agente típico: lo que cambia entre pasos es el estado, no la lista de acciones. Las acciones se codifican una vez y quedan en caché ; cada paso nuevo cuesta una codificación de estado más un producto punto casi gratuito. En el gráfico del equipo, la curva CLM apenas se mueve cuando las opciones rozan el millar: 44 milisegundos frente a 570 con 1024 opciones, unas 13 veces de diferencia. Según VentureBeat, el equipo reporta hasta 9 veces en pruebas abiertas; se tome la cifra que se tome, el gráfico apunta igual.

Tres etapas: primero el mundo, luego los matices

El entrenamiento sigue una receta en tres etapas, y el orden es todo el truco. La primera etapa alimenta 60 millones de pares pregunta-respuesta de los datos Nemotron de Nvidia para el conocimiento general, preguntas como estados y respuestas como acciones. La segunda añade 30 millones de negativos duros redactados por un modelo generativo, respuestas que suenan bien pero falsas, como la trampa de Venus para el planeta más cercano al sol. En una prueba de negativos duros, el preentrenamiento solo logra 52 por ciento, la segunda etapa sube a 69; empezar con negativos duros desde el primer día alcanza 62 y se desliza a la memorización. La página oficial de Notion presenta este orden como relación de preentrenamiento más postentrenamiento: primero aprender el mundo, luego las distinciones finas. La tercera etapa convierte el modelo en agente con alrededor de un millón de trayectorias reales, repitiendo el 40 por ciento de los datos originales; sin esa repetición, la puntuación cae de 69 a 56.

Lo más sorprendente es lo que nunca se mueve: la columna de 8000 millones queda congelada como lector Qwen3-8B, sin un solo gradiente. Solo se entrenan pequeños cabezales de unos 20 millones de parámetros a cada lado. Con la columna fija, el conjunto se codifica una vez y el preentrenamiento completo cabe en cerca de una hora en una sola RTX 4090. El repositorio Qwen3 en GitHub confirma la estructura abierta de 36 capas, y la ficha en HuggingFace registra 8200 millones de parámetros bajo Apache 2.0. La pérdida sigue una ley de potencias en cómputo, datos, tamaño de cabezal y tamaño de codificador, con el codificador dando las mayores ganancias. De ahí la gran versión multimodal anunciada para el próximo mes.

Tras la teoría, el escritorio real: un codificador Qwen3-8B servido con vLLM tal como la documentación de Qwen describe, coronado por el servidor CLM publicado de 75 MB, para unos 25 GB de memoria total. Según Nvidia, el DGX Spark sostiene inferencia de hasta 200000 millones de parámetros en un escritorio con 128 GB de memoria unificada, así que el montaje es ambicioso pero alcanzable. El estado es un ticket de soporte de un cliente cobrado dos veces e incomunicado; si es urgente, qué equipo, cuánta ira: las respuestas llegan en probabilidades, 84 por ciento urgente y 99 por ciento facturación. Visto el ticket una vez, las preguntas repetidas vuelven en menos de 2 milisegundos porque todo está en caché. En la prueba de Romeo y Julieta, las incrustaciones crudas ponen a Marlowe primero mientras CLM eleva a Shakespeare al 98 por ciento; veinte millones de parámetros doblan el espacio desde lo similar hacia lo correcto.

Rápido con mil opciones, limitado en precisión

La arquitectura luce a escala extrema: con 1080 herramientas de Stripe a Trello, la primera llamada tarda segundos por la codificación, luego cada petición se estabiliza hacia 80 milisegundos. Elegir entre mil cuesta casi como elegir entre una. En la carrera wiki, una página de 934 enlaces se puntúa contra el objetivo en una sola pasada y se alcanza en cuatro clics. Pero los mismos experimentos documentan el techo: los aciertos caen de 86 por ciento con 8 herramientas a 17 por ciento con 1080, las herramientas de reembolso gemelas se confunden. La causa es el punto ciego del diseño: el estado se codifica solo, las opciones nunca se ponen lado a lado; cada candidato se juzga aislado.

De ahí el consejo en dos capas para constructores: que CLM reduzca mil a diez primeros, luego que un modelo atento que lee las opciones juntas decida. Cuando el conjunto de acciones es pequeño y estable, bucle de juego o puñado de rutas, el modelo se basta. Según la guía de uso de herramientas de MLflow, apilar más de 8 herramientas en un solo agente es un defecto de diseño y dividir en subagentes por función es el remedio; la curva de precisión de CLM confirma esa regla por su cuenta. El gran cuadro final es nostálgico: la idea rápida sin razonamiento que Jev recalentó se encuentra en la misma olla con los algoritmos contrastivos de 2017 y 2018. Las decisiones quedan con la recuperación, la generación con el pensamiento lento.

Visualization: nodesdaily AI

Momentos clave

  1. Ola System One: decisiones en milisegundos
  2. La idea CLM: CLIP para decidir
  3. Gráfico: 44 ms frente a 570 ms
  4. Entrenamiento en tres etapas y negativos duros
  5. Demo del ticket y prueba Shakespeare
  6. Límites con 1080 herramientas y carrera wiki

Comentario de la IA

"El presentador no deja la teoría sobre la mesa; ejecuta el modelo en su propio equipo y lo lleva al límite con mil herramientas y una carrera wiki. Su honestidad sobre la caída de precisión medida hace creíble el factor 13. A mi juicio, el valor real está en la receta, no en la arquitectura: que el modelo rápido filtre y el modelo cuidadoso decida."

Evaluación de la IA

La objeción más fuerte es arquitectónica, no empírica: como el estado se codifica solo, el modelo nunca compara las opciones lado a lado. Cada candidato se juzga aislado, los gemelos se confunden y la precisión cae al crecer la lista. Recuperar no es razonar, similar no es correcto; el desliz de 86 a 17 por ciento es esa frase en cifras.

Lo que falta también cuenta. Esta versión es solo texto, la grande multimodal sigue pendiente, así que toda pretensión general espera esa prueba. Las cifras titulares vienen de los gráficos del equipo más una serie de demos, sin replicación independiente hasta hoy. Nótese además una circularidad discreta: negativos duros escritos por un gran modelo enseñan la frontera entre lo plausible y lo correcto, pero también heredan sus puntos ciegos.

Miremos la posición del presentador con cabeza fría. Las demos corren en hardware de Nvidia con tono entusiasta y cercano a constructores, el entusiasmo es parte del formato. Frente a ello, dos hechos disciplinan el relato: el código y el servidor se publican abiertos, y según VentureBeat el líder del proyecto Jacky Kwok enmarca el objetivo contrastivo como ventaja para decisiones de dominio y no como victoria universal. Artefactos abiertos más pretensión acotada valen más que cada uno solo.

Para el lector, la lección práctica es concreta. Si el conjunto de acciones es pequeño y estable, bucle de juego o puñado de rutas, esta clase funciona bien hoy. A mayor escala, úsese como primera etapa que reduce mil candidatos a diez en milisegundos, y deje que un modelo que lee las opciones juntas decida. Y guarde la moraleja de la repetición: al adaptar un modelo, siga mezclando los datos antiguos o las ganancias tempranas se evaporan en silencio.

Fuentes

11 enlaces; 2 de ellos también citados por 2 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

clm-8b · system one · aprendizaje contrastivo · herramientas de agentes · qwen3

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…