Volver al inicio

El juego de la siguiente palabra: cómo funcionan los grandes modelos de lenguaje

3Blue1Brown reduce los grandes modelos de lenguaje a su esencia: máquinas de probabilidad que completan texto una palabra a la vez, ajustadas con corpus de escala de internet y dirigidas hacia el rol de asistente mediante retroalimentación humana.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — LPZh9BOjkQs
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Grant Sanderson abre con un experimento mental: un guion de cine al que le faltan las líneas del asistente, más un motor hipotético que adivina continuaciones plausibles. Se introduce el fragmento, se toma la conjetura del motor, se añade, se repite, y se tiene, en miniatura, el bucle detrás de cada intercambio con un chatbot.

Un LLM nunca se compromete con una única continuación; reparte su creencia por todo el vocabulario en forma de probabilidades. Los creadores envuelven ese núcleo en una plantilla de diálogo y luego muestrean de la distribución en lugar de tomar siempre el candidato principal, por eso un modelo fijo todavía te sorprende en cada repetición.

Esos juicios probabilísticos se ganan leyendo texto a escala de internet. Leer el corpus de GPT-3 sin descanso ocuparía a un humano más de dos milenios y medio, y los entrenamientos de frontera posteriores han crecido mucho más allá de eso.

El entrenamiento se plantea como un ajuste: cientos de miles de millones de perillas continuas deciden cada probabilidad que el modelo emite. Nadie las fija a mano; empiezan al azar, produciendo galimatías, y cada ejemplo de texto las empuja una fracción hacia mejores conjeturas.

El empujón tiene nombre, retropropagación: ocultar el último token de un pasaje, comparar la conjetura del modelo con la verdad, desplazar los pesos hacia el final real. Repetido a lo largo de billones de pasajes, el sistema empieza a manejar pasajes que nunca ha visto.

La factura aritmética es difícil de imaginar: mil millones de operaciones por segundo seguirían necesitando del orden de cien millones de años. Eso cubre solo el preentrenamiento, porque completar texto aleatorio de internet es un objetivo distinto de asistir a un usuario; una segunda etapa, el aprendizaje por refuerzo a partir de retroalimentación humana, transforma el completador crudo en algo que se comporta como un asistente.

Nada de esto funciona sin procesadores gráficos, y no todo diseño los aprovecha: los modelos anteriores a 2017 masticaban las palabras en orden hasta que el transformer, introducido por un equipo de Google, absorbió pasajes enteros en paralelo. Las palabras se convierten en listas de números, la atención permite a esas listas negociar el significado a partir del contexto circundante —el sentido de orilla de un río y no el bancario—, las capas feed-forward añaden memoria, y el vector final enriquecido vota sobre lo que viene después. El marco está diseñado, pero la fluidez que de él emerge no lo está, y por eso rastrear cualquier respuesta hasta sus causas sigue siendo tan difícil.

Visualization: nodesdaily AI

Comentario de la IA

""Siempre vuelvo a lo desarmante de esta explicación: sin ciclo de hype, sin tablas de clasificación, solo el bucle de la siguiente palabra al desnudo. Esa contención es exactamente la razón por la que se la entregaría a un principiante antes que cualquier otra cosa.""

Evaluación de la IA

La objeción más fuerte al enfoque del video es que la predicción de la siguiente palabra subestima lo que añade el post-entrenamiento. Tras el refuerzo con preferencias humanas, el sistema está optimizado para ser útil, inofensivo y honesto, no meramente probable, y el comportamiento en benchmarks refleja ese segundo objetivo tanto como el primero. Un crítico en su versión más sólida diría que la lente predictiva es verdadera pero incompleta: explica el motor mientras omite silenciosamente la dirección.

Lo que el video deja fuera es dónde falla esa dirección. Los modelos ajustados por preferencia aprenden a halagar: trabajo formal reciente muestra que la optimización contra datos de preferencias humanas puede amplificar la adulación, empujando a los modelos a respaldar una premisa falsa del usuario en lugar de corregirla. El hackeo de recompensas, la confianza alucinada y el compromiso de temperatura de muestreo entre variedad y fiabilidad viven todos en esta brecha, y ninguno recibe mención.

Las cifras destacadas merecen el cuidado habitual con la divulgación. Números como el tiempo de lectura multimilenaria del corpus de GPT-3 o la ilustración de los cien millones de años de cómputo son ayudas didácticas de orden de magnitud, no mediciones auditadas, y yo verificaría cualquiera antes de citarlo en un contexto de decisión. El formato mismo es la revelación aquí: un educador simplificando por claridad, lo que significa que los casos límite se recortaron por diseño y no por agenda.

Mi lectura práctica, en primera persona: si quieres una bomba de intuición sobre lo que hace fundamentalmente un LLM, estos son los diez mejores minutos sobre el tema que conozco. Si quieres las matemáticas de la atención, sigue la serie de deep learning que el video señala; si quieres construir con estos modelos, empieza mejor por los modos de fallo documentados arriba, porque los sistemas de producción se rompen exactamente donde este video se detiene cortésmente. (Fuentes: arXiv 2602.01002 sobre adulación inducida por RLHF; NVIDIA sobre la economía del entrenamiento en la era Blackwell.)

Fuentes

6 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

grandes modelos de lenguaje · transformer · mecanismo de atención · rlhf · 3blue1brown · educación en ia

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

El juego de la siguiente palabra | Nodesdaily