Volver al inicio

El túnel del tiempo del aprendizaje profundo: los 40 años de Hinton, de las máquinas de Boltzmann a Forward-Forward en PyTorch

El curso práctico de 27 horas de freeCodeCamp convierte los artículos fundamentales de Geoffrey Hinton en un recorrido cronológico. El instructor Mohammed Abrah explica la motivación, el problema y la idea central de cada trabajo y luego conecta la teoría con una implementación compacta en PyTorch, trazando cómo las máquinas de Boltzmann, la retropropagación, las redes de creencia profunda, AlexNet, el dropout, la destilación, las cápsulas, la normalización de capa y el algoritmo Forward-Forward dieron forma a las redes neuronales modernas.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — BMYvfVk8Ar0
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Llamar a Geoffrey Hinton el padrino de la IA es un atajo para una historia más larga, y el curso práctico de 27 horas de freeCodeCamp la cuenta paso a paso. Encadena los artículos clave de Hinton a lo largo de décadas en una sola narrativa y empareja cada uno con una implementación educativa en PyTorch. El instructor Mohammed Abrah enmarca cada capítulo con la motivación, el problema que abordaba y la idea central que introducía, y luego hace que la idea sea ejecutable mediante visualizaciones y pequeños experimentos. El objetivo no es memorizar arquitecturas sino reconstruirlas y sentir por qué las redes modernas tienen la forma que tienen.

Aprender con energía: las máquinas de Boltzmann y la idea de Helmholtz

La historia abre en los años ochenta con las máquinas de Boltzmann. Formuladas por Ackley, Hinton y Sejnowski en 1985, estas redes toman prestada la energía de la mecánica estadística: las unidades se activan y desactivan de manera probabilística y los pesos codifican la fuerza con la que dos hipótesis se apoyan mutuamente. Dividir las unidades en grupos visibles y ocultos permite reducir las restricciones de orden superior entre píxeles o palabras a interacciones por pares mediante explicaciones ocultas. El entrenamiento era lento y requería alcanzar el equilibrio térmico, pero la regla de aprendizaje que empuja las estadísticas de co-ocurrencia hacia la distribución de los datos fue una primera receta clara para elegir representaciones internas de forma automática.

La forma moderna de la retropropagación llega de cerca. El artículo de 1986 de Rumelhart, Hinton y Williams hizo práctica la asignación de crédito para redes multicapa al propagar hacia atrás las derivadas del error con la regla de la cadena. Junto a ella vino un compromiso con las representaciones distribuidas y las mezclas adaptativas de expertos locales, donde el conocimiento vive en patrones de actividad en lugar de en casillas únicas y los especialistas compiten por manejar distintas regiones del espacio de entrada. Esa postura subyace a por qué las redes neuronales pueden generalizar a partir de ejemplos en lugar de solo memorizarlos.

La modelación generativa de los años noventa lleva la misma intuición más lejos. La máquina de Helmholtz y su algoritmo wake-sleep entrenan los pesos de reconocimiento y generación en fases separadas: inferir las causas ocultas a partir de datos reales mientras se está despierto, y luego soñar datos a partir de esas causas mientras se duerme. Como el aprendizaje de Boltzmann, usa dos regímenes con condiciones de frontera distintas sobre las unidades visibles, pero reemplaza la costosa convergencia estocástica por inferencia aproximada feed-forward. Los resultados fueron limitados, pero el intento de aprender tanto un modelo como un procedimiento de inferencia anticipa los métodos variacionales que se usan hoy.

De la visualización a la creencia profunda: t-SNE, preentrenamiento voraz y ReLU

Hacer legibles los datos de alta dimensión llevó a la incrustación estocástica de vecinos. El SNE de Hinton y Roweis y la extensión t-SNE de 2008 con van der Maaten preservan las probabilidades de vecindad de modo que los puntos cercanos en alta dimensión sigan cercanos en dos dimensiones. La técnica se convirtió en una herramienta predeterminada para el análisis exploratorio porque hace visibles de un vistazo las variedades y los modos de fallo, un recordatorio de que una buena incrustación puede valer tanto como un buen clasificador.

2006 revivió la fe en la profundidad. La receta de la red de creencia profunda apilaba máquinas de Boltzmann restringidas y las entrenaba vorazmente una capa a la vez, para luego afinar toda la pila. Con pocos datos etiquetados aún aprendía características jerárquicas porque cada RBM capturaba primero la distribución de su entrada. Mejoras que mostraban que las unidades lineales rectificadas ayudan a las RBM, más la extensión en máquina de Boltzmann profunda, ayudaron a devolver la profundidad del estante al centro de la investigación. Lo que parecía intratable de repente pareció entrenable.

ImageNet en 2012 hizo el punto innegable. AlexNet de Krizhevsky, Sutskever y Hinton funcionaba como una red convolucional de ocho capas con 60 millones de parámetros sobre dos GTX 580 en un dormitorio, alcanzó un error top-5 del 15,3 por ciento y superó al segundo clasificado por más de diez puntos. ReLU, dropout, normalización local de respuesta y una aumentación agresiva trabajaron juntos; la lección mayor fue que grandes datos etiquetados más cómputo en GPU más convolución profunda podían escalar. La visión por computadora se convirtió desde entonces en un problema de aprendizaje profundo.

Mejor generalización: dropout, destilación, normalización y cápsulas

Uno de los trucos más portables de AlexNet se convirtió en un artículo propio. El dropout, sistematizado por Srivastava y Hinton en 2014, silencia aleatoriamente cerca de la mitad de las unidades ocultas en cada paso de entrenamiento, rompiendo la coadaptación y aproximando un ensamble dentro de una sola red. Su simplicidad y su reducción constante del sobreajuste lo convirtieron en una receta de regularización predeterminada mucho más allá de la visión.

Dos ideas complementarias simplificaron la transferencia de conocimiento y la estabilidad del entrenamiento. La destilación de conocimiento de 2015 propone enseñar a un estudiante pequeño a imitar las distribuciones de probabilidad suaves de un profesor engorroso, transportando conocimiento oscuro sobre las similitudes entre clases que las etiquetas duras ocultan. La normalización de capa de Ba y Hinton de 2016 normaliza dentro de una capa por ejemplo en lugar de hacerlo sobre un mini-lote, estabilizando el entrenamiento recurrente y con lotes pequeños donde la normalización por lote sufre, y luego se volvió común en los modelos de secuencias.

Las cápsulas ofrecían una intuición geométrica distinta. El artículo de enrutamiento dinámico de 2017 de Sabour, Frosst y Hinton codifica la presencia y la pose de una entidad en un vector y deja que las partes de nivel inferior voten por los conjuntos de nivel superior mediante acuerdo iterativo; el objetivo es convertir los cambios de punto de vista en multiplicaciones de matrices en el espacio de poses en lugar de aumentación por fuerza bruta. Poco después, el aprendizaje contrastivo de representaciones visuales mostró que características fuertes pueden surgir sin etiquetas al acercar vistas aumentadas de la misma imagen y alejar las demás.

El curso cierra con una alternativa a la propia retropropagación. El algoritmo Forward-Forward de Hinton de 2022 reemplaza el esquema hacia adelante más hacia atrás con dos pasadas hacia adelante: una sobre datos reales donde cada capa eleva una puntuación de bondad y otra sobre datos negativos donde la reduce. La bondad puede ser tan simple como la suma de actividades al cuadrado y cada capa aprende con su propio objetivo, de modo que las derivadas nunca fluyen hacia atrás y las activaciones no necesitan almacenarse para una pasada hacia atrás. El método maneja cajas negras donde las derivadas exactas son desconocidas, permite el pipelining de datos en flujo y sugiere hardware más amigable con la corteza o con lo analógico, aunque en los grandes benchmarks todavía va por detrás de la retropropagación. Reconstruir cada hito como PyTorch ejecutable hace tangible el arco histórico y muestra cómo las ideas incrementales se componen en la pila moderna.

Comentario de la IA

""Mi opinión es que esto no es un tour nostálgico: su valor está en mostrar cómo cada idea histórica todavía se filtra en la práctica actual. La visión energética detrás de las máquinas de Boltzmann, la intuición de regularización detrás del dropout, o la invariancia al punto de vista que buscaban las cápsulas siguen moldeando las decisiones arquitectónicas; reimplementarlas en PyTorch hace visible esa continuidad.""

Evaluación de la IA

Fortalecer la contraopinión: un hilo histórico puede sobreatribuir el éxito moderno a una sola figura y ocultar la red más amplia de contribuciones; AlexNet también debía sus datos al ImageNet de Fei-Fei Li, su cómputo a CUDA y su receta a trucos de aumentación y ajuste. Esa crítica tiene mérito porque el aprendizaje profundo es colectivo, pero el curso la mitiga al separar motivación, problema e idea central por artículo, lo que permite leer la línea de Hinton como una continuidad de decisiones de diseño en lugar de una veneración al héroe.

Los límites importan: la narrativa de 27 horas se apoya en simplificaciones educativas en PyTorch, dejando fuera la escala, la curación de datos y la ingeniería de producción que dominan los despliegues reales. Con el video fuente corriendo largo y el texto construido por síntesis web a partir del título oembed, la descripción y los artículos de apoyo, las fechas, las listas de autores y las tasas de error deberían cotejarse con los artículos originales; cifras como el error top-5 del 15,3 por ciento de AlexNet o sus 60 millones de parámetros merecen una verificación en la fuente primaria.

Los incentivos alrededor de la narrativa merecen una nota: freeCodeCamp optimiza el acceso abierto y la finalización, mientras que una retrospectiva sobre Hinton tras la visibilidad del Nobel enfatiza naturalmente la coherencia; no hay revisión por pares independiente dentro de la lección. Eso no invalida el material, pero significa que los capítulos más especulativos sobre cápsulas o Forward-Forward deberían leerse como propuestas con evidencia y no como práctica establecida.

En la práctica, el movimiento útil es reconstruir en pequeño y capitalizar: reimplementar la visión energética de las máquinas de Boltzmann, el hábito de regularización del dropout, la táctica de compresión de la destilación y el truco de estabilidad de la normalización de capa en una tarea de juguete, y luego mapear cada uno a una decisión de un proyecto actual. Las cápsulas y Forward-Forward sirven entonces como laboratorio de inspiración y cautela, mostrando cómo la intuición geométrica y un aprendizaje amigable con la corteza podrían importar incluso si todavía no reemplazan la pila estándar.

Fuentes

8 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

aprendizaje profundo · hinton · pytorch · inteligencia artificial

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…