Volver al inicio

Entrené un transformer de detección de lengua de señas — y tú también puedes

Nicholas Renotte reconstruye su detector de lengua de señas en torno a un transformer, lo entrena con un conjunto de datos de tres señas recogido a mano, y lo pone en vivo en un portátil sin GPU externa — captura de datos, etiquetado en Label Studio, entrenamiento DETR e inferencia en tiempo real en un solo bucle.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — o_MGqeFMAGE
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Nicholas Renotte regresa a la detección de lengua de señas cuatro años después de su primer modelo, esta vez reconstruyendo toda la biblioteca en torno a un detector transformer. Su promesa es audaz: recopila tus propios datos y entrena un modelo personal en menos de cuarenta minutos. La reconstrucción también responde a los espectadores que tuvieron problemas de dependencias con la base de código anterior.

El núcleo es un Detection Transformer al estilo del artículo de 2020: un backbone ResNet-50 extrae las características de la imagen, se añaden codificaciones posicionales y el resultado pasa por capas de codificador y decodificador transformer. Una salida de torchinfo muestra 26,9 millones de parámetros entrenables, con la profundidad del codificador, la del decodificador, las cabezas de atención y el tamaño oculto configurables. Al final salen dos cabezas de predicción: una nombra la clase entre hello, I love you y thank you, y la otra dibuja la caja en el fotograma.

El entrenamiento se apoya en el emparejamiento húngaro, una rutina de asignación lineal que empareja el conjunto fijo de 25 consultas de objetos del modelo con las cajas verdaderas. Se ponderan y suman tres términos de pérdida: un término de clasificación, un término de regresión de coordenadas de caja y un término de solapamiento generalizado que incorpora la geometría al objetivo. Un pequeño ejemplo resuelto en la carpeta de utilidades permite a los curiosos manipular directamente la lógica de emparejamiento.

La victoria más rápida llega en los primeros cinco minutos: clona el repositorio, ábrelo en VS Code, ejecuta el script en tiempo real con el runner uv, y los pesos incluidos empiezan a predecir desde la webcam de inmediato. Esos pesos incluidos provienen de una ejecución de 4.426 épocas que tardó aproximadamente un día en un MacBook sin GPU externa. Un panel de registro personalizado imprime el nombre del modelo, el número de clases, el tiempo de inferencia y los fotogramas por segundo, y un índice de dispositivo resuelve la mayoría de los errores de cámara.

La recopilación de datos es deliberadamente sencilla: un asistente de captura toma treinta fotogramas por clase para entrenamiento y luego cinco por clase para prueba. Agitas cada seña dentro del encuadre mientras el registrador cuenta, y después borras las tomas borrosas o mal encuadradas. El video es franco: fotogramas malos dentro significan cajas malas fuera.

El etiquetado abandona la herramienta de escritorio retirada y pasa a Label Studio, que funciona en local y gratis. Eliges la plantilla de cajas delimitadoras, añades las tres etiquetas en el orden exacto del video, y ese orden importa porque el entrenamiento y la predicción en vivo se alinean con él. Los atajos de teclado aceleran el encajado, las subidas van por lotes bajo el límite de cien archivos, y el conjunto terminado se exporta en formato YOLO con imágenes para reemplazar las carpetas train y test.

El módulo de datos es un dataset PyTorch estándar con personalidad dividida: el entrenamiento aplica recortes aleatorios y jitter de color para estirar más el conjunto pequeño, mientras que la partición de prueba desactiva esos trucos. Ejecutar el módulo en modo prueba muestra las imágenes normalizadas con sus cajas, lo que sirve también como verificación antes de gastar tiempo de GPU.

El script de entrenamiento ofrece dos caminos: hacer fine-tuning desde los pesos incluidos o comentar una línea y partir de una inicialización aleatoria. La ruta recomendada conserva los pesos incluidos, con tasa de aprendizaje y pesos de pérdida por término ajustables. La ejecución completa apuntaba a diez mil épocas y se detuvo pasadas las cuatro mil; la ejecución de demostración escribe un checkpoint cada diez épocas. La pérdida baja de la banda 7-8 a la banda 5-6 con caídas a los 4, mientras que la pérdida de prueba plana se atribuye a la diminuta partición de prueba.

La prueba carga el archivo de checkpoint final en el script de prueba y lo ejecuta sobre fotogramas reservados. El panel informa de las estadísticas del dataset, las transformaciones activas, el resumen de la arquitectura y, por predicción, el nombre de la clase, la confianza y las coordenadas de la caja. Esa lectura fila por fila es la parte honesta de la demo: ves exactamente lo que el modelo captó y cuán seguro estaba.

El final cambia los pesos personales al script en vivo y lo apunta a la webcam. Un umbral de confianza del ochenta por ciento filtra las 25 consultas hasta quedarse con las buenas, y bajar ese umbral en un experimento en vivo muestra cuán ruidoso puede ser el conjunto bruto de consultas. Incluso los pequeños percances en directo, como un micrófono bloqueando el encuadre, se corrigen con naturalidad.

En conjunto, el video construye un bucle completo en una sola sesión: recopilar, etiquetar, entrenar, probar y desplegar en vivo, todo en un portátil sin hardware de centro de datos. Los pesos personales ajustados a tus propias manos son la recompensa silenciosa. Se ofrece un análisis más profundo de la arquitectura si los espectadores lo desean.

Visualization: nodesdaily AI

Comentario de la IA

""Lo que me convenció es la honestidad del montaje: un conjunto de datos personal, un portátil sin GPU externa y un bucle completo desde los datos hasta la predicción en vivo. Lo veo como el primer proyecto de detección ideal, no como un producto terminado.""

Evaluación de la IA

Para defender el otro lado: una demo de tres gestos no demuestra que DETR sea la herramienta adecuada. Los profesionales recurrirían razonablemente a un detector de una sola etapa o a un pipeline de pose ligero, que entrenan más rápido en conjuntos pequeños y corren más barato en CPU. El video nunca hace benchmarks contra esas alternativas, así que su elección de arquitectura se lee como pedagógica más que probada.

Lo que falta es cualquier prueba seria de robustez. Alrededor de noventa imágenes de entrenamiento y un puñado de fotogramas de prueba provienen de una persona, una habitación y una cámara, así que los cambios de iluminación, los tonos de piel, los fondos desordenados y las manos ocluidas nunca se ejercitan. La pérdida de prueba plana se descarta como artefacto del tamaño de los datos en lugar de investigarse, y la configuración de 25 consultas y umbral del ochenta por ciento nunca se somete a ablación.

Sobre la verificabilidad: las cifras principales — 4.426 épocas en unas 24 horas en un MacBook, la pérdida bajando de la banda 7-8 a la banda 5-6 — provienen de los propios registros del autor sin repetición independiente. No hay mAP, ni curva precisión-recall, ni evaluación con datos reservados, solo trazas de pérdida y fotogramas evaluados a ojo. Volvería a ejecutar los checkpoints en mi propio hardware antes de citar cualquiera de estas cifras como hechos.

Mi lectura práctica, en primera persona: recomendaría este repositorio como demostrador de concepto y bucle de enseñanza, no como tecnología de asistencia. La traducción real de lengua de señas necesita vocabularios amplios, independencia del signante y modelado temporal, nada de lo cual pretende un detector de imágenes fijas de tres clases. Si yo empezara, construiría esto primero para ganar confianza, y luego lo compararía con una baseline basada en pose sobre datos públicos antes de escribir una sola afirmación de producción.

Fuentes

8 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

lengua de señas · detr · detección de objetos

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…