Volver al inicio

Ejecutar modelos sin censura en un servidor Kaggle gratuito de 32 GB

El notebook gratuito de Kaggle con dos T4 que suman 32 GB, combinado con Ollama y un túnel de Cloudflare, se convierte en la forma más barata de ejecutar modelos sin censura a través de Hermes Agent sin poseer VRAM local.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — EkA4pqXgta0
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

La promesa es simple y práctica: en lugar de comprar una tarjeta gráfica más grande, tomas prestado un notebook Kaggle gratuito que combina dos aceleradores T4 en 32 GB de memoria y ejecutas cualquier modelo sin censura en línea, luego apuntas tu agente favorito hacia él como si fuera un servidor local.

El video abre con una frustración familiar de dos episodios anteriores sobre modelos sin restricciones; a los espectadores les encantaron las ideas, pero la mayoría de las máquinas se quedaban sin VRAM, la instalación fallaba y la demo nunca arrancaba porque los portátiles de consumo rara vez superan los 12 GB.

Kaggle proporciona ese margen faltante de forma gratuita: elegir GPU T4 x2 te da dos tarjetas T4 que suman 32 GB, una cuota semanal de 30 horas que se reinicia cada semana, y un requisito estricto de verificar tu número de teléfono antes de que cualquier acelerador esté disponible, de lo contrario te quedas solo con CPU.

Después de la verificación el flujo es sencillo: pulsa Create para abrir un nuevo notebook, abre Settings y configura Accelerator en GPU T4 x2, y compartes la misma cuota de 30 horas ya sea que elijas P100 o T4 x2, con T4 x2 ofreciendo más memoria y mejor rendimiento de precisión mixta para modelos grandes, un límite que se siente más predecible que el tope de sesión de 12 horas en Colab gratuito.

El notebook no parece un servidor clásico; es una pila de celdas de código que solo se ejecutan si antepones un signo de exclamación al comando, ejecutas cada celda individualmente con el botón Play, y agregas o quitas celdas con el control de más, alternando entre Code y Markdown según sea necesario.

La configuración comienza con pequeñas herramientas del sistema como zstd, curl y wget instaladas silenciosamente vía apt, luego el script de instalación oficial de Ollama descargado con curl y canalizado a sh, y como los notebooks de Kaggle carecen de systemd debes iniciar el demonio en segundo plano con una llamada de subprocess o el servicio se bloqueará.

Una vez instalado ejecutas ollama serve y cuando el registro imprime Ollama started el servicio escucha en el puerto 11434 en la dirección local, que sigue siendo invisible para cualquier harness externo, por lo que se requiere un túnel público antes de que un agente pueda alcanzarlo.

El descubrimiento de modelos ocurre en Hugging Face: filtra por Text Generation y la aplicación Ollama, escribe uncensored en el cuadro de búsqueda y aparecerán las variantes abiertas más descargadas, permitiéndote comparar las versiones cuantizadas Q4_K_M y Q6_K y ver una marca verde cuando el archivo elegido cabe en el presupuesto de 32 GB, con algunos modelos ofreciendo una versión optimizada para 16 GB de VRAM.

Para obtener el modelo ejecutas ollama pull con un prefijo de exclamación dentro del notebook; el progreso se imprime línea por línea, el sistema intenta ejecutar el modelo una vez que termina la descarga, y puedes detener ese intento de inmediato porque la inferencia final ocurrirá a través del túnel, no dentro del notebook.

Para exponer el servicio local instalas el binario de túnel de Cloudflare, lo descomprimes y lo lanzas apuntando a localhost en el puerto de Ollama, lo que genera una URL pública que puedes abrir en un navegador para confirmar que Ollama está funcionando, y si la comprobación falla, volver a ejecutar la misma celda generalmente lo soluciona.

El último tramo es la conexión de Hermes Agent: elige Custom Endpoint en el menú de modelos e ingresa su número, pega la URL pública con /v1 añadido como Base URL, escribe ollama como clave API, selecciona el modelo descargado, y si la primera llamada expira reintenta una vez después de que el servicio se caliente y responda la prueba who are you notablemente más rápido que la demo de nube de pago, con la lista completa de comandos compartida como TXT en el Discord del creador.

Visualization: nodesdaily AI

Comentario de la IA

""En mi opinión, esta configuración es un puente probado en el campo para cualquiera que evite alquileres de nube costosos; combina cuota gratuita, túneles y modelos abiertos en un solo flujo y por lo tanto acelera la experimentación.""

Evaluación de la IA

Fortaleciendo el argumento contrario, debo decir que los notebooks de Kaggle fueron creados para competiciones y experimentos ligeros, no como un servidor de modelos persistente. La política de uso aceptable prohíbe explícitamente la granja de servidores y el abuso de recursos no relacionado con el machine learning. Tratar 30 horas gratuitas cada semana como un host de producción garantizado es optimista como mucho.

Los límites son claros para mí. Un solo T4 entrega alrededor de 8,1 TFLOPS en media precisión y 320 GB/s de ancho de banda mientras que un A100 entrega 312 TFLOPS y 2039 GB/s, una brecha de aproximadamente 38x. Las sesiones están limitadas a unas 9 horas y el entorno es efímero, por lo que el modelo descargado se borra cuando el notebook se detiene y debe volver a descargarse, mientras que la CPU de 2 núcleos a menudo ralentiza la carga de datos.

Sobre los incentivos, el TXT de Discord crea un pequeño embudo hacia la comunidad del creador, lo cual es natural. Sobre la seguridad, exponer el endpoint de Ollama a través de un túnel público sin autenticación es arriesgado dadas las CVE pasadas, y cualquiera con la URL puede alcanzar el mismo puerto. Por eso las cifras de 30 horas, 9 horas y 16 GB mostradas deberían contrastarse con la documentación de Kaggle y la marca verde de compatibilidad en lugar de tomarse al pie de la letra.

Mi conclusión práctica es que este método brilla para experimentos cortos, versiones Q4 en el rango de 7 a 13 mil millones, proyectos estudiantiles y comprobaciones rápidas del comportamiento sin censura. No es adecuado para modelos de 70 mil millones, contextos muy largos o producción siempre activa. Para esas cargas de trabajo, un acelerador facturado con almacenamiento persistente en Thunder Compute o Runpod ofrece un tiempo de actividad más predecible que cualquier túnel de Cloudflare o ngrok.

Fuentes

9 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

hardware · ejecucion · sin-censura · modelos · gratuito · kaggle · nodesdaily

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…