La promesse est simple et pratique : au lieu d'acheter une carte graphique plus puissante, vous empruntez un notebook Kaggle gratuit qui combine deux accélérateurs T4 en 32 Go de mémoire et exécutez n'importe quel modèle non censuré en ligne, puis pointez votre agent préféré vers celui-ci comme s'il s'agissait d'un serveur local.
La vidéo s'ouvre sur une frustration familière issue de deux épisodes précédents sur les modèles sans restrictions ; les spectateurs ont adoré les idées, mais la plupart des machines manquaient de VRAM, l'installation échouait et la démo ne démarrait jamais car les ordinateurs portables grand public dépassent rarement 12 Go.
Kaggle fournit cette marge manquante gratuitement : choisir GPU T4 x2 vous donne deux cartes T4 totalisant 32 Go, un quota hebdomadaire de 30 heures qui se réinitialise chaque semaine, et une exigence stricte de vérifier votre numéro de téléphone avant qu'un accélérateur ne devienne disponible, sinon vous restez sur CPU uniquement.
Après vérification, le processus est simple : cliquez sur Create pour ouvrir un nouveau notebook, ouvrez Settings et réglez Accelerator sur GPU T4 x2, et vous partagez le même quota de 30 heures que vous choisissiez P100 ou T4 x2, ce dernier offrant plus de mémoire et un meilleur débit en précision mixte pour les grands modèles, une limite qui semble plus prévisible que le plafond de session de 12 heures sur Colab gratuit.
Le notebook ne ressemble pas à un serveur classique ; c'est une pile de cellules de code qui ne s'exécutent que si vous préfixez la commande d'un point d'exclamation, vous exécutez chaque cellule individuellement avec le bouton Play, et vous ajoutez ou supprimez des cellules avec le contrôle plus, en basculant entre Code et Markdown selon les besoins.
L'installation commence par de petits outils système tels que zstd, curl et wget installés discrètement via apt, puis le script d'installation officiel d'Ollama récupéré avec curl et redirigé vers sh, et comme les notebooks Kaggle n'ont pas systemd, vous devez démarrer le démon en arrière-plan avec un appel subprocess sinon le service bloquera.
Une fois installé, vous exécutez ollama serve et lorsque le journal affiche Ollama started, le service écoute sur le port 11434 sur l'adresse locale, qui reste invisible pour tout harnais externe, donc un tunnel public est nécessaire avant qu'un agent puisse y accéder.
La découverte de modèles se fait sur Hugging Face : filtrez par Text Generation et l'application Ollama, tapez uncensored dans la barre de recherche et les variantes ouvertes les plus téléchargées apparaissent, vous permettant de comparer les versions quantifiées Q4_K_M et Q6_K et de voir une coche verte lorsque le fichier choisi tient dans le budget de 32 Go, certains modèles offrant une version optimisée pour 16 Go de VRAM.
Pour récupérer le modèle, vous exécutez ollama pull avec un préfixe point d'exclamation dans le notebook ; la progression s'affiche ligne par ligne, le système tente d'exécuter le modèle une fois le téléchargement terminé, et vous pouvez arrêter immédiatement cette tentative car l'inférence finale se fera via le tunnel, pas dans le notebook.
Pour exposer le service local, vous installez le binaire de tunnel Cloudflare, le décompressez et le lancez pointé vers localhost sur le port Ollama, ce qui génère une URL publique que vous pouvez ouvrir dans un navigateur pour confirmer qu'Ollama fonctionne, et si la vérification échoue, réexécuter la même cellule corrige généralement le problème.
La dernière étape est la connexion à Hermes Agent : choisissez Custom Endpoint dans le menu des modèles et entrez son numéro, collez l'URL publique avec /v1 ajouté comme Base URL, tapez ollama comme clé API, sélectionnez le modèle récupéré, et si le premier appel expire, réessayez une fois après que le service se soit réchauffé et réponde au test who are you nettement plus vite que la démo cloud payante, avec la liste complète des commandes partagée en TXT sur le Discord du créateur.
Commentaire de l’IA
""À mon avis, cette configuration est un pont éprouvé sur le terrain pour quiconque évite les locations cloud coûteuses ; elle combine quota gratuit, tunneling et modèles ouverts en un seul flux et accélère donc l'expérimentation.""
Évaluation de l’IA
En défendant l'argument opposé, je dois dire que les notebooks Kaggle ont été conçus pour les compétitions et les expériences légères, pas comme un serveur de modèles persistant. La politique d'utilisation acceptable interdit explicitement l'hébergement de serveurs et l'abus de ressources sans rapport avec le machine learning. Considérer 30 heures gratuites chaque semaine comme un hôte de production garanti est optimiste au mieux.
Les limites sont claires pour moi. Un seul T4 délivre environ 8,1 TFLOPS en demi-précision et 320 Go/s de bande passante tandis qu'un A100 délivre 312 TFLOPS et 2039 Go/s, soit un écart d'environ 38x. Les sessions sont plafonnées à environ 9 heures et l'environnement est éphémère, donc le modèle récupéré est effacé à l'arrêt du notebook et doit être retéléchargé, tandis que le CPU à 2 cœurs ralentit souvent le chargement des données.
Sur les incitations, le TXT Discord crée un petit entonnoir vers la communauté du créateur, ce qui est naturel. Sur la sécurité, exposer le point de terminaison Ollama via un tunnel public sans authentification est risqué compte tenu des CVE passées, et toute personne ayant l'URL peut atteindre le même port. C'est pourquoi les chiffres de 30 heures, 9 heures et 16 Go affichés devraient être vérifiés par rapport à la documentation Kaggle et à la coche verte de compatibilité plutôt que pris pour argent comptant.
Mon avis pratique est que cette méthode brille pour les expériences courtes, les versions Q4 de 7 à 13 milliards, les projets étudiants et les vérifications rapides du comportement non censuré. Ce n'est pas adapté aux modèles de 70 milliards, aux contextes très longs ou à la production en continu. Pour ces charges de travail, un accélérateur facturé avec stockage persistant sur Thunder Compute ou Runpod offre une disponibilité plus prévisible que n'importe quel tunnel Cloudflare ou ngrok.
Sources
9 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=EkA4pqXgta0
- @kaggle https://www.kaggle.com/docs/efficient-gpu-usage
- @kaggle https://www.kaggle.com/discussions/product-feedback/361104
- @thundercompute https://www.thundercompute.com/blog/colab-alternatives-for-cheap-deep-learning-in-2025
- @medium https://medium.com/data-science-collective/create-a-remote-llm-server-using-kaggle-notebooks-and-ollama-acb299ead1e5
- @github https://github.com/prottasha123/Ollama-SetUp-in-Kaggle
- @gpuperhour https://gpuperhour.com/compare/t4-vs-a100
- @huggingface https://huggingface.co/models?apps=ollama&search=uncensored&sort=downloads
- @kaggle https://www.kaggle.com/aup
materiel · execution · non-censure · modeles · gratuit · kaggle · nodesdaily