Gündeme dön

Kaggle Üzerinde 32 GB'lık Ücretsiz Sunucu ile Sansürsüz Modelleri Çalıştırmak

Kaggle'ın iki T4 ile sunduğu 32 GB'lık ücretsiz defter, Ollama ve Cloudflare tüneli ile birleşince yerel VRAM olmadan sansürsüz modelleri Hermes Agent üzerinden çalıştırmanın en düşük maliyetli yoluna dönüşüyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — EkA4pqXgta0
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Bugün gösterdiğim yöntem, aylarca yerel bilgisayarında VRAM yetmediği için hayal kırıklığı yaşayan herkes için bir çıkış yolu sunuyor: Kaggle üzerinde iki adet T4 ile toplam 32 GB bellek ayırıp sansürsüz bir modeli hiç ücret ödemeden çevrimiçi çalıştırmak ve ardından bu gücü doğrudan Hermes Agent gibi bir kabuk üzerinden kullanmak.

Videoyu başlatan sorun netti; önceki iki içerikte anlatılan özgür modeller çoğu izleyicide donanım duvarına çarpmıştı, çünkü dizüstü veya masaüstü GPU'lar 8 ya da 12 GB ile sınırlı kalıyor, büyük modeller ise 16 GB üzerinde yer istiyor ve sonuçta kurulum başarısız oluyordu.

Çözüm için seçilen platform Kaggle, herkesin bildiği veri yarışması sitesinden fazlası: ücretsiz defter ortamında iki adet T4 kartını tek bir oturumda birleştirip 32 GB toplam bellek veriyor, haftalık kotası 30 saat ve bu süre her hafta sıfırlanıyor, üstelik telefon numaranı doğrulamazsan kartlar hiç açılmıyor ve yalnızca işlemci ile kalıyorsun.

Hesabı oluşturup numarayı doğruladıktan sonra akış çok basit; Create düğmesi ile yeni bir defter açıyorsun, sağ üstteki Settings menüsünden Accelerator bölümüne girip GPU T4 x2 seçeneğini işaretliyorsun ve sistem sana iki kartlı ortamı veriyor, aynı kota P100 seçiminde de geçerli ama T4 x2 hem bellek hem karışık hassasiyet performansında daha dengeli duruyor, bu limit Colab ücretsiz katmandaki 12 saatlik oturum tavanından daha öngörülebilir.

Defterin çalışma şekli bildiğimiz sunucudan farklı; karşında siyah bir uçbirim yok, üst üste dizilmiş kod kutuları var ve her komutu ünlem işareti ile başlatman gerekiyor, aksi halde hücre çalışmıyor, her kutuyu tek tek Play düğmesi ile tetikliyorsun ve ihtiyaç duydukça artı ile yeni bir Code hücresi ekleyip silebiliyorsun.

Kurulumun ilk adımı bağımlılıkları yerine koymak; zstd, curl ve wget gibi küçük araçları apt ile sessizce kuruyorsun, sonra Ollama'nın resmi kurulum betiğini curl ile çekip sh ile çalıştırıyorsun ve bu noktada defterde systemd olmadığı için Ollama'yı subprocess ile arkaplanda ayağa kaldırman gerekiyor, aksi halde servis kilitleniyor.

Ollama kurulduktan sonra ollama serve komutunu veriyorsun ve ekranda Ollama started mesajını gördüğünde servis 11434 numaralı kapıda yerel adresi dinlemeye başlıyor, bu aşamada model hâlâ yalnızca defterin içinde yaşıyor ve dış dünyadaki hiçbir kabuk ona ulaşamıyor, bu yüzden bir tünel şart oluyor.

Modeli nereden bulacağın kısmında Hugging Face devreye giriyor; sitede Text Generation filtresi altında Ollama uygulamasını seçip arama kutusuna uncensored yazdığında en çok indirilen özgür modeller listeleniyor ve Qwen ailesi başta olmak üzere pek çok varyantın Q4_K_M ve Q6_K gibi nicemlenmiş sürümlerini görüp yeşil tik ile bellek uyumunu kontrol edebiliyorsun.

Beğendiğin varyantı deftere indirmek için başına ünlem koyarak ollama pull komutunu çalıştırıyorsun; indirme satır satır ilerliyor ve tamamlanınca sistem modeli çalıştırmayı deniyor ama bu denemeyi dilediğin anda durdurabilirsin, çünkü asıl çıkarım defterde değil, tünel üzerinden bağlanacağın kabukta yapılacak.

Yerel servisi internete açmak için Cloudflare tüneli kuruluyor; önce cloudflared ikilisini indirip paketini açıyorsun, sonra localhost ve Ollama kapısını parametre vererek tüneli başlatıyorsun ve oluşan genel URL'yi tarayıcıda açtığında Ollama is running yanıtını görürsen bağlantı hazır demektir, hata alırsan aynı hücreyi yeniden oynatman çoğu zaman sorunu çözüyor.

Son adım Hermes Agent tarafı; model listesinde Custom Endpoint seçeneğini bulup numarasını giriyorsun, ardından tünelden gelen adresin sonuna /v1 ekleyerek Base URL alanına yapıştırıyorsun ve API key olarak ollama yazıp modeli seçiyorsun, ilk çağrıda zaman aşımı yaşarsan ikinci denemede servis ısındığı için yanıt hızlanıyor ve video boyunca who are you sorusuna verdiği hızlı cevap, ücretli bulutla kıyaslandığında bile şaşırtıcı bulunuyor, tüm komutların derli toplu metni ise Discord'daki TXT dosyasında duruyor.

Görsel: nodesdaily AI

VRAM karşılaştırması

  • Kaggle T4 x232 GB
  • Kaggle P10016 GB
  • Colab Free16 GB
T4 x2 toplam bellek avantajı net; büyük modeller için kritik eşik.
PlatformGPUVRAMOturum / HaftaÜcret
Kaggle T4 x22x T432 GB9 sa / 30 saÜcretsiz
Kaggle P100P10016 GB9 sa / 30 saÜcretsiz
Colab FreeT416 GB12 sa / değişkenÜcretsiz

AI yorumu

"Benim gördüğüm kadarıyla bu kurulum, pahalı bulut kiralamadan korkan herkes için sahada test edilmiş bir köprü; ücretsiz kotayı, tüneli ve açık modelleri tek bir akışta birleştirdiği için denemeyi hızlandırıyor."

AI değerlendirmesi

Karşıt görüşü en cömert haliyle kurarsam şunu söylemem gerekir: Kaggle defterleri yarışma ve deneme için tasarlandı, kalıcı sunucu barındırmak için değil. Kullanım koşullarında server farming ve makine öğrenmesi ile ilgisi olmayan yoğun kullanım açıkça yasaklı duruyor. Bu yüzden 30 saatlik ücretsiz kotanın her hafta aynı cömertlikte sürmesini garanti gibi görmek gerçekçi değil.

Eksik yönleri net görüyorum. Her T4 yaklaşık 8 teraflop yarım hassasiyet ve 320 GB/s bant verirken bir A100 312 teraflop ve 2039 GB/s sunuyor, yani arada 38 kat fark var. Kaggle oturumları 9 saatte kesiliyor ve ortam kalıcı değil; defter kapanınca model siliniyor, her açılışta yeniden indirmek hem kota hem zaman yiyor ve iki çekirdekli işlemci veri yüklemede darboğaz oluşturuyor.

Çıkar tarafında Discord'daki TXT dosyası küçük bir huni oluşturuyor, izleyiciyi topluluğa çekmek doğal. Güvenlik tarafında ise tünel URL'si herkese açık ve kimlik doğrulaması olmadan paylaşıldığı için Ollama'nın bilinen CVE geçmişi göz önüne alındığında bu ucu açık bırakmak riskli. Bu yüzden videodaki 30 saat, 9 saat ve 16 GB gibi sayıları Kaggle belgelerinden ve kartların yeşil tikinden bağımsız olarak kontrol etmeden aynen almak doğru değil.

Benim pratik çıkarımım şu: bu yöntem kısa denemeler, 7 ile 13 milyar arası Q4 modeller, okul projesi veya sansürsüz davranış testi için ideal. 70 milyar üzeri, çok uzun bağlam veya kesintisiz üretim işi için uygun değil. Orada Cloudflare tüneli bile kalıcı çözüm vermez; Thunder Compute ya da Runpod gibi saatlik kiralanan bir kart öngörülebilir süre ve depolama ile daha mantıklı duruyor.

Kaynaklar

9 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

donanım · kaggle · üzerinde · ücretsiz · sunucu · sansürsüz · nodesdaily

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…