Otuz iki kilobayt ile altı yüz kırk gigabayt arasında tek bir merdiven uzanıyor ve bu videonun sunucusu o merdivenin her basamağına gerçek bir cihaz koyuyor: en altta hiçbir modelin sığmadığı bir Arduino, en üstte sınır modellerle boy ölçüşen sekiz H100. Soru basit: cebinizdeki ya da masanızdaki donanım, hangi büyüklükte yapay zekâyı evde çalıştırabilir?
Çipler: akıl mikrodenetleyicide
Merdivenin ilk basamağı mikrodenetleyici sınıfı; bunların işletim sistemi, dosya sistemi ve ayrı bellek çubuğu yok, her şey kartın üstünde. Sunucunun Arduino Uno R4 kartında yalnızca 32 kilobayt RAM var ve bu alana hiçbir model sığmıyor. Yine de kart çöp değil: Wi-Fi üzerinden evdeki büyük makineye bağlanıp onun çalıştırdığı modelin minik ekranı haline geliyor, nitekim videoda Mac Studio'daki bir modelin neşe mesajı bu kartın ekranında beliriyor.
Bir basamak yukarıda ESP32-S3 var: 8 megabayt RAM, ekranlı haliyle yaklaşık 20 dolar, ekransızı 2-5 dolar. Kart, TinyStories ailesinden 260 bin ve 3 milyon parametreli iki minik hikâye modelini rahatça koşturuyor. CircuitDigest'in Eylül 2026 tarihli ESP32 kıyaslaması da 260 bin parametreli modelin bu sınıfta çalıştığını doğruluyor. Bu modeller sohbet edemiyor, ses ya da görüntü üretemiyor; sadece tutarlı kısa hikâye üretiyor ama üstüne LED ile hikâye ruhunu yansıtan ışıklar ya da İngilizce gramer oyunu gibi projeler eklenebiliyor.
Mini bilgisayarlar: aynı RAM, farklı hız
Sonraki sınıf gerçek bilgisayarlar: Raspberry Pi 5 ve sunucunun iPhone 16'sı, ikisi de 8 gigabayt RAM taşıyor. Pi tarafında demo etkileyici: konuşmadan metne için Whisper, akıl yürütme için Qwen3 1.7B, cevabı seslendirme için Piper adlı üç küçük model zincirleniyor ve kartla sözlü sohbet ediliyor. GitHub'daki pi-assistant türü projeler de bu zincirin başkaları tarafından kurulduğunu gösteriyor. Sunucu zincire bir web kamerası ekleyip küçük görsel dil modeli Moondream'e odayı anlattırıyor; model siyahlı kadını, dağılmış 13 kitabı ve sırt çantasını doğru sayıp döküyor.
Ne var ki Pi'nin bir sınırı var: GPU yok. Küçük bir görüntü modeli belleğe sığsa bile üretim işleri işlem gücü istediği için pratikte görüntü, müzik ve video üretimi bu kartta yok hükmünde. Pi buna karşılık sensör ve aksesuar zenginliğiyle kapatıyor; sunucu, Hugging Face robotlarının bile bu kartla yürüdüğünü hatırlatıyor. Küçük ve orta boy dil modelleri, minik görsel modeller ve ses modelleri Pi'nin konfor alanı.
Aynı 8 gigabayt, iPhone 16'da bambaşka davranıyor çünkü Apple her uygulamayı 4-5 gigabaytla sınırlıyor; Pi'ye sığan 7-14 gigabaytlık orta sınıf modeller telefona giremiyor. Üstelik telefona rastgele yazılım kurulmuyor, her şey resmi uygulama üzerinden yürüyor: Google'ın GitHub'daki AI Edge Gallery uygulaması Gemma ailesini, Draw Things uygulaması 2 gigabaytlık Stable Diffusion 1.5'i telefonda koşturuyor. Büyük Whisper modelleri ve tüm seslendirme modelleri telefonda rahat; Ultralytics'in YOLO 11N algılama modeli ise kameraya bakıp nesne sayıyor; yüz tanımadan sürücüsüz araca giden yolun temeli bu sessiz modeller. Ultralytics belgelerine göre YOLO 11, Eylül 2024 çıkışlı güncel kararlı seri.
Mutfak benzetmesi: kapasiteye karşı bant genişliği
Videonun ortasındaki restoran mutfağı benzetmesi, donanımı ezberden çıkarıp sezgiyle anlatıyor: derin dondurucu depolama, hazırlık tezgâhı RAM , tezgahtan ocaklara giden bant hafıza yolu, şef CPU, sıra aşçılar GPU, duvara cıvatalı tek işlik makineler NPU. Model önce tezgahtaki belleğe alınıyor, banttan geçip işlemcilerde pişiyor ve cevap olarak servis ediliyor. PromptQuorum'un Eylül 2026 kılavuzu da bu sezgiyi sayıyla bağlıyor: 4 bit sıkıştırmada parametre başına yaklaşık 0,6 gigabayt kuralıyla 7 milyar parametre 4-5, 14 milyar yaklaşık 9, 70 milyar ise 40 gigabayt istiyor.
Bu benzetme Pi-iPhone bilmecesini çözüyor: kapasite aynı ama bant genişliği farklı. Pi'nin hafıza yolu dar ve yavaş, üstelik tek başına bir CPU var; iPhone'da ise CPU, GPU ve NPU birlikte çalışıyor. Görüntü, video ve müzik üretimi de bu yüzden ayrışıyor: bunlar yoğun işlem işi ve yalnızca CPU ile kotarılamıyor. Kural net: modeli sığdırmak kapasite işi, onu hızlı çalıştırmak bant genişliği ve işlemci işi.
Dizüstü ve ev sunucusu: formül ve 7x24 makine
Dizüstü sınıfında sunucunun 32 gigabaytlık MacBook Pro'su neredeyse her kategoriyi açıyor: büyük dil modelleri, kod modelleri, görsel analiz, görüntü ve video üretimi, seslendirme, konuşmadan metne, ses ve müzik üretimi. Günlük işlerde Qwen3 14B/16B/32B ile Hermes Agent, kod tarafında OpenCode ile Qwen3 Coder 30B yerelde koşuyor; Ollama kayıtlarına göre qwen3-coder 30B yaklaşık 19 gigabayt ve 256 bin bağlam penceresi sunuyor. Görüntüde favori Flux Dev. Sunucu, kendi makinesinden yola çıkan pratik bir formül de veriyor: duyurulan RAM'den yüzde 25 düş, kalanı 0,6'ya böl, çıkan sayı milyar parametre olarak tavanın; 32 gigabayt için 24/0,6 ile 40 milyar. Hesap, PromptQuorum'un 0,6 katsayısıyla birebir örtüşüyor.
Videonun bir bölümü Crusoe sponsorluğuna ayrılmış; sunucu, sunucusuz çıkarım ve ince ayar hizmetini küme kurma derdi olmadan açık modelleri denemenin yolu olarak anlatıyor. İçerik olarak tek cümlelik yer tutuyor, makinenin merdivenindeki yerini değiştirmiyor.
Ev sunucusu sınıfı iki özellikle alınır: makine hep açık ve kapasiteyle bant genişliği daha yüksek. 64 gigabaytlık Mac Studio, 27-32 milyar bandında büyük dil ve kod modelleri, büyük görüntü ve müzik modelleri koşturuyor; video üretimi orta seviyede ve yavaş. Sunucu, yerel ajanlarını bu makinede tutuyor ve Arduino'yu da ona bağlıyor. Sınıfın uygun giriş kapısı sayılan Mac mini'nin bulunurluğu düşük olduğu için Studio alınmış. Formülü uygularsak 64 gigabayttan 48 kullanılabilir, 48/0,6 ile 80 milyar tavan çıkar ama sunucu kalite ve hız için 30 milyar bandında kalmayı seçiyor.
128 gigabayt duyurulan AMD Halo'da yaklaşık 96 gigabayt kullanılabilir alanla kapı büyüyor: Llama 3.3 70B ve GPT-OSS 120B rahat koşuyor, DeepSeek Coder V2 gibi çok büyük kod modelleri açılıyor. AMD'nin duyurusuna göre Strix Halo tabanlı makineler LM Studio ile 128 milyar parametreye kadar model çalıştırıyor. VRLA Tech'in (vrlatech.com) Llama 3.3 70B gereksinim analizi de 70 milyar sınıfının tek kartın ötesinde bellek istediğini doğruluyor. Sunucunun bu sınıfta asıl övdüğü şey tek dev model değil, belleğe sığan çok sayıda modeli aynı anda yüklü tutup kod ajanı, dil modeli ve üretim işlerini paralel yürütmek. Zayıf karnı ise bant genişliği: işi yapıyor ama görüntü, video ve müzikte yavaş kalıyor.
Ayrık GPU: iki dünyanın birleşmesi
Finalde bant genişliği sorunu ayrık GPU ile çözülüyor. Benzetmeyle her GPU, aşçıların yanına kendi özel tezgâhı ve çok geniş bandıyla gelen bir paket; kart eklendikçe hem işlemci hem özel bellek hem de bant artıyor. Sunucunun saatlik ücretle kiraladığı RTX 4090, 24 gigabaytla bunun canlı demosu: görüntü ve video üretimi göz açıp kapayıncaya kadar beliriyor. packet.ai'nin Temmuz 2026 rehberine göre Flux.1 Dev, FP8'de 18-23 gigabayt bellek istiyor ve RTX 4090'da 9-10 saniyede görüntü üretiyor; demek ki 24 gigabayt bu modele tam uyuyor ama daha büyük modellere kapı kapalı. AMD Halo ile 4090 birbirinin tersi: biri yüksek kapasite-düşük bant, öteki düşük kapasite-yüksek bant.
Zirvede kiralanmış 8 adet H100 var: 640 gigabayt bellek, devasa kapasite ve bant genişliği bir arada. Burada 700 milyar parametrenin üstünde dil modelleri, 480 milyarın üstünde kod modelleri, görsel dil işleme ve her tür çok modlu üretim açılıyor; Minimax ile dakikalara uzanan videolar hızlı üretiliyor. Sunucunun hükmü: model şirketi değilseniz ya da sınırsız bütçeniz yoksa gidebileceğiniz en uç burası ve artık bulut API parasıyla alınan sınır modellerle aynı ligdesiniz. Merdivenin dersi tek cümle: önce kullanılabilir belleği hesapla, sonra kapasite ile bant genişliğini birlikte tart.
Videodaki anahtar anlar
AI yorumu
"Mutfak benzetmesiyle kapasite-bant genişliği ayrımını ilk kez bu kadar berrak anlatan video, 0,6 katsayılı pratik formülüyle izleyeni hesap yapabilir hale getiriyor. Sponsor bölümü ve seçilmiş demolarına rağmen merdiven mantığı sağlam ve bağımsız kaynaklarla doğrulanabiliyor."
AI değerlendirmesi
En güçlü karşı görüş bulut tarafında: bu merdivenin üst basamakları saatlik ya da dakikalık kira bedeliyle çalışıyor ve çoğu okur için ayda birkaç dolarlık API, binlerce dolarlık donanımın yerini tutuyor. Yerel çalıştırmanın gizlilik, çevrimdışı kullanım ve uzun vadede maliyet avantajı gerçek; ama sınır model kalitesini kiralamak ile evde daha küçük modeli beslemek arasındaki tercih, kullanım sıklığına ve gizlilik ihtiyacına göre değişir. Sunucu bu hesabı açıkça yapmıyor.
Eksikler de var: güç tüketimi, ısı ve gürültü hiç konuşulmuyor; 8x H100 kirasının dakika bedeli, RTX 4090'ın saat ücreti, Halo ve Mac Studio'nun etiketleri sayıya dökülmüyor. VRAM ile birleşik bellek farkı, niceleme seviyelerinin kalite maliyeti ve hız ölçümleri (saniyede jeton gibi) demoların dışında kalıyor. Gösterimler seçilmiş anlar; başarısız deneme, hata ayıklama ve kurulum süresi görünmüyor.
Konuşmacının konumu da not edilmeli: video bir bölümüyle Crusoe destekli ve sunucu açık modellerle denemeyi işi olarak yapıyor; açıklama altındaki kılavuz bağlantıları kendi ekosistemine akıyor. Bu, anlatılanları yanlış yapmaz ama seçimleri renklendirir: hangi modelin öne çıktığı, hangi donanımın parladığı bu mercekten geçiyor.
Okur için pratik çıkarım formülle başlıyor: makinenin duyurulan belleğinden yüzde 25 düşüp 0,6'ya bölerek tavanı bulun, sonra merdivenden yerinizi seçin. Telefon ve Pi ile algılama, ses ve küçük dil işleri; dizüstüyle kod ve görüntü; ev sunucusuyla 7x24 ajanlar; Halo ile 70 milyar üstü; kiralanmış GPU ile hızlı üretim. Her basamak bir öncekini çöpe atmıyor, aksine Arduino örneğindeki gibi büyük makinenin küçük eli oluyor.
Kaynaklar
9 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
yerel yapay zekâ · donanım · esp32 · raspberry pi · açık kaynak modeller · gpu