Dizüstünde koşan bir ajan tek kişi için rüya gibidir: Qwen3 akıl yürütür, Ollama sunar, ileti verisi makineden dışarı adım atmaz ve fatura sıfırdır. Ne var ki kapak kapanıp eve gidilince veya ikinci bir kişi aynı akla dokunmak isteyince rüya biter; tek makine, tek kullanıcı düzeneki çok kullanıcılı gerçeklikte çöker. Sunucu soruyu tam buradan kuruyor: dizüstündeki bu sessiz düzeni kalabalığın kullanacağı bir hizmete nasıl taşırız, üstelik tek makine tuzağı na düşmeden?
Başlangıç düzeneği yalın: hesap makinesi, web araması ve GitHub MCP bağlantısı taşıyan üç araçlı ajan , akıl yürütmeyi Qwen3 açık ağırlık modelinden alıyor ve sunumu dizüstündeki Ollama üstleniyor. İleti verisi makineden çıkmadığı için gizlilik derdi yok, maliyet kalemi yok; deneme yanılma özgürlüğü tam. Sunucu bu düzeni bir kişi bir makine konforu diye çerçeveliyor ve üretim sorusunu net koyuyor: aynı ajan, kapağı kapalı bir dizüstüne bağlı kalmadan nasıl yaşar?
Sunumun en güçlü fikri ilk dakikada geliyor: ajanın içinde hiçbir şey değişmiyor, değişen yalnızca modelin sunulduğu yer ile ajanın koştuğu konum. İki hamle var: önce Ollama yerine eşzamanlı trafiğe ayarlı bir çıkarım sunucusu geçiyor, sonra bütün düzenek kapsayıcıya konup OpenShift kümesine taşınıyor. Yapı, Claude veya GPT gibi dış uçlarla da aynen çalışır; ajan akıl yürütmenin nereden geldiğini umursamaz, konuşacağı bir uç soyutlama ister. Unsloth belgelerinde Ollama ile vLLM gibi sunucuların aynı OpenAI uyumlu arayüz deseniyle bağlandığı anlatılır; bu yüzden dizüstü ile küme arasındaki fark .env dosyasında üç satıra iner.
Model katmanı: Ollama'dan vLLM'e
Birinci parça model katmanı. Dizüstündeki Ollama kurulumunun yerini OpenShift AI üzerinden vLLM sunumu alıyor; vLLM, Berkeley çıkışlı açık bir proje ve RedHat blogundaki tanıtıma göre hızlandırıcı hafızası verimliliği ile hız için geliştirildi, GitHub üzerinde 40 binden fazla yıldız topladı. TheNewStack yazısında anlatıldığı üzere sunucu, istekleri sürekli gruplama ve sayfalı dikkat teknikleriyle aynı model üzerinde yığılan çağrıları verimli taşıyor; Llama, Mistral, Granite ve DeepSeek gibi aileleri destekliyor. AI Hub akışında model HuggingFace URI adresinden çekiliyor, hızlandırıcı kaynağı ve çalışma zamanı seçilip dağıtılıyor; küme içinden erişen iç bağlantı, dışarıdan erişen dış bağlantı ve istekleri doğrulayan bir API anahtarı üretiliyor. .env dosyasındaki fark üç satır: localhost Ollama adresi yerine küme içi vLLM hizmeti, yeni anahtar ve vLLM sunucusunun beklediği model kimliği.
Ajana akıl veren Qwen3. GitHub üzerinde yayımlanan resmi duyuruya göre amiral sürüm 235B-A22B, kod ve matematikte DeepSeek-R1 ve Gemini-2.5-Pro gibi üst düzey modellerle boy ölçüşüyor; 30B-A3B gibi küçük karışık uzman sürümler ile 0.6B'den 32B'ye uzanan yoğun sürümler Apache 2.0 lisansıyla açık ağırlık paylaşılıyor. Uzun bağlam penceresi ve hibrit düşünme kipi, modeli araç çağıran ajan iş yüklerine elverişli kılıyor; sunucunun dizüstünde ücretsiz koşturduğu düzenek, bu lisans açıklığının gündelik karşılığı sayılır.
Ajan katmanı: kapsayıcı ve küme
İkinci parça ajanın kendisi. Önce OpenShift konsolundan oturum komutu alınıp kümeye giriliyor; sonra Podman ile imaj derleniyor, Quay üzerinden gönderiliyor ve dağıtıma veriliyor, Docker da aynı işi görür. Repo içindeki make komutları derleme, gönderme ve dağıtım adımlarını tek tuşa indiriyor. Bir dakika sonra model ucu ile ajan aynı kümede yan yana podlar olarak koşuyor; pod zamanlanıyor, imaj çekiliyor ve bir dakika önce dizüstünde yaşayan ajan artık OpenShift üzerinde bir pod olarak çalışıyor. Kod satırı değişmedi, ev adresi değişti.
Canlı denemede ajan önce web araması ve hesap sorusuyla yoklanıyor; ardından GitHub üzerinden bir kayıt okutulup yeni kayıt açtırılıyor ve aynı MCP aracı kümenin içinden okuma ile yazmayı birlikte sırtlıyor. Sohbet günlükleri yerel uçbirim yerine RedHat OpenShift AI oyun alanında izleniyor; modelden ajana ve oyun alanına kadar her şey kümede koşuyor, düzenek küme içi günlük izlemeye geçiyor.
Dağıtıldı demek üretime hazır demek değil
Sunucu finalde dürüst bir sınır çiziyor: pod kendi kapsayıcısındaki her dosyayı okuyabiliyor, dışarıya neredeyse istediği yere erişebiliyor; davranış görünürlüğü, kaynak sınırları, çok ekibin güvenli kullanımı, ajana atanmış izinler ve davranış kapsamı ortada yok. CNCF yazısında anlatılan sıfır güven yaklaşımına göre kümede koşan yapay zekâ iş yüklerinde sınırsız ağ trafiği ve açık uçlar, klasik sorunların pahalı sürümüdür; çalınan bir anahtar küçük sızıntı değil kabaran faturadır. InfoQ kaydına göre açık Agent Sandbox düzeni gVisor perdesiyle yalıtım kurarken, Google tarafının KubeCon duyurusundaki geçici sandbox yaklaşımı aynı boşluğu kapatmaya adaydır. Repo ve manifest bağlantılarda duruyor; kapatma işi sonraki videonun konusu olarak bırakılıyor.
| Hamle | Öz |
|---|---|
| Model katmanı | Ollama çıktı, OpenShift AI üzerinde vLLM geldi |
| Ajan katmanı | Podman derledi, Quay taşıdı, ajan pod oldu |
| Eksik parça | Görünürlük, kota ve izinler sonraki videoda |
Videodaki anahtar anlar
AI yorumu
"Bu anlatım üretime geçişi model takası ve kapsayıcı dağıtımına indirgeyen berrak bir çerçeve kuruyor. Ne var ki güvenlik ve maliyet defteri sonraki videoya bırakılıyor; izleyici ilk günden görünürlük ve izinleri de plana yazmalı."
AI değerlendirmesi
En güçlü karşı görüş maliyet ve ölçekten geliyor: vLLM takası bedava değil; hızlandırıcı hafızası planlaması, sürücü uyumu ve sürekli çalışan küme gideri ister. İki kullanıcılı bir iç deneme için Ollama sadeliği yeter de artar; küçük yükte kümeye taşınmak top arabasıyla markete gitmektir. Sunumda eşzamanlılık sayısı ve gecikme ölçümü verilmediği için ölçek eşiği belirsiz kalıyor: kaç eşzamanlı istekte kümeye geçmeli, sunum söylemiyor.
Eksik listesi kısa değil: hangi hızlandırıcı profiliyle kaç isteğin taşındığı, gecikmenin kaç saniyeden kaç saniyeye indiği, aylık faturanın ne olduğu yok. Güvenlik bölümü sonraki videoya söz verilerek geçiliyor; izin, kota ve ağ politikası konuşulmadan üretim kelimesi erken kuruluyor. Okur bu videoyu kurulum tarifi gibi değil taşınma provası gibi izlemeli; kotasız ve izinsiz podu üretime taşıyan, fırtınada şemsiyeyle yürür.
Sunucunun konumu da not edilmeli: anlatım Red Hat kanalında yayımlanıyor, OpenShift AI ve Quay doğal başrolde; yönetilen dış uçlarla yan yana maliyet karşılaştırması yok. Bu içerik ürün turu süzgeciyle izlenmeli; vLLM erdemleri gerçek olsa da sahne tercihi ev sahibinin. Karşılaştırma ölçümleri bağımsız kaynaklardan doğrulanmadan bütçe kararı verilmemeli.
Pratik çıkarım taşınabilir: akıl yürütme ucunu adres, anahtar ve model kimliği üçlüsüyle soyutla; ajanı uçtan bağımsız yaz ki yarın uç değişsin, ajan yaşasın. Küçük başla, görünürlük ve izinleri ikinci güne bırakma; sandbox ve kota işini sonraki videoya erteleme. Dizüstündeki ücretsiz düzen üretimin provasıdır, provası ciddiye alınan taşınır.
Kaynaklar
8 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — Red Hat
- @redhat.com RedHat — Meet vLLM
- @thenewstack.io TheNewStack — Inside the vLLM inference server
- @qwenlm.github.io Qwen3 announcement
- @cloud.google.com Google Cloud — Agentic AI on Kubernetes
- @cncf.io CNCF — Zero-trust AI on Kubernetes
- @unsloth.ai Unsloth — Connecting model servers
- @infoq.com InfoQ — Agent Sandbox on Kubernetes
yapay zekâ · vllm · openshift · qwen3 · kubernetes · mcp