Gündeme dön

Gemini 4 Pro Sızdı, GPT-6 Soul Testte: Arena'dan Google Buluta Haftanın AI Sarsıntısı

Google'ın Arena'da hayalet testte görülen Gemini 4 Pro'su, OpenAI'nin 30 Nisan kesimli GPT-6 Soul'u, Google Bulut kotalarında beliren Grok 4.7, Unbiased'ın Pareto 269 olarak açığa çıkan Union Alpha'sı ve Xiaomi'nin 2 milyar tokenlik Mimo 2.6 RL koşusu aynı haftaya yığıldı.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — ZJ6RUAH--Js
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Bu video, sunucunun bir aylığına ev düzeninden uzak kaldıktan sonra döndüğü ilk uzun bülten ve tek seferde sekiz ayrı sızıntıyı bir araya getiriyor: Gemini 4 Pro, GPT-6 Soul, Grok 4.7, Union Alpha, Typesafe Jev, Google'ın Dream RSI çerçevesi, Claude Code'daki Projects ve Xiaomi'nin Mimo 2.6 eğitim koşusu. Ortak tema, hiçbirinin resmi lansman duyurusu olmaması; hepsi Arena hayalet testleri, Bulut kotaları, açık kaynak denemeleri veya araştırmacının paylaştığı günlükler üzerinden okunuyor. Benim için bu da haftanın asıl hikayesini açıklıyor: artık model kadar modelin nasıl test edildiği de haber değeri taşıyor.

Gemini 4 Pro Arena'da Hayalet Testte

Google cephesinde en net iz, Arena'da Gemini 3.8 Flash adıyla dolaşan bir kontrol noktası. Bir kullanıcı binden fazla gezegeni aşırı detaylı biçimde üretmesini isteyen sonsuz JSON stres testini denediğinde, gerçek Flash özetleyip bırakırken bu kontrol noktası tarayıcı karakter sınırına çarpıp sayfayı çökertene dek tekrarsız, ayrıntılı veri üretmeye devam etmiş. Bu dayanıklılık, sızan bilgideki 256 bin çıkış token sınırıyla örtüşüyor ve izlerin Gemini 4 Pro'ya ait olduğu tahminini güçlendiriyor. Videoda teste erişmek için Arena'da Battle moduna girip Code kategorisinde istem göndermek gerektiği, düşük muhakeme seviyesinde bile sonuçların şaşırtıcı olduğu vurgulanıyor; yani lansmanda kapasitenin daha da yüksek olması bekleniyor.

Aynı kontrol noktasının yaratıcı çıktıları da bültenin omurgasını oluşturuyor. Mario Kart tarzı pürüzsüz görselli bir oyun, Formula 1 aracının ışık ve kamera açılarıyla kurulu üç boyutlu simülasyonu, kiraz çiçekleri, nehirdeki balıklar ve gün döngüsüyle bezeli kutu-sanatı tapınak gibi üretimler, normalde Arena'nın kısıtlı muhakeme seviyesinde görülmeyecek kalitede anlatılıyor. En çok konuşulan örnek ise Nintendo Switch'in kumandasının gövdeye kenetlenip ekranın logoyla açıldığı animasyonlu SVG: videoya göre Gemini 4 Pro bu istemde Opus 5'i belirgin biçimde geride bırakmış. On dakikalık üretim süresiyle hazırlanan PS5'e ait derinlikli, çok açılı ve hatta kontrolcünün sessiz tuş ışığı ve iskelet katmanına kadar giden saf SVG ise ölçek kadar işçiliğin de arttığını gösteriyor. Pelikanın bisiklet sürdüğü aynı istemde GPT-6 Astra'nın görsel derinlikte bir adım önde olduğu notu da düşülüyor; ama hayalet kontrol noktasının taban seviyede bile ileri modellerle yarışması, Google'ın geri dönüş argümanını besliyor.

GPT-6 Soul: Kesim Tarihi, Katmanlar ve İlk İzlenimler

OpenAI tarafında bülten, GPT-6 Soul'un geliştirici gününden hemen önce gündeme gelmesini ele alıyor. Modelin bilgi kesiminin 30 Nisan olarak anılması, aynı kesimi paylaştığı söylenen GPT-6 Astra ile akraba mimariye işaret ediyor; Luna ve belki Terra adlarıyla daha alt katmanların da geleceği konuşuluyor. Soul'un ChatGPT web uygulamasında gri teste girdiği, erken deneyenlerin daha zengin biçimlendirme ile bellek ve kişiselleştirmede belirgin iyileşme raporladığı aktarılıyor. Yüksek muhakeme çabasıyla üç dakikada üretilen bir PS5 kumandası SVG'si ve 3GS benzeri bir ortamda kodlanan ev içi üç boyutlu sahne, verimlilik katmanında bile Astra'ya yaklaşan bir kalite izlenimi veriyor. Sunucu, birkaç farklı istemde Soul'un henüz yayınlanmamış Claude Opus 5.2'yi geride bıraktığı iddialarını da aktarıyor; ancak bunların bağımsız doğrulama olmadan erken izlenim olarak kalması gerektiğini özellikle vurguluyor, çünkü maliyetin Astra'ya göre daha düşük olması beklenirken hız ve kalite dengesinin lansmanda netleşmesi gerekiyor.

Grok 4.7 Bulut Kotalarında Belirdi

Grok cephesinde haber, modelin Google Bulut kotaları ve sistem sınırları içinde görülmesi. Elon'un yakın zamanda geleceğini söylemesiyle birleşince, bu iz sızıntısı birkaç gün içinde gelebilecek bir sürüme yoruluyor. Videodaki ilk kıyaslamalarda Colony Bench Mega'da Grok 4.7'nin 6.4 puanla Gemini 3.8 Flash'ın 2.7 ve GPT-5.6 Soul'un 2.6 değerlerini belirgin biçimde aştığı, ancak GLM 5.3, DeepSeek 4.1 Flash, GPT-6 Astra Pro ve Claude Fable 5 gibi tepe modellerin gerisinde kaldığı anlatılıyor. CUDA tarafında tablo daha çekişmeli: GLM 5.2 füzyon testlerinde 9.5 ile Grok 4.6'nın 9.4'ünün hemen üzerinde, diğer CUDA iş yüklerinde de küçük iyileşmeler var. Sunucunun yorumu net: 4.6'ya göre gerçek bir sıçrama var, fakat birçok alanda kazanım marjinal; bu yüzden heyecanı abartmadan, bağımsız tekrar testlerini beklemek daha sağlıklı.

Union Alpha'nın Perdesi: Pareto 269 ve Harness Gerçeği

Haftanın en çok konuşulan gizemi Union Alpha, video çekildikten hemen sonra çözülüyor. Başta OpenCode, OpenRouter ve Klein üzerinden ücretsiz denenen, 256 bin bağlam pencereli, çok modlu ve ajan odaklı kodlama iddiasındaki model, GPT-6 Astra ve Claude Opus 5 seviyelerine yakın performans ve yaklaşık 18 kat düşük maliyet beklentisiyle merak uyandırmıştı. Kurgunun hemen ardından gelen açıklamada modelin Unbiased şirketine ait Pareto 269 olduğu ve tek bir model değil, Sukuna benzeri bir sistem olarak birden fazla açık ve ileri model arasında işi yönlendiren bir koşum takımı olduğu ortaya çıkıyor. Listelenen fiyat milyon giriş token başına 2.50 dolar ve önbellekli giriş için 0.25 dolar, çıkış için 7.50 dolar; şirketin iddiasına göre Astra'nın liste fiyatının dörtte birinden az. Bu mimari, neden bazı görevlerde tepe modellere bu kadar yakın göründüğünü de açıklıyor: koşum takımı gerektiğinde işi doğrudan o modellere yönlendiriyor. Benim okumam, Union Alpha'yı modelden çok bir orkestrasyon ürünü olarak görmek gerektiği yönünde; değerlendirme, tek bir ağırlıktan ziyade yönlendirme mantığının şeffaflığına odaklanmalı.

Typesafe tarafında ise bültende Jev adıyla anılan, Dio ve ekibinin geliştirdiği model bambaşka bir kulvarda tanıtılıyor. Token token metin üreten klasik büyük dil modellerinden farklı olarak Jev, yapılandırılmamış girdiyi alıp önceden tanımlı olasılık kümesi içinden kalibre edilmiş kararlar ve olasılıklarla döndürüyor; her şey paralel hesaplanıyor. Eğitim yaklaşımı RLCD yani kalibre kararlar için pekiştirmeli öğrenme olarak adlandırılıyor. Şirketin kendi kıyaslarında 20 ile 200 kat daha hızlı ve 40 ile 400 kat daha ucuz olduğu, fiyatın milyon giriş token başına 4 sent ve çıkışların ücretsiz olduğu belirtiliyor; elbette bunlar bağımsız testle teyit bekleyen beyanlar. Kritik kısıt da açık: Jev normal metin üretemiyor, bu yüzden GPT-6 Astra veya Claude gibi bir modelin yerini almıyor; daha çok ağır muhakemeyi yapan modelin etrafında yönlendirme, sınıflandırma, çıktı hakemliği veya bir ajanın bir sonraki adımını seçme gibi binlerce ucuz ve hızlı kararı üstlenen tamamlayıcı olarak konumlanıyor.

Dream RSI, Claude Projects ve Xiaomi'nin Kamuya Açık RL Koşusu

Google DeepMind tarafındaki Dream RSI, döngüyü kapatan bir çerçeve olarak anlatılıyor. Model ağırlıkları doğrudan iyileşmiyor; onun yerine keşif stratejisini yürüten ajan, geçmiş bulma denemelerinden öğrenerek daha iyi çözümler arama biçimini yinelemeli olarak geliştiriyor. Bültene göre bu döngü algoritma keşfi, GPU çekirdek mühendisliği ve model geliştirme gibi üç farklı alanda gösterilmiş; bu da sistemin tek bir görevde değil, arama politikasının kendisinde genelleştiğini düşündürüyor. Yine de hatırlatma önemli: bu, modelin kendi kendini ağırlık seviyesinde iyileştirmesi değil, politika seviyesinde yinelemeli iyileşme; bu yüzden RSI etiketi heyecan verici olsa da henüz kapalı döngü anlamında tam özerk iyileşme değil, kontrollü bir basamak.

Claude tarafında Projects özelliği, tek sohbetten birden fazla işin paralel iplikçiklere dağıtılması olarak tanıtılıyor; dizüstü kapağı kapansa bile ipliklerin çalışmayı sürdürmesi ve her ipliğin ortak bellek ile dosyalar üzerinden güncel kalması özellikle hareket halindeki çalışma için pratik bulunuyor. Şimdilik seçili Pro ve Max kullanıcılarında beta olan özelliğin daha geniş dağıtıma çıkması bekleniyor; bülten bunun Opus 5.2 ile eş zamanlı gelebileceğini tahmin ediyor. Xiaomi cephesinde ise altı aylık sessizlik sonrası Mimo 2.6'nın devasa bir pekiştirmeli öğrenme koşusunun ortasında olduğu bilgisi var: pekiştirmeli öğrenme hesaplama kaynakları, çok görevli ajan ortamları ve toplam hesaplama ölçeği üçe katlanıyor; eğitim adım başına yaklaşık 2 milyar tokenın binlerce paralel açılımla üretildiği ve şirketin bu koşuyu herkese açık biçimde yayınlayıp önümüzdeki haftalarda eğitim detaylarını açık kaynaklayacağı söyleniyor. Modelin kendisi için bir ila iki ay beklemek gerekeceği notu da düşülüyor.

Kapanışta bülten, GPT-6 Astra ile dans adımları oluşturulan bir robotun kısa gösterimine de yer veriyor; bu, ağır modellerin fiziksel dünyadaki koreografiye kadar uzanan esnekliğini sembolize ediyor. Sunucunun kendi bülteni, kıyaslama platformu ve ikinci kanal hatırlatmalarıyla birlikte tablo netleşiyor: Google arena üzerinden sessizce geri dönüş denerken OpenAI katmanlı bir aileyle maliyeti düşürmeyi, xAI kotalar üzerinden sürümü ısındırmayı, Xiaomi ise eğitimi kamuya açarak güven toplamayı deniyor. Benim çıkardığım ders, bu haftayı tek bir kazananla okumaktan çok her laboratuvarın farklı bir şeffaflık yolunu test ettiği bir hafta olarak görmek: kimin hayalet testi daha dürüst, kimin kotası daha erken sızdı, kimin günlüğü daha öğretici — asıl yarış orada dönüyor.

Görsel: nodesdaily AI

Videodaki anahtar anlar

  1. Açılış — sekiz başlık tek bültende
  2. Gemini 4 Pro hayalet testi ve 256 bin iddiası
  3. Mario Kart ve Formula 1 üç boyutlu üretimleri
  4. Tapınak kutu sanatı ve gün döngüsü detayı
  5. PS5 saf SVG — on dakikalık derinlik
  6. Pelikan bisiklette — Astra ile yan yana
  7. GPT-6 Soul kesim tarihi ve gri test izleri
  8. Grok 4.7 Bulut kotası ve ilk skorlar
  9. Union Alpha ve Pareto 269 perdesi
  10. Jev, Dream RSI, Claude Projects ve Mimo 2.6

AI yorumu

"Benim gözümde bu haftanın sinyali tek bir model değil, test biçimi: Arena'daki hayalet turlar, Bulut kotalarındaki sızıntılar ve herkesin bir anda yayınladığı RL günlükleri, lansman takviminden çok deneme altyapısının kendisi haber oldu."

AI değerlendirmesi

Bu bültenin en güçlü karşı tezi, sızıntıların kalitesini abartmama çağrısı. Arena'daki hayalet test düşük muhakeme seviyesinde yapılıyor ve tek bir istekte rastgele bir kontrol noktasına düşme şansı var; yani gördüğümüz parlak SVG veya 3D, seçilmiş en iyi örnek olabilir ve ortalama performansı temsil etmeyebilir. Üstelik 256 bin çıkış gibi sayılar etiket bilgisine dayanıyor, bağımsız ölçüm değil. Bu yüzden Gemini 4 Pro geri dönüşünü tek bir Switch animasyonundan okumak yerine aynı istemlerin tekrarlanabilirliğini ve başarısız denemelerin oranını görmek gerekir.

İkinci eksik, yöntem ve süre sınırları. Bin gezegenli JSON testi dayanıklılığı gösteriyor ama çeşitlilik, tutarlılık ve gerçekten tekrarsızlık ölçümü olmadan bir ezber testi de olabilir. PS5 iskeletine kadar inen SVG etkileyici, fakat üretim süresi on dakikaya çıkıyor; bu maliyet gerçek kullanımda kabul edilebilir mi, tarayıcı çökmesi pratikte ne anlama geliyor, bu sorular yanıtsız. Benzer biçimde Grok 4.7'nin Colony Bench ve CUDA skorları erken ve dar bir kesit; farklı alanlarda, uzun bağlamda veya güvenlik testlerinde tablo değişebilir. Bu noktaları bağımsız tekrar testleri olmadan hükme çevirmemek en sağlıklısı.

Çıkar ve doğrulanabilirlik katmanında her başlıkta bir beklenti yönetimi var: Gemini izleri anonim kullanıcı paylaşımları, GPT-6 Soul gri test gözlemleri, Grok kotası bir Bulut listesi, Union Alpha ise başında ücretsiz deneme olarak pazarlanan bir koşum takımı. Özellikle Pareto 269'un fiyatı kulağa çok cazip geliyor ama işin bir kısmı ileri modellere yönlendiriliyorsa ödenen ücret ile gerçekte çalışan modelin maliyeti aynı şey değil; şeffaf yönlendirme günlüğü olmadan maliyet karşılaştırması yanıltır. Jev'in 20 ile 200 kat hız ve 40 ile 400 kat ucuzluk iddiası da şirketin kendi iş yüklerinde ölçülmüş; genelleme için bağımsız kıyas gerekir.

Benim pratik çıkarımım şu: Arena'da deneme yapmak, Bulut kotalarını izlemek ve Xiaomi'nin herkese açık RL günlüklerini okumak bu dönemde en öğretici üç pratik. Ancak karar anında tek bir videodaki en parlak örneğe yatırım yapmamak lazım. Eğer prototip yapıyorsanız Gemini hayaletini aynı istemle birkaç kez yoklayın, Soul için bellek ve biçimlendirme farkını kendi verinizde ölçün, Grok 4.7 için resmi sürümü bekleyin ve Union Alpha'yı model değil, orkestrasyon olarak bütçeleyin; Jev'i ise metin üretemediğini bilerek sadece karar katmanında pilotlayın.

Kaynaklar

11 bağlantı; 3 tanesi 19 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

gemini 4 pro · gpt-6 soul · grok 4.7 · union alpha · pareto 269 · dream rsi · mimo 2.6

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…