Gündeme dön

Google Rüya Görerek mi Kendini Geliştirdi? Dream RSI ve Zeka Patlaması Tartışması

Fireship'in 17 Eylül dosyası, Google DeepMind ve Maryland'in Dream RSI makalesini ByteDance öncülüğündeki beş aşamalı RSI yol haritasıyla birlikte masaya yatırdı; özü şu: geçmiş keşif kayıtlarını bedava bir simülatöre çevirip binlerce keşif stratejisini rüyada test eden bir ajan, sekiz görevde arama maliyetini dramatik biçimde düşürdü.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — LoLYw--s-5w
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

1965'te Bletchley Park'ta Turing ile çalışan kriptolog I. J. Good , yeterince zeki bir makinenin kendi ardıllarını tasarlayabildiği noktada zeka patlaması (intelligence explosion) başlayacağını ve insanın geride kalacağını yazmıştı. Bu fikir, bugün RSI (özyinelemeli kendini geliştirme — sistemin kendi iyileştirme becerisini de iyileştirmesi) diye anılıyor ve iki ayrı okunuşu var: kolay RSI 'da model Ar-Ge'yi otomatikleştirip insan araştırmacının yerini alır, zor RSI 'da ise model kendi ağırlığını veya mimarisini doğrudan daha verimli hale getirir. Lilian Weng'in 4 Temmuz tarihli Harness Engineering taraması tam bu ayrımı netleştiriyor; yaklaşık 35 makaleyi inceleyip asıl kaldıracın model değil harness (iskoç — modeli saran değerlendirme, seçme ve orkestrasyon altyapısı) olduğunu söylüyor. Tıpkı iyi bir atölyede tezgâhın ustadan daha uzun yaşaması gibi, harness son bir yılda matematiğin manşetlerini taşıdı.

Pekin'in Beş Aşamalı Yol Haritası: Son İnsan Yapımı AI

Geçen hafta ByteDance, Tsinghua ve Şanghay Yapay Zeka Laboratuvarı başta olmak üzere 33 araştırmacının imzaladığı The Last AI Built by Humans başlıklı makale, RSI'ı beş basamakta kademelendiriyor. 1) AI yalnızca insanın yazdığı iyileştirme prosedürünü uygular, 2) nasıl iyileşeceğini kendisi seçer, 3) hangi yeni bilgiyi veya deneyimi toplaması gerektiğine karar verir, 4) dağıtım sonrası değişime uyum sağlar, 5) en sonunda iyileştirme yönteminin kendisini kalıcı biçimde yeniden yazar. Yazarlar ısrarla şunu vurguluyor: tek seferlik bir yanıtı düzeltmek RSI değildir; iyileşme bir sonraki sisteme miras kalmalıdır. Rekabetçi kaldıraç da burada: döngünün emek-yoğun kısmını otomatikleştiren, model geliştirme süresini ve maliyetini kısaltır. Bu, ABD-Çin yarışında kıt donanımda daha fazla verim sıkıştırma olarak okunuyor.

Keşif Döngüsünün Gerçek Motoru: Alpha Evolve

2026 yazında Jacobian sanısı , Navier-Stokes ilerlemesi ve Riemann hipotezi etrafındaki manşetlerin ortak bir deseni var: hiçbirinde model tek başına sahneye çıkmadı. Google DeepMind'ın Alpha Evolve'u (Mayıs 2025) bu deseni kurumsallaştırdı — Gemini Flash geniş fikir taraması, Gemini Pro derin öneri sunarken, otomatik değerlendiriciler (evaluator) her programı puanlayıp bir program veritabanında evrimsel seçilime sokar. Mantık 3 adımda: 1) öner — ajan kod üretir, 2) ölç — değerlendirici puan ve çökme bilgisini kaydeder, 3) seç ve yeniden besle — en umut verici programlar bir sonraki isteme (prompt) eklenir. Sonuçlar laboratuvar dışına da taştı: veri merkezi verimliliği, çip tasarımı ve hatta LLM eğitim sürecinin kendisi bu döngüyle iyileştirildi. Yani sürpriz modelde değil, döngüyü yöneten iskoçta.

Kimsenin Konuşmadığı Darboğaz: Keşif Politikası

Her döngünün içinde gizli bir karar verici var: keşif politikası (exploration policy — bir sonraki denemede nereye dallanacağına, neyi paralel koşacağına, neyi erken keseceğine karar veren kural seti) . Video bunu at eşleştirme örneğiyle anlatıyor — bir deneme atları biraz daha iyi eşleştiriyorsa ısrar mı etmeli, sıfırdan mı başlamalı? Çökme fikirden mi kodlamadan mı kaynaklandı? Geçen haftaya kadar bu politika kurucunun elle yazdığı koda gömülüydü; sabit bir strateji biriken deneyimden öğrenmiyordu. Tıpkı bir labirentte aynı yan duvara tekrar tekrar vurmak gibi, sabit politika başarısız yönleri yeniden ve yeniden ücretlendiriyordu. İki duvar aynı anda yükseliyordu: politikanın geri bildirimi gecikmeli ve pahalıydı — kalitesini anlamak için tüm keşfi baştan sona izlemek gerekiyordu — ve politika uzayı devasa olduğundan denenecek adayların çoğu, tam bir koşu maliyetine mal olan kötü adaylardı.

Dream RSI Üç Adımda Nasıl Rüya Görür

Google, DeepMind, Maryland ve Virginia'dan 17 araştırmacının 14 Eylül'de arXiv:2609.14858 olarak yayımladığı Dream-RSI: Recursive Self-Improvement through Evolving Worlds tam bu darboğaza nişan alıyor ve ağırlıklara dokunmuyor. Mekanizma orkestrasyon katmanında çalışır ve 3 adımda tekrarlar: 1) Çevrimiçi keşif — dondurulmuş kodlama ajanı (makalede Gemini 3.1 Pro / 3.7 Flash ) gerçek problemi çözerken her düğüm bir ağaçta (discovery tree) saklanır; her düğümde kod, puan ve çökme bayrağı vardır. 2) Tekrar oynatma benzetimcisi (replay simulator — geçmiş ağacı deterministik bir dünya gibi kullanan hafif simülatör) — bitmiş bir koşu artık metin değil, yürütme sonucunu taşıyan yapılandırılmış bir ağaçtır; yeni bir politika hiçbir şeyi yeniden çalıştırmadan aynı ağacı farklı sırada gezip tarihteki gerçek sonucu okur. Bu simülatör öğrenilmiş bir dünya modeli değil, kesin (exact) bir kayıttır — gittiği yerde tahmin yoktur. 3) Rüyada strateji iyileştirme — sabit bir strateji geliştirici ajan onlarca aday politika üretir, her biri tüm geçmiş ağaçlarda sıfır maliyetle tekrar oynatılır; puan formülü çözüm kalitesi artı, açıklanan düğüm sayısı (maliyet) eksi, paralellik ödülü artı şeklinde çalışır ve en yüksek rüya puanını alan politika bir sonraki gerçek koşuya dağıtılır. Her dağıtım yeni bir ağaç üretir, havuz büyür; tek bir ağacın şansına ayarlanmış politika yerine havuz genelinde iyi olan kazanır.

Neden bu ucuz? Çünkü fatura zaten ödenmiş. Politikanın tek işi geçmişi farklı sırada okumak olduğunda, binlerce aday binlerce tam koşu yerine diskteki kayıtları yürümek kadar ucuza gelir. Makalenin kartvizit cümlesi de bunu söyler: ekip çevrimiçi keşifle tarih toplar, tarihten simülatör kurar, rüyada stratejiyi geliştirir ve yine sahaya sürer. Tıpkı satrançta oynanmış bir oyunun hamle ağacını ezberleyip zihinde binlerce varyantı risksiz denemek gibi — tahtaya dokunmadan en iyi açılışı bulursun. Sınırlama da aynı yerden gelir: simülatör yalnızca tarihin gittiği yerde kesindir; hiç ziyaret edilmemiş bir dal rüyada görülemez, bu yüzden döngünün her turda yeni tarih üretmesi şarttır.

Sekiz Görevde Ne Değişti: Lasso ve 162 Kat Az Arama

Ekip, algoritma tasarımı ve matematikten sekiz probleme aynı kurulumu iki kez uyguladı: biri sabit politikayla, biri rüyadan çıkmış politikayla. Manşet sonuç lasso çözücüsü (seyrek regresyon — yüzlerce değişken arasından en sade ve hatasız modeli seçen algoritma, tıpkı kalabalık bir pazarda en az malzemeyle en iyi yemeği çıkarmak gibi) oldu — standart Python makine öğrenmesi kitaplığını geride bırakan bir çözücü, rüya gören politikayla yaklaşık 300 denemede bulunurken sabit politika 550 , önceki en iyi yöntem yaklaşık 51 bin deneme gerektirmişti. Makale ve bağımsız özetler bunu 162 kata kadar daha az arama çağrısı olarak raporluyor. Detaylarda ilginç bir not var: istek metni ajandan geçmiş denemelerin tamamını kod yazmadan önce okumasını , aynı fikri küçük oynamalarla ısıtmamasını ve süreçleri öldürmemesini özellikle rica ediyor — küçük bir istem değişimi, büyük bir strateji farkı yaratıyor. Örneğin , 500 özellikli bir veri setinde her deneme yeni bir katsayı budama kodu önerir; rüya gören politika, geçmişte 200 kez çöken budama ailesini rüyada eleyip hiç sahaya sürmeden atlar, sabit politika ise aynı ailede 40 deneme daha harcar.

Görsel: nodesdaily AI

AI yorumu

"Bana göre asıl haber modelin kendisinin büyümesi değil, arama işini yöneten katmanın rüyada olgunlaşması; ağırlıklar sabitken stratejinin öğrenmesi, zekâ patlaması retoriğini soğutup mühendislik hesabına çekiyor."

AI değerlendirmesi

Video'nun en güçlü sentezi şunu doğru kuruyor: ağırlıklar sabitken politikanın rüya görmesi, Good tarzı zekâ patlaması değil ama yine de mühendislikte ölçülebilir bir kaldıraç. En iyi haliyle bu, lisansüstü bir araştırmacının sabah stratejisini geceki loga göre yenilemesi gibi — model aynı zekâda kalır, fakat arama israfı azalır. Bu steelman, Dream RSI'ı abartıdan ayırıp harness katmanında kalıcı iyileşme olarak konumlar.

Sınırlar net. Simülatör yalnızca ziyaret edilmiş dallarda kesindir ; hiç denenmemiş parlak bir fikir rüyada görülemez. Ayrıca değerlendirme hâlâ elle yazılmış puanlayıcılara (scorer) bağımlı — lasso'da sklearn'i geçmek anlamlı olsa da, puanlayıcı dar tanımlıysa politika puanlayıcıyı oyunlaştırır (gaming) ve gerçek genellenebilirliği kaçırır. Son olarak, o3 benzeri akıl yürütme modelleri gibi değerlendiricinin kendisi model tabanlıysa maliyet hesabı değişir; simülatör bedava olsa bile nihai doğrulama yine pahalı kalır.

Çıkar ve doğrulanabilirlik tarafında iki kaynak ayrışıyor. Fireship anlatısı Dream RSI'ı tek videoda özetlerken, arXiv:2609.14858 ve ByteDance'ın beş aşamalı haritası aynı haftada farklı RSI tanımlarını yan yana koyuyor — biri orkestrasyonu, diğeri otonomi merdivenini ölçüyor. Bağımsız tekrar için üç kontrol şart: a) sekiz görevde 162 kat iddiasının kod ve puanlayıcıları açık mı, b) aynı rüya puan formülü farklı alanlarda (ör. kombinatorik vs sürekli optimizasyon) tutarlı mı, c) strateji havuz-genelinde mi yoksa tek ağacın şansına mı ayarlı? Bunlar olmadan patlama retoriği erken.

Pratik çıkarım ayrışıyor. Matematik ve algoritma ekipleri için Dream RSI, donmuş bir kodlama ajanıyla bile gecelik logu sabaha stratejiye çevirdiği için hemen uygulanabilir — özellikle değerlendiricisi ucuz ve deterministik problemlerde. Ürün ekipleri ve genel amaçlı ajanlar için ise tablo farklı: değerlendiricisi pahalı, açık uçlu veya insan geri bildirimli görevlerde rüya havuzu hızla sığlaşır ve insan-in-the-loop (insanın döngüde kalması) hâlâ maliyetin belirleyicisi olur. Yani kimin için uygun sorusunun cevabı, puanlayıcının ne kadar ucuz ve güvenilir olduğunda gizli.

Kaynaklar

7 bağlantı; 2 tanesi 3 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

dream rsi · rsi · alpha evolve · google deepmind · bytedance

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…