1965'te Bletchley Park'ta Turing ile çalışan kriptolog I. J. Good , yeterince zeki bir makinenin kendi ardıllarını tasarlayabildiği noktada zeka patlaması (intelligence explosion) başlayacağını ve insanın geride kalacağını yazmıştı. Bu fikir, bugün RSI (özyinelemeli kendini geliştirme — sistemin kendi iyileştirme becerisini de iyileştirmesi) diye anılıyor ve iki ayrı okunuşu var: kolay RSI 'da model Ar-Ge'yi otomatikleştirip insan araştırmacının yerini alır, zor RSI 'da ise model kendi ağırlığını veya mimarisini doğrudan daha verimli hale getirir. Lilian Weng'in 4 Temmuz tarihli Harness Engineering taraması tam bu ayrımı netleştiriyor; yaklaşık 35 makaleyi inceleyip asıl kaldıracın model değil harness (iskoç — modeli saran değerlendirme, seçme ve orkestrasyon altyapısı) olduğunu söylüyor. Tıpkı iyi bir atölyede tezgâhın ustadan daha uzun yaşaması gibi, harness son bir yılda matematiğin manşetlerini taşıdı.
Pekin'in Beş Aşamalı Yol Haritası: Son İnsan Yapımı AI
Geçen hafta ByteDance, Tsinghua ve Şanghay Yapay Zeka Laboratuvarı başta olmak üzere 33 araştırmacının imzaladığı The Last AI Built by Humans başlıklı makale, RSI'ı beş basamakta kademelendiriyor. 1) AI yalnızca insanın yazdığı iyileştirme prosedürünü uygular, 2) nasıl iyileşeceğini kendisi seçer, 3) hangi yeni bilgiyi veya deneyimi toplaması gerektiğine karar verir, 4) dağıtım sonrası değişime uyum sağlar, 5) en sonunda iyileştirme yönteminin kendisini kalıcı biçimde yeniden yazar. Yazarlar ısrarla şunu vurguluyor: tek seferlik bir yanıtı düzeltmek RSI değildir; iyileşme bir sonraki sisteme miras kalmalıdır. Rekabetçi kaldıraç da burada: döngünün emek-yoğun kısmını otomatikleştiren, model geliştirme süresini ve maliyetini kısaltır. Bu, ABD-Çin yarışında kıt donanımda daha fazla verim sıkıştırma olarak okunuyor.
Keşif Döngüsünün Gerçek Motoru: Alpha Evolve
2026 yazında Jacobian sanısı , Navier-Stokes ilerlemesi ve Riemann hipotezi etrafındaki manşetlerin ortak bir deseni var: hiçbirinde model tek başına sahneye çıkmadı. Google DeepMind'ın Alpha Evolve'u (Mayıs 2025) bu deseni kurumsallaştırdı — Gemini Flash geniş fikir taraması, Gemini Pro derin öneri sunarken, otomatik değerlendiriciler (evaluator) her programı puanlayıp bir program veritabanında evrimsel seçilime sokar. Mantık 3 adımda: 1) öner — ajan kod üretir, 2) ölç — değerlendirici puan ve çökme bilgisini kaydeder, 3) seç ve yeniden besle — en umut verici programlar bir sonraki isteme (prompt) eklenir. Sonuçlar laboratuvar dışına da taştı: veri merkezi verimliliği, çip tasarımı ve hatta LLM eğitim sürecinin kendisi bu döngüyle iyileştirildi. Yani sürpriz modelde değil, döngüyü yöneten iskoçta.
Kimsenin Konuşmadığı Darboğaz: Keşif Politikası
Her döngünün içinde gizli bir karar verici var: keşif politikası (exploration policy — bir sonraki denemede nereye dallanacağına, neyi paralel koşacağına, neyi erken keseceğine karar veren kural seti) . Video bunu at eşleştirme örneğiyle anlatıyor — bir deneme atları biraz daha iyi eşleştiriyorsa ısrar mı etmeli, sıfırdan mı başlamalı? Çökme fikirden mi kodlamadan mı kaynaklandı? Geçen haftaya kadar bu politika kurucunun elle yazdığı koda gömülüydü; sabit bir strateji biriken deneyimden öğrenmiyordu. Tıpkı bir labirentte aynı yan duvara tekrar tekrar vurmak gibi, sabit politika başarısız yönleri yeniden ve yeniden ücretlendiriyordu. İki duvar aynı anda yükseliyordu: politikanın geri bildirimi gecikmeli ve pahalıydı — kalitesini anlamak için tüm keşfi baştan sona izlemek gerekiyordu — ve politika uzayı devasa olduğundan denenecek adayların çoğu, tam bir koşu maliyetine mal olan kötü adaylardı.
Dream RSI Üç Adımda Nasıl Rüya Görür
Google, DeepMind, Maryland ve Virginia'dan 17 araştırmacının 14 Eylül'de arXiv:2609.14858 olarak yayımladığı Dream-RSI: Recursive Self-Improvement through Evolving Worlds tam bu darboğaza nişan alıyor ve ağırlıklara dokunmuyor. Mekanizma orkestrasyon katmanında çalışır ve 3 adımda tekrarlar: 1) Çevrimiçi keşif — dondurulmuş kodlama ajanı (makalede Gemini 3.1 Pro / 3.7 Flash ) gerçek problemi çözerken her düğüm bir ağaçta (discovery tree) saklanır; her düğümde kod, puan ve çökme bayrağı vardır. 2) Tekrar oynatma benzetimcisi (replay simulator — geçmiş ağacı deterministik bir dünya gibi kullanan hafif simülatör) — bitmiş bir koşu artık metin değil, yürütme sonucunu taşıyan yapılandırılmış bir ağaçtır; yeni bir politika hiçbir şeyi yeniden çalıştırmadan aynı ağacı farklı sırada gezip tarihteki gerçek sonucu okur. Bu simülatör öğrenilmiş bir dünya modeli değil, kesin (exact) bir kayıttır — gittiği yerde tahmin yoktur. 3) Rüyada strateji iyileştirme — sabit bir strateji geliştirici ajan onlarca aday politika üretir, her biri tüm geçmiş ağaçlarda sıfır maliyetle tekrar oynatılır; puan formülü çözüm kalitesi artı, açıklanan düğüm sayısı (maliyet) eksi, paralellik ödülü artı şeklinde çalışır ve en yüksek rüya puanını alan politika bir sonraki gerçek koşuya dağıtılır. Her dağıtım yeni bir ağaç üretir, havuz büyür; tek bir ağacın şansına ayarlanmış politika yerine havuz genelinde iyi olan kazanır.
Neden bu ucuz? Çünkü fatura zaten ödenmiş. Politikanın tek işi geçmişi farklı sırada okumak olduğunda, binlerce aday binlerce tam koşu yerine diskteki kayıtları yürümek kadar ucuza gelir. Makalenin kartvizit cümlesi de bunu söyler: ekip çevrimiçi keşifle tarih toplar, tarihten simülatör kurar, rüyada stratejiyi geliştirir ve yine sahaya sürer. Tıpkı satrançta oynanmış bir oyunun hamle ağacını ezberleyip zihinde binlerce varyantı risksiz denemek gibi — tahtaya dokunmadan en iyi açılışı bulursun. Sınırlama da aynı yerden gelir: simülatör yalnızca tarihin gittiği yerde kesindir; hiç ziyaret edilmemiş bir dal rüyada görülemez, bu yüzden döngünün her turda yeni tarih üretmesi şarttır.
Sekiz Görevde Ne Değişti: Lasso ve 162 Kat Az Arama
Ekip, algoritma tasarımı ve matematikten sekiz probleme aynı kurulumu iki kez uyguladı: biri sabit politikayla, biri rüyadan çıkmış politikayla. Manşet sonuç lasso çözücüsü (seyrek regresyon — yüzlerce değişken arasından en sade ve hatasız modeli seçen algoritma, tıpkı kalabalık bir pazarda en az malzemeyle en iyi yemeği çıkarmak gibi) oldu — standart Python makine öğrenmesi kitaplığını geride bırakan bir çözücü, rüya gören politikayla yaklaşık 300 denemede bulunurken sabit politika 550 , önceki en iyi yöntem yaklaşık 51 bin deneme gerektirmişti. Makale ve bağımsız özetler bunu 162 kata kadar daha az arama çağrısı olarak raporluyor. Detaylarda ilginç bir not var: istek metni ajandan geçmiş denemelerin tamamını kod yazmadan önce okumasını , aynı fikri küçük oynamalarla ısıtmamasını ve süreçleri öldürmemesini özellikle rica ediyor — küçük bir istem değişimi, büyük bir strateji farkı yaratıyor. Örneğin , 500 özellikli bir veri setinde her deneme yeni bir katsayı budama kodu önerir; rüya gören politika, geçmişte 200 kez çöken budama ailesini rüyada eleyip hiç sahaya sürmeden atlar, sabit politika ise aynı ailede 40 deneme daha harcar.
AI yorumu
"Bana göre asıl haber modelin kendisinin büyümesi değil, arama işini yöneten katmanın rüyada olgunlaşması; ağırlıklar sabitken stratejinin öğrenmesi, zekâ patlaması retoriğini soğutup mühendislik hesabına çekiyor."
AI değerlendirmesi
Video'nun en güçlü sentezi şunu doğru kuruyor: ağırlıklar sabitken politikanın rüya görmesi, Good tarzı zekâ patlaması değil ama yine de mühendislikte ölçülebilir bir kaldıraç. En iyi haliyle bu, lisansüstü bir araştırmacının sabah stratejisini geceki loga göre yenilemesi gibi — model aynı zekâda kalır, fakat arama israfı azalır. Bu steelman, Dream RSI'ı abartıdan ayırıp harness katmanında kalıcı iyileşme olarak konumlar.
Sınırlar net. Simülatör yalnızca ziyaret edilmiş dallarda kesindir ; hiç denenmemiş parlak bir fikir rüyada görülemez. Ayrıca değerlendirme hâlâ elle yazılmış puanlayıcılara (scorer) bağımlı — lasso'da sklearn'i geçmek anlamlı olsa da, puanlayıcı dar tanımlıysa politika puanlayıcıyı oyunlaştırır (gaming) ve gerçek genellenebilirliği kaçırır. Son olarak, o3 benzeri akıl yürütme modelleri gibi değerlendiricinin kendisi model tabanlıysa maliyet hesabı değişir; simülatör bedava olsa bile nihai doğrulama yine pahalı kalır.
Çıkar ve doğrulanabilirlik tarafında iki kaynak ayrışıyor. Fireship anlatısı Dream RSI'ı tek videoda özetlerken, arXiv:2609.14858 ve ByteDance'ın beş aşamalı haritası aynı haftada farklı RSI tanımlarını yan yana koyuyor — biri orkestrasyonu, diğeri otonomi merdivenini ölçüyor. Bağımsız tekrar için üç kontrol şart: a) sekiz görevde 162 kat iddiasının kod ve puanlayıcıları açık mı, b) aynı rüya puan formülü farklı alanlarda (ör. kombinatorik vs sürekli optimizasyon) tutarlı mı, c) strateji havuz-genelinde mi yoksa tek ağacın şansına mı ayarlı? Bunlar olmadan patlama retoriği erken.
Pratik çıkarım ayrışıyor. Matematik ve algoritma ekipleri için Dream RSI, donmuş bir kodlama ajanıyla bile gecelik logu sabaha stratejiye çevirdiği için hemen uygulanabilir — özellikle değerlendiricisi ucuz ve deterministik problemlerde. Ürün ekipleri ve genel amaçlı ajanlar için ise tablo farklı: değerlendiricisi pahalı, açık uçlu veya insan geri bildirimli görevlerde rüya havuzu hızla sığlaşır ve insan-in-the-loop (insanın döngüde kalması) hâlâ maliyetin belirleyicisi olur. Yani kimin için uygun sorusunun cevabı, puanlayıcının ne kadar ucuz ve güvenilir olduğunda gizli.
Kaynaklar
7 bağlantı; 2 tanesi 3 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — Fireship: Did Google just kickstart the intelligence explosion?
- @arxiv.org https://arxiv.org/abs/2609.14858
Aynı kaynağı kullanan: Arena'da kostüm giyen Gemini: 3.8 Flash etiketi altında sızan Gemini 4 izleri · Google'ın Rüya RSI'sı: Tarihi Simülatöre Dönüştürüp Kendini Sürekli İyileştiren Yapay Zeka
- @aimodeling.com https://www.aimodeling.com/en/news/slug/dream-rsi-replay-simulator
Aynı kaynağı kullanan: Gemini 4 Pro Sızdı, GPT-6 Soul Testte: Arena'dan Google Buluta Haftanın AI Sarsıntısı
- @shattered.io https://shattered.io/dream-rsi-recursive-self-improvement-2026/
- @deepmind.google https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/
- @thestar.com.my https://www.thestar.com.my/aseanplus/aseanplus-news/2026/09/16/chinese-researchers-chart-5-stage-path-toward-last-ai-built-by-humans
- @channelnewsasia.com https://www.channelnewsasia.com/east-asia/chinese-researchers-map-out-five-stage-plan-ai-improve-without-human-intervention-6393996
dream rsi · rsi · alpha evolve · google deepmind · bytedance