Wes Roth, 'Google is SO back…' başlığında Google'ın RSI'yi doğrudan sahada koşmak yerine 'rüyaya' yatırma fikrini anlatıyor: çoğu kişi RSI yapalım mı tartışırken Google, yapay zekayı bir simülasyona koyup hangi iyileşme yolunun en hızlı sonuç verdiğini binlerce kez rüyada deniyor. Videonun merkezindeki makale Dream-RSI, adı 'r' harfinden gelen 'simulation' vurgusuyla, tek bir kodlama ajanını değil, o ajanı hangi deneye yönlendireceğimize karar veren keşif politikasını iyileştirmeyi hedefliyor.
Keşif neden bir teknoloji ağacı gibi
Araştırma neden ağaç metaforuyla anlatılıyor sorusunun cevabı, video oyunlarındaki teknoloji ağacında gizli: Minecraft'ta tahta aletlerden taş aletlere, oradan elmasa geçmek gibi, bilimde de bir buluş diğerinin ön koşulu. Wes, insanlığın taş aletlerden cilalı aletlere, ardından wiki'lerden DVD'ye, Wi-Fi'dan GPU'ya, en sonunda 2025'te LM sohbet botu, muhakeme modeli ve yapay zeka kodlama ajanına uzanan zinciri bu ağacın canlı örneği olarak çiziyor; bazı dallar heyecan verip çıkmaza girerken bazı tesadüfi dallar büyük sıçrama yaratıyor.
Bu tarihsel sarkaç, 80'ler ve 90'larda sinir ağlarına 'çıkmaz' diyen çoğunluğa karşı Geoffrey Hinton'ın 'donanım yetmiyor' ısrarını ve Jensen Huang'ın GPU'suyla birleşince gelen patlamayı hatırlatıyor. Aynı tartışma büyük dil modellerinde de tekrarlandı: bir grup 'bu yol AGI'ye gitmez, kapatın' derken diğer grup 'çalışıyor gibi duruyor, ölçekleyelim' dedi ve ikinci grup haklı çıktı. Dream-RSI tam da bu karar anını sistemleştiriyor: mükemmel bir araştırmacı bile yanlış dalı seçerse bir haftayı boşa harcayabilir, önemli olan hangi deneye kaynak ayıracağımızı daha iyi seçmek.
Dream-RSI'nin cevabı: tarih zaten bir simülatör
Google ve işbirlikçilerinin önerisi kulağa basit ama aykırı: zaten koşulmuş tüm deneyler, hangi bulgunun hangisinden türediğiyle birlikte bir veri kümesi, dolayısıyla bir harita. Makale bunu üç sloganla özetliyor: 'History is the world to dream in', 'Dreaming is how it self-improves' ve 'Every lap adds a world'. Öğrenilmiş bir dünya modeli değil, yaklaşım değil; ajanın zaten inşa ettiği keşif ağacının kendisi, ulaşılan arama uzayının tam simülatörü ve çalışma sırasında bedavaya oluşmuş yan ürün.
Pratikte bu, geçmişi belirli bir noktaya geri sarıp ajanı o tarihsel ağaç üzerinde yürütmek demek. Wes'in aktardığı Demis Hassabis düşünce deneyi gibi: modeli 1900'lerin başına kadar veriyle eğitip ileriye doğru koşsan görelilik teorisini bulur mu, ya da aynı tarihi hızlandırılmış keşifle daha kısa yoldan geçebilir mi? Dream-RSI bu soruyu 'speedrun' fikrine bağlıyor: Binlerce aday politikayı tarihsel dünyada rüyada dene, sıfır yürütme ile puanla, sadece kazananı gerçek dünyada çalıştır. Video'daki Mario benzetmesi bunu netleştiriyor: bir milyar Mario aynı bölümü koşar, işe yarayan taktiğe yakınsar; burada da Mario'lar dallanmayı, paralelliği ve durdurma kararlarını öğreniyor.
Döngüyü kapatan mekanik: büyüyen dünya havuzu
Döngü üç adımda dönüyor. Önce çevrimiçi keşif: mevcut politika kodlama ajanını yönlendirir, keşif ağacını büyütür ve izleri kaydeder. Sonra simülatör inşası: o ağaç, dalları, yürütme sonuçları ve teşhis geri bildirimleriyle birlikte yeniden kullanılabilir bir replay havuzuna çevrilir. Son adım rüya tabanlı iyileştirme: politika geliştirme ajanı binlerce alternatif keşif politikasını bu havuzda yeniden oynatır, hızlı geri bildirimle en iyiyi seçer ve bir sonraki tur için sahaya geri gönderir. Her kazanan tur yeni bir ağaç, yani yeni bir dünya eklediği için havuz her döngüde genişler; birden fazla dünyada rüyası görülmüş politika, tek bir koşunun şansına ayarlanmış politikayı yener ve daha önce hiç gidilmemiş yerlere ulaşan dünyalar getirir. Bu yüzden makale 'dünyalar ajanla birlikte evrilir' diyor.
Bu evrimin cazibesi maliyet hesabında. Uzun ufuklu keşifte bir politikayı değerlendirmek, bütün bir keşif koşusunu sonuna kadar izlemek demek; geri bildirim gecikmeli ve pahalı, meta politika uzayı ise devasa ve çoğunlukla kötü adaylarla dolu. Sabit, el yazımı bir keşif stratejisi biriken deneyimden öğrenemediği için zaten başarısız olmuş yönlere ödeme yapmaya devam ediyor. Dream-RSI bu duvarı, geçmişi okuma biçimiyle aşıyor: daha önce statik metin bağlamı ya da ince ayar verisi olarak okunan tarih, ağaç olarak okunduğunda simülatöre dönüşüyor ve alternatif bir strateji aynı düğümler üzerinde farklı sırada, farklı paralellikte ve farklı durdurma noktasıyla yeniden oynatılabiliyor; sonuçlar zaten kayıtlı olduğu için değerlendirme anında dönüyor ve sıfır yürütme harcıyor.
Sayılara yansıyan kazanç ve adaptif davranış
Peki işe yarıyor mu? dream-rsi.com'daki öne çıkan sonuçlara göre sekiz görevde üç alan (algoritma mühendisliği, matematiksel optimizasyon, GPU çekirdek mühendisliği) test edildi; kontrollü taban çizgi aynı ajan, aynı değerlendirici, aynı bütçeyle ama keşif politikası hiç değişmeyen 'Recursive Fixed Exploration'. Lasso düzenlileştirme yolunda Dream-RSI, SimpleTES'e göre 162 kat daha az keşif ajanı çağrısıyla, VGG16'da benzer başarım için 2,43 kat daha az nesil ve ConvDiv'de benzer bütçede 2,09 kat daha yüksek skor gibi kazanımlar raporluyor. Detay tabloda Gemini-3.7-Flash ile Dream-RSI ortalama beklenen çalışma süresinde 2.350,6 ms ile sabit politikanın 2.516,7 ms'sini ve gpt-oss-120b ile SimpleTES'in 3.804,8 ms'sini geride bırakırken kümülatif çağrıyı 1.879'da tutuyor; Gemini-3.1-Pro için de benzer eğilim var.
Wes'in grafikte vurguladığı iki davranış da ilgi çekici: sistem adaptif; ilerleme kolayken daha az hesaplama harcıyor, iş zorlaştıkça çabayı artırıyor. Daha da çarpıcı olan, ajana geçmişten rehberlik vermeye çalışmanın işleri kötüleştirmesi. Açık uçlu keşif, yönlendirmeli varyantlardan daha iyi sonuç veriyor; bu, 'geçmişi kopyala' değil 'geçmişin haritası üzerinde farklı rotaları karşılaştır' fikrini destekliyor. Bu noktada video önemli bir not düşüyor: AlphaEvolve bazı matematiksel optimizasyonlarda Dream-RSI'ı geride bırakıyor, ama iki sistem farklı işlere odaklı; biri matematiksel keşifte güçlü, diğeri keşfi nasıl keşfedeceğimizi öğreniyor. Kıyas tam da bu yüzden tablo değeri taşıyor.
Videonun finalinde bu parçalar birleşiyor. Google'ın AlphaEvolve ile Borg veri merkezi planlamasında bulduğu verimlilik kazanımı — Wes'in 'milyonlarca dolar tasarruf' diye aktardığı, teoride kalmayan optimizasyon — aynı RSI vizyonunun diğer ayağı: bir sistem deneyleri yapar, diğeri hangi deneyin ne zaman koşacağını planlar, zamanla birlikte bir sonraki model neslini iyileştirir. Dream-RSI bu mimaride planlayıcıyı rüya ile eğiten katman; hafif orkestrasyon tabakası keşfi explicit ve programlanabilir kılarken alttaki kodlama ajanını hiç değiştirmiyor. Bu yüzden Wes bunu 'hemen heyecan veren yeni model' değil, 'modelleri iyileştirmeye devam etmemizi sağlayacak temel katman' olarak selamlıyor; transformer'ı icat eden kurumun bir sonraki kaldıracı, tarihi bedava simülatöre çevirmek olabilir.
Videodaki anahtar anlar
- Açılış — Google neden RSI'yi rüyada deniyor
Tarih, rüya görmek için dünyadır
- Teknoloji ağacı — Minecraft'tan insanlık tarihine
- Dream-RSI fikri — birikmiş tarih ücretsiz veridir
Birikmiş geçmiş zaten bir simülatördür
- Rüya mekaniği — binlerce aday sıfır maliyetle
Kazanan dışındaki her rüya bedavadır
- Her tur yeni bir dünya ekler — havuz büyür
- Sonuçlar — adaptif hesap ve en düşük skor kazanır
AI yorumu
"Bence Dream-RSI'nin zarif tarafı 'daha büyük model' yarışı değil, 'daha akıllı arama' yarışı olması; tarih zaten elimizdeyken onu simülatör gibi okumak, RSI'yi pahalı deneme-yanılmadan ucuz zihinsel provaya taşıyor."
AI değerlendirmesi
En güçlü itirazı ciddiye alırsam: Dream-RSI'nin 'exact simulator' iddiası kapsama bağlı. Replay dünyası sadece tarihin gerçekten gittiği uzayda kesin; hiç ziyaret edilmemiş dallarda hiçbir şey söyleyemez. Eğer erken turlardaki keşifler dar veya yanlıysa, rüyada çok iyi görünen politika sahada yeni bölgeye çıkınca şaşırabilir. MIT Technology Review'un RSI üzerine Ağustos 2026 derlemesinde de vurgulandığı gibi, özyinelemeli iyileşmenin hızını sınırlayan şey çoğu zaman yeni fikir değil, değerlendirmenin maliyeti ve güvenilirliği — simülatör bu maliyeti sıfıra indiriyor ama yeniliği garanti etmiyor.
Metodoloji tarafında açık bir sınır var: değerlendirme kısa ve orta ufukta güçlü (Lasso, ConvDiv, VGG16 gibi tanımlı görevler) ama çok uzun ve açık uçlu keşifte aynı ekonominin sürüp sürmeyeceği belirsiz. Makaledeki ortalama tutma süresi tabloları alt akış başarımını ölçüyor, ancak gerçek dünyada downstream metrik tek başına yeterli değil; güvenlik, tekrar üretilebilirlik ve bakım maliyeti de aynı anda optimize edilmeli. TechCrunch'ın 'RSI yeni AGI' başlıklı Mayıs 2026 notu, RSI tanımının kendisi kadar ölçümünün de muğlak olduğunu hatırlatıyor — hangi skorun 'iyileşme' sayılacağı oyunun kurallarını değiştiriyor.
Çıkar ve doğrulanabilirlik açısından tabloyu ayırmak lazım. Birincil kanıt Google ve DeepMind yazarlı teknik rapor ve onun sitesi; bağımsız tekrar henüz sınırlı, GitHub deposu yeni açıldı. '162 kat daha az çağrı' gibi çarpıcı oranlar, aynı ajan ve değerlendiriciyle kontrollü karşılaştırmaya dayanıyor; farklı değerlendirici veya farklı bütçe varsayımında oran değişebilir. Karar anında bağımsız kontrol isteyeceğim iki sayı Lasso ortalama süresi ve VGG16 nesil sayısı — ikisi de arXiv HTML'deki tablolar ve dream-rsi.com üzerindeki Figür 3(b) ile çapraz doğrulanabiliyor, ama üretim ortamı Borg gibi kapalı bir sistemde aynı tasarrufun tekrarlayacağını varsaymamak gerekir.
Pratik çıkarımım şu: Dream-RSI, keşif bütçesi kısıtlı ve geçmiş izleri zengin ekipler için hemen denenebilir bir kaldıraç; özellikle algoritma ve çekirdek optimizasyonunda aynı ajanla daha az çağrıda benzer veya daha iyi sonuç almak, ürün takvimini doğrudan kısaltıyor. Buna karşın geçmişi fakir, sıfırdan başlayan veya keşif uzayı henüz haritalanmamış projelerde rüya havuzu sığ kalır; orada önce kasıtlı çeşitlendirmeyle harita çizmek, sonra rüyaya geçmek daha sağlıklı. Ben bu çerçeveyi 'önce harita, sonra rüya' diye özetliyorum — tarih simülatöre dönüşene kadar sabır, dönüştükten sonra cesur rüyalar.
Kaynaklar
8 bağlantı; 1 tanesi 2 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — Dream-RSI videosu (Wes Roth)
- @arxiv.org https://arxiv.org/abs/2609.14858
Aynı kaynağı kullanan: Arena'da kostüm giyen Gemini: 3.8 Flash etiketi altında sızan Gemini 4 izleri · Google Rüya Görerek mi Kendini Geliştirdi? Dream RSI ve Zeka Patlaması Tartışması
- @dream-rsi.com https://www.dream-rsi.com/
- @arxiv.org https://arxiv.org/html/2609.14858v1
- @technologyreview.com https://www.technologyreview.com/2026/08/18/1142188/ai-recursive-self-improvement/
- @techcrunch.com https://techcrunch.com/2026/05/28/rsi-is-the-new-agi-and-its-just-as-hard-to-pin-down/
- @deepmind.google https://deepmind.google/blog/alphaevolve-impact/
- @github.com https://github.com/zhengkid/Dream-RSI
dream-rsi · recursive self-improvement · google deepmind · keşif politikası · simülatör · alphaevolve · gemini