On yılı aşkın süredir yapay zekâyla aramızda görünmez bir cam vardı: yazıyor, görüyor, çözüyor ama dokunamıyordu. Google şimdi bu camı kırmaya çalışıyor. Gemini Robotics 2 adlı sistem, talimatları harekete çeviren cisimleşmiş zekâ yı hedefliyor; dünyayı uzaktan anlatan değil, içinde davranan bir zekâ.
Sabah kahvenizi alışınızı düşünün: eliniz kulpa uzanır, parmaklar kapanır, kavrama ağırlığa göre kendini ayarlar. Mesafe hesabı yapmaz, seramiğin dayanacağı kuvveti tartmazsınız; beyniniz yılların deneyimiyle bu hesabı bilinçaltında görür. Robottan aynı işi istediğinizde ise tablo değişir: bardağı bulmak, kulpu seçmek, açıyı tutturmak, kuvveti ayarlamak, ağırlığı telafi etmek ve taşıma boyunca dengeyi korumak gerekir. Her adım, bir önceki denemede farklı olabilecek bilgiye bağlıdır; masa eğri olabilir, bardak dolu çıkabilir, araya biri girebilir. Dil modeli bardak üzerine akıl yürütebilir ama robotun bu aklı kuvvete, harekete, dengeye ve temasa dönüştürmesi şarttır.
Fabrika robotu bu dertlerin çoğundan muaftır çünkü ortam makineye göre düzenlenmiştir; aynı hareketi aynı noktada binlerce kez tekrarlar. İnsansı robot ise insan için inşa edilmiş bir dünyada çalışır: kapı kolları insan boyunda, raflar insan erişimine göre, merdivenler iki bacağa göre tasarlanmıştır. Konuşmacının tezi burada netleşiyor: tek işlik uzmanlardan ziyade, birçok farklı görevi üstlenen genelci robot modeli daha fazla değer yaratacak; koşan, zıplayan gösteri makineleri bu yarışın vitrini, asıl sınavı değil.
Üç katmanlı zekâ yığını
DeepMind cephesinde mimari üç parçadan kuruluyor. Merkezde eylem modeli yer alıyor: kamera görüntüsüyle dil talimatını alıp harekete dönüştürüyor. Üstte ER2 adlı akıl yürütme katmanı ortamı yorumluyor, işi adımlara bölüyor, ilerlemeyi izliyor ve gerçeklik plana uymadığında rotayı güncelliyor. En altta ise doğrudan makine üzerinde koşan sürüm var; uzak sunucuya gidip gelmenin gecikmesini ortadan kaldırıyor. DeepMind ürün sayfasının doğruladığı üzere bu yerleşik model, yeni bir gövdeye birkaç saat içinde ve 200'den az örnekle uyum sağlayabiliyor. Birlikte bakıldığında ortaya bir yığın çıkıyor: ortamı kavrama, karar verme, kararı harekete çevirme ve bunu yerinde icra etme.
Bu yığının aklı en iyi garaj toplama sahnesinde görünüyor. Kullanıcı dağınık garajı toplamayı ve aletleri kutusuna koymayı istiyor; sistem ovma eldiveniyle sprey şişesini birlikte alıp üst raftaki en sağ şeffaf kutuya taşıyor. Üst düzey model ne yapılacağını, nereye gidileceğini ve en kritik soruyu çözüyor: işin ne zaman bittiğini. DeepMind belgelerinde geçen başarı takibi yeteneği, robotun yeniden denemesi mi yoksa durması mı gerektiğini bilmesi demek; çok robotlu düzende ise makineler birbirinin gücünü tanıyıp işi aralarında bölüşüyor.
Bütün-vücut zekâsı ve Apollo deneyi
Google bu aklı Apptronik üretimi Apollo 2 adlı insansı platformda sınıyor. Talimat yalın: sulama kabını alıp alt raftaki yeşil kutuya koy. Ne var ki yürüme, iki bacağı sırayla oynatmaktan ibaret değil; her adım ağırlık merkezini kaydırıyor, her uzanma dengeyi bozuyor, kavranan her cisim bedene binen kuvveti değiştiriyor. Apptronik tasarımında bacaklar, gövde, kollar ve eller tek koordineli sistem gibi çalışmak zorunda; şirketin deyişiyle bütün-vücut zekâsı tam da bu. Demo başarıya ulaşıyor ama dürüst bir not düşülüyor: makine insandan yavaş ve daha az akıcı; bir kez yapmak gösteri, her seferinde hızlı ve güvenilir yapmak ise ürün demek.
Asıl uçurum parmaklarda açılıyor. İnsan eli yumurtayı kırmadan tutar, şişe kapağını çevirir, düğüm atar, temas anını hissedip kaymadan önce kavramayı düzeltir. Apollo 2'ye takılan beş parmaklı el 22 serbestlik derecesi sunuyor; esneklik kadar hata ihtimali de büyüyor. Google değerlendirmeleri tabloyu sayıya döküyor: ampulü sökmek yaklaşık %92 başarıyor ama geri takmak %36'da kalıyor; çöp torbasına düğüm %44, faraşla süpürme %32, kilitli poşeti kapatma %40 civarında. İnsan için ampul takmak yüzde yüzlük bir iştir; robot için ise zar atmak. Yürümek alkış alıyor olabilir ama gündelik dokunma işleri, fiziksel zekânın gerçek sınavı.
Bedenler arası aktarım
Genel amaç iddiasının ikinci sınavı, zekânın bedenden bağımsızlaşması. Her platformun eklemi, algılayıcısı, ölçüleri ve sınırları farklı; kolla öğrenileni insansıya taşımak, sağ elle öğrenileni bambaşka bir bedenle yapmaya benziyor. Google aynı model kopyasını üç farklı gövdede koşturarak yanıt veriyor: farklı eller taşıyan Apollo 2 sürümleri ve kıskaçlı bir çift kol düzeneği. Cihaz üstü modelin birkaç saatte ve az örnekle yeni bedene uyumu, ekonomiyi değiştiren vaat: her makineye aylarca özel eğitim gerekmiyorsa tek zekâ, farklı işlere farklı bedenlerle dağıtılabilir. Uzun vadeli hedef, beden değiştiren ölçeklenebilir zekâ katmanı .
Ne var ki model ancak deneyimlediği kadar genelleyebilir ve fiziksel deneyim pahalıdır. Dil modellerinin interneti vardı; milyarlarca sayfa dijital olarak kopyalanabiliyordu. Robotun böyle bir kısayolu yok: havlunun dokusunu okuyarak, çekmecenin istediği kuvveti tariften öğrenemez. Dört kaynak sayılıyor: insanın uzaktan kumandayla makineyi yönettiği teleoperasyon, insanların iş yaparken kaydedildiği videolar, sanal ortamda milyonlarca tekrar sunan simülasyon ve robotun kendi sahada topladığı veri. Hiçbiri tek başına fiziksel dünyanın ışık, yüzey, eşya, insan ve arıza kombinasyonlarını kapsamıyor.
Veri yarışı ve Robot Park
Bu yüzden insansı yarışı, fiziksel deneyim biriktirme yarışına dönüşüyor. Figure şirketi Brookfield ortaklığıyla 100 binden fazla konuta, yüz milyonlarca metrekare ticari ve lojistik alana yayılan bir veri ağı kuruyor; Helix adlı model, tamamen insanların baş kamerası kayıtlarından navigasyonu öğrenip robot demosu olmadan gerçek mekânda yol bulabiliyor. Figure kayıtlarına göre insan videosundan robota sıfır örnek aktarımı ilk kez gösterilmiş durumda. Değerli varlık artık robotun kendisi değil; robotla insanlar arasında doğan etkileşimlerin oluşturduğu deneyim havuzu.
Google ve Apptronik ise deneyimi fabrika gibi üretmeyi seçiyor. Apptronik duyurusuna göre 30 Haziran 2026'da Austin'de genişletilen Robot Park, 90 bin metrekareye yakın alanda Apollo 2 filolarını lojistik, üretim ve perakende işlerinde çalıştırıyor; Mercedes-Benz ve GXO gibi müşteri sahaları da ağın parçası. Her başarılı kavrama bir eğitim örneği, her başarısız deneme bir başka örnek; yoldan geçen insan bile veriye dönüşüyor. Buradan veri volanı doğuyor: robotlar veri üretir, veri modelleri iyileştirir, iyi modeller daha çok ortama girer ve daha çok veri getirir. Dağıtım, eğitim sürecinin parçası haline geliyor.
Genelleme ve programlanabilir iş
Volanın çalışması, veriyi tekrar kullanılabilir bilgiye çevirmeye bağlı; milyon kez zayıf sinyal tekrarlamak iyi model vermez. Bir depoda tıkır tıkır çalışan tutuş, ışık değişince bozulabilir; kuru kutuyu kavrayan el ıslak yüzeyde kayar; kimse yokken güvenli hareket, araya insan girince riskli olur. Sistemin ezber yerine örüntü öğrenmesi, görmediği duruma akıl yürütmesi gerekiyor. Rekabet aynı soruya farklı cephelerden yükleniyor: Google'ın Gemini robotiği, Figure'in Helix'i, Nvidia'nın GR00T platformu ve Physical Intelligence ekibi; mimariler farklı, soru aynı: fiziksel deneyim yeniden kullanılabilir zekâya nasıl dönüşür?
ER2 katmanı bu soruya kolektif bir yanıt deniyor: işi parçalayıp robotlara dağıtmak. Biri kaldırmaya elverişli konumda, öteki hedefe yakın, üçüncüsü başka parçayı üstleniyor; üst akıl işbölümünü kuruyor. Tek robot aynı anda tek noktada olabilirken ekip mekânı ve emeği paylaşıyor, biri aksadığında öteki kapatıyor. Zorluk, belirsizlik altında koordinasyon: kontrollü salonda iki robotun uyumu, kaotik depoda yüzlercesinin özerk çalışacağını kanıtlamaz. Alan rekabeti, ekipman arızası, yarıda çöken plan; paylaşılan zekâ bu anlarda sabit komutlara değil, akıl yürütmeye güvenmek zorunda.
Ekonomik çerçeve de burada değişiyor: soru mesleklerin toptan alınması değil, görevlerin tek tek programlanabilir hale gelmesi. Bir vardiyadaki yürüme, alma, taşıma, dizme, tarama, denetleme ve yükleme işleri ayrı ayrı eşik aştıkça makineye geçiyor. Ampulü %36 olasılıkla takan makine üretim bandına giremez; insandan yavaş makine çoğu işte pahalı kalır. Yakın vade milyonlarca insansının işçiyi değiştirmesi değil, otomatikleşmeye değer görev kümesinin kademeli genişlemesi olacak; sınır her iyileşmede biraz daha dışarı taşınacak.
Güvenlik: ne zaman davranmamalı
Yazılım hata yapınca çıktı çöpe gider; fiziksel makine hata yapınca eşya kırılır, insan yaralanır. Bu yüzden sistemin en kritik yeteneği durmayı bilmek olabilir: neye baktığını, bedeninin nerede olduğunu, cisimle insanı ayırt etmeyi, neyin güvensiz olduğunu ve ne zaman yardım isteyeceğini kestirmek. Google bu cepheyi ASIMOV ölçütleriyle sınıyor; CoRL 2025'te sunulan ilk sürüm, robot anayasalarını otomatik üretip davranış hizalanmasını %84,3'e taşımıştı ve ölçüt GitHub üzerinden açık yayınlanıyor. İkinci sürüm fiziksel tehlike algısını, aracı sürüm ise güvensiz görevi reddetme, kritik anda durma ve insana danışma becerilerini ölçüyor. Kapanıştaki vizyon da bu eşiğe bağlanıyor: fiziksel AGI yolunda soru artık makinenin bardağı al komutunu anlaması değil; bardağın nerede olduğunu, ne kadar kırılgan olabileceğini, kimin yakında durduğunu ve plan tutmazsa ne yapılacağını bilmesi. Zekâ bedene kavuştuğu anda dünyanın kendisi sınavın parçası oluyor.
Videodaki anahtar anlar
AI yorumu
"Konuşmacı Google'ın yol haritasını ikna edici bir mimari öyküyle anlatıyor, ancak el becerisi skorları makinenin hâlâ çıraklık döneminde olduğunu ele veriyor. Asıl izlenecek cephe, demolar değil; saha verisinin modellere dönüşme hızı."
AI değerlendirmesi
En güçlü itiraz, veri volanı anlatısının fazla pürüzsüz olması. Saha verisi toplamak tek başına genelleme üretmez; teleoperasyon kayıtları operatörün alışkanlıklarını, simülasyonlar ise fizik motorunun kabullerini taşır. Figure cephesinde insan videosundan navigasyon transferi etkileyici, fakat yürümek ile kavramak farklı zorluklar; tutma, burma, hissetme gibi temas gerektiren işlerde insan videosunun sinyali zayıflar. Dolayısıyla veri ölçeği büyürken temas zenginliği aynı hızla büyümeyebilir, volan yavaşlayabilir.
Sunumda boş kalanlar da dikkat çekici. Sistemin enerji tüketimi, saatlik işletme maliyeti ve insan hızına göre kaç kat yavaş kaldığı sayıya dökülmüyor. Apptronik tarafında Apollo 2'nin ölçüleri kamuya açıklanmadığı için ilk nesil Apollo'nun rakamlarını yeni makineye yapıştırmak yanıltıcı olur. Güvenlik tarafında ASIMOV ölçütleri laboratuvar senaryolarında çalışıyor; kalabalık bir depoda yüzlerce robotun aynı anda sınavdan geçmesi bambaşka bir ölçek sorunu.
Konuşmacının çerçevesi Google ve DeepMind eksenli; rakip yaklaşımlar kısa bir geçit töreninden ibaret kalıyor. Nvidia'nın GR00T platformu, Figure'in Helix modeli ve Physical Intelligence ekibi kısaca anılıp kapanıyor; oysa veri stratejileri birbirinden köklü biçimde farklı. Apptronik ortaklığı ve Robot Park övgüsü de tek taraflı; saha verisinin kalitesini bağımsız denetleyen bir kaynak sunulmuyor. Bu, anlatıyı yanlış yapmaz ama eksenini belli eder: bu bir sektör panoraması değil, Google yol haritasının savunusu.
Okur için pratik çıkarım net: insansı robotlar önce meslekleri değil, tekil görevleri alacak. Bir raf dizme, kutu taşıma ya da basit toplama işi güvenilirlik eşiğini aştığında otomatikleşir; eşik aşılmadan yatırım kararı verilmemeli. İzlenecek üç metrik var: tekrar denemelerde başarı oranları, yeni bir gövdeye uyumun maliyeti ve saha verisinin model güncellemesine dönüşme süresi. Bu üçü iyileşmeden satın alınan her pilot proje, pahalı bir gösterimden ibaret kalır.
Kaynaklar
6 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
yapay zeka · robotik · google deepmind · insansı robot · otomasyon