Gündeme dön

Robot Kullanım Ajanları: Genel Amaçlı Modeller Robot Kontrolünü Neden Kazanıyor

Y Combinator sahnesinde Waddle Labs ve RoboCurve kurucuları, genel amaçlı dil modellerinin robot kollarını kodla yönettiği yeni dönemi anlatıyor ve Isola tezinden canlı küp taşıma demosuna uzanan kanıtları tartışıyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — Jv5B5CEaPJI
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Kodlama ajanlarının beklenmedik genellemesi, son yılların en büyük sürprizlerinden biri oldu. İnternetteki milyonlarca kod satırıyla eğitilen modeller, hiç görmedikleri alanlara da taşan bir problem çözme disiplini kazandı. Şimdi aynı sıçrama robot kollarına uzanıyor ve genel amaçlı modeller farklı gövdeleri tek bir dille yönetmeye başlıyor. Bu değişim, özel gövdeye özel beyin zorunluluğunu ilk kez ciddi biçimde sarsıyor.

Isola tezi ve bulut kuklacı

MIT araştırmacısı Phillip Isola, 7 Eylül 2026 tarihli denemesinde bu kırılmayı net adlandırıyor. Ona göre bir dil modeli hesap makinesini ya da bilgisayarı kullandığı gibi robotu da araç olarak kullanabilir. MIT metnine göre internete bağlı her robot, Fable ve Astra gibi güçlü modellere potansiyel bir el haline geliyor. Bu vizyonda zekâ bulutta durur, gövdenin yazılımı değişmeden kalır ve güncellemeler havadan iner.

Waddle Labs kurucuları Jaime ve Vincent, bu vizyonu donanım üzerinde kanıtlamaya çalışıyor. Ekip, büyük modellerin robotları etkin yönetmesi için bir çalıştırma katmanı kurup veri topluyor ve sonra bu veriyle daha iyi modeller eğitiyor. waddlelabs.ai sayfasına göre ajan hedefi alt görevlere bölüyor, kamera akışlarına bakıp denetim kodu yazıyor ve gerektiğinde hazır eylem modellerini araç diye çağırıyor. Yaklaşımın iddiası, yeni kol ya da yeni kıskaç için sıfırdan veri toplamadan işe başlamak.

Ölçüm tarafında RoboCurve sahneyi dürüst tutuyor. Kuruculardan Jay, kolları, kıskaçları, humanoidleri ve dört bacaklıları aynı titizlikle sınadıklarını anlatıyor. robocurve.org sitesine göre girişim, Y Combinator destekli bir kamu yararı şirketi olarak sınır yetenekleri halka açık raporluyor. Açık kaynak Inspect Robots çerçevesi, kiraz seçilmiş demo videolarının yerine sürekli ve standart bir cetvel koymayı hedefliyor.

Son haftalarda yayılan kısa videolar tartışmayı alevlendirdi. Bir kayıtta büyük bir model şişe kapağını gevşetiyor, bir diğerinde iki robot aralarında iş bölüşüyor, üçüncüsünde ise bir kol kalem kapağını açıyor. The Decoder aktarımına göre StationeryBench adlı yeni bir kırtasiye testinde Astra, çift kollu YAM robotlarla 200 denemede 100 görevden 7'sini tamamen bitirirken rakip model sıfırda kaldı. Medyan ilerleme skoru 46'ya 12 olunca uzamsal akıl yürütmedeki sıçrama somut bir sayıya kavuştu.

RT2 ve doğrudan eylem dönemi

Google DeepMind ekibinin 2023'te tanıttığı RT2, bu yolun ilk ciddi durağıydı. DeepMind açıklamasına göre PaLI-X tabanlı görsel dil modeli, 13 robotla 17 ay boyunca mutfak tezgâhında toplanan gösterimlerle ince ayarlandı. Model İngilizce üretmek yerine uç işlevci konumu denen koordinatları çıkarıyor ve bu koordinatlar eklem komutlarına çevriliyordu. Ağ ölçeğindeki görsel ve dilsel ön eğitim, robot verisinin görmediği nesne ve komutlara genellemeyi belirgin biçimde artırdı. O dönemin kısıtı, modelin eylemi doğrudan ve tek adımda üretmek zorunda olmasıydı. GSM8K benzetmesiyle anlatılırsa, model ara hesap yapamadan son işareti basmak zorundaydı. Bugünkü ajanlar ise bir zincir düşünce aralığı açıp turlar boyunca düşünebiliyor, sonra tek bir komut çıkarıyor. Bu fark, karmaşık görevlerde ayrılan düşünme bütçesini büyüten belirleyici bir esneklik sağlıyor.

Buradaki sezgi, acı ders denen ilkeyle aynı: modele daha fazla özerklik ve hesap verildiğinde ince ayarla öğretilen birçok hüner kendiliğinden beliriyor. Yapıyı baştan robot verisine hapsetmek yerine güçlü bir temel modeli serbest bırakmak daha ucuza daha uzağa götürüyor. Google Research kökenli Code as Policies çizgisi de bu yüzden verinin türüne odaklanıyor. research yazısına göre az örnekli komut-kod eşleşmeleri, modüler kod politikaları ile tek sistemden çok çeşitli görev çıkarmayı mümkün kıldı.

Kod politikaları ve beceri kütüphaneleri

Kasım 2022'de Liang ve Zeng imzasıyla duyurulan Code as Policies, robot programlamayı baştan tanımladı. Fikir basitti: al, kaldır, git gibi ilkel beceriler Python işlevleri olarak verilir ve model yeni görevi bu işlevleri birleştiren kodla çözer. arXiv üzerindeki 2209.07753 numaralı makaleye göre modeller, ek robot verisi görmeden ilk denemede makul dizilimler üretebildi. Bu tek atış başarısı, sonraki ajan çalışmalarını ateşleyen kıvılcım oldu.

Minecraft evrenindeki Voyager, aynı fikri araç yapımına taşıdı. Ajan, gömülü Python işlevleriyle başlayıp koşular sırasında francois.py gibi yeni dosyalar derliyor ve bu dosyaları daha sonra çağrılabilir ustalara dönüştürüyor. Bağlam içi öğrenme burada parlıyor çünkü model birkaç örnekle yeni rutini kavrıyor. Ancak aynı deney, bu öğrenmenin monoton olmadığını da gösterdi: başarı önce dalgalanıyor, 20 ila 40 örnekten sonra doyuma ulaşıyor ve pencere dolunca daha fazla örnek eklemek performansı artırmıyor.

Francois'nun çerçevesi bu yüzden bir merdiven öneriyor: hızlı bağlam içi deneme, ardından RAG ve bellekle desteklenen geri çağırma, sonra düşük rütbeli LoRA uyarlamaları ve en tepede tam ince ayar ya da pekiştirmeli öğrenme. Tesla gibi sınırsız sürüş verisine sahip bir şirketin bağlam içi yöntemle yetinmeyeceği açık. Gündüz toplanan durum-eylem-ödül izlerinin gece uykusu benzeri bir derlemeyle ağırlıklara işlenmesi, DreamCoder geleneğinin robotikteki karşılığı olarak görülüyor.

Donanım demosu ve gecikme gerçeği

Canlı demoda Ashra adlı ajan, yalnızca kamera girdisiyle masadaki küpü kavrayıp kaba taşıyor. Sistem turlar halinde çalışıyor: her turda görüntüler geliyor, model bir sonraki uç işlevci pozunu basıyor ve kol oraya gidiyor. Bu katmanda kod, tam bir politika yerine araç çağrıları dizisi gibi davranıyor. Yaklaşma gibi tekrarlı ve belirlenimci kısımlar koda gömülebiliyor, nesne bulma ve hata tespiti gibi değişken noktalarda ise görsel dil modeli devrede kalıyor.

Waddle katmanı ile doğrudan Astra kullanımı arasındaki fark, ekonomi ve hızda ortaya çıkıyor. Her adımda dev modeli düşünmeye sokmak pahalı ve yavaştır. Ekip bu yüzden ilk başarılı izi hızlı çalışan bir beceriye derliyor ve sonraki koşularda o beceriyi çağırıyor. OpenAI duyurusuna göre Astra, Terminal-Bench Science ölçümünde 64.6 skorla Fable 5.1 çizgisini geride bırakırken yaklaşık üçte bir daha düşük maliyetle çalışıyor. Gecikmenin ayda yaklaşık ikiye katlanan iyileşmesi sürerse yıl sonuna doğru neredeyse gerçek zamanlı denetim konuşulabilir.

Platonik temsil ve önümüzdeki iki yıl

Bilişsel bilimden gelen bir başka destek, Platonik temsil hipotezi. MIT'de Huh ve arkadaşlarının çalışması, büyüyen vizyon ve dil modellerinin veri noktaları arası mesafeleri giderek daha benzer ölçtüğünü gösteriyor. Bu yakınsama doğruysa güçlü bir dil modeli zaten güçlü bir dünya modeli taşıyor demektir. Yani mimariyi robot verisine hapsetmek yerine dünya anlayışını kodu ve bilgisayarı kullanma verisiyle büyütmek daha verimli olur.

Astra'nın sıçramasını açıklayan aday veri de bu: bilgisayar kullanımı ve CAD ile Blender sahneleri. Ekranda bir nesneyi döndürmek için imleği sürüklemek, yukarı aşağı ve sol sağ gibi uzamsal kavramları modele öğretiyor. Eski Xerox PARC günlerinde fiziksel dünyaya benzetilen grafik arayüzler, şimdi ters yönden robotlara ders veriyor. Princeton çizgisindeki bulut robotik deneyleri de bağlantıyı doğru kurunca dil modellerinin fiziksel görevlerde belirgin iyileştiğini raporluyor.

Kapanıştaki tahmin iddialı: iki yıl içinde yetkin bir gencin elleriyle yapabildiği her doğal dil komutunu yerine getiren genel amaçlı robotlar. Bu, robotik için bir ChatGPT anı demek. Konuşmacılar bile uyarıyor: bu takvimde gecikme, güvenlik doğrulaması ve beceri kütüphanesinin budanması gibi sert düğümler var. Yine de yön belli: veri türünü çeşitlendir, ajana kod yazdır, ölçümü açık tut ve tekrarı hıza derle.

Görsel: nodesdaily AI

Videodaki anahtar anlar

  1. Açılış: kodlama ajanlarının genelleme sürprizi
  2. Isola tezi: bulut kuklacı vizyonu
  3. Viral demolar: kapak ve kalem işleri
  4. RT2: ağ verisinden eyleme
  5. Code as Policies: tek atışta kod
  6. Bağlam içi öğrenmenin sınırları
  7. Ashra küpü kaba taşıyor
  8. Platonik temsil ve iki yıllık tahmin

AI yorumu

"Konuşmacıların heyecanı bulaşıcı ama RoboCurve tarafının ölçüm ısrarı bu sevinci dengeliyor. Bana göre bu video, robotikteki yön tartışmasını veri ve mühendislik düzlemine çekmesiyle değerli."

AI değerlendirmesi

En güçlü karşı görüş, genelci bulut modellerinin henüz gerçek zamanlı denetim döngüsüne giremediği yönünde. Fabrika sahasında milisaniye mertebesinde tepki gerekirken büyük modellerin tur başına düşünme süresi saniyeler alıyor. Cihaz üstü küçük politikalar bu boşluğu dolduruyor ve yatırımın çoğu hâlâ oraya akıyor. Dolayısıyla kuklacı vizyonu, gecikme ve maliyet eğrileri bükülmeden genelleşemez.

Eksik kalanlar arasında güvenlik ve sorumluluk çerçevesi var. Yanlış yazılmış bir tutuş kodu pahalı donanımı kırabilir ya da insana zarar verebilir. Videoda hata yakalama ve geri alma konuşuluyor ama resmî bir doğrulama katmanından söz edilmiyor. Ayrıca uzun kuyruklu ev ortamları, ıslak zeminler ve kalabalık atölyeler gibi dağınık sahneler yeterince test edilmiyor.

Konuşmacıların olası çıkarı açık: Waddle Labs ajan altyapısı satıyor, RoboCurve ise ölçüm hizmetiyle konumlanıyor. İkisi de genelci model dalgasından besleniyor ve iyimser takvimi desteklemek işlerine geliyor. Bu durum verileri geçersiz kılmaz ama iki yıllık genel amaçlı robot tahminini okurken bir miktar indirime gitmek gerekir.

Okur için pratik çıkarım, robot yatırımlarını tek gövdeye kilitlememek. Aynı kol üzerinde hem özel politikaları hem de bulut ajanlarını deneyen ekipler daha hızlı öğreniyor. Küçük ekipler için en ucuz başlangıç, mevcut kameralarla bir tutuş görevini kod üreten ajana vermek ve başarısızlıkları beceri kütüphanesine yazmak. Ölçümü baştan kuranlar, hangi işin gerçekten otomatize olduğunu ilk görenler olacak.

Kaynaklar

9 bağlantı; 1 tanesi 17 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

robot-use agents · llm · waddle labs · robocurve · code as policies

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…