Gündeme dön

Google'ın WikiSkill Çerçevesi: Ajanlara Şirket Kurallarını Kendi Kendine Öğretmek

Google Research'in WikiSkill çalışması, bir yapay zeka ajanının şirketin yazılmamış kurallarını kendi kendine öğrenmesini sağlıyor: her hata okunur bir yönergeye işleniyor ve değişiklik yalnızca görülmemiş işlerde puan yükselirse tutuluyor. Dağınık satış tablolarındaki dizüstü tanıtımı, fine-tuning olmadan yüzde yetmişlik tabandan onda on sonuca ulaşıyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — ewxQLr7IxzY
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Google Research, WikiSkill başlıklı bir çalışma yayımladı ve çalışma sektörde hızla konuşulmaya başladı; isim ilk anda yanıltıyor çünkü bu tek bir beceri değil, ajan uygulamaları için bir çerçeve. Kurucu benzetme işe yeni başlayan bir çalışan: acemi hata yapıyor, neyin yanlış gittiğini not ediyor ve aynı hatayı tekrarlamıyor, üstelik bunun için okula geri dönmüyor. Buradaki dil modeli asla yeniden eğitilmiyor, fine-tuning uygulanmıyor; bunun yerine çerçeve ajanın yönerge dosyasını sonuçlar tutarlı hale gelene kadar yeniden yazıyor.

Çerçevenin hedef aldığı sorun yazılmamış şirket kuralları. Finansa yeni katılan biri tabloları çok iyi bilse bile ilk ayı başarısız geçirebilir, çünkü belirleyici adetler yalnızca çalışanların kafasında yaşıyor. Tanıtımda bir kasa altı birim sayılırken genel beklenti on iki yönünde ve iade edilen ürün negatif ciro satırı olarak işleniyor. Bu tür yerel adetler hiçbir yerde yazmadığı için, model ne kadar güçlü olursa olsun genel bilgisinden çıkaramaz.

Çözüm, kabul testi katı bir döngü. Worker her başarısız olduğunda hatayı anlatan bir ders yönerge dosyasına işleniyor ve değişiklik yalnızca ajanın hiç görmediği işlerde puan yükselirse yaşıyor. Her tur keep-or-discard hükmüyle bitiyor ve dosya, bütün set geçene kadar evrilmeye devam ediyor. Böylece her hatadan sonra yönergeyi elle düzelten insanın yerini otomasyon alıyor.

Sunucu bu döngüyü dizüstü bilgisayarında, uydurma bir şirketin dağınık ay-sonu tablosu etrafında yeniden kurdu ve her şeyi Google'ın ajan geliştirme kiti üzerine kurulu bir sohbet penceresinden yönetti. Ajandan kendisini tanıtması istendiğinde mimari ortaya çıkıyor: dağınık dosyaları okuyup küçük bir temizlik betiği yazan, çalıştırıp temiz dosyayı kaydeden bir worker; sonucu bilinen doğru sayılarla karşılaştırıp puan veren bir checker; her hatayı kayda geçiren bir note taker; notları tek bir yönerge değişikliğine çeviren bir playbook writer; ve değişikliği hiç görülmemiş on tabloda deneyip puan yükselirse tutan katı bir manager.

Test verisi bilerek çirkin, tıpkı gerçek satış çıktıları gibi. Tek tabloda birbirinden farklı tarih biçimleri, boşluklar, tutarsız yazılmış bölge adları, birbirini tutmayan birim kısaltmaları ve büyük-küçük harf karışmış ürün etiketleri var. İadeler, aceminin kolayca yanlış okuyacağı negatif ciro satırları olarak görünüyor. Şube tabloları birleştirmiş herkes bu türü anında tanır.

Finans ekibinin şartnamesi ikinci bir zorluk ekliyor: tarihe, bölgeye ve sipariş numarasına göre sıralama ile tarih, birim, iade ve mükerrer kayıtlar için standart finans gelenekleri isteniyor ama yerel standardın ne olduğu tanımlanmamış. Öğrenilmiş yönerge olmadan, ilk gün davranışıyla çalıştırıldığında ajan eksik bölge değerlerini bulup hataları listeliyor ama çözemiyor; bu tam da anlatılmak istenen nokta: yerel kural kitabı olmadan tespit bir yere varmıyor.

Makaledeki şema, üç çalışan artı bir katı yönetici, burada hakkını veriyor ve eski tekniklerle karşılaştırma da burada yerine oturuyor. Retrieval bakılacak bir belge ister ama burada kurallar hiçbir belgede yok. Fine-tuning günler sürer ve öğrendikleri geri okunamaz. Sıradan bellek kaydeder ama kaydın doğru olup olmadığını denetlemez. WikiSkill hatalardan öğreniyor, dersi okunur düzyazıyla yazıyor ve yalnızca işe yaradığı kanıtlanırsa tutuyor; sunucunun sonucu özel bulması bu yüzden.

Eğitim yirmi dosyayla yürütüldü: alıştırma için on tablo ve yöneticinin hükmü için ayrılmış on görülmemiş tablo. Görünen puan tablosu yüzde yetmişlik tabandan başlıyor, yüzde kırkta kalan on birinci ve on ikinci denemeleri reddediyor ve yedinci iterasyonu onda on ile kabul ediyor. Üçüncü ile altıncı arasındaki denemeler sıradan bir sebeple çöktü, sunucunun kendi hesabındaki kullanım kotası tükendi; bu çerçevenin değil kurulumun sorunu ama işletme maliyeti hakkında yine de öğretici.

Sonra sonuç sahnesi geliyor: aynı dosya ve aynı model, bu kez öğrenilmiş yönerge yüklü. Çalışma geçiyor, her satır beklenen doğru sonuçla birebir eşleşiyor ve iadeler doğru işaretle işleniyor. En güzel taraf, ortaya çıkan yönergenin düz ve okunur düzyazıyla her finans kuralının ne zaman uygulanıp ne zaman uygulanmayacağını söylemesi; hazır verilenlerin yanında ajanın kendi çıkardığı adetler de içinde.

Peki bu kimler için? Hataların dünya bilgisinden değil ev adetlerinden kaynaklandığı tekrarlayan işleri olan her ekip için: her mağazanın çıktısının kendi tuhaflıklarını taşıdığı ay kapanışları veya doğru masraf merkezini yalnızca muhasebe ekibinin bildiği fatura yönlendirme. Sunucu deneyi bir kodlama asistanına düz İngilizceyle tarif edip makaleyi yükleyerek ve Google'ın ajan kitini kullanarak kurdu; tekrarlanabilmesi için topluluk uygulamasını ve makale bağlantısını da paylaşıyor. Kazanç en çok, düzeni istikrarlı uzun soluklu ajanlarda; tek seferlik işlerde en az.

Görsel: nodesdaily AI

AI yorumu

"Beni burada yakalayan çerçeve şu: bir şirketteki en zor kurallar hiç yazılmamış olanlar ve WikiSkill bu sorunu ajanın kendi kendine çalıştırdığı bir döngüye dönüştürüyor. Tanıtımdaki hava yerine döngünün kendisi bence daha ikna edici."

AI değerlendirmesi

En güçlü itirazı şöyle kuruyorum: doğrulama tabloları eğitim tablolarının akrabası, yani tam puan yalnızca yönergenin tek bir ailenin tuhaflıklarını ezberlediğini kanıtlıyor olabilir. Gerçek mağaza çıktıları her çeyrekte değişir ve makalenin beş kontrollü değerlendirme seti de bu kaymayı ölçmüyor. Birbiriyle akraba yirmi dosyada alınan tam puan bence alkışı hak eder, güveni değil.

Videoda test edilmeyenler maliyet, gecikme ve güvenlik. Her aday değişiklik on görülmemiş tabloda yeniden koşuyor, bu da işlem gücü ve zaman yakıyor; sunucunun kendisi tanıtımın ortasında hesap kotasını bitirdi, bu bile çok şey anlatıyor. Kendi yazdığı betikleri finans verisine karşı çalıştıran bir worker ayrıca yıkıcı komut riski taşıyor ve gördüğüm döngüde insan onayı adımı yok.

Doğrulama tarafında: dağınıklığı da, doğru cevapları da, sonucu da aynı el ürettiği için bu tek kişilik bir tanıtım ve checker karşılaştırması döngüsel olabilir. Makaledeki rakamları bir karara dayanak yapmadan önce bağımsız tekrarını görmek isterim; sunucunun işverenden bağımsız görüş notu dürüst olsa da hikaye yine tek kaynaklı kalıyor. Bütçe ayırmadan önce ikinci bir uygulamanın sayılarını beklerim.

Benim pratik hükmüm, birinci tekil dille: biçimi istikrarlı tekrarlayan arka-ofis işleri için bu değerli bir öğrenme katmanı ve ben olsam her yönerge değişikliğinde insan onayıyla, önce salt-okunur başlatırım. Tek seferlik analizde veya yaratıcı işte kurulum maliyeti karşılamaz. Benim gözümde asıl ödül okunabilir yönerge, çünkü bir denetçi bir belgeyi inceleyebilir ama bir ağırlık güncellemesini asla inceleyemez.

Kaynaklar

7 bağlantı; 1 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

wikiskill · yapay zeka ajanları · google research · adk · skill evolution · fine-tuning · kurumsal otomasyon

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…