Hazır bir gömme modeli genel veriyi iyi tanır ama senin belgelerini, ürün adlarını ve uygulamalarının önemsediği sesleri bilmez. Embedding Gemma 2 tam bu boşlukta öne çıkıyor: Google tarafından Apache 2.0 lisansıyla açılan bu model metin, görsel, işitsel ve görüntülü girdileri 768 boyutlu tek bir paylaşılan uzayda buluşturuyor. Model kartını yayımlayan HuggingFace kaydına göre sistem toplam 740 milyon parametre taşıyor ve yalnızca metin gerekiyorsa 270 milyon parametrelik hafif sürümüyle yetinebiliyorsun. Sunucu iddiasını önce canlı bir denemeyle gösteriyor: kendi kanal kayıtlarından ürettiği soru ve pasaj eşleşmeleriyle ince ayarladığı sürüme bir soru yazıyor, model de yanıtın geçtiği anı tıklanabilir bir zaman damgasıyla döndürüyor. Videonun yanıt aradığı soru net: birkaç dakikalık ince ayar, modeli kendi verinde belirgin biçimde daha iyi hale getirir mi ve karşılığında eski yeteneklerini bozar mı?
Gömme modelinde ince ayarın anlamı, büyük dil modellerindekinden farklıdır. Bir dil modeline girdiyi ve birebir yazmasını istediğin yanıtı gösterirsin; eğitim verisi doğru yanıtı kelimesi kelimesine içerir. Gömme modeli ise hiçbir şey yazmaz: girdiyi bir sayı listesine çevirir ve bu sayılar yalnız birbirleriyle ilişkileri içinde anlam taşır. Bu ilişki ağına gömme uzayı denir ve yazılabilecek tek bir doğru liste yoktur. Modele söyleyebileceğin tek şey, hangi öğelerin birbirine yakın durması gerektiğidir. Google geliştirici belgeleri de ince ayarı tam böyle çerçeveliyor: genel anlam bilgisiyle alana özgü doğruluk arasındaki boşluğu kapatma işi. Bu ayrımı anlamak önemlidir, çünkü eğitim verisinin biçimi de bu ayrımdan doğar.
Eşleşmeler ve grup içi karşıtlar
Eğitim verisi, soru ve yanıtlayan pasaj ikililerinden oluşur. Sunucu bunu akıllı ev şirketinin destek kutusu üzerinden anlatıyor: her örnek, bir müşteri sorusuyla yardım merkezindeki ilgili pasajdan ibarettir. Puan vermeye, yanlış yanıtları tek tek etiketlemeye gerek yoktur; yalnızca birbirine ait soru ve pasajları toplarsın. Bu yalınlık işin cazibesidir, çünkü veri hazırlığı haftalar süren bir etiketleme projesine dönüşmez. Elindeki belgeler ve kullanıcıların sorduğu gerçek sorular çoğu zaman yeterlidir. Önemli olan, eşleşmelerin temiz olması ve her sorunun gerçekten o pasajla yanıtlanmasıdır.
Her soruyu kendi pasajına yaklaştırmak tek başına yetmez, çünkü model bütün girdileri aynı noktaya yığıp yine iyi puan alabilir. Çözüm, eğitimi öbekler halinde yürütmektir: örneğin 32 eşleşmelik bir öbekte her sorunun kendi pasajı doğru yanıt sayılır, öbekteki diğer tüm pasajlar yanlış yanıt varsayılır. Böylece tek bir yanlış yanıt etiketlemeden, her adımda bol miktarda karşıt örnek bedavaya gelir. Sunucu bunu çoktan seçmeli bir sınava benzetiyor: öbekteki diğer eşleşmeler, hazır şıklar gibi davranır. SBERT belgelerinde bu yaklaşım Multiple Negatives Ranking adıyla geçer ve OpenAI tarafından görsellerle metinleri tek uzayda buluşturan CLIP çalışmasındaki fikrin aynısıdır. Karşıt örnekleri elle toplamak yerine öbeğin yapısından çıkarmak, yöntemi bu kadar pratik kılan şeydir.
Bu kurnazlığın bir bedeli vardır: öbekte aynı yanıt iki kez geçerse kayıp, doğru yanıtı yanlış diye öğretir. İki müşteri aynı sıfırlama yordamını sormuşsa ve ikilileri aynı öbeğe düşmüşse, model ilk sorunun doğru pasajını iter. Çözüm, aynı metni bir öbekte asla yan yana getirmeyen bir örnekleyicidir; SBERT ekosisteminde buna kopyasız örnekleyici denir. Küçük bir ayrıntı gibi görünür ama veri kümesinde tekrar çoksa eğitimin yönünü sessizce bozar. Sunucu bunu özellikle vurguluyor, çünkü etiketten çok veri düzeniyle ilgili bir hatadır ve kayıp eğrisine bakarak fark edilmez.
İstem biçimi, LoRA ve ölçüm
İkinci kritik nokta istem disiplinidir. Embedding Gemma 2, arama sorgusunun önünde kısa bir görev istemi ve belgelerde başlık ile metin düzenini bekler. Eğitimde hangi biçimi kullandıysan, arama sırasında da aynısını kullanmak zorundasın. Sunucu bunu dil modellerindeki istem şablonu disiplinine benzetiyor: eğitim şablonuyla üretim şablonu birebir aynı olmalıdır. Biçimi sonradan değiştirirsen, ince ayarla kazandığın yakınlık ilişkileri yeni düzende geçersiz kalır. O yüzden veri hazırlığına başlamadan önce üretimde kullanacağın şablonu kilitlemek gerekir.
İşin en ilgi çekici bölümü, gerçekte neyin eğitildiğidir. Bütün ağırlıkları güncellemek yerine LoRA kullanılır: donmuş katmanların yanına küçük eğitilebilir dizeyler eklenir ve orijinal ağırlıklara dokunulmaz. Sunucunun denemelerinde eğitilen pay ağırlıkların yüzde 2'sinden azdı; koca modelin kopyası yerine küçük bir adaptör dosyası saklamak yetti. GoogleBlog geliştirici rehberi de bu modüler yapıyı öne çıkarıyor: metin, görsel ve ses kodlayıcıları ihtiyaca göre yüklenebiliyor. Google Blog duyurusundaki konumlandırma da aynı yöndedir: tüketici donanımında çalışan, alçak gecikmeli bir model. Yine de ortak omurga bir risk taşır: metin, görsel, video ve ses aynı gövdeden geçtiği için sesi eğitmek görseli ve metni işleyen bölümü de değiştirir. Bunun bedelini ayrıca ölçmek gerekir.
Son ilke ölçümle ilgilidir. Eğitim kaybının düşmesi, modelin yalnızca gördüğü örneklerde iyileştiğini gösterir; asıl soru, hiç görmediği sorularda arama kalitesidir. Yoksa ortaya çıkan şey genel bir yetenek değil, ezberdir. O yüzden test kümesi ayrı tutulur ve bölme kaynağa göre yapılır: aynı makalenin pasajları hem eğitimde hem testte yer alırsa model yanıtı zaten görmüş olur. Doğru bölme; makaleye, videoya ya da kayda göredir. Bu düzenek ikinci bir soruyu da yanıtlar: model genel bir işitme ya da anlama becerisi mi kazandı, yoksa verilen etiketleri mi ezberledi? Sunucu çalışmalarını bu soru üzerine kuruyor.
İki küçük çalışma ve üç kural
İlk çalışma, önceki videoda zayıf kalan noktayı hedefliyor: gündelik sesler. ESC50 adlı veri kümesi, köpek havlaması, yağmur ve testere sesi gibi 50 gündelik sesin kısa kliplerini içerir; veri kümesinin tanıtımını yapan GitHub sayfasında 50 sınıfta 2000 kayıt listelenir. Her ses adı bir cümleye çevrilir; sınıflandırma, arama işine dönüşür: model klibi ve etiket cümlesini gömer, en yakını seçer. Eğitim öncesi model doğru sesi ilk sırada ancak dörtte bir oranında buluyordu, yani yaklaşık yüzde 25 doğruluk. Etiket cümlesi ve ses klibi ikilileriyle, A100 hızlandırıcısında yaklaşık 7,5 dakikalık bir eğitim yürütüldü. Görülmemiş kliplerde ilk sıra başarısı dörtte birden üçte ikiye çıktı ve diş fırçalama gibi bazı sesler neredeyse her seferinde doğru tanınmaya başladı. Sonra sunucu 10 sesi eğitimden bütünüyle saklayıp yeniden denedi: eğitilen seslerde kazanç aynısıydı ama saklananlarda iyileşme yoktu. Yani model genel bir işitme kazanmamış, verilen etiketleri öğrenmişti. Bedel tarafında fotoğraf ve ses araması kıpırdamazken genel metin araması yaklaşık 4 puan geriledi. Bir de mühendislik tuzağı çıktı: ilk denemede ses araması sıfıra düşmüştü; sorun adaptörde değil, adaptörle kaydedilen işlemcideydi ve her klibi birkaç milisaniyeye kırpıyordu. Tek satırlık düzeltme, taban modelin işlemcisini yeniden kullanmak oldu. Ders açık: ses adaptörünü kaydedip yeniden yükledikten sonra başarımı baştan ölç.
İkinci çalışma, videonun başındaki denemenin ta kendisidir: sunucu 120 videosunun dökümlerini kısa pasajlara böldü. Elinde bu pasajlara ait sorular olmadığı için Gemini modelinden her pasaja izleyici tarzı bir soru yazmasını istedi; böylece soru ve yanıtlayan pasaj ikilileri oluştu. Bölme videoya göre yapıldı, yani test soruları eğitimde hiç görülmemiş videolardan geldi. Eğitim öncesi doğru pasaj üçte iki oranında ilk sırada dönüyordu; 3 dakikadan kısa bir eğitimin ardından bu oran dörtte üçe yükseldi. Genel metin aramasındaki bedel yine yaklaşık 4 puan oldu. Sonuç iki yönlüdür: birkaç dakikalık ince ayar, modeli kendi seslerinde ve kendi videolarında açıkça daha iyi hale getirdi; ama karşılığında genel bir beceri değil etiket bilgisi kazandı ve genel metin aramasından biraz verdi. Sunucu buradan üç kural çıkarıyor: verini eşleşmelere dönüştür ve kopyaları öbeklerden uzak tut, görülmemiş veride test et ve kaynağa göre böl, son olarak ortak omurga yüzünden başka neler değişti diye her eğitimden sonra genel başarımı denetle.
| İlke | Uygulama |
|---|---|
| Eşleşme verisi | Soru ve yanıtlayan pasaj ikilileri topla |
| Kopyasız öbekler | Aynı metni bir öbeğe sokmayan örnekleyici |
| Kaynağa göre test | Test soruları görülmemiş videolardan gelsin |
Videodaki anahtar anlar
AI yorumu
"Ezber ile beceri ayrımını saklanan etiketlerle test etmesi, videoyu sıradan bir tanıtımdan ayırıyor. Bedeli de saklamıyor: genel aramadaki 4 puanlık gerileme iki çalışmada da ölçülmüş. Kısıtlı verisi olan her ekip için izlemeye değer bir yol haritası."
AI değerlendirmesi
En güçlü karşı görüş, ince ayarın çoğu ekip için gereksiz olabileceğidir. İyi yazılmış bir görev istemi, temiz belge düzeni ve güçlü bir taban model, arama işlerinin büyük bölümünü ek eğitim olmadan çözer. Veri azsa ve etiketler darsa, birkaç dakikalık eğitim genel beceri değil dar bir ezber üretir; saklanan 10 sesteki sıfır kazanç bunun kanıtıdır. Önce taban modelin başarımını kaynağa göre bölünmüş bir testte ölçmeden eğitime başlamak, kazanımı olduğundan büyük gösterir.
Sınırlar da açıktır. Model, eğitimde görmediği etiketlere genellenmez; uygulamandaki her etiket eğitim verisinde yer almalıdır. Ortak omurga yüzünden genel metin aramasındaki 4 puanlık gerileme iki çalışmada da tekrarlandı; genel aramaya da bel bağlayan bir ürün, her ince ayardan sonra bu bedeli ödemek zorunda kalır. İşlemci hatası ise ayrı bir uyarıdır: adaptör doğru yüklense bile çevresindeki parça zinciri sonucu sessizce bozabilir. Kaydet ve yeniden yükle adımından sonra baştan ölçüm almak, süs değil zorunluluktur.
Sunucunun konumu da not edilmelidir: kendi defterini, kendi kanal kayıtlarını ve tek bir donanım kurulumunu anlatıyor. Farklı bir veri dağılımı, farklı bir öbek büyüklüğü ya da farklı bir LoRA ayarı, sayıları değiştirir. Yine de yöntem şeffaftır; veri biçimi, bölme kuralı ve bedel ölçümü açıkça paylaşılmıştır. Bu açıklık, sonuçların tek kurulumdan çıkmış olmasına rağmen güven vermesinin nedenidir.
Okur için pratik çıkarım üç adımdır. Önce üretimde kullanacağın istem şablonunu kilitle ve taban başarımı kaynağa göre bölünmüş bir testte ölç. Sonra soru ve pasaj eşleşmelerini topla, kopyaları öbeklerden uzak tutacak örnekleyiciyi aç ve küçük bir adaptör eğit. Son olarak kazancı görülmemiş kaynaklarda doğrula, genel arama bedelini kaydet ve adaptörü yeniden yükledikten sonra ölçümü tekrarla. Bu döngü oturduğunda ince ayar, korkulan bir ameliyat olmaktan çıkıp rutin bir bakım işine dönüşür.
Kaynaklar
8 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — Prompt Engineering channel
- @developers.googleblog.com GoogleBlog developer guide for EmbeddingGemma 2
- @blog.google Google Blog launch post for EmbeddingGemma 2
- @ai.google.dev Google AI Developers fine-tuning guide
- @sbert.net SBERT losses documentation
- @github.com GitHub ESC-50 environmental sound dataset
- @openai.com OpenAI CLIP connecting text and images
- @huggingface.co HuggingFace embeddinggemma-2 model card
gömme modelleri · ince ayar · embedding gemma · lora · arama