Gündeme dön

Telefonda Çalışan Dört Ortamlı Yapay Zekâ: EmbeddingGemma 2

Google DeepMind, metin, görsel, video ve sesi tek uzayda buluşturan 740 milyon parametrelik açık gömme modeli EmbeddingGemma 2 modelini duyurdu; 4 bit sürüm telefonlarda bile akıcı çalışıyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — 7EMr9BCKglc
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Binlerce fotoğraf, ses kaydı ve metin dosyası arasında kaybolan bir arşivi tek cümleyle sorgulayabildiğinizi düşünün. Bulut servislerine dosya yüklemeden, ücretli bir arayüze abone olmadan, üstelik telefonunuz uçak modundayken bile çalışan bir anlamlı arama motoru. Google DeepMind ekibinin 6 Ekim 2026 günü duyurduğu EmbeddingGemma 2 tam olarak bu sözü veriyor: metin, programlama dosyaları, görseller, videolar ve ses kayıtlarını tek bir yapay zekâ modelinde buluşturan, dört ortamlı bir gömme modeli . Modelin resmi kartına göre bütün girdiler 768 sayılık tek bir ortak uzaya yerleşiyor, yani yazıyla fotoğraf artık aynı dili konuşuyor. Bu bilgi Google kaynağından elde edilmiştir ve yazının omurgasını oluşturur.

Duyurunun heyecan verici yanı ölçek avantajı. Toplam 740 milyon parametrelik model, yalnızca metin işlerinde 270 milyon parametrelik çekirdeğe iniyor; görsel birim 170 milyon, ses birimi 300 milyon parametreyle isteğe bağlı ekleniyor. Google blogu, 4 bit sıkıştırmayla metin ağırlıklarının Pixel 11 Pro üzerinde yaklaşık 191 MB, dört ortamlı tam sürümün ise 567 MB etkin RAM kullandığını yazıyor. Önceki sürümün 20 milyonu aşan indirme sayısına ulaşması, bu hafiflik iddiasının boş bir pazarlama cümlesi olmadığını düşündürüyor. Apache 2.0 lisansı da tabloyu tamamlıyor: modeli indirip uygulamalarınıza gömmeniz ve bu uygulamalardan gelir elde etmeniz serbest. Bu bilgi Google blogu kaynağından elde edilmiştir ve lisans ile hafiflik iddialarını doğrular.

İndirme ve kurulum: iki yol, tek hedef

Kurulum iki ayrı kapıdan yapılıyor ve sunucu ikisini de tek tek gösteriyor. İlk kapı, Hugging Face üzerindeki resmi sayfadan model ağırlıklarını doğrudan indirmek; ikinci kapı ise Unsloth ekibinin hazırladığı GGUF biçimindeki sıkıştırılmış tek dosya. 4 bit kuantalama, indirme boyutunu yarım gigabayt düzeyine çekiyor ve yüksek sıkıştırma seçenekleri bunun yaklaşık iki katı yer istiyor. Sunucu, HF indirme komutuyla dosyayı models alt klasörüne alıyor; bu yöntem özellikle yavaş bağlantılarda rahat nefes aldırıyor. Model kartındaki parametre dağılımı da bu tercihi açıklıyor: yalnızca metin gerektiren işlerde görsel ve ses birimlerini hiç indirmiyorsunuz. Bu bilgi HuggingFace kaynağından elde edilmiştir ve indirme seçeneklerini belgeler.

Ağırlıklar indikten sonra sahneye Ollama çıkıyor. Sunucu, indirdiği GGUF dosyasını işaret eden küçük bir modelfile yazıyor; dosya, kullanıcı sorgusunun nerede başlayıp nerede biteceğini modele anlatan standart bir sohbet şablonunu da içeriyor. Tek komutla model Ollama dizinine kaydoluyor ve artık Python tarafı hazır. Alternatif olarak Ollama kitaplığından hazır etiketler de çekilebiliyor: 378 MB düzeyindeki 270m etiketinden 1.3 GB düzeyindeki tam 740m etiketine kadar kademeli seçenekler var. Bu katmanlı yapı, deneme yapmak isteyenle üretime geçmek isteyenin aynı kapıdan girmesini sağlıyor. Bu bilgi Ollama kaynağından elde edilmiştir ve kurulum akışını doğrular.

Modelin iç yapısı, modüler bir mutfak gibi düşünülebilir: her iş için yalnızca gereken ocak yanıyor. Metin ve programlama sözdizimi 270 milyon parametrelik çekirdekte işleniyor; görsel girdiler ek bir görme birimini, ses kayıtları ise adanmış bir ses işlemcisini uyandırıyor. Kısa video kliplerdeki hareketli sahneler bile aynı çatı içinde okunuyor ve bütün ortamlar 768 sayılık standart dizilere dönüşüyor. 8K jetonluk (token) bağlam penceresi, dakikalar süren ses ve video parçalarının tek seferde ele alınmasına izin veriyor; video diliyle söylersek model bir seferde yaklaşık 8 bin kelimelik girdiyi yutabiliyor. Bu bilgi DeepMind kaynağından elde edilmiştir ve modüler yapı ile bağlam kapasitesini doğrular.

MRL sıkıştırma: küçült, neredeyse hiç kaybetme

En şık fikir, Matryoshka Temsili Öğrenmesi denen katmanlı sıkıştırma. Model önce 768 sayılık tam genişlikte dizi üretiyor; sonra bu diziyi 512, 256 hatta 128 sayıya kısaltabiliyorsunuz. Geliştirici rehberine göre 256 sayıda metin ve programlama niteliği neredeyse tamamen korunurken görsel, video ve konuşma tarafında orijinal niteliğin yüzde 95'i duruyor. Unsloth rehberi iki kritik inceliği ekliyor: kısaltmadan sonra dizileri normalize etmek gerekiyor ve FP16 duyarlığından uzak durulmalı, çünkü bu modelde bozuk gömme riski var; BF16 ya da FP32 güvenli liman. Kısaltma sırası tersine çevrilirse sonuç sessizce bozuluyor. Bu bilgi Unsloth kaynağından elde edilmiştir ve sıkıştırma kurallarını belgeler.

Sorgu tarafında iki küçük etiket büyük iş yapıyor. Arama sorgularının başına sorgu etiketi, arşivlenen belgelerin başına belge etiketi konuyor; model böylece elindeki metnin soru mu yoksa aday yanıt mı olduğunu anlıyor. Benzerlik ölçüsü olarak kosinüs benzerliği kullanılıyor: iki sayı dizisi matematiksel uzayda ne kadar yakınsa içerikler de o kadar ilişkili sayılıyor. Sunucu, Python dosyalarını programlama ortamı, ses uzantılı dosyaları konuşma sesi diye etiketleyip tek bir sözlükte topluyor. Tarayıcı içinde çalışan anlamlı arama denemeleri de aynı ilkeyi doğruluyor: gömme modeli istemcide koştuğunda gizlilik korunuyor ve sunucu maliyeti sınırlanıyor. Bu bilgi GlaForge kaynağından elde edilmiştir ve benzerlik yaklaşımını bağımsız biçimde destekler.

Demo günü modelin karnesi açıklanıyor. Ses kaydı soran sorgu, konuşma dosyasını bütün sıkıştırma düzeylerinde en üste taşıyor; MRL tekniğini soran Python işlevi sorgusu doğru dosyayı işaretliyor; turuncu-camgöbeği renk bileşimli fotoğraf sorgusu örnek fotoğrafı yüzde 90 düzeyinde yakalıyor. Tam genişlikte arşiv 30 MB yer tutarken 256 sayıya inmek alanın yüzde 83'e kadarını geri kazandırıyor ve doğruluk neredeyse hiç düşmüyor. Sunucunun aktardığına göre 512 sayı, üçte bir depolamayla yüzde 98 doğruluğu koruyan tatlı nokta. Rakamlar küçük bir ev arşivinden geliyor, ama eğilim resmi belgelerle aynı yönü gösteriyor. Bu paragraftaki ölçümler videodaki demoya aittir ve resmi kaynaklardaki eğilimle tutarlıdır.

Hafıza planı ve günlük kullanım

Hafıza bütçesi işe göre seçiliyor. Yalnızca metin ve belge işleyen 4 bit metin sürümü 200 MB düzeyinde kalıyor ve en hızlı programlama ile belge taramasını vadediyor. Görme ile ses-video birimleri eklenince ihtiyaç büyüyor; kuantalamasız 16 bit tam sürüm küçük sistemlerde 1.5 GB RAM'e kadar çıkarken en yüksek doğruluğu veriyor. Sunucunun önerisi net: ihtiyacınız olan birimden fazlasını yüklemeyin. Doğal cümlelerle eski anıları bulmak, kamera klasörlerini hiçbir yere yüklemeden taramak, uzun sohbet kayıtlarında konuşulan anın dakikasına zıplamak ve programlama dosyalarındaki mantık hatalarını kovalamak günlük kullanımın yıldızları. Gemma 4 ile paylaşılan sözlük sayesinde model, ailenin büyük üyeleriyle aynı uygulamalarda buluşabiliyor. Bu paragraftaki kullanım örnekleri videodaki anlatıma dayanır ve resmi belgelerdeki konumlandırmayla örtüşür.

Kapanışta pratik kural üç maddede özetleniyor. Önce görevi tanımlayın: metin yetiyorsa 270 milyon parametrede kalın, görsel ve ses gerekiyorsa kademeli büyüyün. Sonra 512 sayıyla başlayın; üçte bir depolamayla yüzde 98 doğruluk çoğu ev ve küçük ekip arşivine yeter. En sonda etiketleri ve normalize sırasını atlamayın: sorgu ile belge etiketleri modelin pusulası, kısaltma-sonrası normalize ise emniyet kemeri. Böylece pahalı bulut faturası ödemeden, dosyalarınızı kendi sisteminizde tutarak özel bir yerel model arşivi kurmuş olursunuz. Modelin 100'ü aşkın dili anlaması da çok dilli arşivler için kapıyı açık bırakıyor. Bu paragraftaki öneriler videodaki anlatım ile resmi rehberlerin ortak paydasıdır.

Görsel: nodesdaily AI
ÖzellikDeğer
Parametre740M toplam, 270M metin çekirdeği
Çıktı768 sayı, 512/256/128 kısaltma
LisansApache 2.0, ticari kullanıma açık

Videodaki anahtar anlar

  1. Dört ortamlı gömme modeline giriş
  2. Resmi ağırlıklar ve sıkıştırılmış dosya
  3. Ollama kaydı ve sohbet şablonu
  4. 270 milyon parametrelik metin çekirdeği
  5. Katmanlı sıkıştırma ve boyut seçenekleri
  6. Etiketli sorgu ve benzerlik hesabı
  7. Ses, programlama ve fotoğraf demoları
  8. Hafıza bütçesi ve pratik öneriler

AI yorumu

"Bu model, gizlilik ile pratikliği aynı cümlede buluşturuyor. Dosyalarını buluta taşımak istemeyen herkes için güçlü bir başlangıç noktası görüyorum, ancak demoları kendi arşivinizde doğrulamadan hüküm vermeyin."

AI değerlendirmesi

En güçlü karşı görüş, hafifliğin bedeliyle ilgili. Bulut tarafındaki dev gömme servisleri, özellikle deyim ve alan jargonu yüklü metinlerde hâlâ daha isabetli sonuçlar verebiliyor; 8B parametrelik rakiplerle yarışmak ile onları geçmek aynı şey değil. Videodaki 79 puan ve 38B sürümün yalnızca 2 puan gerisinde kalma iddiası da küçük bir ev arşivinden geliyor; gerçek kurumsal arşivlerde tablo değişebilir. Bu yüzden modeli tek ölçüt ilan etmeden önce kendi dosyalarınızla kör bir karşılaştırma yapmanız yerinde olur. Resmi kıyaslamalar MTEB programlama ve MAEB ses ölçütlerinde sınıfının en iyisi diyor, ama sınıf notuyla dünya şampiyonluğu karıştırılmamalı.

Eksik kalanlar listesi de dürüstçe not edilmeli. FP16 duyarlığındaki bozulma riski, acemi kullanıcıların sessizce yanlış sonuç almasına yol açabilir; rehberler BF16 öneriyor ama hata mesajı her zaman açık değil. 8K jetonluk pencere cömert görünse de saatler süren ham görüntüler için parçalama ve özetleme katmanı şart. Video kliplerde kısa sahneler iyi yakalanıyor, ancak uzun anlatı takibi bu modelin işi değil; o yükü üstteki üretici modele bırakmak gerekiyor. Ayrıca renk ve kompozisyon gibi yüzeysel eşleşmeler bazen içerik eşleşmesinden yüksek puan alabiliyor, yani yüzde 90'lık fotoğraf skoru her zaman anlam doğruluğu demek değil.

Sunucunun konumu da teraziye konmalı. Ray Codes kanalının Yapay Zekâyla İnşa Et serisi, yerel ve ücretsiz araçlara odaklanıyor; kanalın büyümesi bu tür coşkulu incelemelerden besleniyor. Açıklamadaki GitHub bağlantıları ve destek çağrısı, içeriğin bir vitrin işlevi de gördüğünü hatırlatıyor. Bu, gösterilen rakamları yalanlamaz ama yanlı örnekleme işaret eder: başarısız sorgular videoya girmemiş olabilir. Neyse ki çekirdek iddialar resmi belgelerle doğrulanabiliyor; lisans, parametre dağılımı ve sıkıştırma davranışı bağımsız kaynaklarda aynen yazıyor.

Okur için pratik çıkarım üç adımda netleşiyor. Kendi arşivinizin bir kopyasıyla 768 ve 512 sayıyı yan yana karşılaştırın; farkı göremiyorsanız küçük boyutta kalın ve kazandığınız alanı yeni dosyalara ayırın. Etiket düzenini ilk günden standartlaştırın, çünkü sonradan eklenen etiketsiz belgeler arama niteliğini düşürür. Son olarak metin ağırlıklı işlerde 270 milyon parametrelik çekirdekle başlayıp yalnızca ihtiyaç doğduğunda büyüyün; bu disiplin hem telefonunuzu hem de sabrınızı korur. Model sihirli değnek değil, ama iyi ayarlanmış bir ev arşivinin sessiz ve özel motoru olabilir.

Kaynaklar

8 bağlantı; 2 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

embeddinggemma 2 · google deepmind · yerel yapay zekâ · anlamlı arama · ollama · mrl sıkıştırma

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

Kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…