Gündeme dön

Mitra-v2 ve TabFM: Amazon'un 20 Kat Küçük Sentetik Modeli Google'ın Devini Nasıl Zorluyor

Amazon'un AutoGluon ekibinden Mitra-v2, yalnızca 29 milyon sentetik tabloyla eğitilmiş 77 milyon parametreli bir tablo temel modeli olarak 20 kat daha büyük Google TabFM ile 300'den fazla gerçek veride kafa kafaya geliyor; fark TabFM'in tek geçişte donuk tahminine karşın Mitra'nın 50 adımlık hızlı ince ayar ve 8'li oylama ile ağırlıklarını tabloya uyarlaması ve Apache 2.0 ile tamamen açık olması.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — l6os-gJHWeU
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Tablosal veriler iş dünyasının omurgası olmaya devam ediyor, fakat her yeni tablo için sıfırdan model kurmak hâlâ haftalar alıyor; Google TimesFM ile başlayan tahmin dalgasının ardından TabFM tablo dünyasına sıfır atış mantığını taşıdı, şimdi Amazon Mitra-v2 ile üçüncü bir örnek geliyor ve videodaki anlatıcı 22 yıllık bir inancı ikinci kez sorguladığını söylüyor, çünkü sentetik veriyle eğitilmiş küçük bir model aynı baseline'a birkaç dakikada ulaşıyor.

Mitra-v2, AutoGluon ekibinden çıkan tabloya özel bir temel model; 77 milyon parametreyle TabFM'den yaklaşık 20 kat daha küçük, 29 milyon sentetik tablo üzerinde ön-eğitim almış ve hiç gerçek tablo görmeden 300'den fazla gerçek veri kümesinde aynı noktada geziniyor, üstelik Apache 2.0 ile tamamen açık kaynak olarak GitHub ve Hugging Face üzerinden indirilebilir durumda.

Neden yalnızca sentetik veri? Gerçek tablolar çoğu zaman özel şemalar ve gizlilik duvarları yüzünden büyük ölçekte toplanamıyor; Amazon araştırması bu boşluğu yapısal nedensel modeller ve ağaç tabanlı öncüllerin karışımıyla dolduruyor, TabPFN'den beri bilinen öncül tasarımı ilkesini ilk kez sistematik inceliyor ve çeşitlilik ile ayırt ediciliğe göre seçilmiş karışık öncüllerle Mitra-1'i kuruyor, sonuç TabRepo, TabZilla, AutoML Benchmark ve TabArena'da özellikle 5 bin altı örnek ve 100 altı özellikli küçük-orta tablolarda TabPFNv2 ve TabICL'i geride bırakıyor.

İki modelin çalışma farkı videonun kalbini oluşturuyor; TabFM, bilinen etiketli satırları ve tahmin edilecek satırları tek bir birleşik istem gibi alıp hiçbir ağırlığı güncellemeden tek ileri geçişte tahmin üretiyor, Mitra-v2 ise varsayılanında önce tablon üzerinde 50 küçük düzeltme adımı uygulayıp yaklaşık bir dakikalık ince ayar yapıyor, ardından verinin farklı dilimlerinde sekiz kopyayı çalıştırıp oylarını ortalıyor, böylece ağırlıklar senin tablona göre gerçekten değişiyor.

Mimari, tabloyu metin gibi düzleştirmek yerine iki boyutu kucaklıyor; ham tablo önce kolonlar ve satırlar arasında gidip gelen dikkat katmanlarından geçiyor, sonra her satırın zengin bilgisi tek bir yoğun vektöre sıkıştırılıyor, en sonda ise in-context learning Transformer'ı bu sıkıştırılmış satır dizisi üzerinde çalışıyor, Google tarafında TabFM bu deseni hibrit bir tasarımla uyguluyor: 256 boyutlu gömüler, üç kolon ve üç satır dikkat bloğu, 24 ICL bloğu, 10 sınıfa kadar sınıflandırma, ayrı regresyon ve sınıflandırma kontrol noktaları, heterojen tipler ve eksik değerler doğal olarak ele alınıyor.

Geleneksel döngü sekiz adımda özetleniyor; veri toplama, temizleme ve aykırı değer düzeltme, öznitelik oluşturma ve birleştirme, model seçimi, hiperparametre ayarı, eğitim, doğrulama ve dağıtım, videoda kredi kartı dolandırıcılığı örneğiyle anlatılan bu yol bir haftayı bulurken, temel modeller bağlamı okuyarak özellik mühendisliğini ve ayarı büyük ölçüde devralıyor ve dakikalar içinde denenebilir bir baseline sunuyor.

Demo bu fikri canlıya taşıyor; anlatıcı antigravity, cloud code veya benzer ajanlarla kurulabilecek bir uygulama üzerinden her çağrıyı gerçek veriyle gösteriyor, iki senaryo var: ev fiyatı tahmini için 2 bin satır, 1800 bilinen 200 gizli, 9 kolon ve gerçekçi dağılımlar, diğeri makine arızası için 5 bin satır, 4000 bilinen 1000 gizli, biri regresyon diğeri sınıflandırma, yazar akışı anlatmak için ev fiyatını seçiyor.

Önce tablo okunuyor; satır ve kolon taraması birlikte süpürülüyor, ardından ince ayar başlıyor, 77 milyon ağırlık grafik karta yükleniyor, tablo modelin okuyabileceği sayılara yani gömülere dönüşüyor, 1800 bilinen ev üzerinde tutulan dilim karşısında 50 küçük düzeltme yapılıyor, hata eğrisi geri-ileri salınarak ihtiyaç kadar ayarlama gösteriliyor ve yaklaşık bir dakikada ağırlık kilitleniyor.

Oylama aşamasında seçili tek satır için sekiz dilimden gelen tahminlerin ortalaması 238.569 dolar olarak hesaplanıyor, gerçek değerle karşılaştırınca sapma yaklaşık 15 bin dolar, fakat toplu sonuçlara bakınca bazı satırlarda hata 2 dolara kadar iniyor, RMSE, R-kare ve ortanca gibi metrikler raporlanıyor, standart baseline'a göre hata %16,5 daha düşük ve ev başına 5.378 dolar tasarruf görünüyor, sonuçlar indirilebilir tablo olarak da sunuluyor.

İkinci senaryo önceden çalıştırılmış olarak gösteriliyor; makine arızası sınıflandırmasında karışıklık matrisi, doğruluk, kesinlik, duyarlılık, F1 ve AUC değerleri yüksek çıkıyor, hem regresyon hem sınıflandırma tarafında küçük bir dizüstü bilgisayarda birkaç satır kodla benzer başarı elde edilmesi, modelin pratikteki esnekliğini vurguluyor.

Videoyu kapatan soru net; hiç gerçek tablo görmemiş bir model 200 evi fiyatlayıp binin üzerinde makineyi işaretleyebiliyorsa veri bilimi bitti mi, yazarın yanıtı hayır, temizleme ve ayarlama kısalıyor ama tablonun doğruluğu ve yanlış yanıtın maliyeti hâlâ insanın sorumluluğu, ayrıca eğitim ucuzlarken çıkarım ağırlaşıyor, her tahminde tarihsel bağlamı yeniden işlemek gerekiyor, KV önbellek prefill'i bir kez ödeniyor fakat tek haneli milisaniye isteyen API'ler veya 1 milyondan büyük tablolarda örnekleme dezavantajı sürüyor, Mitra'nın 5 bin altı-100 özellik odağı ve TabFM'in 500 özellik sınırı ile lisans farkı da karar tablosunu tamamlıyor.

Görsel: nodesdaily AI
ÖzellikMitra-v2TabFM
Parametre77 milyon~1,6 milyar (20 kat)
Sentetik ön-eğitim29 milyon tabloYüz milyonlarca SCM
Uyarlanma50 adım + 8 oy ort.Tek geçiş, donuk
Lisans ağırlıkApache 2.0 açıkTabFM-NC 1.0 ticari-dışı
Ölçek odak300+ veride parity51 TabArena, 700-150K

AI yorumu

"Benim gözümde bu video veri bilimi bitti mi sorusunu abartmadan yanıtlıyor; haftalar süren temizleme-ayarlama döngüsünü dakikalara indiren bir demo izlemek heyecan verici, ama tablonun güvenilirliği ve yanlış tahminin bedelini hâlâ insanın üstlenmesi gerektiğini hatırlatması bence en değerli kısmı."

AI değerlendirmesi

Karşıt açıdan bakınca TabFM'in tek geçişte donuk tahmin yaklaşımı hız ve sadeliğiyle öne çıkıyor, özellikle BigQuery içinde AI.PREDICT olarak SQL bilen analistin doğrudan tablo yanında tahmin üretebilmesi gerçek bir ürün sinyali, Mitra'nın 50 adımlık ince ayarı ise açık kaynak esnekliği ve küçük-orta tabloda uyarlanabilirlik sunuyor, ikisi de üretimdeki ağır ayarlı ağacın yerini almakten çok hızlı baseline ve triyaj katmanı olarak değerli.

Eksik taraflar sentetikte gizli; öncüller gerçek dünyanın kirli eksik değer, yüksek kardinaliteli kategorik ve dağılım kaymasını ne kadar kapsıyor tam bilinmiyor, 300 ve 51 veri kümesindeki ortalama başarı alt gruplardaki zayıflığı gizleyebilir, GPU gereksinimi ve her tahminde bağlamı yeniden işlemenin maliyeti BigQuery'nin 30 Ekim 2026 sonrası token bazlı fiyatlamasında ölçekte pahalılaşabilir, kalibrasyon ve dilim analizi olmadan eşik seçmek riskli.

Doğrulanabilirlik Amazon Science 2025 MITRA makalesi ve Google Research 30 Haziran 2026 TabFM blogu ile VentureBeat ve InfoWorld aktarımlarına dayanıyor, 20 kat küçüklük ve 29 milyon sentetik tablo arXivDaily'nin %5 parametre başlığıyla kesişiyor, fakat 77 milyon karşısında ~1,6 milyar tam karşılaştırması TabFM model kartındaki 256-dim ve blok sayılarıyla birlikte bağımsız TabArena Elo tekrar üretimi ve AutoGluon 1.4 ile 1.5 entegrasyon ölçümlerinde teyit edilmeli.

Pratikte kime uygun sorusu ayrımı netleştiriyor; hızlı prototip, lean ekipler, yüksek drift'li iç araçlar, CRM kuyruğu ve destek biletlerini sıralama gibi insanın son kararı verdiği işlerde fayda yüksek, kredi onayı, tıbbi triyaj veya dolandırıcılık auto-block gibi yanlışın bedeli ağır olan düzenlenmiş kararlarda, ultra düşük gecikme veya 1 milyon üstü tablolarda ise XGBoost ve katı holdout, kalibrasyon ve izleme hâlâ zorunlu.

Kaynaklar

7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

yapay zeka · mitra-v2 · tabfm · amazon · küçük · sentetik · nodesdaily

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…