Tablosal veriler iş dünyasının omurgası olmaya devam ediyor, fakat her yeni tablo için sıfırdan model kurmak hâlâ haftalar alıyor; Google TimesFM ile başlayan tahmin dalgasının ardından TabFM tablo dünyasına sıfır atış mantığını taşıdı, şimdi Amazon Mitra-v2 ile üçüncü bir örnek geliyor ve videodaki anlatıcı 22 yıllık bir inancı ikinci kez sorguladığını söylüyor, çünkü sentetik veriyle eğitilmiş küçük bir model aynı baseline'a birkaç dakikada ulaşıyor.
Mitra-v2, AutoGluon ekibinden çıkan tabloya özel bir temel model; 77 milyon parametreyle TabFM'den yaklaşık 20 kat daha küçük, 29 milyon sentetik tablo üzerinde ön-eğitim almış ve hiç gerçek tablo görmeden 300'den fazla gerçek veri kümesinde aynı noktada geziniyor, üstelik Apache 2.0 ile tamamen açık kaynak olarak GitHub ve Hugging Face üzerinden indirilebilir durumda.
Neden yalnızca sentetik veri? Gerçek tablolar çoğu zaman özel şemalar ve gizlilik duvarları yüzünden büyük ölçekte toplanamıyor; Amazon araştırması bu boşluğu yapısal nedensel modeller ve ağaç tabanlı öncüllerin karışımıyla dolduruyor, TabPFN'den beri bilinen öncül tasarımı ilkesini ilk kez sistematik inceliyor ve çeşitlilik ile ayırt ediciliğe göre seçilmiş karışık öncüllerle Mitra-1'i kuruyor, sonuç TabRepo, TabZilla, AutoML Benchmark ve TabArena'da özellikle 5 bin altı örnek ve 100 altı özellikli küçük-orta tablolarda TabPFNv2 ve TabICL'i geride bırakıyor.
İki modelin çalışma farkı videonun kalbini oluşturuyor; TabFM, bilinen etiketli satırları ve tahmin edilecek satırları tek bir birleşik istem gibi alıp hiçbir ağırlığı güncellemeden tek ileri geçişte tahmin üretiyor, Mitra-v2 ise varsayılanında önce tablon üzerinde 50 küçük düzeltme adımı uygulayıp yaklaşık bir dakikalık ince ayar yapıyor, ardından verinin farklı dilimlerinde sekiz kopyayı çalıştırıp oylarını ortalıyor, böylece ağırlıklar senin tablona göre gerçekten değişiyor.
Mimari, tabloyu metin gibi düzleştirmek yerine iki boyutu kucaklıyor; ham tablo önce kolonlar ve satırlar arasında gidip gelen dikkat katmanlarından geçiyor, sonra her satırın zengin bilgisi tek bir yoğun vektöre sıkıştırılıyor, en sonda ise in-context learning Transformer'ı bu sıkıştırılmış satır dizisi üzerinde çalışıyor, Google tarafında TabFM bu deseni hibrit bir tasarımla uyguluyor: 256 boyutlu gömüler, üç kolon ve üç satır dikkat bloğu, 24 ICL bloğu, 10 sınıfa kadar sınıflandırma, ayrı regresyon ve sınıflandırma kontrol noktaları, heterojen tipler ve eksik değerler doğal olarak ele alınıyor.
Geleneksel döngü sekiz adımda özetleniyor; veri toplama, temizleme ve aykırı değer düzeltme, öznitelik oluşturma ve birleştirme, model seçimi, hiperparametre ayarı, eğitim, doğrulama ve dağıtım, videoda kredi kartı dolandırıcılığı örneğiyle anlatılan bu yol bir haftayı bulurken, temel modeller bağlamı okuyarak özellik mühendisliğini ve ayarı büyük ölçüde devralıyor ve dakikalar içinde denenebilir bir baseline sunuyor.
Demo bu fikri canlıya taşıyor; anlatıcı antigravity, cloud code veya benzer ajanlarla kurulabilecek bir uygulama üzerinden her çağrıyı gerçek veriyle gösteriyor, iki senaryo var: ev fiyatı tahmini için 2 bin satır, 1800 bilinen 200 gizli, 9 kolon ve gerçekçi dağılımlar, diğeri makine arızası için 5 bin satır, 4000 bilinen 1000 gizli, biri regresyon diğeri sınıflandırma, yazar akışı anlatmak için ev fiyatını seçiyor.
Önce tablo okunuyor; satır ve kolon taraması birlikte süpürülüyor, ardından ince ayar başlıyor, 77 milyon ağırlık grafik karta yükleniyor, tablo modelin okuyabileceği sayılara yani gömülere dönüşüyor, 1800 bilinen ev üzerinde tutulan dilim karşısında 50 küçük düzeltme yapılıyor, hata eğrisi geri-ileri salınarak ihtiyaç kadar ayarlama gösteriliyor ve yaklaşık bir dakikada ağırlık kilitleniyor.
Oylama aşamasında seçili tek satır için sekiz dilimden gelen tahminlerin ortalaması 238.569 dolar olarak hesaplanıyor, gerçek değerle karşılaştırınca sapma yaklaşık 15 bin dolar, fakat toplu sonuçlara bakınca bazı satırlarda hata 2 dolara kadar iniyor, RMSE, R-kare ve ortanca gibi metrikler raporlanıyor, standart baseline'a göre hata %16,5 daha düşük ve ev başına 5.378 dolar tasarruf görünüyor, sonuçlar indirilebilir tablo olarak da sunuluyor.
İkinci senaryo önceden çalıştırılmış olarak gösteriliyor; makine arızası sınıflandırmasında karışıklık matrisi, doğruluk, kesinlik, duyarlılık, F1 ve AUC değerleri yüksek çıkıyor, hem regresyon hem sınıflandırma tarafında küçük bir dizüstü bilgisayarda birkaç satır kodla benzer başarı elde edilmesi, modelin pratikteki esnekliğini vurguluyor.
Videoyu kapatan soru net; hiç gerçek tablo görmemiş bir model 200 evi fiyatlayıp binin üzerinde makineyi işaretleyebiliyorsa veri bilimi bitti mi, yazarın yanıtı hayır, temizleme ve ayarlama kısalıyor ama tablonun doğruluğu ve yanlış yanıtın maliyeti hâlâ insanın sorumluluğu, ayrıca eğitim ucuzlarken çıkarım ağırlaşıyor, her tahminde tarihsel bağlamı yeniden işlemek gerekiyor, KV önbellek prefill'i bir kez ödeniyor fakat tek haneli milisaniye isteyen API'ler veya 1 milyondan büyük tablolarda örnekleme dezavantajı sürüyor, Mitra'nın 5 bin altı-100 özellik odağı ve TabFM'in 500 özellik sınırı ile lisans farkı da karar tablosunu tamamlıyor.
| Özellik | Mitra-v2 | TabFM |
|---|---|---|
| Parametre | 77 milyon | ~1,6 milyar (20 kat) |
| Sentetik ön-eğitim | 29 milyon tablo | Yüz milyonlarca SCM |
| Uyarlanma | 50 adım + 8 oy ort. | Tek geçiş, donuk |
| Lisans ağırlık | Apache 2.0 açık | TabFM-NC 1.0 ticari-dışı |
| Ölçek odak | 300+ veride parity | 51 TabArena, 700-150K |
AI yorumu
"Benim gözümde bu video veri bilimi bitti mi sorusunu abartmadan yanıtlıyor; haftalar süren temizleme-ayarlama döngüsünü dakikalara indiren bir demo izlemek heyecan verici, ama tablonun güvenilirliği ve yanlış tahminin bedelini hâlâ insanın üstlenmesi gerektiğini hatırlatması bence en değerli kısmı."
AI değerlendirmesi
Karşıt açıdan bakınca TabFM'in tek geçişte donuk tahmin yaklaşımı hız ve sadeliğiyle öne çıkıyor, özellikle BigQuery içinde AI.PREDICT olarak SQL bilen analistin doğrudan tablo yanında tahmin üretebilmesi gerçek bir ürün sinyali, Mitra'nın 50 adımlık ince ayarı ise açık kaynak esnekliği ve küçük-orta tabloda uyarlanabilirlik sunuyor, ikisi de üretimdeki ağır ayarlı ağacın yerini almakten çok hızlı baseline ve triyaj katmanı olarak değerli.
Eksik taraflar sentetikte gizli; öncüller gerçek dünyanın kirli eksik değer, yüksek kardinaliteli kategorik ve dağılım kaymasını ne kadar kapsıyor tam bilinmiyor, 300 ve 51 veri kümesindeki ortalama başarı alt gruplardaki zayıflığı gizleyebilir, GPU gereksinimi ve her tahminde bağlamı yeniden işlemenin maliyeti BigQuery'nin 30 Ekim 2026 sonrası token bazlı fiyatlamasında ölçekte pahalılaşabilir, kalibrasyon ve dilim analizi olmadan eşik seçmek riskli.
Doğrulanabilirlik Amazon Science 2025 MITRA makalesi ve Google Research 30 Haziran 2026 TabFM blogu ile VentureBeat ve InfoWorld aktarımlarına dayanıyor, 20 kat küçüklük ve 29 milyon sentetik tablo arXivDaily'nin %5 parametre başlığıyla kesişiyor, fakat 77 milyon karşısında ~1,6 milyar tam karşılaştırması TabFM model kartındaki 256-dim ve blok sayılarıyla birlikte bağımsız TabArena Elo tekrar üretimi ve AutoGluon 1.4 ile 1.5 entegrasyon ölçümlerinde teyit edilmeli.
Pratikte kime uygun sorusu ayrımı netleştiriyor; hızlı prototip, lean ekipler, yüksek drift'li iç araçlar, CRM kuyruğu ve destek biletlerini sıralama gibi insanın son kararı verdiği işlerde fayda yüksek, kredi onayı, tıbbi triyaj veya dolandırıcılık auto-block gibi yanlışın bedeli ağır olan düzenlenmiş kararlarda, ultra düşük gecikme veya 1 milyon üstü tablolarda ise XGBoost ve katı holdout, kalibrasyon ve izleme hâlâ zorunlu.
Kaynaklar
7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube YouTube — AI with Surya: Mitra-v2 vs. TabFM
- @amazon.science https://www.amazon.science/publications/mitra-mixed-synthetic-priors-for-enhancing-tabular-foundation-models
- @research.google https://research.google/blog/introducing-tabfm-a-zero-shot-foundation-model-for-tabular-data/
- @venturebeat https://venturebeat.com/technology/googles-tabfm-skips-per-dataset-training-and-still-predicts-on-tables-its-never-seen
- @marktechpost https://www.marktechpost.com/2025/07/23/amazon-researchers-reveal-mitra-advancing-tabular-machine-learning-with-synthetic-priors/
- @infoworld https://www.infoworld.com/article/4217530/google-brings-predictive-ai-to-bigquery-without-the-ml-training.html
- @reidmarlow https://reidmarlow.com/google-tabfm-sql-tabular-ai/
yapay zeka · mitra-v2 · tabfm · amazon · küçük · sentetik · nodesdaily