Google, satış, stok ve ciroyu verinize hiç dokunmadan tahmin ettiğini söylediği TimesFM-3 modelini yayımladı. İddia büyük: kendi verinizle sıfır eğitimle gelecek ayın tablosunu almak. Video, bu iddiayı bir dondurma şirketinin günlük satış verisiyle test ediyor.
TimesFM bir dil modeli değil, zaman serisi temel modeli. Mantık tanıdık: Gemini yarım cümleden sonraki kelimeyi kestirir, TimesFM ise daha önce görmediği bir grafiğe bakıp devamını çizer. İlk sürüm 2024'te geldi ve 100 milyar zaman noktasıyla beslendi: trend aramaları, sayfa görüntülemeleri, trafik, hava, satış ve sentetik veri.
Yeni sürüm iki şeyi büyütüyor: parametre sayısı 330 milyona, eğitim kümesi 1 trilyon noktanın üzerine çıktı. Asıl kırılma ise kapsamda: eski sürümler tek sinyali okuyordu, TimesFM-3 ise ilişkili ürün satışlarını, geçmiş ziyaretçi trafiğini ve bilinen gelecek bilgilerini (hava tahmini, tatil, planlı promosyonlar) aynı anda kullanıyor.
Modeli başarısız olana kadar zorlamak için sunucu kendi uygulamasını yazmış: 156 günlük dondurma satış kaydı, ilk 128 gün geçmiş, son 28 gün tahmin ufku. Sütunlarda satılan dondurma adedi, külah ve şurup satışları, promosyon bayrağı, sıcaklık ve mağaza trafiği var. Skor MAPE, MAE ve WAPE ile tutuluyor, her ek özelliğin ciro farkı da hesaplanıyor.
Promosyon, hava ve trafik bilgileri kapalıyken model MAPE'de 4,6-4,7 bandına oturuyor. Grafik fena değil ama mango promosyonlarının yarattığı ani sıçramaları ıskalıyor. Yani tek başına geçmiş satış, kampanya haftalarını açıklamaya yetmiyor.
Promosyon bilgisi açılınca tablo değişiyor: model kampanya sıçramalarını yakalıyor, MAPE belirgin şekilde düşüyor ve promosyonların ciroya katkısı görünür hale geliyor. Hava ve trafik sinyalleri tek tek eklenince tahmin yeniden kıpırdıyor; sunucu özellikle eylül-ekim soğuğunun dondurma satışını bastırdığına dikkat çekiyor. Sinyallerin bileşimi, tek sinyalden açıkça daha iyi çalışıyor.
Düello bölümünde TimesFM sıfır örnekle MAPE'de 4,73 yaparken Holt-Winters 8,89'da, mevsimsel naif yöntem 6,72'de kalıyor. Farklar net: Holt-Winters'tan 4,16 puan, naif yöntemden 1,99 puan daha iyi. Üstelik tek tahmin 203 milisaniyede, sıfır eğitimle geliyor.
Kutunun içi de anlatılıyor: model günü gününe okumak yerine sürekli yama denen teknikle 128 günü 32'şer günlük dört parçaya sıkıştırıyor. Benzetme yerinde: harf harf okumak yerine cümle cümle okumak. Gürültülü günlük dalgalanmalar eleniyor, genel eğilim öne çıkıyor; hızın sırrı da burada.
Mimari iki yönlü dikkatle çalışıyor: önce her satır yalnızca kendi geçmişine bakıyor ve geleceğe göz atmak matematiksel olarak yasak, böylece organik taban öğreniliyor. Sonra dikkat sütun boyunca dönüyor: eylül satışı henüz boşken planlı promosyon indirimi ve hava bilgisi aynı sütundan yukarı akıp tahmini yukarı taşıyor. Döngü transformatör katmanlarında 20 kez tekrarlanıyor; sunucu bunu geçmiş grafikleri okuyup masasındaki kampanya takvimine göz atan bir planlamacıya benzetiyor.
Hüküm dengeli: tahmin ekibi olmayan şirket için bu model iyileştirmeden fazlası; tahminin yokluğuyla varlığı arasındaki fark. Ama yarım puanlık sapmanın milyonlar ettiği büyük perakendede ekipler kendi verisiyle özel model eğitmeye devam edecek, çünkü tedarik kısıtı, ürün ikamesi ve fiyatlama stratejisini bu model göremez. Pratik notlar: kod GitHub'da, ağırlıklar ticari olmayan lisansla geliyor, ticari kullanımın yolu BigQuery entegrasyonundan geçiyor.
| Model | MAPE | Fark (puan) |
|---|---|---|
| TimesFM-3 (sıfır örnek) | 4,73 | — |
| Mevsimsel naif | 6,72 | +1,99 |
| Holt-Winters | 8,89 | +4,16 |
AI yorumu
"Sıfır örnek iddiasını sizin için en sert haliyle tarttım: çekirdek iddia sağlam, vitrin özellikleri verinize bağlı. Kuralım basit — tabanı önce TimesFM ile koyun, ekibinizi ancak bu çizgiyi geçen işe harcayın."
AI değerlendirmesi
En güçlü itirazı baştan, en cömert haliyle yazayım: bu düello tek bir dondurma veri setinde, tek tahmin penceresinde, sunucunun kendi uygulamasında koştu. Kayan pencereli, yirmi binden fazla tahminli bağımsız bir test sıfır örnek iddiasını doğruluyor; ama aynı testte yeni çok değişkenli özellikler testçinin verisinde fark yaratmamış. Yani çekirdek iddia sağlam, vitrin özellikleri veriye bağlı.
Videoda test edilmeyenler listesi uzun: tedarik kısıtları, ürünlerin birbirini yemesi ve fiyatlama kararları modele hiç girmiyor. Tek pencere şansı da yabana atılmaz; bağımsız testte pencereyi kaydırmak klasik modellerin skorunu yüzde 10 oynatmış. Ölçekte maliyet, gecikme bütçesi ve olasılıksal tahminlerin kalibrasyonu da açıkta kalmış.
Doğrulama tarafında iki katman var: kod Apache-2.0 lisanslı, ağırlıklar ise ticari olmayan kullanımla sınırlı; üründe kullanmanın yolu Google'ın veri platformundan geçiyor. Demo MAPE'si ve promosyonların ciro katkısı, bir karar toplantısına girmeden önce kendi verinizde bağımsız tekrar koşulmayı hak ediyor.
Benim çıkarımım net: tahmin ekibi kuramayan işletme için bu model anında bir taban çizgisi demek, BigQuery kullanan ekip için birkaç satır SQL ile tahmin demek. Ama yarım puanlık sapmanın milyonlar yazdığı ölçekte özel eğitim zorunlu kalıyor. Ben olsam tabanı önce bu modelle koyar, ekibin zamanını ancak bu çizgiyi geçen işe harcardım.
Kaynaklar
7 bağlantı; 2 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube AI with Surya — Google TimesFM-3 Klasik Tahminle Düelloda
- @research.google https://research.google/blog/timesfm-3-a-zero-shot-foundation-model-for-multivariate-forecasting/
Aynı kaynağı kullanan: Haftanın En Sıcak 10 GitHub Reposu: Archify'den Omarchy ve TimesFM'e — Görsel Koddan Agentic Linux'a
- @github https://github.com/google-research/timesfm
Aynı kaynağı kullanan: Haftanın En Sıcak 10 GitHub Reposu: Archify'den Omarchy ve TimesFM'e — Görsel Koddan Agentic Linux'a
- @cloud.google https://cloud.google.com/blog/products/data-analytics/timesfm-models-in-bigquery-and-alloydb
- @cloud.google https://docs.cloud.google.com/bigquery/docs/timesfm-model
- @dev.to https://dev.to/han-co/i-tested-googles-timesfm-3-the-zero-shot-claim-holds-the-new-features-dont-4ol4
- @andrew.ooo https://andrew.ooo/posts/timesfm-google-time-series-foundation-model-review/
timesfm · tahmin · google · yapay zeka · zaman serisi · bigquery