Eylülün üçüncü haftasında iki gelişme, görünürde birbirinden çok farklı dünyalarda gerçekleşti. Biri San Francisco merkezli bir yapay zeka laboratuvarında, diğeri Washington ile Yorktown Heights arasında, Ay yüzeyini tarayan veri kümeleri üzerine. Ortak soru şuydu: bir modelin görevi gerçekten daha çok metin üretmek mi, yoksa daha az metinle daha doğru karar vermek mi? İki taraf da ikinci cevaba yöneldi.
TypeSafe tarafındaki ürün Jev. Şirket, bunu bir sohbet modeli değil, bir karar modeli olarak konumlandırıyor: yazılımın sorusunu alıyorsunuz, karşılığında tipli değerler ve bunlara eşlik eden olasılıklar dönüyor. Modelin üretken bir metin üretmesi yerine, yazılımın doğrudan dallanabileceği sabit bir şema üretmesi hedefleniyor. Sitenin kendi ifadesiyle model, önceden tanımlanmış olası çıktılar kümesi dışına çıkamıyor; bu da tip hatasını yapısal olarak imkânsız kılıyor.
Bu tasarımın teknik sonucu önemli. Geleneksel bir dil modeli cümle üretirken her adımda sıralı ilerler: bir jeton üretilir, sonraki onun üzerinden kurulur. Donanım tarafında bu, her adımda model durumunun okunup geri yazılması anlamına gelir. Jev'de ise tüm çıktılar tek sorguda paralel üretiliyor. Hız ve maliyet farkının kaynağı büyük ölçüde bu mimari değişiklik, yani yeni bir matris çarpma yöntemi değil, donanıma ne sorulduğunun değiştirilmesi.
Jev'in farklı kıldığı ikinci konu kalibrasyon. Bir model yüzde 60 eminim derse, bu sayının gerçekten yaklaşık yüzde 60 doğru olması gerekir. Panelde bunun sadece bir zarafet değil, otomasyonun ön koşulu olduğu vurgulandı: bir işi yüzde 95 oranında yapan ama kalan yüzde 5'te nereye düşeceğini söyleyemeyen model, o işi otomatikleştirilemez. Kalibre edilmiş bir güven skoru, eşiği kimin ve nasıl belirleyeceği sorusunu da öne çıkarıyor.
Bu ayrımın teknik bir karşılığı var ve panelde üzerinde duruldu. Olasılık, dağılımsal ve matematiksel bir tanımdır; güven ise daha çok bir eşik kararıdır. Arayüzde kullanıcıya tek bir sayı veriliyorsa, aslında bir olasılık dağılımı ve üstünde seçilmiş bir eşik gösteriliyor demektir. Bu eşiği kim, hangi veriyle belirliyor sorusu modelin değil, uygulamanın sorusudur. Jev'in iddiası, çıktıların birbirine gore siralamasinin tutarli oldugu yönünde.
Panelin farklı çekimserleri aynı noktaya işaret etti. Bir yanda, bu modellerin LLM'lerin yaptığı her iş için uygun olmadığı, yalnızca belirli bir alt küme için anlamlı olduğu vurgulandı: sınıflandırma, yönlendirme, puanlama. Öte yanda, doğrusal programlama modellerinin sıralı mantığı gevşetip yalnızca karar noktalarında böyle bir model çağırabileceği, böylece yazılımın geri kalanının belirlenimci kalabileceği öne sürüldü. Bu, modeli sohbet kutusundan çıkarıp bir bileşen haline getiriyor.
Fiyatlandırma da aynı fikrin ticari tarafı. Jev, milyon jeton giriş için 0,042 dolar, çıktı için ise ölçüm altına düşeceği kadar düşük bir tarife ile konumlandırılıyor. Karşılaştırma tablosundaki devasa fark, bir modelin yazılım içinde saniyede yüzlerce kez çağrılabileceği gerçeğiyle ilgili. Kullanıcıya metin göstermek için tasarlanmış bir model, bu kullanım deseninde hem pahalı hem de yavaş kalır.
Ancak burada da bağımsız ölçüm gerekiyor. Şirketin kendi iş akışı testleri çok büyük kazançlar bildiriyor; aynı dönemde bağımsız değerlendirmeler, pahalı sınır modelleriyle kıyaslandığında çok daha küçük ama gerçek bir hız ve maliyet avantajına işaret ediyor. Bu iki tür rakam arasındaki mesafe, şirketin seçtiği karşılaştırma tabanına bağlı. Karar verirken ücretlendirme sayfasındaki güncel rakamları kendi senaryonuzla yeniden ölçmek gerekiyor.
İkinci büyük gelişme, IBM ile NASA arasında. Eylülün onunda iki kurum, Ay keşfi için açık kaynaklı bir temel model yayımladı. Modelin arkasındaki veri seti, dört görevden dokuz aletin verilerini uzamsal olarak hizalayarak otuzdan fazla katmandan oluşuyor. Daha önce bu tür çok modlu, çok çözünürlüklü veriyi makine öğrenmesine hazır hâle getiren tek bir kamuya açık veri seti yoktu; bu boşluğu dolduruyor.
Modelin iki somut sonucu var. Birincisi, yüksek buz potansiyeli taşıyan bölgeleri belirlemede hata oranının referans modele göre yüzde 22'ye kadar düştüğü. İkincisi, yaklaşık yüz metrelik bağlam ölçeğinde, referans modeli yarı veriyle yaklaşık yüzde 19 geride bırakması. NASA'nın kendi değerlendirmesi daha temkinli: krater eşleme ve bazı volkanik alanlarda sonuçlar benzer, belirgin üstünlük kutuplu buzun kararlılığını tahmin etmede ortaya çıkıyor. Aynı zamanda yörüngeler arasında değişen aydınlatma koşullarının küçük kraterlerin görünürlüğünü etkilediği not düşülmüş.
Bu modelin asıl değeri, tek bir soruya odaklanmak yerine yeniden kullanılabilir bir temel sunması. Dört farklı görev için ayrı model eğitmek yerine, ortak bir temeli uyarlamak (fine-tune, ince ayar) yaklaşımı benimsenmiş; ağırlıkların büyük kısmı dondurularak küçük uyarlayıcılar kullanıldığı belirtiliyor. Bu, hem daha az eğitim maliyeti hem de topluluk için daha kolay bir başlangıç noktası anlamına geliyor. Bilimsel veri tarafındaki asıl darboğazın çoğu zaman algoritma değil, veri mühendisliği olduğunun somut bir örneği.
Ay verisi özel bir durum çünkü her şey farklı ölçeklerde. Bir görev yüz metrelik, diğeri metre ölçeğinde; bazı katmanlar yüzeyden, bazıları yeraltından geliyor. Bu yüzden veri setini tek bir çözünürlükte hizalamak, modeli eğitmek kadar zorlu bir iş. Panelde tam da bu noktaya duruldu: farklı çözünürlük ve gözlem koşullarını hizalamak, parametre sayısını artırmak kadar belirleyici olabilir. Kısacası temel modelin altındaki asıl iş, kavramsal değil bürokratik.
İki gelişmeyi bir araya getirdiğimizde aynı eğilim görünüyor. Biri kararın kendisini yapılandırılmış ve kalibre edilmiş hâle getirmekle, öteki veriyi tek bir makine öğrenmesi diline indirgemekle uğraşıyor. İkisinde de hedef, modelin ürettiği metnin zenginliği değil, çıktının denetlenebilirliği. Bu, model ekonomisinin yeni birimini de tanımlıyor: üretilen cümle sayısı değil, doğrulanabilir karar sayısı.
Pratikte bu iki yaklaşımı birleştirmek mümkün görünüyor. Sıralı, uzun ve az sayıda adımdan oluşan bir iş akışını belirlenimci bir program iskeleti üzerine kurup, yalnızca dallanma gerektiren noktalarda kalibre edilmiş bir karar modeli çağırmak, hem maliyeti düşürür hem de hata yüzeyini küçültür. Bu desen, yazılım dünyasında zaten var olan bir fikrin yapay zekâya uyarlanmış hâli: kuralı koda yaz, belirsizliği makineye bırak ama hangi eşikte karar vereceğini sen belirle ve kaydet.
Sonuç olarak eylülün bu iki haberi, model geliştirme yarışının nereye gittiğine dair iki farklı ama uyumlu işaret. Bir tanesi ürün sayfasında, diğeri bilimsel veri setinde görünür oluyor. Kalan soru şu: bu tür yapılandırılmış karar modelleri, kendilerini besleyen veri setleri kadar açık ve doğrulanabilir olduğunda, altyapı maliyetini düşürmekten öte, sistemin tamamının güvenilirliğini de yükseltecek mi?
Kutuplu buz hatasindaki azalma
- Referans model100
- NASA-IBM modeli78
- Yuzde 22 daha az hata22%
| Ölçüt | Jev | NASA-IBM modeli |
|---|---|---|
| Odak | Karar kalitesi | Veri hizalaması |
| Cikti bicimi | Tipli degerler ve olasiliklar | Harita ve siniflandirma ciktilari |
| Teknik dayanak | Paralel uretim | Ortak uzamsal cerceve |
| Ana sinir | Yaratici isler uygun degil | Aydinlatma kosullari etkili |
| Ortak nokta | Denetlenebilirlik onceliklidir | Denetlenebilirlik onceliklidir |
Videodaki anahtar anlar
AI yorumu
"Bu iki gelişme, model yarışının artık zekadan çok karar kalitesine kaydığını gösteriyor. Jev'in iddiası şu: çoğu görevde bir modelin söylemesi gereken şey cümle değil, seçim ve olasılıktır. NASA-IBM modeli de aynı mantığın bilim tarafını gösteriyor: veriyi toplamak kadar, onu tek bir ölçekte karşılaştırılabilir hâle getirmek de zaman alıyor."
AI değerlendirmesi
En iddialardan en güçlüsü, Jev'in yazılım içinde karar modeli olarak konumlandırılması ve bunun mimari gerekçesi. Sıralı jeton üretimine karşı paralel çıktı üretimi, hem hız hem de maliyet iddiasını fiziksel olarak anlaşılır kılıyor. NASA-IBM modeli için de veri setini hizalama kararı aynı değeri taşıyor: modelden önce gelen şey, veriyi ortak bir çerçeveye sokmaktır.
Eksik kalan yer, bağımsız doğrulamanın sınırlı olması. Jev'in kendi iş akışı testleri ile bağımsız değerlendirmeler arasında ciddi bir fark var ve bu fark, şirketin karşılaştırmayı hangi tabana kurduğuna bağlı. Aynı şekilde Ay modelinde küçük kraterlerin görünürlüğünü etkileyen aydınlatma koşulları, bazı görevlerde ölçüm sonuçlarını etkileyebilir. Yani her iki tarafta da sonuç, veri ve karşılaştırma tabanı seçimine duyarlı.
Karşı görüş: bu yaklaşımın sınırı, tam da kazandığı yerde. Karar modeli bir görevi daha iyi yapmaz; yalnızca o görevi daha az maliyetle ve daha kontrollü biçimde yapar. Bu, sınıflandırma ve yönlendirme için büyük kazançtır ama açık uçlu üretim, yaratıcı yazım veya belirsiz problem çözme gibi alanlarda önceki nesil modellerin yerini almaz. Dolayısıyla bu bir ikame değil, katmanlamadır.
Pratik çıkarım: bir sonraki mimari kararınızı yazılım iskeleti üzerinden verin. Uzun ve sıralı akışları belirlenimci kodla kurun, dallanma gerektiren noktalarda kalibre edilmiş karar modeli çağırın, ve eşiği kendi verinizle belirleyip kaydedin. Bu desen, iki gelişmeyi tek bir mühendislik kararında birleştiriyor ve denetlenebilirliği varsayılan hâle getiriyor.
Kaynaklar
7 bağlantı; 1 tanesi 3 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube https://www.youtube.com/watch?v=O4n1jtWzt30
- @typesafe.ai https://typesafe.ai/blog/introducing-system-one-models-and-jev
Aynı kaynağı kullanan: Konuşmayan Model Jev: Claude Code'u Hızlandıran 7 Ücretsiz Repo · Jev: Claude Code'u 10 Kat Hızlandıran Sistem 1 Modeli · ChatGPT'den Sonra En Büyük Kırılma mı: TypeSafe'in Sistem Bir Modeli Jev
- @typesafe.ai https://typesafe.ai/
- @newsroom.ibm.com https://newsroom.ibm.com/2026-09-10-ibm-and-nasa-release-open-source-ai-model-to-support-lunar-exploration
- @science.nasa.gov https://science.nasa.gov/science-research/artificial-intelligence-lunar-foundation-model/
- @research.ibm.com https://research.ibm.com/blog/nasa-ibm-lunar-foundation-model
- @research.ibm.com https://research.ibm.com/publications/from-orbits-to-insights-a-foundation-model-for-lunar-science
yapay zeka · jev · kalibrasyon · temel modeller · nasa ibm · veri mikromehendisligi · nodedaily