Bu haftanın yapay zekâ gündemi, alışıldık model tanıtımının çok ötesine geçti. Aynı yedi gün içinde üç dünya modeli, dört açık ağırlıklı dil modeli, iki robot hareket ve el modeli, birkaç küçük yerel model ve uzayda yapay zekâ altyapısı kurma girişimi bir arada duyuruldu. Ortaya çıkan tablo şu: üretimde kalan iş yükü açık ağırlıklı modeller, gerçek zamanlı ses üretimi ve fiziksel dünya simülasyonu başlıklarında yoğunlaşıyor. Kapalı modeller tarafında ise tek yönlü bir yükseliş yerine, aynı aile içinde farklı maliyet katmanlarına ayrılan bir portföy beliriyor.
Dünya modelleri üç boyutlu hafızaya yöneliyor
Haftanın en görünür üçlüsü, video üretimini üç boyutlu hafıza destekli hâle getirmeye çalışan modeller oldu. WorldCrafter, tek bir metin ya da referans görselden keşfedilebilir bir dünya kuruyor ve bunu yaparken üç boyutlu nokta bulutunu yeniden kuruyor; böylece bakıp uzaklaştığınızda nesneler kaybolmuyor. WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory adlı çalışmanın arXiv kaydı bu yaklaşımı özetliyor. Proje sayfasındaki vurgu da buna: bir dünyayı keşfetmek, ona bakmayı bıraktığınızda onu kaybetmek anlamına gelmemeli. İkinci araç MirrorScene, tamamen farklı bir problemi çözüyor: elimizde video yok, yalnızca tek bir fotoğraf var. Nesneleri ayırıp sahne derinliğini kestirerek her nesne için üç boyutlu geometri üretiyor ve konumları fotoğraftakilerle eşleştiriyor. Böylece bir fotoğraftaki her nesne ayrı ayrı seçilebilir hâle geliyor; nesne Blender'a aktarılabiliyor ya da bir fizik simülatörüne bağlanıp robot eğitimi için kullanılabiliyor. Bu ayrıştırma yaklaşımı, tek görselden sahne üretme yöntemlerinin çoğundan farklı olarak nesneleri ayrık tutuyor ve iş akışını bugün kullanılabilir kılıyor.
Üçüncüsü GAE, Geometry-Native Autoencoder ifadesinden adını alıyor ve çalışmanın başlığı konuyu doğrudan ele veriyor: öğrenilmiş gizil uzayın kendisinin geometriye bağlı olması. GAE çalışması, modelin yalnızca video üretmediğini, aynı anda derinlik haritası, kamera hareketi yolu ve sahnenin üç boyutlu yeniden kurulumunu ürettiğini anlatıyor. Ağırlıkların toplamının 12 GB'ın altında kalması ve eğitim ile değerlendirme kodunun da paylaşılması, alanın artık yalnızca video üretimiyle değil tekrarlanabilir deneylerle de ilgilendiğini gösteriyor.
Açık ağırlık tarafında birim maliyet savaşı
Açık ağırlıklı modellerde sıralamayı değiştiren şey zekâ endeksinden çok görev başına maliyet oldu. Xiaomi'nin MiMo-V2.6-Pro modeli, Artificial Analysis'ın açık modeller listesinde en yüksek puanı alan isim oldu; karşılaştırma sayfası modeli GLM-5.3 ile yan yana koyuyor ve aradaki farkın bir puanla sınırlı kaldığını gösteriyor. VentureBeat'in haberine göre model, DeepSeek sonrası açık ağırlıklı dünyada birinci sırayı aldı. Model seyrek bir mimari kullanıyor: bir trilyon parametre civarında, her çalıştırmada ise çok daha küçük bir bölüm etkinleşiyor kullanıyor; bu, büyük modelin avantajını yerel donanımda taşınamama maliyetinden kurtarıyor. Aynı aileden Flash sürümü daha küçük ve daha ucuz. Model kartları ve bağımsız fiyat derlemeleri, Pro sürümünün görev başına onlarca sent, Flash'ın ise on iki sent civarında bir maliyete indiğini gösteriyor. Buradaki ilginç olan şey, maliyetin nerede kesildiği değil, hangi işin artık pahalı sayılmadığı: iki saniyelik bir işlevi otomatikleştirmek için ortalama bir kozmetik yapay zekâ modelini kullanmaya gerek kalmıyor. SiliconANGLE (siliconangle.com) da aileyi açık kaynak model ailesi olarak duyurdu.
Çinli ikinci laboratuvar StepFun da bu arada kendi amiral gemisini sundu. Step 5 Preview, altı yüz milyar parametreli seyrek bir uzman karışımı modeli ve çalıştırıldığında yirmi yedi milyar parametre etkinleşiyor; model kartı bu ayrımı açıkça belirtiyor. Model bir milyon token'a uzanan bağlam penceresi destekliyor ve önceliği yazılım mühendisliği ile finansal araştırmaya veriyor. Artificial Analysis'in model karşılaştırma sayfası, Step 5'in endekste GLM-5.3'ten bir puan geride kaldığını, buna karşılık maliyetinin yaklaşık üç kat daha düşük olduğunu ortaya koyuyor. Hugging Face model kartı da aktif ve toplam parametre ayrımını açıkça yazıyor. GitHub deposundaki model kartı aynı mimariyi doğruluyor.
Üçüncü açık ağırlık sürümü, çoğunluğun ilgisini çekmediği bir model. dots3-note preview, 280 milyar toplam ve 16 milyar etkin parametreye sahip seyrek bir mimari kullanıyor ve 512 bin token'a uzanan bağlam penceresi destekliyor. Model kartı, küçük bir modelin neden büyük rakiplerine yaklaştığını en iyi şekilde ARC-AGI testinde gösteriyor: bu test, modeli hiç görmediği bir oyun ortamına bırakıp kuralları kendisinin öğrenmesini istiyor. Dönüştürücü ağırlıklarının sabit olması nedeniyle bu tür testler çoğu model için çok zordur; FP8 sürümünün tam sürümün yarısına yakın boyutta olması da pratik dağıtım için önemli. Tek işe odaklı küçük modeller de ilginç bir alt küme oluşturuyor. Paradigma'nın Limite 1B adlı modeli, yalnızca zor matematik problemlerini çözmek için tasarlanmış bir milyar parametreli yapı; Hugging Face (huggingface.co) model kartındaki matematik yarışması testi skoru yüzde doksan dört civarında ve toplam paket iki gigabaytın altında. Aynı haftanın güvenlik odaklı sürümü Aikido Altar, GLM-5.3 üzerine inşa edilmiş ve uzmanlarının bir bölümü çıkarılarak dört yüz GB'nin altına (INT4) indirilmiş. AikidoSec model kartındaki güvenlik testi sonucu, küçültülmüş sürümün tam modelin yeteneğinin büyük kısmını koruduğunu gösteriyor.
Ses, robot ve uzay donanımı
Google'ın yeni metin-konuşma modelleri, haftanın ses tarafını taşıyor. Gemini 3.8 Flash TTS ve daha ucuz olan Flash-Lite sürümü, yazılı bir yönlendirmeyle tamamen yeni bir ses tasarlamayı mümkün kılıyor; model açıklamaları stüdyo kalitesinde ses sadakati, ifade oyunculuğu ve gerçek bölgesel aksanlar üzerine duruyor. Google'ın blog yazısı iki modelin birlikte duyurulduğunu ve AI Studio ile Gemini API üzerinden kullanılabilir olduğunu doğruluyor.
Robot tarafında iki farklı yaklaşım öne çıktı. Black Forest Labs (bfl.ai), görüntü ve video modellerinden sonra bu kez bir robot hareket modeli yayımladı: FLUX 3 Action, kamera karesi ve metinsel talimatı alıp sonraki iki saniyelik eylemi döndüren yedi milyar parametreli açık ağırlıklı bir dünya-eylem modeli. The Decoder (the-decoder.com) haberi ve Black Forest Labs duyurusu, Hugging Face (huggingface.co) blog yazısı, DROID veri kümesi üzerinde ince ayarlandığında RoboLab başarı tablosunda birinci sıraya çıkıyor; model kartı, ağırlıkların on dört gigabayt civarında indirilebildiğini belirtiyor. Bu boyut, hareket modelini gerçek zamanlı robot kontrolü için pratik bir aday hâline getiriyor. Sistem Bir düşüncesi de bu hafta açık bir sürümle karşılık buldu. Konuşmacı, hızlı ve ani karar veren, derin akıl yürütmeden önce yanıt üreten model sınıfını anlatırken Stanford ve Nvidia'nın birlikte yayımladığı CLM projesini işaret ediyor. CLM-8B, ürettiği metin dizisi yerine her seçenek için bir olasılık puanı dönüyor ve testlerde önceki JEVA modelinden dokuz kata kadar hızlı koştuğu hâlde çoğu durumda benzer başarı gösteriyor. Nedeni basit: birkaç oyun ya da araç durumu sadece anlık bakıştan ve seçimden ibaret. Black Forest Labs bu yönelimi kendi duyurusunda da vurguluyor.
İnsan biçimli robotlarda ise gösteri dolu bir hafta yaşandı. UBTECH, gerçekçi yüz ve saç detaylarıyla tasarladığı U1 serisinin ilk partilerini sevkiyata başladığını duyurdu; kaynaklara göre on üç binin üzerinde ön sipariş ve on altı bin beş yüz dolardan başlayan fiyatlar söz konusu. Unitree ise yirmi iki serbestlik derecesine sahip, insan boyunda bir becerik el tanıttı; tanıtım videolarında parmakların esneme hareketleri, piyano tuşları ve kâğıt kesme gösteriliyor. Skild AI'nin S1 modeli ise bambaşka bir şeyi kanıtlıyor: NVIDIA Isaac Sim içinde kendi kendine karşı oynayarak öğrenen bir futbolcu, simülasyonda yüz kırk yılı aşkın oyun süresi oynadı. Therobotics Media'nin aktardığı simülasyon süresi, ölçeğin somut bir göstergesi.
Google'ın Sun Catcher projesi ise en iddialı ve en erken aşamadaki girişim. Reuters'in haberine göre şirket, Trillium nesil yapay zekâ işlemcilerini taşıyan bir prototip uyduyu fırlatmayı planlıyor; Ars Technica (arstechnica.com) ise uydunun dört işlemciyle ve on beş dakikalık çalışma bloklarıyla sınırlı olacağını yazıyor. Google araştırma blogunda projenin güneş enerjili uydu takımlarını işlemciler ve serbest uzay optik bağlantılarıyla donatmayı hedeflediği anlatılıyor. Alçak yörüngede güneş ışığı sürekli olduğu için yeryüzüne göre belirgin biçimde daha fazla enerji üretilebileceği, dört ayrı engelin de fırlatma titreşimi, radyasyon, soğutma ve lazer bağlantısı başlıklarında çözülmesi gerektiği vurgulanıyor. Ars Technica'nın aktardığı test süresi, programın olgunluk derecesini gösteriyor.
Kapalı modellerde fiyat katmanları
Kapalı tarafta OpenAI, GPT-6 ailesinin orta ve ucuz sınıflarını tanıttı. OpenAI'ın duyurusunda Astra, Sol ve Luna olmak üzere üç sınıfın en akıllıdan en ucuza doğru sıralandığı ve orta sınıf Sol'un en pahalı sınıfa göre belirgin ölçüde ucuz olduğu anlatılıyor. Luna sürümü görev başına yaklaşık yedi sent gibi çok düşük bir maliyetle, hızlı ve basit işler için konumlanıyor. Kapalı tarafta fiyat aralığının iki büyüklük mertebesi birimice araya girdiği bu hafta, en ucuz Claude sürümüyle yapılan karşılaştırmada yüzlerce kat fark ortaya çıkıyor.
Anthropic'in Opus 5.5 sürümü bu haftanın kapalı tarafındaki ana sürüm olarak öne çıktı. Anthropic'in duyurusu modeli Claude 5.5 ailesinin ilk üyesi olarak tanımlıyor ve platform belgeleri bir milyon token'a uzanan bağlam penceresi ile milyon başına dört dolar giriş, yirmi dolar çıkış fiyatlarını listeliyor. Konuşmacının kendi ölçümleri üç boyutlu tasarım, kodlama ve web üzerinde arayüz çalışması konularında çok güçlü olduğunu, ancak GPT-6 Astra ile zekâ düzeyinin yakın olduğunu ve görev başına maliyetin yine de belirgin biçimde yüksek kaldığını söylüyor. Aynı haftanın en tartışmalı duyurusu ise Claude'un genom verisi üzerindeki keşfi. Anthropic neredeyse bin ajan, 21 saat ve 210 milyon token kullanarak tekrarlayan dizileri taradığını, bulduğu yapıyı CRISPR benzeri bir mekanizma olarak sunduğunu açıklıyor. The Verge (theverge.com) haberi aynı noktada duruyor: keşif henüz doğrulanmadı ve alan çalışanlarının önceliğinin bir numaralı mesele olmadığını belirtiyor. Buna karşılık Anthropic'in açıklaması, ajanların devasa bir dizi havuzunda bağımsız arama yapıp sonuçları test edilmeye değer bir adayda toplamalarının gerçek başarıyı gösterdiğini vurguluyor. The Verge bu uyarıyı haberin gövdesinde ayrı bir uyarı olarak koyuyor.
Değerlendirme ve pratik sonuç
Haftanın gerçek başlığı çıkan ürün sayısında değil, birim maliyetteki kaymada. Artificial Analysis'in açık modeller karşılaştırması, on iki sentlik bir görev maliyetinin bugün gerçekten ulaşılabilir bir seviye olduğunu gösteriyor; aynı sıralamanın kapalı modeller tarafında hâlâ iki haneli dolarlar seviyesinde kaldığı görülüyor. Bu, en iyi model sorusunu hangi iş için en iyi model sorusuna dönüştürüyor ve geliştiricilerin karar mantığını değiştiriyor.
Bir ikinci sınırlama, model seçiminin kendisinde değil ölçüm altyapısında. Üreticilerin kendi kıyaslamalarıyla bağımsız değerlendirme kuruluşlarının sıralamaları arasında mesafe açıldığı zaman tek puanlık farklar anlamlılığını yitiriyor. Grok 4.7 için üreticinin kendi kıyaslamaları olumlu, bağımsız değerlendirme ise modeli endekste geride gösteriyor ve görev başına maliyeti pahalı tarafta işaretliyor. Üçüncü sınırlama, açık ağırlık sözünün pratikte ne anlama geldiginde. ölçek artık model dosyalarının boyutunda yaşıyor: MiMo ailesinde 573 GB, dots3-note'da 577 GB. Bu tablo, açık ağırlıklı modelin öğrenmek isteyen herkes için değil, yeterli donanıma sahip sınırlı bir kitle için açık olduğunu hatırlatıyor. Artificial Analysis'in açık modeller karşılaştırması bu farkı bir puanla sınırlı tutuyor.
Pratik çıkarım şu: hangi modelin daha zekâ olduğunu sormak yerine, hangi işin hangi modelle yapılacağını sormak. Uzun ufuklu ve maliyet duyarlı işlerde düşük maliyetli açık sürümler artık yeterli seviyeye geldi. Ses, üç boyutlu dünya ve robot kontrolü gibi alanlarda ise araç zinciri o kadar hızlı kuruldu ki, yıl sonunda beklenen manzaranın yıl başındakinden çok farklı olacağı neredeyse kesin.
Videodaki anahtar anlar
- Haftanın genel görünümü
- WorldCrafter ve üç boyutlu hafıza
- Ming-Image tasarım modeli
- MirrorScene ve Blender iş akışı
- FLUX 3 Action robot kontrolü
- Gemini 3.8 Flash TTS
- MiMo-V2.6-Pro açık model lideri
- Step 5 ve ajan işleri
- OpenMuse ve kişisel ajanlar
- CLM ve Sistem Bir düşüncesi
- Grok 4.7 değerlendirmesi
- GPT-6 Sol ve Luna
- Claude Opus 5.5
- Claude'un genom keşfi
- Robotlar: UBTECH, Unitree, Skild AI
- Sun Catcher ve uzay altyapısı
AI yorumu
"Bu hafta yayımlanan sayılar tek başına etkileyici, ancak asıl hikâye basın bültenlerinde değil karşılaştırmalarda saklı. Aynı model ailesi içinde birkaç dolar fark, birkaç ayrı kullanım biçimini birbirine dönüştürüyor. Açık ağırlık tarafındaki sıçrama gerçek; buna karşılık kapalı modellerde fiyat ve performans eğrisinin ne kadar dayanıklı olacağı da belirsiz."
AI değerlendirmesi
En güçlü karşı görüş, bu haftanın çıktılarının bir bölümünün gerçek kullanımda olduğundan çok daha büyük gösterildiğine dair. Özellikle açık ağırlık modellerinin endeks sıralamasındaki yer değiştirmeleri, farklı değerlendirme altyapılarının farklı sıralama getirdiği bir dönemde okunmalı. Üreticinin kendi kıyaslaması ile bağımsız kuruluşun sıralaması arasında mesafe açıldığında, tek puanlık fark bir şey ifade etmiyor.
Eksik kalan konu, bu modellerin gerçek dünyada ne kadar dayanıklı olduğuna dair uzun vadeli veri. Robot hareket modeli, oyun motoru ve web arayüzü testleri kısa vadeli ve kontrollü ortamlarda geçiyor; aynı sistemlerin açık, karmaşık ve kısmen öngörülemeyen ortamlarda nasıl davrandığı henüz bilinmiyor. Bu tür gösterilerin ortak eğilimi, kontrollü koşullarda parlak sonuçlar verip açık koşullarda beklenmedik biçimde kırılgan kalması.
Konuşmacının çıkarı da dikkate alınmalı. Haftalık model turunda her ürünü eşit ölçüde övmek, izleyiciyi abartılı bir tabloyla baş başa bırakır. Ölçüm altyapısının şu anki hâliyle, tek bir kanalın tek bir turda on beş ayrı ürünü değerlendirmesi teknik olarak neredeyse imkânsızdır. Bu tür haftalık turlar, üreticinin kendi kıyaslaması ile bağımsız kuruluşun sıralaması arasındaki farkı görünür kıldığı için değerli, ancak tek başına karar vermek için yeterli bir temel oluşturmaz.
Okur için pratik çıkarım şu: hangi modelin daha zekâ olduğunu sormak yerine, hangi işin hangi modelle yapılacağını sormak. Uzun ufuklu ve maliyet duyarlı işlerde düşük maliyetli açık sürümler artık yeterli seviyeye geldi. Ses, üç boyutlu dünya ve robot kontrolü gibi alanlarda ise araç zinciri o kadar hızlı kuruldu ki, yıl sonunda beklenen manzaranın yıl başındakinden çok farklı olacağı neredeyse kesin.
Kaynaklar
22 bağlantı; 9 tanesi 17 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — AI weekly news roundup
- @siliconangle.com SiliconANGLE — Xiaomi MiMo-V2.6 series open-sourced
- @venturebeat.com VentureBeat — MiMo-V2.6-Pro open weights lead
Aynı kaynağı kullanan: Xiaomi MiMo-V2.6 Pro Açık Kaynağın Yeni Zirvesi: 1 Milyon Token ve 20 Kat Hız
- @artificialanalysis.ai Artificial Analysis — MiMo-V2.6-Pro vs GLM-5.3
- @stepfun.com StepFun — Step 5 Preview
Aynı kaynağı kullanan: Opus 5.5 Sızıntısı ve 600 Milyar Parametreli Çin Dalgası: Qwen, Kimi ve MiniMax Aynı Haftaya Sığdı
- @huggingface.co Hugging Face — Step-5-Preview model card
- @github.com dots3-note preview repository
- @arxiv.org arXiv — WorldCrafter
- @arxiv.org arXiv — GAE geometry-native latent space
- @the-decoder.com The Decoder — Black Forest Labs FLUX 3 Action
- @huggingface.co Hugging Face blog — FLUX 3 Action
- @blog.google Google blog — Gemini 3.8 TTS
Aynı kaynağı kullanan: Google'ın Beş Yapay Zeka Hamlesi: Her Gün Kullandığın Araçlara Giren Gemini
- @openai.com OpenAI — GPT-6 Sol and Luna
Aynı kaynağı kullanan: Space Bunny Alpha: Ücretsiz Gizli Yapay Zeka Deneyinin Perde Arkası · Yapay Zeka Fiyat Savaşı: Opus 5.5, GPT-6 Sol ve Agent Dünyasının Sessiz Darboğazı · Aynı Gün Dört Lansman: Opus 5.5 Dönüşü ile GPT-6 Sol ve Luna Fiyat Devrimi · Piyasa Gözden Kaçırıyor: Yapay Zekâda Dev Talep Dalgası ve Neo Bulutların Sessiz Rallisi
- @anthropic.com Anthropic — Claude Opus 5.5
Aynı kaynağı kullanan: Süperzeka yarışı: Musk ve Huang enerjiyi, yörüngeyi ve güvenli ajanları anlattı · Claude Opus 5.5: Fikirden Bitmiş İşe Tek Oturuşta Giden Yapay Zeka · 12 Bin Dolarlık Mac Studio'yu Almadan Önce Saatliği 2 Dolara Kiralayıp Test Et · OpenAI'nin "o" Asistanı, Claude Sonnet 5.5 ve MiniMax M3.1: DevDay Öncesi Üç Model Savaşı · Yapay Zeka Fiyat Savaşı: Opus 5.5, GPT-6 Sol ve Agent Dünyasının Sessiz Darboğazı · Aynı Gün Dört Lansman: Opus 5.5 Dönüşü ile GPT-6 Sol ve Luna Fiyat Devrimi · Karar Önce, Zekâ Sonra: Jev Artı Opus 5.5 Düzeni · Piyasa Gözden Kaçırıyor: Yapay Zekâda Dev Talep Dalgası ve Neo Bulutların Sessiz Rallisi · Opus 5.5'i 24 Kod Görevinde Test Ettim: Fable Seviyesinde, Yari Zamanda, Yari Maliyette · Claude Opus 5.5 Sahnede: Bir Saatte Ödüllü Site, 3D Uzay Yolculuğu ve Tek Panelde Tüm Hesaplar
- @theverge.com The Verge — Anthropic biolab Crispr claim
- @aikido.dev Aikido — Altar open-weight security model
- @venturebeat.com VentureBeat — CLM-8B System One
Aynı kaynağı kullanan: Kararı Getirme İşine Çeviren Mimari: 13 Kat Hızlı CLM-8B
- @reuters.com Reuters — Project Suncatcher satellite
Aynı kaynağı kullanan: Tunç Şatıroğlu: Piyasa Dipten Döndü — Önce Yeni Zirve, Sonra Ekim Düşüş Senaryosu
- @arstechnica.com Ars Technica — Suncatcher orbital test
Aynı kaynağı kullanan: Tunç Şatıroğlu: Piyasa Dipten Döndü — Önce Yeni Zirve, Sonra Ekim Düşüş Senaryosu
- @gamesbeat.com GamesBeat — Skild AI S1 self-play football
- @artificialanalysis.ai Artificial Analysis — Benchmarking Grok 4.7
Aynı kaynağı kullanan: Grok 4.7 Geldi: Elon Sözünü Tutabildi mi? Yarı Fiyata Sınırın Bir Adım Gerisi
- @huggingface.co Hugging Face — Limite 1B Violetto
yapay zeka · açık ağırlık modeller · robotik · dünya modelleri · ses teknolojisi · uzay altyapısı