Gündeme dön

Opus 5.5 Sızıntısı ve 600 Milyar Parametreli Çin Dalgası: Qwen, Kimi ve MiniMax Aynı Haftaya Sığdı

Anthropic'in Wafer kod adlı Opus 5.5 sızıntısı Salı iddiasıyla gündeme oturdu, aynı günlerde Çin'den StepFun 600B, MiniMax M3.1, Alibaba Qwen ailesi ve Moonshot Kimi K3.1 haberleri peş peşe geldi. Ucuzlayan sınır modeller ve devasa açık ağırlık takvimleri aynı haftayı bir yarış pistine çevirdi.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — i00isgmGgGg
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Haftanın çerçevesi tek bir duyuru değil, sıkışmış bir takvim. Videoda derlenen beş ayrı sızıntı aynı 72 saate yığılıyor: Anthropic tarafında yeni bir Opus denemesi, Pekin ve Şanghay ekseninde StepFun, MiniMax, Alibaba ve Moonshot'tan art arda işaretler. Tıpkı bir festival afişinde sahnelerin çakışması gibi, her laboratuvar kendi saatini öne çekmiş görünüyor. Benim için bu yığılma tesadüf değil, açık ağırlık ve fiyat baskısının aynı haftada kesişmesi.

Anthropic cephesindeki başrol Opus 5.5. Kod adı Wafer olarak anılan deneme, daha önce konuşulan 5.2 etiketini rafa kaldırmış ve iç sistemlerde claude-wafer-eap damgasıyla test ediliyor. Sızıntı Salı penceresini işaret ediyor ve tek model mi yoksa Sonnet ve Haiku ile birlikte bir paket mi gelecek sorusu hâlâ açık. MoE (uzman karışımı — modelin tamamı yerine her sorguda yalnızca ilgili uzmanların ateşlenmesi) mantığı burada tersine değil, yoğun bir frontier modelin daha verimli çalıştırılmasına hizmet ediyor. Bu, hastanedeki tüm branşları aynı anda çağırmak yerine sadece ilgili uzmanı odaya almak gibi.

Fiyat iddiası asıl manşeti taşıyor. Sızan tabloya göre Opus 5.5 milyon girdi jetonunda 4 dolar, çıktı jetonunda 20 dolarla konuşuluyor; önbellek okuma 20 sent, yazma 5 dolar bandında. Mevcut Opus 5'in 5 ve 25 dolarlık çıpası düşünülünce, bu %20 civarı bir indirim demek. Rakam doğruysa, GPT-6 Astra seviyesinde performans iddiasıyla birleşince teklif cazip hâle geliyor. Örneğin 10 sayfalık bir sözleşmeyi özetletip ardından 20 sayfalık ekleri tek seferde yorumlatmak isteyen bir hukuk ekibi için aynı işi daha düşük fatura ile kapatmak anlamına gelebilir. Küçük bir pencere daralması da not edilmiş, ancak ekip maliyeti düşürüp hız kazanmayı tercih etmiş görünüyor.

Demo tarafı neden heyecan yarattığını gösteriyor. Videoda tek komutla üretilen SVG sahneler, prosedürel 3 boyutlu ortamlar ve bir BMW M5 canlandırması yan yana getiriliyor. Tekerlek gibi bazı parçalar henüz kusurlu, fakat uzamsal tutarlılık ve malzeme ayrımı önceki denemeden belirgin biçimde ileri. Kahve makinesi örneği de aynı eğilimi destekliyor: model sadece şekil değil, işlevsel parça ilişkisini de kuruyor. Bir önceki Opus 5.2 denemesiyle yapılan yan yana kıyasta, 5.5'in aynı komut setinde daha temiz geometri ürettiği vurgulanıyor. Bu, atölyede el çizimini bırakıp parametrik modele geçmek gibi bir sıçrama.

StepFun'un Step 5 Preview modeli haftanın en somut duyurusu. Toplam 600 milyar parametreli, seyrek uzman karışımlı bir mimari ve her jetonda yalnızca 27 milyar parametre aktif. Bağlam penceresi 1 milyon jeton, görsel girdi doğal. Artificial Analysis Intelligence Index'te 44 puanla, GLM 5.3 ve Kimi K3 bandında konumlanıyor. Fiyat ise iddialı: StepFun kendi grafiğinde görev başına maliyeti rakiplere göre yaklaşık %65 daha düşük gösteriyor. Yani aynı araştırmanın faturasını neredeyse üçte bire indirme vaadi. Nasıl çalışır sorusuna 4 adımda bakılabilir: 1) Sorgu yönlendiriciye gelir, 2) Yönlendirici en ilgili uzman kümesini seçer, 3) Yalnızca bu küme hesap yapar, 4) Sonuçlar birleştirilip tek yanıt üretilir.

Neden bu mimari önemli? Çünkü 600 milyar parametrenin tamamını her soruda çalıştırmak devasa donanım ister, oysa seyrek yapı yalnızca gereken parça için enerji harcar. StepFun özellikle ajan işleri, yazılım mühendisliği ve finansal uzmanlıkta ısrarcı: uzun ufuklu yürütme (long-horizon execution) vurgusu, modelin 50 adımlık bir kod tabanı onarımını baştan sona bırakmadan sürdürebilmesi demek. Kavramı gündelik dille düşünün: tüm kütüphaneyi her soruda taşımak yerine, yalnızca ilgili rafı masaya getirmek. Ön izleme API üzerinden denenebiliyor, açık ağırlıklar için verilen tarih 15 Ekim. Tartışılan sınır ise pratik: 600 milyar parametreli ağırlıkları yerelde çalıştırmak, sıkıştırma (quantization) ile bile çoğu kurum için gerçekçi değil; bulut API'si bu yüzden birincil yol.

MiniMax cephesinde iki kulvar var. M3.1 için test dosyalarında görülen gizli commit ve açık kaynaklı kod deposundaki işaretler, lansmanın yaklaştığı şeklinde okunuyor; ay sonu ya da önümüzdeki ayın başı telaffuz ediliyor. 26 Ağustos ara dönem sonuç görüşmesinde CEO, M3.1, M3 Pro ve H3.1'in tamamlanmaya yakın olduğunu söylemişti. M3.1'in odağında ölçek büyütmeden çok kararlılık, çıktı kalitesi, çıkarım verimliliği ve ajan genelleştirmesi var; altyapıyı ölçekte güvenilir kılma hedefi. M3 Pro ise hikâyeyi büyütüyor: yaklaşık 3 trilyon parametreye ölçekleneceği ve ön eğitim ölçeği, eğitim verimliliği ve aşırı uzun görevlerde mimari sıçrama getireceği anlatılıyor. Bu, otoyolu genişletmekten çok, üstüne yeni katlı bir kavşak inşa etmek gibi.

Alibaba tarafında Qwen ailesi Apsara Konferansı takvimine kilitlenmiş görünüyor. Konferans 22-24 Eylül aralığında ve Qwen 2.5 ile Qwen 3'ün de sahnede tanıtılmış olması beklentiyi güçlendiriyor. Gündemde Agents Çağına Doğru Qwen başlıklı bir oturum var; şirketin amiral gemisinde kodlama ve ofis yetkinliklerinde büyük iyileşme, yanında yeni bir omni model ve gerçek zamanlı çok dilli çeviri modeli anlatılıyor. Aynı vitrinde Happy Oyster 2 dünya modeli ön izlemesi ile ASR, TTS ve gerçek zamanlı ses modelleri de listeleniyor. Yani Qwen 4 yalnız değil, bir paket olarak geliyor. Bu, tek ürün lansmanı değil, ofis + kod + ses + dünya modelini aynı sahneye dizme denemesi.

Sürpriz ise zaten yayında: Qwen-Image 2.1. Yalnızca 7 milyar parametreli görsel üretim bileşeniyle (DiT — Diffusion Transformer, görüntüyü gürültüden adım adım arındırarak kuran mimari) hem üretim hem düzenleme yapıyor, 10 referans görsele kadar destek, yüksek sadakatli düzenleme ve yerleşik RGBA (şeffaflık kanalı) ile şeffaf arka plan üretebiliyor. Google'ın Nano Banana 2'si (Gemini 3.1 Flash Image) ile kıyaslayan kullanıcı yorumları, modelin kapalı kaynak rakiplerle başa baş gittiğini söylüyor; bir ölçümde 60.28'e karşı 59.82 skoru telaffuz ediliyor. Lisans detayı önemli: Apache yerine araştırma amaçlı lisansa geçiş, ticari ürünlerde çıktıyı doğrudan satmayı kısıtlıyor. Örneğin bir pazarlama ekibi için bu, model ağırlıklarını kendiniz barındırıp denemek serbest, ancak üretilen görseli mağazada ürün olarak paketlemek için ek izin katmanı demek.

Moonshot tarafında Kimi K3.1 için pi sayısı kadar zarif bir teaser var: resmi Kimi hesabı 3.1 ön eki ardından pi dizisini paylaştı ve topluluk mesajı tek cümlede çözdü — sıradaki model Kimi K3.1. Resmi lansman henüz yok ama pazarlama ısıtması hızlanmış durumda. Haftayı topluca okuyunca tablo net: ABD tarafında aynı zekâyı daha ucuza sunma hamlesi, Çin tarafında ise devasa uzman karışımlarını daha ucuza çalıştırıp ağırlıkları açma hamlesi. İkisi de aynı soruya farklı yanıt: sınır zekâ herkes için erişilebilir olacak mı, yoksa sadece kiralık API'de mi kalacak? Bu hafta, ikinci yolun ağırlıkla birinciye yaklaştığını gösteren ilk haftalardan biri.

Görsel: nodesdaily AI

AI yorumu

"Benim gördüğüm kadarıyla bu hafta tek bir modelin değil, iki ayrı üretim felsefesinin yarışı: Anthropic fiyatı aşağı çekip aynı zekâyı daha erişilebilir kılmaya oynuyor, Çinli laboratuvarlar ise devasa uzman karışımlarını ucuza çalıştırıp açık ağırlıkla dağıtmayı deniyor."

AI değerlendirmesi

En güçlü karşı argümanı ciddiye alalım: sızıntıların çoğu doğrulanmamış fiyat ve performans tablolarına dayanıyor. Opus 5.5 için Salı penceresi ve Astra seviye iddiası, bağımsız bir değerlendirme çıkmadan spekülasyon olarak kalır; StepFun'un %65 tasarruf grafiği de kendi ölçümü. Bu yüzden tek bir laboratuvarın grafiğini nihai hüküm saymak yerine, aynı görevi iki farklı sağlayıcıda aynı komutla koşup fatura ve kaliteyi yan yana koymak daha sağlıklı. Video güzel bir derleme sunuyor ama derleme kendi başına kanıt değil.

Sınırlar tarafı da net. StepFun 600B'yi yerelde çalıştırmak çoğu ekip için pratik değil; M3 Pro'nun 3 trilyon parametre hedefi ise ön eğitim ölçeği kadar çıkarım maliyetini de büyütür. Qwen-Image 2.1 tarafında 7 milyar parametre etkileyici olsa da RGBA ve 10 referans görsel desteği lisansla birlikte geliyor; araştırma lisansı ticari kullanımda fren demek. MiniMax M3.1'in kararlılık vurgusu kâğıt üstünde doğru, ancak ajan genelleştirmesi gerçek dünyada tek bir uzun görevde değil, onlarca farklı araç ve izin katmanında sınanır ve bu testler henüz kamuda yok.

Çıkar ve doğrulanabilirlik merceğinden bakınca, her iddia farklı bir doğrulama istiyor. Anthropic fiyatını yalnızca resmi tarife doğrular, performans iddiasını ise aynı SVG ve prosedürel sahne komutlarının bağımsız tekrarı; StepFun tasarruf iddiası için faturanın kendisi kanıt; Alibaba Qwen 4 için Apsara sahnesindeki resmi duyuru ve model kartı; Kimi K3.1 için ise pi teaser'ı sonrası tarihli bir model kimliği. Bağımsız bir kurumun endeksinde (örneğin Intelligence Index 44) yer almak tek başına yetenek garantisi değil, bir ölçümde bir noktayı gösterir ve uzun görev başarısı ayrı bir ölçüm ister.

Pratik çıkarım için ayrım basit: API üzerinden uzun ajan işleri ve finans odaklı analiz koşan ekipler için Step 5 Preview'un ön izlemesi bugün denenmeye değer, ancak üretimde kalıcılık için 15 Ekim açık ağırlık takvimini beklemek mantıklı. Kapalı sınır modelde maliyet hassasiyeti olanlar için Opus 5.5 sızıntısı bekle-gör sinyali; Salı gerçekleşse bile ilk gün fiyat ve erişim katmanları dalgalanabilir. Görsel üretimde ise Qwen-Image 2.1'i kendiniz barındırıp denemek düşük riskli, fakat çıktıyı ürün olarak satacaklar lisansı baştan netleştirmeli.

Kaynaklar

8 bağlantı; 2 tanesi 2 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

opus 5.5 · anthropic · qwen · kimi · minimax

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

Opus 5.5 Sızıntısı ve 600 Milyar Parametreli Çin Dalgası