Gizli kod adlarıyla sessizce yayınlanan deneme sürümleri , ardından gelen resmi lansmanla testi baştan yazdıran modeller: konuşmacı bu döngüden açıkça yorulmuş. Yine de izleyiciler yorumlarda ısrarla LongCat'i yazınca kolları sıvamış. Üstelik LongCat 2.0 o kadar kötüymüş ki kendi kodlama liderlik tablosuna bile girememiş ve hafızalardan silinmiş. Şimdi 2.5 ortada ve iki hafta boyunca ücretsiz denenebiliyor; kısa bir video, hızlı bir hüküm için şartlar uygun görünüyor.
Test rutini her zamanki gibi iki katmanlı. Önce 24 kod istemi çalıştırılıp geçen testler sayılıyor; ardından üretilen kodun kalitesi GPT-5.6 hakemliğinde puanlanıyor. Kalite değerlendirmesi iki ayrı hatta bakıyor: tek bir proje içinde React ve TypeScript ön yüzü, ayrı bir hatta PHP ve Laravel arka yüzü. Tavan 60 puan ve konuşmacı güncelleme anını ekranda canlı yapıyor; beklentisi en baştan düşük, çünkü model ne köklü bir laboratuvardan geliyor ne de parlak bir geçmiş taşıyor.
Skor Tablosundaki Yeri
Tablo güncellenince tahmin doğrulanıyor: LongCat 2.5 Preview alt sıralarda beliriyor, en dipte değil ama zirvenin çok uzağında. Toplam 44 puan alan model, 50'li skorlarla 57 bandında gezen liderlerin yanına bile yaklaşamıyor. Konuşmacının kayda geçirdiği en çarpıcı detay dil dağılımı: Go projesinde 5 üzerinden yalnızca 0,9 alınırken Dart ve Flutter projesinde 4/5 tutturulmuş. Beş projeden dördünde hiç başarısız test yok, yani model çoğu işi bitiriyor, ama bitiş çizgisine varış süresi sabır zorluyor.
Bitiren ama yavaş kalan bir model tablosu bu. Test sırasında aralıklı çökmeler yaşanmış ve yanıt süreleri konuşmacıyı yıldırmış; ücretsiz olmasa tavsiye listesine girmeyecek bir profil çiziliyor. Yine de hüküm tamamen karanlık değil: küçük görevler için yeterli bulunmuş ve sıfırdan farklı bir skorla tabloya adını yazdırmış. Zirveyle arayı kapatan bir sıçrama yok, ancak 2.0'ın yok hükmündeki performansından sonra 2.5 en azından ölçülebilir bir varlık gösteriyor.
Fiyat, Kimlik ve Ücretsiz Kuyruk
Modelin künyesi dikkate değer. LongCat, yemek dağıtım devi Meituan'ın yapay zekâ kolu; LongCat'in resmi bloguna göre 2.0 sürümü 1,6 trilyon parametreli bir MoE mimarisi taşıyor, token başına yaklaşık 48 milyar parametre aktifleşiyor ve 1 milyon token bağlam destekleniyor. Reuters'a göre model tamamen yerli işlemcilerden kurulu 50 bin çiplik bir kümede eğitilmiş. GitHub'daki resmi depoda paylaşılan şirket içi ölçümler Terminal-Bench 2.1'de 70,8 ve SWE-bench Pro'da 59,5 yazıyor; HuggingFace'teki açık ağırlık sayfası da bu tabloyu doğruluyor. Resmi sitede 2.5 preview fiyatı 2.0 ile aynı, milyon token başına 30 sent giriş ve 1,20 dolar çıkış, yanında indirim ibaresi var; yani fiyatın sonra yükselme ihtimali açıkça işaretlenmiş. Dikkat çekici bir ayrıntı: model OpenRouter'da yok, erişim pratikte OpenCode üzerinden akıyor.
Ücretsiz erişim tarafı videonun en pratik bölümü. OpenCode'un Zen dokümantasyonuna göre longcat-2.5-preview-free kimlikli modelin girişi de çıkışı de ücretsiz; katalogda MiMo-V2.6-Flash Free ve MiMo-V2.5 Free gibi başka sıfır ücretli seçenekler de dönüyor. TUI içinde /models komutuyla açılan listede free filtresi bu modelleri anında öne çıkarıyor. Fiyat karşılaştırması için konuşmacı GPT-5.6 Luna bandını örnek veriyor: 20 sent giriş, 1,20 dolar çıkış. LongCat 30 sent girişiyle biraz daha pahalı, GPT-6 Luna ise çok daha ucuz; ancak konuşmacıya göre LongCat'in kalitesi GPT-5.6 Luna'nın gerisinde ve daha yavaş, yani ucuzluk tek başına tercih nedeni olmuyor.
MiMo Düzeltmesi ve Preview İkilemi
Videonun sürpriz ara başlığı bir gün öncenin konusu: MiMo-V2.6-Flash. Modelin ekibi, video yayınlandıktan bir saat sonra araç çağrısı tekrarı hatasını teşhis edip düzelttiklerini duyurmuş; düzeltmenin hızı artırıp kaliteyi yükseltmesi bekleniyor. Konuşmacı tek sorguluk bir kontrol yapmış ama gözle görülür bir iyileşme yakalayamamış, model hâlâ çok yavaş bulunmuş; hafta içinde tam yeniden test planlanıyor. Bu arada kuyrukta MiniMax de var: MiniMax'e göre açık ağırlıklı M3, BrowseComp'te 83,5 alıyor; HuggingFace'teki MiniMax-M3 kartı ise SWE-bench Verified 80,5 ve SWE-bench Pro 59,0 yazıyor. Finalde konuşmacı samimi bir ikilemi masaya koyuyor: preview'u şimdi mi test etmeli, resmi sürümü mü beklemeli, üstelik resmi sürümlerin bazen sessizce zayıflatıldığı teorileri dolaşırken? Yanıtı yorumlara bırakıyor ve LongCat hakkında derin bilgisi olanları tartışmaya çağırıyor.
Videodaki anahtar anlar
AI yorumu
"Bağımsız bir kod testinin preview bir modele bu kadar mesafeli yaklaşması değerli; skorlar şişirilmiş lansman tablolarından daha çok şey anlatıyor. LongCat 2.5'in ücretsiz penceresi denemeye değer, ama üretim kodu için henüz erken."
AI değerlendirmesi
En güçlü karşı görüş şudur: tek bir bağımsız test, ne kadar şeffaf olursa olsun, bir modelin kaderini belirlemez. Konuşmacının 24 promptluk rutini gerçek kullanıcı görevlerine dayanması açısından şirket içi benchmark'lardan daha sahici, ancak tek çalıştırma ve küçük örneklem istatistiksel gürültüye açık. Üstelik hakem koltuğunda GPT-5.6 ailesi oturuyor; OpenCode'un Zen listesindeki varyantlara bakılırsa aynı ailenin üyeleri yarışın da içinde, yani hakem ile yarışmacı akraba. Bu tabloyu okurken 44 puanı mutlak bir hüküm değil, tek laboratuvarın tek ölçümü olarak görmek gerekir.
Videoda eksik kalanlar da var. Yavaşlık hissi hiç sayısallaştırılmamış; token/saniye, kuyruk süresi, yeniden deneme oranı gibi sayılar olmadan hız şikâyeti izlenim düzeyinde kalıyor. Go projesindeki 0,9/5 çöküşünün kök nedeni araştırılmamış; model mi dili bilmiyor, test koşumu mu kırılgan, belli değil. Reuters'ın aktardığı 50 bin çiplik yerli küme iddiası ile bu yavaşlık arasında bağ kurulmamış. Ayrıca konuşmacının dile getirdiği preview-sonrası skor düşüşü teorisi test edilmemiş bir şüphe olarak havada duruyor.
Konuşmacının olası çıkarını da not etmek gerekir. Ücretsiz modellere odaklanan format, OpenCode'un Zen listesindeki dönüşümlü ücretsiz modellere sürekli trafik çeker ve her yeni preview yeni bir video demektir. Ancak skorları sansürsüz paylaşıp modeli alt sıralara yazması, bu formatın reklam broşürü olmadığını gösteriyor. LongCat'in resmi blogundaki 70,8 gibi şirket içi rekorlarla videodaki 44 puanın yan yana durması da okur için sağlıklı bir denge kuruyor.
Okur için pratik çıkarım net. Küçük betikler, deneme projeleri ve merak giderme için longcat-2.5-preview-free kuyruğu mantıklı bir durak; cebinizden para çıkmadan modelin karakterini tanırsınız. Ama teslim tarihi olan işlerde, Go gibi dillerde ve hızın önemli olduğu ajan döngülerinde zirvedeki modellere sadık kalın. Preview skorlarını satın alma kararına çevirmeden önce resmi sürümü ve en az bir bağımsız tekrar testini bekleyin.
Kaynaklar
8 bağlantı; 2 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — LongCat 2.5 Preview coding test
- @opencode.ai OpenCode Zen — models and free pricing
Aynı kaynağı kullanan: Gemini 4 Pro Sızıntısı, Kaçak Ajanlar ve Çin'in 10 Trilyon Parametre Planı: Bir Günün AI Manşetleri
- @longcat.ai LongCat official blog — LongCat 2.0 specs
- @github.com GitHub — meituan-longcat LongCat-2.0 repository
Aynı kaynağı kullanan: Gemini 4 Pro Sızıntısı, Kaçak Ajanlar ve Çin'in 10 Trilyon Parametre Planı: Bir Günün AI Manşetleri
- @reuters.com Reuters — Meituan domestic-chip training report
- @huggingface.co Hugging Face — LongCat-2.0 open weights
- @minimax.io MiniMax — M3 model page
- @huggingface.co Hugging Face — MiniMax-M3 model card
longcat · yapay zeka · kodlama · opencode · mimo · minimax