722 el yazması ve 372 sonuç ailesi
Haftanın manşeti tek cümleyle özetlenebilir: OpenAI, adı konmamış bir sınır modeli ile yaklaşık 4 bin matematik araştırma problemini yokladı ve ortaya çıkan 722 el yazmasını 372 sonuç ailesi halinde herkese açtı. Anlatıcı bu derlemeyi yayımlanmamış modelin ilk büyük önizlemesi sayıyor; ortalıkta dolaşan Bel adı ise henüz doğrulanmış değil. Ölçek tek başına düşündürücü: tek bir model, tek hamlede, bir matematik bölümünün yıllara yayacağı kadar metin üretti.
İlk ayrıntılı döküm ScientificAmerican'den geldi: dergiye göre sonuçların önemli bir bölümü Lean denetimi nden geçmiş durumda, yani kanıtların mantıksal iskeleti makineyle doğrulanmış. Bu dalga, OpenAI'nin bir ay önce Navier-Stokes probleminde aldığı sonucun hemen ardından geldi; dergi o günkü havayı şaşkınlık içindeki bir alana inen yüzlerce sonuç diye özetliyor. OpenAI ayrıca sonuçların nasıl paylaşılacağı konusunda Institute for Advanced Study çevresinden ve bağımsız matematik ile yapay zekâ danışma gruplarından görüş almış.
Ölçeğin ne anlama geldiğini NewScientist'in çerçevesi iyi koyuyor: dergi, 2019'da lise düzeyi matematik sorularında zorlanan modellerden yalnızca birkaç yılda sınır matematiğine uzanan çizgiyi hatırlatıyor. Bu kez vurgu derinlikten çok genişlikte: tek seferde yüzlerce bulgunun duyurulması akademide hem hayranlık hem şaşkınlık yaratmış. NewScientist'e göre matematikçiler, kanıtların yeni ve önemli fikirler mi taşıdığını yoksa mevcut tekniklerin derlemesi mi olduğunu anlamak için aylara ihtiyaç duyacak. Bu temkinli hava, haftanın geri kalanını okurken de akılda tutulmalı.
Anlatıcının altını çizdiği nokta ise daha yapısal: mesele tek bir teorem değil, araştırmanın kendisinin paralelleşebilir hale gelmesi. Bir matematikçinin aylarca tek yönü yoklaması yerine binlerce araştırma yönü aynı anda taranabiliyor. Zincir iyi biliniyor: matematik fiziği, fizik mühendisliği, mühendislik de yonga, enerji, malzeme ve tıbbı besliyor. Yapay zekâ daha iyi algoritma, yapı ve altyapı keşfine yardım ettikçe bu yardım daha iyi yapay zekâ olarak geri dönüyor. Bu geri besleme döngüsü, 722 sayısının neden bir meraktan fazlası olduğunu açıklıyor.
28 günlük sevkiyat maratonunda ikinci gün
Bu matematik dalgası, OpenAI'nin 28 gün boyunca her gün yenilik yayımlama sözü verdiği maratonun ikinci gününe denk geldi. AIReport'un derlediği tabloya göre günün paketi dört kalemden oluşuyor: otomatik inceleme artık tüm ChatGPT kullanıcılarına ücretsiz ve kota tüketmiyor; geliştirici kademeleri beşten üçe (kur, başlat, büyüt) indi ve en üst eşiğin toplam ödeme koşulu $1.000'dan $500'a çekildi. Kota yakan bir özelliğin ücretsiz hale gelmesi, uzun soluklu ajan işleri yürütenler için doğrudan maliyet düşüşü demek.
Paketin diğer yarısı toplantı ve karar altyapısında. ChatGPT'ye gelen toplantı eklentisi, görüşmeler sırasında not tutuyor, kişiye özel özet ve sonraki adım listesi çıkarıp her şeyi doğrudan ChatGPT alanına kaydediyor; hafıza özelliğiyle birleşince bu notlar proje planına ve yazılım ajanına aktarılabiliyor. Dördüncü kalem ise Luna destekli karar API'sinin herkese açık betaya girmesi. AIReport'a göre maratonun kuralı sert: söz verilen günde sevkiyat yapılmazsa tüm kullanıcılara tam kota sıfırlaması uygulanıyor.
Üç kademeli güvenlik erişimi ve Avrupa'nın açık ağırlık hamlesi
Anthropic cephesinde haftanın haberi siber doğrulama programının genişlemesi. Anthropic'in duyurusuna göre program artık üç erişim kademesinden oluşuyor: olay müdahalesi, zararlı yazılım incelemesi ve zafiyet araştırmasını kapsayan savunma kademesi; yetkili sızma denemelerine açılan kırmızı ekip kademesi; ve kapsamlı güvenlik taramasından geçen kuruluşlara daha geniş yetkiler veren özel kademe. Opus 5.5, Sonnet 5.5 ve Mythos 5.1 bu kademeler üzerinden kullanılabiliyor; herkese açık modeller ise aynı korumalarla yoluna devam ediyor. Başvuru herkese açık durumda.
Avrupa'dan ise haftanın en iddialı açık ağırlık duyurusu geldi: Mistral, Large 4'ü (lakabı Le Chonk) herkese açık önizlemeye sundu. Mistral'in paylaştığı teknik nota göre model 1 trilyon parametreli; karışım-uzman yapısı sayesinde her adımda bunun 49 milyarını işletiyor ve baştan sona Avrupa'da geliştirilip şirketin kendi Avrupa bulutunda sunuluyor. Metin, yazılım, görsel ve sesi aynı yapıda işleyen modelin ağırlıkları ekim sonunda yayınlanacak, önizleme API'si ise bugünden kullanılabiliyor. Avrupalı şirketler için verilerin kıta içinde kalması duyurunun en çok öne çıkan yanı.
VentureBeat'in aktardığı perde arkası, ölçeğin bedelini de ortaya koyuyor: model yaklaşık iki ayda, şirketin kendi veri merkezlerindeki 4000 grafik hızlandırıcıda sıfırdan eğitilmiş ve 160'tan fazla dili kapsıyor. Şirket, siber güvenlik ve üretim gibi kurumsal iş yüklerinde açık modeller arasında en iyi sonucu, görsel dayanak testlerinde ise kapalı sınır modellerinden ilerisini iddia ediyor. En çarpıcı örnek bir tersine mühendislik denemesi: model, daha önce görmediği bir zararlı yazılım örneğini Cobalt Strike olarak teşhis edip yapılandırma dökümü, tehlike göstergeleri ve Yara kuralı içeren tam bir inceleme raporu çıkarmış; VentureBeat'e göre normalde bir uzmanın gününü alan bu iş 12 dakikada bitmiş.
Anlatıcının kendi ölçüm düzeneği WoAI Bench ise tabloya bir şerh düşüyor: Large 4, yazılım mühendisliği ve ajan testleri gibi alan görevlerinde GPT-6 Luna'yı geride bırakıyor; ama hız ve verimlilikte aynı modelin gerisinde kalıyor. Yazarın hükmü açık: akıl yürütme süreci yüzünden yavaş kalan bu model günlük kullanım için değil, siber güvenlik ve bilgi işçiliği gibi ağır alan işleri için düşünülmeli. Doğuştan çok modlu yapı ve 1 milyon girdilik bağlam penceresi de bu hükmü destekliyor.
Google cephesi ve haftanın yazılım notları
Google tarafında görsel üretim cephesi hareketli: Nano Banana 2.1, önceki sürümlerin genelini aşan bir yükseltme olarak duyuruldu. DeepMind'in model kartına göre Nano Banana 2.1, Gemini 3 dizisinin bir üyesi; metin ve görsel girdileri birlikte anlayıp görsel ve metin çıktısı üretiyor, 1 milyon girdilik bağlam penceresini destekliyor. Görsel üretimde kalite yarışı hızlanırken bu sürümün en büyük kazanımlarının görsel alanda toplandığı belirtiliyor; model kartındaki ölçüm ayrıntıları DeepMind'in sayfasında yer alıyor.
Gömme tarafında ise haftanın sessiz ama önemli adımı EmbeddingGemma 2: yalnızca 740 milyon parametreli, metin, yazılım, görsel, ses ve görüntüyü aynı uzayda eşleyen, telefon ve bilgisayarda çalışmaya uygun açık bir model. Digit'in haberine göre model Apache 2.0 lisansıyla ağırlıklarını herkese açmış durumda. Anlatıcının paylaştığı gerçek dünya denemesi de iddiayı destekliyor: DGX Spark üzerinde 30 ayrı türden 300 hayvan fotoğrafı dizine eklenip 20 ayrı görselle 200 benzerlik sorgusu yapılmış; model 165 doğru eşleşmeyle yüzde 82,5 isabet tutturmuş, zebra ve pandalarda 10'da 10 yaparken at ve leoparlarda zorlanmış.
Yazılım cephesinde iki not var. İlki Claude Code 2.1.292: PromTime'ın sürüm notlarından derlediği listeye göre ajan aracına gelen efor parametresi, her alt- ajan ın ne kadar düşüneceğini ayrı ayrı ayarlamaya izin veriyor; yerel protokol sunucuları da 2026-07-28 protokolünü öntanımlı olarak konuşuyor. Ayrıca OpenCode içinde ücretsiz erişilebilen gizli bir model konuşuluyor; anlatıcı ayrıntıyı bir sonraki videosuna bırakmış. İkincisi açık yazılım dünyasından: bir geliştirici, Opus 5.5 ile Photoshop dahil yedi büyük Adobe uygulamasını Rust ile yazılmış özgür alternatifler olarak yeniden ürettiğini duyurdu; Photocraft adlı Photoshop karşılığı ilk sürümde asıl yeteneklerin yüzde 90'ına ulaşmış görünüyor. Projenin GitHub deposu herkese açık; ama geliştirici de kabul ediyor ki bunlar henüz günlük profesyonel kullanımda Adobe'nin yerini tutmuyor.
| Gelişme | Neden önemli |
|---|---|
| 722 matematik el yazması | Sınır modeli araştırmayı seri üretiyor |
| Mistral Large 4 önizlemede | 1 trilyon parametre, ağırlıklar ekimde |
| Claude Code alt-ajan ayarı | Her alt-ajan için ayrı düşünme düzeyi |
Videodaki anahtar anlar
- 722 el yazmalık matematik dalgası
- Lean denetiminde kanıtlar
- 28 günde 28 yenilik sözü
- Ücretsiz otomatik inceleme ve sadeleşen kademeler
- Üç kademeli güvenlik erişimi
- 1 trilyon parametreli açık ağırlık
- 12 dakikada zararlı yazılım incelemesi
- Nano Banana 2.1 görselleri
- Telefonlarda çalışan gömme modeli
- Rust ile yazılmış Adobe karşılıkları
AI yorumu
"Bu haftanın tablosu net: büyüyen yalnız modeller değil, modellerin ürettiği araştırma hacmi. 722 el yazması bağımsız denetimden geçene kadar bir vaat olarak kalacak; ama vaadin büyüklüğü bile alanın temposunu ele veriyor. Benim asıl merakım, Mistral Large 4'ün ağırlıklarının gerçekten herkese açılıp açılmayacağı."
AI değerlendirmesi
En güçlü itiraz, sayıların yorumuna: 722 el yazması henüz bağımsız denetimden geçmiş değil; Lean denetimi kanıtın mantığını doğrular ama sonucun önemini tartmaz. Matematikçilerin önünde aylar sürecek bir ayrıştırma işi var ve bu metinlerin ne kadarının gerçekten yeni fikir taşıdığı, ne kadarının mevcut tekniklerin yeniden karması olduğu ancak o zaman bilinecek. Genişlik, derinliğin kanıtı değil.
Eksik kalanlar listesi de kabarık: Bel lakaplı modelin kimliği, eğitimi ve erişim takvimi belirsiz; Large 4'ün fiyatlandırması ve lisans ayrıntıları ağırlıklar yayınlanmadan netleşmeyecek; Luna destekli karar API'si betada; gizli modelin arkasında kimin olduğu bilinmiyor. Bu belirsizlikler, haftanın haberlerini bir zafer turu değil, açılış turu olarak okumayı gerektiriyor.
Anlatıcının konumunu da not düşelim: videonun omurgası kendi ölçüm düzeneği WoAI Bench; yayında Skool topluluğu ve Zapier SDK sponsorluğu yer alıyor. Bu, seçkinin taraflı olduğu anlamına gelmez ama okurun bilmesinde yarar var: hangi testin öne çıktığı, testi yapanın elindeki araçla akraba.
Okur için pratik çıkarım üç başlıkta toplanıyor: güvenlik işi yapanlar Anthropic'in başvuru sayfasını inceleyebilir; Avrupa'da veri barındıranlar Large 4'ün ağırlık takvimini izleyebilir; toplantı yükü ağır olanlar ChatGPT'nin toplantı eklentisini deneyebilir. Gerisi için kural basit: 722 makaleden çıkan tek bir doğrulanmış atılım, yüzlerce doğrulanmamış duyurudan değerlidir.
Kaynaklar
11 bağlantı; 1 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — WorldofAI
- @scientificamerican.com Scientific American
Aynı kaynağı kullanan: Nasdaq zirvede: nükleer anlaşma, hafıza rallisi ve $40B'lik YZ yarışı
- @newscientist.com New Scientist
- @anthropic.com Anthropic
- @mistral.ai Mistral
- @venturebeat.com VentureBeat
- @deepmind.google Google DeepMind
- @digit.in Digit
- @aireport.net AIReport
- @promtime.net PromTime
- @github.com GitHub — Photocraft
yapay zekâ · openai · anthropic · mistral · google · açık ağırlık · matematik