Gündeme dön

Transformers Sonrası İlk Ciddi Aday: Pathway'in BDH Mimarisi Ne Vaat Ediyor?

Pathway'in Dragon Hatchling (BDH) mimarisi ve onun uzerine kurulu 150 milyon parametreli BDH-CQ modeli, ARC-AGI-1'de gorev basina 0.0007 dolar maliyetle %29.5 basari yakalayarak akil basina dusen maliyeti yeniden tanimladi. Model, ara adimlari dile dokmeden tekrar eden gizli uzayda dusunuyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — 9hf8JzDvWUo
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Krish Naik bu videoda aylardir deginmedigi bir arastirma incelemesine geri donuyor ve gundemine Pathway'in Dragon Hatchling (kisa adiyla BDH) mimarisini aliyor. Basliktaki soru dogrudan: BDH, Transformer'in yerini alacak mi? Naik'in verdigi kisa ozet su: BDH, Transformer ile beyin modelleri arasindaki kayip halka olarak sunuluyor ve Hugging Face'te yayimlanan 30 Eylul 2025 tarihli makale ile birlikte tanitildi. Uzerine insa edilen kucuk muhakeme modeli BDH-CQ ise sadece 115 ila 150 milyon parametreyle ARC-AGI-1'de maliyet-verimlilikte yeni bir noktaya ulasmis.

Transformer neden pahali dusunur?

Simdi neden boyle bir mimariye ihtiyac duyuldugunu adim adim acayim. Bugun ChatGPT, Claude veya Gemini ile 20 cikolatali basit bir hesabi bile cozdururken model ara adimlari tek tek kelimeye doker: 20 eksi 7 esittir 13, 13 eksi 6 esittir 7 gibi. Bu, Chain-of-Thought (dusunce zinciri) denen tekniktir ve modelin ic hesaplamasini dile cevirmesini gerektirir. Tıpkı her ara sonucu yuksek sesle soylemek zorunda kalan bir ogrenci gibi, model de dusunmek icin token uretir. Token uretmek ise hem gecikme hem maliyet demektir. Pathway ekibinin makalelerinde buna token darboğazı diyor: iceride milyarlarca islem yapabiliyorsun ama bir sonraki adima ancak dar bir kelime kanalindan aktarabiliyorsun.

Ikinci darboğaz hafizada. Transformer'da iki ayri hafiza var: egitimde agirliklara yazilan uzun sureli bilgi ve her yeni oturumda sifirlanan, token indeksli KV cache (anahtar-deger onbellegi). Baglam uzadikca cache sisiyor, uzun belgeyi ozetle ya da dis vektör veritabanina yaz gibi dolambaçli cozumler gerekiyor. Gercek hayatta bir ajan uygulamasi kurarken bu durum, her seferinde not defterini yeniden yazmaya benzer. BDH'nin tezi su: not defteri disarida degil, sinapslarin kendisinde durmali; deneyim birikmeli ve bir sonraki soruya davranisi degistirmeli. Yeni gelen ornekler modelin ic hafizasini dogrudan guncellemeli, tipki ilk gunundeki calisan ile bir yil sonraki calisan arasindaki fark gibi.

Dragon Hatchling nasil calisir?

BDH, beynin olceksiz (scale-free) ag yapisindan ilham aliyor. Beyinde her noron her norona bagli degildir; az sayida cok baglantili dugum, cok sayida az baglantili dugumle seyrek ama etkili bir ag kurar. BDH de dili, yogun matris carpimlari yerine yerel dagitik bir cizge dinamigi olarak modeller. Her dugum yalnizca komsularindan gelen sinyalle konusur, bellek agirliklarda degil kenar agirliklarinda (sinapslarda) tasinir. Etkilesim cekirdegi atesleme (spiking) benzeri seyrek sinyallere kisitlanir ve muhakeme, kenarlari yeniden agirliklandiran bir surec olarak tanimlanir. Oyuncak model olarak bir salinici agi (oscillator network) dusunulebilir: dugumler fazlarini karsilikli ceker, ortak bir ritme kitlenir.

Bu soyut fikri GPU'da calisir hale getiren surum BDH-GPU. Burada cizge, tensor dostu durum-uzay sistemine cevrilir. Lineer dikkat (linear attention) noron boyutuna hizalanir, aktivasyonlar seyrek ve pozitif tutulur, ReLU-lowrank denen dusuk rankli blok Transformer'daki MLP'nin yerini alir. ReLU, Markov zinciri benzeri sinyal yayilimini guclendirirken moduler yapiyi korur. Amac pratik: yogun dikkat yerine LSH ile anahtar vektorlerini pozitif ortanta toplamak, uzun baglamda kapasiteyi buyutmek ve ayni zamanda herbiri tek bir kavrama bakan tek anlamli sinapslar (monosemantic synapses) ortaya cikarmak. Pathway'in olcumlerinde bu sinapslarin ve seyrek aktivasyonlarin dogal olarak belirdigi rapor ediliyor.

BDH-CQ: Baglamdan ogrenip gizli uzayda dusunmek

BDH-CQ, bu mimarinin muhakeme icin ozellesmis hali. Adi In-Context Learning with Recurrent Latent Reasoning ifadesinden geliyor. Mantik su: sana birkac ornek gosteriliyor, model de yeni gorevi yalnizca bu orneklere bakarak cozuyor. Iki asamali calisiyor. 1) Baglamda ogrenme: ornekler sirasiyla islenirken tekrarlayan hafiza (recurrent memory) guncelleniyor, tipki kisa sureli notlari icerde biriktirmek gibi. 2) Tekrar eden gizli muhakeme: soru geldiginde model cevabi dogrudan kelime kelime yazmiyor; yuksek boyutlu gizli durumda iteratif olarak cozumu rafine ediyor ve yalnizca aday cevaplari cozuyor. Hicbir ara adim dile dokulmuyor, parametre guncellemesi yok, yeniden egitim yok. Ticari modellerin uzun dusunce zincirlerine kiyasla bu, sozluksuz dusunme rejimi olarak tanimlaniyor.

Degerlendirme icin secilen zemin ARC-AGI-1. Bu kiyaslama, modele birkac renkli izgara ornegi verip her gorevde degisen gizli kurali bulduruyor. Ornegin iki girdi-cikti ciftinde bir renk deseni saga kayiyor; ucuncu izgara geldiginde model ayni kaydirma kuralini uygulamali. Onemli olan tek bir kural degil, her bulmacada yeni bir kural uretme becerisi. Pathway bu veri kumesinin herkese acik degerlendirme kumesinde BDH-CQ ile pas@2'de %29.5'a ulasti. Hesaplanan cikarim maliyeti gorev basina 0.0007 dolar, yani bir sentin onda birinden az. Ayni liderlik tablosunda GPT 5.6 Luna (Low) %34.2 alirken 11 kat daha pahali; bu kiyas OpenAI'in 30 Temmuz fiyat indirimi sonrasi bile gecerli. Sonuclar bagimsiz kara-kutu testinde ve Lukasz Kaiser'in (Transformer makalesinin ortak yazari) kendi replikasyonunda da dogrulandi.

Olceklenebilirlik kismi videoda ozellikle vurgulaniyor. Pathway, yalnizca kucuk model degil, erken egitim sonuclarini 600 milyar parametreye kadar gosterip Transformer benzeri olcek yasasina isaret ediyor. Transformer'in tarihsel gucu buydu: daha fazla veri ve parametre verdiginde ongoru gorulebilir sekilde iyilesiyordu. Eger BDH de ayni egriyi izlerse, mimari degisimi sadece verimlilik degil, buyume yolu da sunar. Naik'in aktardigina gore makale bu olcege giden yolun henuz basinda oldugunu, ancak sinyalin umut verici oldugunu belirtiyor.

Peki bu renkli izgaralarin otesinde ne anlama geliyor? Pathway ornegini odunc alirsak, cok ulkeli karmasik bir seyahat planini dusunun: ucuslar, vizeler, butceler, hava durumu, acilis saatleri ve kisisel tercihler birbirini kisitliyor. Bir ucus iptal oldugunda iyi bir sistem neyin gecerliligini korudugunu, neyin yeniden kurulmasi gerektigini anlamali. Bu sadece belge getirme sorunu degil; etkilesimli kisitlar arasinda tutarli muhakeme gerektiriyor. BDH'nin iddiasi, bu tur durumlari dis hafiza yamasiyla degil, icerde surekli guncellenen bir halde cozmek.

Kisaca, video tek bir mesaj etrafinda toplaniyor: muhakeme icin odedigimiz token vergisi zekânin dogasi degil, mimarinin secimi. BDH, dikkati sinaptik hafizaya cevirerek, ayni anda hem baglamdan ogrenmeyi hem de gizli uzayda dusunmeyi ayni dokuya dikmeyi deniyor. Henuz 150 milyon parametrelik bir modelle sinirli bir kiyaslamada gorduk; buyuk olcek, uretim entegrasyonu ve daha zorlu muhakeme kumelerinde test edilmeden tablo tamamlanmayacak.

Görsel: nodesdaily AI

Videodaki anahtar anlar

  1. BDH nedir? Dragon Hatchling'e ilk bakisPathway'in BDH mimarisi Transformer ile beyin modelleri arasindaki kayip halka olarak tanitiliyor.
  2. Token vergisi: neden her adim kelimeye donusuyor20 cikolata ornegiyle Chain-of-Thought'un gizli maliyeti
  3. Hafiza darboğazi ve dis not defteri sorunuKV cache sisiyor, ajanlar dis vektor veritabanina yazmak zorunda kaliyor
  4. Beyin esinli cizge: sinapslar nasil hatirlarOlceksiz ag ve kenar agirliklandirma olarak muhakeme
  5. BDH-CQ: baglamdan ogren, gizli uzayda dusunOrnekler tekrarlayan hafizayi gunceller, cozum gizli durumda rafine olur
  6. ARC-AGI-1'de 0.0007 dolarlik 29.5%Gorev basina bir sentin onda birinden az maliyetle yeni verimlilik siniri

AI yorumu

"Benim icin BDH'nin asil iddiasi yuzde puani degil, aklin faturasini kisma bicimi: her akil yurutme adimini token'a cevirmek zorunda kalmamak, uretimde muhakemeyi gercekten olceklenebilir kilabilir."

AI değerlendirmesi

En guclu haliyle BDH tezini ciddiye alirsam soyle gorunuyor: dil modellerinde muhakeme maliyetini dusurmenin en temiz yolu daha uzun dusunce zinciri degil, dusunceyi kelimeye cevirmeden tasiyabilen bir mimari. Token darboğazini kaldirirsan hem gecikme hem fatura duser, ayni butceyle daha fazla aday cozumu sessizce deneyebilirsin. ARC-AGI-1 gibi her gorevde kuralin degistigi bir kiyaslamada %29.5'u bir sentin onda birinden ucuza almak, aklin birim fiyatini dusurdugunu gosterir ve bunu Lukasz Kaiser bagimsiz dogrulamasi destekler.

Sinirlar da net. Birincisi, BDH-CQ renkli izgara bulmacalarinda uzmanlasmis kucuk bir model; genel muhakeme, matematik, kod veya uzun belge uzerinde ayni verimliligi henuz gostermedi. Ikincisi, 600 milyara kadar olcek sinyali erken egitim gozlemlerine dayaniyor, tam olcekli 150 milyon ustu bir modelin liderlik tablosundaki buyuk modellerle kafa kafaya karsilastirmasi yok. Ucuncusu, Hugging Face makalesi ile BDH-CQ raporu ayri asamalarda yayimlandi; uretim kosullarinda gecikme, bellek ayak izi ve hata duzeltme davranisi gibi isletme metrikleri henuz kamuya acik degil.

Dogrulanabilirlik tarafinda tablo oldukca seffaf: ARC Prize liderlik tablosundaki resmi puan ve hesaplanan donanim suresinden turetilen gorev basina maliyet yan yana veriliyor, kara-kutu bagimsiz test raporu linkli. Ancak kiyas maliyetleri bazi modellerde API fiyatlandirmasina dayandigi icin elma-elmaya degil; ayrica ARC-AGI-1'in kendisi gorsel soyutlama agirlikli, gercek dunya ajan gorevlerini birebir temsil etmiyor. Daha saglam hukum icin ARC-AGI-2 veya canli ajan kiyaslamalarinda ayni protokolle tekrar olcum gerekir.

Pratik cikarim su: eger muhakemeyi urune tasiyip faturalandirilabilir hale getirmek istiyorsan, BDH yaklasimi cazip bir deney alani. Dusuk maliyetli, yuksek hacimli akil yurutme gerektiren yerlerde — ornegin surekli kural cikaran siniflandirma, kucuk ajan donguleri veya kisitli butceli arastirma — 150 milyon parametreli bir modeli denemek mantikli. Ancak kritik guvenlik veya finansal kararlar icin henuz genel amacli buyuk modellerin yerini alacak kanit yok; mimari degisimi olcekle birlikte kanitlamasi gerekecek.

Kaynaklar

7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

bdh · dragon hatchling · pathway · arc-agi · post-transformer

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…