Gündeme dön

Kararı Getirme İşine Çeviren Mimari: 13 Kat Hızlı CLM-8B

Stanford ve Nvidia Research ortaklığında geliştirilen CLM-8B, karar vermeyi metin üretiminden ayırıp getirme işine çeviren 8 milyar parametrelik açık bir model. 1024 seçenekte 570 milisaniyeye karşı 44 milisaniye ölçülürken doğruluk benzer kalıyor; ancak seçenek sayısı bine çıkınca isabet belirgin düşüyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — eSuMmMMMrm0
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Gerçek yazılımların içinde verilen kararların çoğu, bir modelin otuz saniye boyunca düşünmesini gerektirmez. Bir destek talebi acil mi, sıradaki çalışacak araç hangisi olmalı, ajan ekrandaki hangi bağlantıya tıklamalı: bunların yanıtı saniyeler sonra değil, milisaniyeler içinde lazımdır. Bu yüzden System One dalgası büyüyor; düşünmeyen, muhakeme yürütmeyen, sadece hızlı ve tipli karar veren modeller yeniden gündemde. Konuşmacının açılış tezi de bu: ajan döngülerinin kalbi artık üretim değil, seçim hızı.

Bu haftanın farkı ise mimaride. Stanford ve Nvidia Research ortaklığındaki ekip, karşıtsal dil modeli adını verdikleri CLM-8B adlı 8 milyar parametrelik açık bir model yayımladı. En iyi benzetme, kararlar için CLIP demek: Arxiv'deki CLIP çalışmasında anlatılan ortak gömme uzayı fikri burada durum ile eyleme uygulanıyor. Bir durum kodlayıcı o an ne olup bittiğini, bir eylem kodlayıcı ise yapılabilecekleri okuyor. Mario örneğiyle: ekran görüntüsü durum, sol, zıpla ve koş eylemler; her seçenek gömülüp duruma yakınlığına göre puanlanıyor, softmax üzerinden olasılığa çevriliyor ve zıplama yüzde 80 ile seçiliyor.

CLIP Kararlar İçin: Durum ve Eylem Aynı Uzayda

Tasarımın akıllıca yanı, mevcut alışkanlıkla birebir konuşması: model, Jev ile aynı uygulama arayüzünü kullanıyor. Jevapi belgelerine göre üç primitif var; evet-hayır sorusu, çoktan seçmeli soru ve puanlama. System-One belgelerine göre bunların üçü de özünde aynı şey: bir durum artı kapalı bir aday listesi. Bu kapalılık iki ucu keskin bir söz veriyor: model listededışı bir yanıt uyduramıyor, tıpkı Jev'in halüsinasyon görmeme iddiası gibi. Ama Jevals yöntemine göre System One modelinin tanımı gereği listededışı üretim yoktur, listeiçi hata ise her zaman mümkündür; model yanlış şıkkı da özgüvenle seçebilir.

Doğru eylemin duruma en yakın noktaya düşeceği uzay nasıl kuruluyor? Yanıt, karşıtsal eğitim . Eğitim, her biri bir durum ile gerçekten yapılmış bir eylemden oluşan milyonlarca örnekle başlıyor; model her durumu kendi eylemine yaklaştırıp diğerlerinden uzaklaştırmayı öğreniyor. Güzel hile, yanlış örnekleri kimse yazmıyor: bin örneklik bir yığında Mario ekranı için zıplama doğruysa, diğer 999 eylem otomatikman bu durum için yanlış sayılıyor. Böylece pozitif ve negatif örnek dengesi bedavaya geliyor ve benzer görünenle doğru olan arasındaki fark, uzayın geometrisine işleniyor.

Hızın kaynağı bu ayrımda gizli. Jev tarzı modelde durum ve tüm seçenekler her çağrıda birlikte okunuyor; seçenekler ikiye katlanınca okuma yükü de katlanıyor, üstüne yanıtın belirteç belirteç çözülmesi ekleniyor. CLM ise ikisini ayırıyor ve ajan döngülerindeki tipik durumu kullanıyor: adımlar boyunca değişen durumdur, eylem listesi değil. Eylemler bir kez gömülüp önbelleğe alınıyor; her yeni adım tek bir durum gömmesi artı neredeyse bedava bir nokta çarpım demek. Ekibin grafiğinde seçenek sayısı bine dayanırken CLM çizgisi neredeyse kıpırdamıyor: 1024 seçenekte 44 milisaniyeye karşı 570 milisaniye, yani yaklaşık 13 kat fark. VentureBeat'e göre ekip açık testlerde 9 kata kadar hız bildiriyor; hangi sayı alınırsa alınsın tablo aynı yönü gösteriyor.

Üç Aşamalı Eğitim: Önce Dünya, Sonra İnce Ayrım

Eğitim üç aşamalı bir tarif izliyor ve sıra, işin püf noktası. Birinci aşamada Nvidia'nın Nemotron verisinden 60 milyon soru-yanıt çiftiyle genel dünya bilgisi veriliyor; soru durum, yanıt eylem sayılıyor. İkinci aşamada üretken bir modelle yazdırılmış 30 milyon sert negatif , yani kulağa doğru gelen ama yanlış yanıtlar ekleniyor; güneşe en yakın gezegen sorusunda Venüs tuzağı gibi. Sert negatifli testte tek başına ön eğitim yüzde 52 alırken, ikinci aşama skoru yüzde 69'a taşıyor; sert negatifle baştan başlamak ise yüzde 62'de tepe yapıp ezberadüşüyor. Notion'daki resmi sayfa bu sırayı ön eğitim artı son eğitim ilişkisiyle anlatıyor: önce dünyayı öğren, sonra ince ayrımı. Üçüncü aşamada yaklaşık 1 milyon gerçek ajan iziyle ajan davranışına dönüşülüyor ve ilk verinin yüzde 40'ı tekrara karıştırılıyor; bu tekrar olmazsa sert negatif skoru yüzde 69'dan 56'ya geriliyor.

Eğitimin en şaşırtıcı yanı, 8 milyar parametrelik gövdenin hiç kıpırdamaması: Qwen3-8B olduğu gibi dondurulmuş bir okuyucu, tek bir gradyan almıyor. Eğitilen yalnızca her iki yanda yaklaşık 20 milyon parametrelik küçük başlıklar. Omurga değişmediği için veri kümesi bir kez gömülüyor ve tam ön eğitim tek bir RTX 4090 üzerinde yaklaşık bir saatte bitiyor. GitHub'daki Qwen3 deposu modelin açık ağırlıklı ve 36 katmanlı yapısını doğruluyor; HuggingFace'teki model kartı 8,2 milyar parametre ve Apache 2.0 lisansını kayda geçiriyor. Kayıp; işlem, veri, başlık boyutu ve kodlayıcı boyutu ile güç yasası izliyor ve en büyük kazancı daha büyük kodlayıcı veriyor. Bu yüzden ekip, gelecek ay gelmesi beklenen çok modlu büyük sürümü işaret ediyor.

Teoriden sonra konuşmacı işi kendi masasına taşıyor: Qwen belgelerine göre vLLM hizmetiyle sunulan Qwen3-8B kodlayıcının üstünde, ekibin yayımladığı yalnızca 75 MB'lık CLM sunucusu çalışıyor; toplam bellek tutarı 25 GB civarında. Nvidia'ya göre DGX Spark, 128 GB birleşik belleğiyle 200 milyar parametreye kadar çıkarımı masada tutabilen bir kutu, yani deney düzeneği iddialı ama erişilebilir. Çifte ücretlendirilmiş ve kimseye ulaşamayan bir müşterinin destek bileti durumda ele alınıyor; acil mi, hangi ekip, öfke düzeyi sorularının yanıtları olasılıkla geliyor, acil yüzde 84, faturalama yüzde 99. Bilet bir kez görüldükten sonra aynı soru 2 milisaniyenin altında dönüyor, çünkü her şey önbellekte. Romeo ve Juliet testinde ham gömmeler Marlowe'u birinci çıkarırken CLM Shakespeare'i yüzde 98 olasılıkla öne taşıyor; 20 milyon parametre uzayı benzerlikten doğruluğa büküyor.

Bin Seçenekte Hız, Doğrulukta Sınır

Mimari asıl şovunu aşırı ölçekte yapıyor: Stripe'tan Trello'ya 1080 araçlık listede ilk çağrı gömme yüzünden saniyeler sürüyor, sonrası her yeni istekte 80 milisaniye civarında sabitleniyor. Bin seçenekle tek seçenek neredeyse aynı sürede eleniyor. Wiki yarışında 934 bağlantılık sayfanın tamamı tek seferde hedefe göre puanlanıyor, dört tıklamada varılıyor. Ama aynı deneyler sınırı da belgeliyor: 8 araç arasından doğru seçim yüzde 86 iken 1080 araçta yüzde 17'ye düşüyor; birbirine benzeyen iade araçları karışıyor. Nedeni tasarımın kör noktası: durum tek başına kodlandığı için seçenekler yan yana konup karşılaştırılamıyor, her aday tek tek yargılanıyor.

Konuşmacının inşaatçılara önerisi bu yüzden iki katmanlı: CLM bini ilk 10'a indirsin, son kararı seçenekleri birlikte okuyan dikkatli model versin. Eylem kümesi küçük ve sabitse, oyun döngüsü ya da birkaç rota gibi, model tek başına da iş görüyor. MLflow'a göre araç kullanımı kılavuzu, 8'den fazla aracı tek ajana yığmayı tasarım sorunu sayıyor ve işlev başına alt ajanlara bölmeyi öneriyor; CLM'nin doğruluk eğrisi bu kuralı bağımsız biçimde doğruluyor. Kapanıştaki büyük resim ise nostaljik: Jev'in ısıttığı hızlı ve muhakemesiz karar fikriyle 2017-2018'in karşıtsal öğrenme algoritmaları aynı potada buluşuyor. Karar getirme işine, üretim ise yavaş düşünmeye kalıyor.

Görsel: nodesdaily AI

Videodaki anahtar anlar

  1. System One dalgası: milisaniyelik kararlar
  2. CLM tarifi: kararlar için CLIP fikri
  3. Hız grafiği: 44 ms ve 570 ms karşılaştırması
  4. Üç aşamalı eğitim ve sert negatifler
  5. Destek bileti demosu ve Shakespeare testi
  6. 1080 araç ve wiki yarışı sınırları

AI yorumu

"Konuşmacı teoriyi masada bırakmıyor; modeli kendi donanımında koşturup bin araçlık listede ve wiki yarışında sınıra kadar zorluyor. Ölçtüğü doğruluk düşüşünü saklamaması, 13 kat hız iddiasını ciddiye alınır kılıyor. Benim gözümde bu işin asıl değeri mimaride değil, getirdiği tarifte: hızlı model elesin, dikkatli model karar versin."

AI değerlendirmesi

En güçlü itiraz deneysel değil, mimari: durum tek başına kodlandığı için model seçenekleri yan yana koyup karşılaştıramıyor. Her aday tek başına yargılanıyor, benzer görünenler birbirine karışıyor ve liste büyüdükçe doğruluk düşüyor. Getirme muhakeme değildir, benzerlik doğrulukla aynı şey değildir; yüzde 86'dan yüzde 17'ye kayış bu cümlenin sayılara dökülmüş hali.

Eksikler de önemli. Bu sürüm salt metin; daha büyük çok modlu sürüm hâlâ yolda, yani genel karar iddiası o teste kadar bekliyor. Manşet rakamlar ekibin grafiklerinden ve tek konuşmacının demolarından geliyor, bağımsız tekrar ölçümü henüz yok. Bir de sessiz bir döngüsellik var: sert negatifleri üretken bir model yazıyor; makul ile doğru arasındaki sınırı öğretirken o üreticinin kör noktalarını da miras bırakıyor olabilir.

Konuşmacının konumuna serin bakmalı. Demolar Nvidia donanımı üzerinde, coşkulu ve inşaatçı dostu bir tonda sunuluyor; heyecan formatın parçası. Buna karşılık iki olgu hikâyeyi disipline ediyor: kod da sunucu da açık yayımlanmış, ve VentureBeat'e göre proje lideri Jacky Kwok karşıtsal hedefi evrensel zafer değil, alana özgü karar işlerinde avantaj diye çerçeveliyor. Açık yapıt artı sınırlı iddia, ikisinden birine tek başına duyulacak güvenden büyüktür.

Okur için pratik ders somut. Eylem kümeniz küçük ve sabitse, bir oyun döngüsü ya da birkaç rota, bu sınıf bugün tek başına iş görür. Ölçek büyüyünce tarifi ilk aşama olarak kullanın: CLM bini milisaniyelerde ilk 10'a indirsin, son kararı seçenekleri birlikte okuyan model versin. Tekrar deneyinden çıkan eğitim ahlâkını da unutmayın: model uyarlarken eski veriyi karışıma katmazsanız önceki kazanımlar sessizce buharlaşır.

Kaynaklar

11 bağlantı; 2 tanesi 2 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

clm-8b · system one · karşıtsal öğrenme · ajan araçları · qwen3

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…