Gündeme dön

Jev ile Harness Kurmak: LangChain ve TypeSafe'in Sistem 1 Modeli

LangChain ve TypeSafe’in ortak yayınında tanıtılan Jev, metin üretmeyen, yapılandırılmış kararlar döndüren bir Sistem 1 modeli olarak agent harness’lerinin maliyet ve hız sorununa çözüm sunuyor. 32K bağlam, üç soru tipi ve LangChain middleware örnekleriyle model, gerçek zamanlı kullanımın kapısını aralıyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — HHUsHkYhkcM
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Jev’i ilk duyduğunuzda kafa karışıklığı normal: Metin üreten bir model değil, metni okuyup yapılandırılmış bir karara dönüştüren bir Sistem 1 motoru. LangChain ve TypeSafe’in ortak webinerinde Allie, Hunter ve Sydney bu farkı en sade haliyle anlattı; Jev, iyi tanımlanmış bir soruya beş saniyede yanıt verebilen bir insan paneli gibi çalışıyor ve sonucu doğrudan kodun kullanabileceği tipli bir değerle döndürüyor.

Webinerin açılışında LangSmith’in agent mühendisliği vizyonu çerçevelendi: Build, Test, Deploy ve Monitor döngüsü. Birçok şirketin “sonsuz girdi, deterministik olmayan çıktı” problemiyle boğuştuğu, Deep Agents, LangChain ve LangGraph ile kodla; Fleet ile kodsuz agent kurulabildiği, eval’ler, tek tık dağıtım ve tek panelde gözlemin standartlaştığı bir hat anlatıldı. Governance ve LLM Gateway de her aşamaya gömülü.

Sistem 1 nedir ve neden kod-önceliklidir

Allie’nin Sistem 1 – Sistem 2 ayrımı Daniel Kahneman’ın Hızlı ve Yavaş Düşünme kitabına dayanıyor. Sistem 1 hızlı sezgi, Sistem 2 çok adımlı akıl yürütme. Jev, ikinciye öykünmeyen, hızlı ve dar kapsamlı kararlara odaklı bir model. Eskiden LLM’ler sezgisel ama güvenilmez hızlı yanıtlar veriyordu; akıl yürütme modelleri ise Sistem 2’ye kaydı. Jev, bu spektrumda bilinçli olarak birinciye yerleşiyor ve “kod aslında Sistem 2’niz” diyor.

Neden code-first? Allie’ye göre geleceğin otomasyonunun büyük kısmı makinenin makineyle konuşması. Zaten API’lar dünyayı ayakta tutuyor. Böyle bir dünyada insan dili üreten ağır bir modelin araya girmesi gereksiz köprü kurmak demek. CLI’lar ve tool call’lar bile insan için tasarlanmış arayüzler; onları çalıştırmak için koca bir LLM’i metin ürettirip sonra JSON’a çevirmek hem maliyetli hem yavaş kalıyor.

Hunter’ın çekiç benzetmesi aynı noktaya vuruyor: LLM popülerleşince her şey çivi gibi göründü. Tool calling ve structured outputs bu çivileri çakmak için eklenen protezlerdi ve gerçekten dönüştürücüydü; ama her küçük karar için aynı ağır makineyi çalıştırmak, maliyeti ve gecikmeyi şişirdi. Jev, bu protezleri baştan doğru tasarlanmış bir karara bırakmak için ortaya çıkıyor.

Jev’in çekirdeği üç soru tipinde saklı. Her çağrıda bir state ve bir soru dizisi gönderiyorsunuz; sorular paralel ve izole değerlendiriliyor, ek soru eklemek gecikmeyi neredeyse artırmıyor. Choice bir listeden tek seçenek seçer ve her seçenek için olasılık artı güven döndürür. Score bir eksende derecelendirir, sıfırdan N’e kadar sıralı seviyelerle sürekli bir skor verir. Noul ise bir önermenin doğru olup olmadığını 0–1 arası olasılıkla yanıtlar.

Choice en sık kullanılan tip. “Bu destek talebi faturalandırma, teknik ya da satıştan hangisine gitmeli?” örneğiyle anlatıldı. Sınıflandırıcı gibi çalışır; seçenekler net ayrıştığında ve tek dominant cevap beklendiğinde en iyi performansı verir. Seçenekler birbiriyle çakışıyorsa veya birden fazla cevap makulse, soru tasarımını bölmek gerekiyor.

Score’un gücü seviyelerin tanımında yatıyor. Örnekte müşteri öfkesini 0–2 ölçeğinde sakin, öfkeli, çok öfkeli diye ölçüyorlar. Her seviyenin ne anlama geldiği semantik olarak yazılmazsa, 6 ile 7 arasındaki fark muğlak kalır. İyi tanımlanırsa aynı soruyu binlerce farklı state’te sorduğunuzda 1 alanlar gerçekten aynı anlama gelir; bu tekrarlanabilirlik, log satırlarından canlı sohbet mesajlarına kadar ölçeklenebilir denetim sağlar.

Noul kulağa en basit gelen ama en çok hata yapılan tip. “Mesaj aciliyet iletiyor mu?” gibi yalın bir önerme soruyorsunuz, dönen değer 0–1 arası bir olasılık. Soru içinde “veya” geçiyorsa sarı bayrak kalkmalı, çünkü iki ekseni tek Boolean’a sıkıştırıyorsunuz demektir. Kural net: birleşik soru sorma, eksen başına bir Noul aç ve sonucu kodda birleştir.

LangChain tarafı Jev’i agent döngüsüne nasıl yerleştirdiğini iki canlı demo ile gösterdi. Agent’ların klasik döngüsü model → araç → değerlendirme → devam; her adımda ağır LLM çağırmak pahalı. LangChain’in felsefesi her işe uygun modeli kullanmak; Jev de harness’in içindeki küçük ama kritik kavşaklarda devreye giriyor, böylece ana LLM sadece gerçekten metin veya akıl yürütme gerektiğinde çağrılıyor.

Harness’in içinde: risk filtresi ve model yönlendirme

İlk demo AutoModeMiddleware idi. CRM’e not eklemek zararsız sayılırken müşteri hesabını silmek yıkıcı. Eskiden bu ayrım için ayrı bir LLM’e danışılıyor, hem gecikme hem maliyet artıyordu. Jev, araç çağrısı yapılmadan hemen önce devreye girip “riskli mi?” diye soruyor; Hunter’ın örneğinde güvenli çağrı geçti, silme işlemi ise “riskli” diye engellendi. Middleware, langchain-typesafe paketinden doğrudan import edilebiliyor.

İkinci demo model yönlendirme. Ucuz ve hızlı Luna ile derinlemesine Sol arasında seçim yapan bir RouterMiddleware. “Bu cümleyi yeniden yaz” gibi basit bir istekte Jev hızlı rotayı seçti, uzun ve araştırma gerektiren bir görevde ise derin rotaya yönlendirdi. Aynı middleware, LangSmith trace’ine her kararı yazdığı için hangi girdinin neden hangi modele gittiğini adım adım görmek mümkün.

Gözlemlenebilirlik webinerde ayrı bir başlıktı. Sydney, LLM’lerde trace ve eval’in ne kadar kritik olduğunu hatırlatıp Jev için de aynı disiplini önerdi. Allie’nin iki pratik tavsiyesi vardı: Jev çağrılarını denetleyebileceğiniz bir audit katmanı kurun ve tüm instruction/criteria metinlerini tek bir merkezi dosyada toplayın. Böylece vibe coding ile üretilmiş kötü yazılmış bir soruyu bir satırda düzeltip doğruluğu ciddi oranda artırabiliyorsunuz.

Sorulardan biri bağlam uzunluğuydu: Jev’de limit state artı en büyük soru için 32K token, tüm state artı sorular toplamında 64K. Multimodal henüz yok, ekip resmi olarak “henüz değil” diyor ve önceliğin kapasite ile hız/maliyet iyileştirmeleri olduğunu söylüyor. Yayın sonrası Discord’da paylaşılan örnekler ve LangSmith’e son dakikada eklenen yeni trace görselleştirmesi de bu hızlı ürün ritmini gösteriyor.

En heyecanlı kısım gerçek zamanlıydı. Allie, saniyede yüz bin izleyicili bir Twitch sohbetini 100–150 ms ek gecikmeyle filtreleyebildiklerini anlattı; skor eksenini bir kaydırıcıyla oynatıp sadece en ilginç soruları göstermek mümkün, üstelik aynı istekte her mesajı soru/mesaj/hype diye paralel sınıflandırabiliyorsunuz. Kendi favorisi ise Jev’in Doom’u gerçek zamanlı oynatması: her karede hangi canavara bakılacağına dair en iyi seçimi almak, düşük maliyet ve hız birleşince mümkün oluyor.

Eğitim tarafında TypeSafe, mixture of pretrained modeller ve tamamen şirket içinde üretilmiş sentetik veri kullandıklarını söylüyor; RLCD ile kalibre edilmiş kararlar ve post-training ötesinde “secret sauce” vurgusu var ama detaylar sınırlı. LangChain blogu Jev’in sınıflandırma işlerinde benzer LLM’lere göre 200 kata kadar hızlı ve 400 kata kadar ucuz olabildiğini aktarıyor; bu da çok sorulu tek çağrının neden ek maliyeti neredeyse artırmadığını açıklıyor.

Güven ve eşik tartışması webinerin en nüanslı bölümüydü. Dönen güven değeri, olasılık dağılımı üzerinden deterministik bir hesap; tek dominant cevap beklenen durumlarda iyi bir vekil, ama birden fazla iyi seçenek yarıştığında doğal olarak düşük kalıyor ve bu bir hata değil. Doom’da veya alışveriş sepeti örneğinde en yüksek olasılığı doğrudan almak, güvene göre fallback yapmaktan daha doğru. Bazen eşik için tepe olasılık, bazen tepe eksi ikinci, bazen oran daha anlamlı.

Son olarak büyük girdilerde bozulma ve context engineering uyarısı geldi. Model Jaggedness dokümanı dürüstlük ilkesiyle zayıf noktaları listeliyor; state’e gereksiz detay doldurmak doğruluğu düşürebiliyor. Allie, Doom state’ine eklediği aşırı granüler “son eylemler” dizisinin zekâyı nasıl azalttığını örnek verdi. Tavsiye net: state’i sadece karar için gerekli olanla kurun, bileşik soruyu parçalayın ve her şeyi prod’a atmadan kendi verinizde test edin.

Görsel: nodesdaily AI

AI yorumu

"Bana kalırsa Jev’in en güçlü vaadi yaratıcılık değil tutarlılık. Her kararda ağır bir LLM’i çalıştırmak yerine, binlerce küçük kararı 100 milisaniyede ve kuruşun kesri maliyette çözmek, agent’ları laboratuvardan ürüne taşıyan köprü. TypeSafe’in “kararlar, metin değil” sloganı bu yüzden isabetli; prod’a giden yol hız ve öngörülebilirlikten geçiyor."

AI değerlendirmesi

Webiner, Jev’in güçlü yanını da sınırını da net koyuyor. Üç soru tipine indirgenebilen, iyi tanımlanmış karar problemlerinde hız ve maliyet avantajı tartışmasız; paralel soru ve LangChain middleware’leri bunu prod’a taşınabilir kılıyor. Ancak Jev, metin üretmesi veya çok adımlı akıl yürütmesi gereken yerde LLM’in yerini almıyor; alanını genişletmek soru tasarımını ve state budamayı gerektiriyor.

Bana kalırsa en kritik risk, güven skorunu tek eşik olarak kutsamak ve belirsiz soruları Jev’e atmak. Güven dağılıma duyarlı, soru kötü yazılmışsa düşük güven modelin değil tasarımın sinyali. Ekip “kendi verinde test et” demekte haklı; özellikle Türkçe karakterli destek kayıtları, uzun sohbet geçmişleri ve regülasyon odaklı senaryolarda ayrı kalibrasyon şart.

Kaynaklar

5 bağlantı; 2 tanesi 2 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

yapay zeka · harness · kurmak · langchain · typesafe · sistem · nodesdaily

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

Jev ile Harness Kurmak: LangChain ve TypeSafe'in…