Uzun bir sohbette projenin ortasında verilen bir söz, üç yüz mesaj sonra hâlâ geçerli midir? Standart dil modelleri için cevap çoğunlukla hayırdır; pencere büyüdükçe ortadaki ayrıntılar silinir. Sunucu, bu derde yerel öğrenen bellek adında bir çözüm getiriyor: Hindsight adlı açık kaynaklı sistem, kodlama yardımcısının geçmiş etkileşimlerden ders çıkarmasını ve her kullanımda daha isabetli davranmasını amaçlıyor.
Neden klasik yöntemler yetmiyor
Sıradan tüm bağlamı pencereye doldurma yaklaşımı, konuşma uzadıkça maliyeti şişirir ve kritik ayrıntıyı kalabalıkta kaybeder. Klasik geri getirme destekli üretim ise metin parçalarını olduğu gibi saklar; ilişkileri, varsayım değişikliklerini ve eskimeyi izleyemez. GitHub deposundaki felsefe bu noktada ayrışır: amaç sohbet geçmişini hatırlamak değil, yardımcının zaman içinde öğrenmesidir. Bu ayrım, bilgi grafiği meraklılarıyla salt vektör aramacıları arasındaki eski tartışmaya da yeni bir yanıt verir.
Sayılar ilk bakışta çarpıcıdır. LongMemEval ölçütünün S kümesinde 500 soruluk dizide 20 milyar parametreli açık modelle çalışan Hindsight yüzde 83,6 toplam doğruluk bildirirken, tüm bağlamı pencereye dolduran GPT-4o aynı dizide yüzde 60,2 düzeyinde kalıyor. Gemini-3 omurgasıyla skor yüzde 91,4 düzeyine çıkıyor ve bilgi güncelleme ile zamansal akıl yürütme alt kırılımlarında yüzde 94,9 ile yüzde 91,0 değerleri görülüyor. Vectorize ölçüm panosu manşet değeri olarak yüzde 94,6 uzun menzilli geri çağırmayı öne çıkarıyor ve GitHub tarafındaki not, ana tablonun Virginia Tech Sanghani Center iş birliğiyle bağımsız biçimde yeniden üretildiğini belirtiyor.
Motorun içi: dört katmanlı bellek
Sistem, dağınık sohbet yığınını tek bir metin dosyasına tıkıştırmak yerine bilgiyi dört uzman depoya ayırıyor. İlk katman kullanıcı, tarih ve çalışma alanına dair kalıcı olguları tutar; ikinci katman tamamlanan görevleri, kullanılan araçları ve sonuçlarıyla kaydeden bir faaliyet günlüğü işlevi görür. Üçüncü katman değişen gereksinimlere göre güncellenen işletimsel varsayımları izler, dördüncü katman ise arka planda sessizce yazılan derli toplu bellek sayfalarını saklar. DeepWiki mimari özeti bu katmanların Postgres üzerinde pgvector dizinleriyle nasıl durduğunu, Agent Memory Atlas incelemesi ise ham belge ile dünya olgusu, deneyim olgusu, gözlem ve kullanıcı yansıtması arasındaki ayrımı anlatır.
Bir anıyı bulma işi, dört kolun paralel koştuğu TEMPR düzeniyle yapılır. Anlamsal arama aynı anlama gelen farklı sözcükleri eşleştirir, birebir anahtar kelime taraması işlev adları ve hata kodları gibi kesin dizgeleri yakalar, ilişki çizgesi kişi ile araç ile konu arasındaki bağları izleyerek düz metin aramasının kaçırdığı bağlamı toplar ve zamansal süzgeç eski girdileri eleyerek güncel öğrenmelere odaklanır. Vectorize geliştirici belgelerindeki geri çağırma sayfası, her sorguda hangi kolun koşacağına önceden karar verilmediğini, uygun tüm kolların çalışıp sonuçların çapraz kodlayıcıyla yeniden sıralandığını açıklar.
Maliyet tablosu, projenin en iddialı yanıdır. Bellek aramaları aygıtın içinde yapıldığı için her sorgu başına bulut faturası işlemez; sunucu, 25 civarı model sağlayıcısı arasında bellek veritabanını yeniden kurmadan geçişe izin verir. Python kitaplığı birkaç yüz megabaytlık sistem belleğiyle dizüstü bilgisayarda düzenleyiciyle yan yana çalışacak şekilde tasarlanmıştır. GitHub üzerindeki Docker ve istemci yönergeleri, gömülü Postgres ile tek kapsayıcıda ayağa kalkan, Ollama üzerinden tamamen yerel modellere bağlanabilen bir kurulum çizer.
Kurulum ve ilk banka
Kurulum öyküsü bilerek sade tutulmuştur: sanal ortam açılır, pip ile istemci kurulur, istenirse Gemini anahtarı ortam dosyasına konur, istenmezse yerel model yolu seçilir. İstemci üç fiille konuşur; retain bilgi yazar, recall anı arar, reflect bankada biriken bilgi üzerinden konuya uygun yanıt üretir. Her banka kendi yapılandırmasını taşır, çok kiracılı uçlar banka kimliğiyle ayrışır ve iki satırlık sarmalayıcıyla mevcut yardımcıya bellek otomatik bağlanır. GitHub deposundaki Python örneği, Alice örneği üzerinden bu üç çağrının birkaç satırda nasıl kurulduğunu gösterir.
Gösterinin can alıcı bölümü, Pulse Grid adlı kurgusal ürün belgesinin sisteme yedirilmesidir. Belgede istemcileri yeniden yazmadan veritabanını hızlandıran bir ürün, 14 büyük müşteri, günde 4 milyar istek, ayda 38 bin dolar sunucu faturası, gelecek ay sözleşmesi bitecek üç büyük müşteri ve yoğun yükte yarım saniyeye çıkan gecikme gibi olgular yer alır. Yardımcı önce bu olguları bellek bankasına çıkarır, sonra aynı olgu kümesini üç farklı kişilik süzgecinden geçirir. Sonuçlar hem Markdown dosyasına hem de profilleri yan yana gösteren sade bir HTML panoya yazılır.
Kyra: üç kişilik, üç hüküm
Kişilik sistemi Kyra, yardımcının kanıtlara nasıl davranacağını üç eksende ayarlar. Yatırımcı profili şüpheciliği en yükseğe çeker, duygusal sıcaklığı en düşüğe indirir ve acımasız bir başkan yardımcısı gibi sorar: gelirin çoğu gelecek ay biten üç sözleşmedeyse kasa ne kadar dayanır? Kıdemli mühendis profili kurallara harfiyen bağlılığı zirveye taşır ve neredeyse ışık hızında çoğaltma söylemini yarım saniyelik ölçümle çürütür. Destek profili ise şüpheyi kısar, sıcaklığı yükseltir ve yeniden yazmadan hızlanma vaadinin yorgun geliştiriciler için gerçek bir rahatlama olduğunu vurgular. Aynı bellek, üç ayrı mizaçla üç tutarlı ama farklı hüküm üretir.
Günlük işlere tercümesi hızlıdır: girişim belgelerinde nakit erime riskini erken yakalamak, abonelik iptallerinden önce uyarı işaretlerini toplamak, binlerce proje notunu buluta para ödemeden taramak ve gelen metinlerdeki gizli anahtar ile kişisel veriyi belleğe yazılmadan ayıklamak. Sunucu, bu sonuncusunu özellikle vurgular; tehlikeli dizgeler saklanmadan önce süzülür. Üç fiil ile kişilik eksenleri birleşince ortaya tek bir sohbet robotu değil, farklı roller için yeniden yapılandırılabilen bir bellek altyapısı çıkar.
Bedeller de açıkça sayılır. İlk kurulumda birkaç yüz megabaytlık model ağırlığı iner ve belleğe yazılan her metin parçası alım sırasında bir dil modeli çağrısını tetikler; bu yüzden bulut kullananların parçaları toplu göndermesi öğütlenir. Eski bilgiyi rastgele silmek yerine mevcut bilgi dikkatle arıtılır, böylece ortadaki talimatlar son mesajlar kadar net hatırlanır. ACL bildirisi aclanthology adresinde bu saklama, geri çağırma ve yansıtma üçlüsünü biçimsel bir çerçeveye oturtur; DeepWiki üzerindeki bileşen dökümü ise HTTP ile MCP arayüzlerinden Postgres şemalarına kadar üretimde neyin nerede koştuğunu gösterir.
| Sistem | Omurga | Genel |
|---|---|---|
| Hindsight | Gemini-3 | %91,4 |
| Hindsight | OSS-120B | %89,0 |
| Hindsight | OSS-20B | %83,6 |
| Supermemory | GPT-4o | %81,6 |
| Tam bağlam | GPT-4o | %60,2 |
Videodaki anahtar anlar
AI yorumu
"Uzun sohbetlerde unutkanlık, kodlama yardımcılarının en pahalı zaafı ve Hindsight bu soruna şaşırtıcı derecede pratik bir cevap veriyor. Skorlar güçlü görünüyor, mimari ciddiye alınacak kadar olgun; yine de her iddiayı bağımsız ölçütlerle test etmeden üretim kararına taşımamak gerekir."
AI değerlendirmesi
En güçlü karşı görüş, skorların tek bir ölçüt ailesine yaslanmasıdır. LongMemEval, Hindsight ekibinin de önerdiği gibi zemin gerçekliği en sağlam testtir; ancak LoCoMo tarafında rakip skorların bir kısmı öz-bildirimlidir ve Vectorize dışındaki sonuçlar bağımsız laboratuvarlarda tek tek yeniden üretilmemiştir. Virginia Tech Sanghani Center doğrulaması yalnızca ana tabloyu kapsar, bu yüzden yüzde 94,6 sayısı umut verici bir tepe değer olarak okunmalı, taban beklenti olarak değil.
Sunumda eksik kalanlar da var. Kişilik katmanı Kyra, üç hazır profille etkileyici bir gösteri sunuyor; fakat şüphecilik, harfiyen bağlılık ve sıcaklık gibi eksenlerin gerçek denetim işlerinde nasıl kalibre edileceği belirsiz. Üretim tarafında gömülü Postgres geliştirme için rahat olsa da yüksek yazma trafiğinde dış veritabanı, gözlemlenebilirlik ve yedekleme planı gerekir; DeepWiki mimari özeti bu operasyonel katmanı açıkça belgeler.
Konuşmacının konumu da hesaba katılmalıdır. Build with AI dizisi, ücretsiz yerel araçları tanıtarak büyüyen bir formattır ve ilk bağlantıdaki belge ile kodlara yönlendirme, izleyiciyi aynı ekosistemde tutar. Gemini anahtarı adımı ücretsiz katmanla sunulsa da bulut çağrısı başına maliyet konuşmacının değil izleyicinin hanesine yazar; bu yüzden sıfır maliyet söylemi yalnızca tamamen yerel kurulumda ve toplu alım disipliniyle geçerlidir.
Okur için pratik çıkarım nettir: önce küçük bir bankayla başlayın, gözlemleri kapalı tutarak temel geri çağırma kalitesini ölçün, sonra kişilikli yansıtma katmanına geçin. Alım tarafında metin parçalarını toplu gönderin, Vectorize belgelerindeki sağlayıcı tablosunu kendi modelinize göre doğrulayın ve kritik kararlar öncesi GitHub ile aclanthology kaynaklarındaki sayıları kendi veri kümenizde yeniden koşun.
Kaynaklar
8 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — Build with AI: Hindsight agent memory
- @github.com GitHub — vectorize-io/hindsight
- @github.com GitHub — vectorize-io/hindsight-benchmarks
- @benchmarks.hindsight.vectorize.io Vectorize — Hindsight Benchmarks board
- @hindsight.vectorize.io Vectorize — Recall: How Hindsight Retrieves Memories
- @aclanthology.org ACL Anthology — HINDSIGHT structured memory paper
- @deepwiki.com DeepWiki — Hindsight component overview
- @neoneye.github.io Agent Memory Atlas — Hindsight review
yapay zeka · ajan bellek · hindsight · longmemeval · yerel llm · ollama