Telefon ikonu kadar küçük bir dosyayla büyük modelleri geride bırakma iddiası kulağa pazarlama cümlesi gibi geliyor, ama Needle 3 tam da bunu söylüyor. En küçük çalışır sürümü 4 katmanda yaklaşık 8 MB, tam sürümü 20 katmanda 29 MB tutuyor. İnternet yok, sunucu yok, gecikme yok; model doğrudan cihazda koşuyor. Video, bu iddiayı tek tek parçalara ayırıp her birinin nerede abartılabileceğini gösteriyor.
Arkasındaki ekip Cactus Compute, San Francisco merkezli ve Y Combinator destekli küçük bir ekip. Vizyonları epey net: buluta bağımlı zeka pahalı, gecikmeli ve veriyi dışarı taşıyor. Onlar bunun yerine zekayı cihazın kendisine indirmek istiyor. Yıllardır mobil ve uç cihazlar için açık kaynak araçlar üretiyorlar, bu yüzden Needle bir anda ortaya çıkmış tek seferlik deney değil, hattın üçüncü halkası.
Serinin evrimi hızlı olmuş. Needle 1, bu yılın başında 26 milyon parametreyle Gemini’nin araç çağırma yeteneğinin damıtılmış hali olarak tanıtıldı, bütçe telefonunda bile çalışacak kadar küçüktü ve tamamen açıktı. Needle 2, 45 milyon parametreye çıkmasına rağmen diskte 14 MB’ta kaldı, 256 token’lık kayan pencere ve sabit referansla araç tanımlarını bellekte pinleyerek konuşma uzasa bile bellek izini 28 MB’ta sabitledi. Ekip o sürümün genel sohbet için değil, tek iş için uzman olduğunu baştan söylemişti: doğru fonksiyonu seç ve argümanları doldur.
Proje, sayılara bakınca tek seferlik deney görüntüsünden uzak. GitHub deposu 11.300 yıldızın üzerinde, 700’ü aşkın çatal ve onlarca aktif katılımcı var; lisans yakın zamanda MIT’ten Apache 2.0’a güncellendi ve son bir iki gün içinde dahi motor düzeltmeleri ve bellek yönetimi güncellemeleri gelmiş. Hızlı yıldız artışı ve 17 etiket sürümü, ilginin geçici olmadığını düşündürüyor.
En güçlü sinyal ise sahada. Pebble’ın ekransız akıllı yüzüğü Pebble Index Ring, Cactus Needle’ı doğrudan uygulama içinde çalıştırıyor. Kurucunun söylediği net: ekranı olmayan bir cihazda sesli komut her seferinde, internet olsa da olmasa da yerine gelmek zorunda, bu yüzden bulut yerine yerel model tercih edilmiş. Ayak izi küçük kalırken performansın düşmemesi, laboratuvar tabloları dışında da bir doğrulama sunuyor.
Needle 3’ün vaadi üç işi tek modelde toplamak ve hepsini cihazda bitirmek. İlki araç çağırma: uygulama, modelin kullanabileceği fonksiyonları açıklamalarıyla veriyor, Needle da kullanıcının cümlesini okuyup hangi fonksiyonların hangi argümanlarla çağrılması gerektiğini buluyor. Tek cümlede iki iş varsa iki çağrıyı doğru sırada döndürüyor, hiçbir araç uymuyorsa tahmin yürütmeden boş liste veriyor ki yanlış işlem tetiklenmesin.
Bunu ete kemiğe büründüren örnek Cactus’ün kendisi: “Yatak odasını kıs ve kapıları kilitle” cümlesi tek seferde iki çağrıya dönüşüyor — biri ışıkları kısmak, diğeri kilitlemek için. İki eylem de merkezi hub’a veya buluta tur atmadan anında yerelde çalışıyor. Videoya göre bu, Needle’ın özellikle hedeflediği anın kendisi: sesli komutun gecikmesiz ve çevrimdışı yerine gelmesi.
İkinci iş yapılandırılmış çıkarım. Modelden dağınık bir metin ve istenen bilginin şemasını veriyorsunuz, Needle da türe uygun tertemiz alanları geri döndürüyor. Faturadan satıcı adı, toplam tutar ve vade tarihi çekmek, rezervasyon teyidi, telefon bildirimi veya formdan kritik detayları ayıklamak buna örnek. Güvenirliği sağlayan şey decode grammar: üretim sırasında model şemaya kilitleniyor, çıktı her zaman ayrıştırılabilir ve geçerli geliyor. Ekip bu yaklaşımın sınıflandırmaya da genellendiğini söylüyor.
Üçüncü iş metin gömme. Aynı model bir cümleyi vektöre, yani anlamın sayısal parmak izine çeviriyor. Böylece uygulama cihaz içinde arama, eşleştirme ve yönlendirme yapabiliyor: yüzlerce not arasından doğru olanı bulmak, belirsiz bir isteğe en yakın aracı seçmek veya aynı şeyi söyleyen iki uyarıyı birleştirip tekilleştirmek gibi. Ekran ve dikkat alanı dar bir saatte bunun yerel yapılması özellikle değerli; aksi halde her sorgu buluta gidip gelmek zorunda kalırdı.
Bu üç işi ayrı uzman modeller veya buluttaki dev bir modele havale etmek yerine tek küçük modelde birleştirmek, eğer pratikte tutarsa geliştirici için ciddi karmaşıklığı ortadan kaldırır. Needle 3’ü farklı kılan fikir ise Cactus’ün zeka merdiveni dediği yapı: tek bir ağırlık setinde 2’den 20’ye kadar her derinlik kendi başına çalışan ve alttakinden daha yetenekli bir model. Geliştirici saate 4 katmanlık 8 MB ve 29 milyon parametreli sürümü, amiral telefonuna 20 katmanlık 29 MB sürümü koyabiliyor, ikisi de aynı eğitim sürecinden geliyor. Derinlikler birlikte eğitildiği için küçük alt ağlar büyük sürecin yeteneğini miras alıyor ve her derinlik sonra ayrı ince ayar alabiliyor.
Bu kadar esnekliği mümkün kılan mimari dokunuşlar epey spesifik. Çoğu transformer’daki ileri beslemeli katman yerine Monarch Hadamard yapısı, dikkat mekanizmasında rotary pozisyon gömmeli gruplu sorgu dikkat ve hafif konvolüsyon dokunuşları var. En ilginç parça Cactus’ün engram dediği hash bellek araması: parametrelerin büyük kısmı canlı hesap yerine ezberlenmiş desen olarak tutuluyor, bu yüzden 121 milyon parametreli model ham işlem açısından 50 milyon parametreli gibi davranıyor. Tek bilgi yoluna ek olarak çok kulvarlı hiper-bağlantılar da veriyi paralel taşıyor. Cactus’e göre bu tercihlerin toplamı token başına standart aynı boyuttaki transformer’a kıyasla iki kattan fazla daha az işlem anlamına geliyor; çevirisi pil ömrü ve ısıda doğrudan kazanç. Ekip, ağırlık paylaşımının kendisinin yeni olmadığını da dürüstçe not ediyor, yeninin bu kadar cilalı ve gerçekten küçük cihazlarda çalışır ürün olarak sunulması olduğunu söylüyor.
İddiayı kabul etmeden önce neyin test edildiğine bakmak gerekiyor. Cactus, araç çağırma tarafında 961 satırlık Google Mobile Actions (telefon komutları → Android intent), 200 satırlık DroidCall (sıralı çift çağrılar) ve 3.641 satırlık Berkeley BFCL v4’ü (uç durum ve yanlış pozitiften kaçınma dahil) kullanmış. Çıkarım tarafında DSDC8, Snips Gold ve SNIPS 7way ile alan doldurma mikro-F1 ölçülmüş. Karşılaştırma düzeni kritik: taban modeller tam 16-bit hassasiyette standart motorda, DeepSeek V4 Flash kendi bulut API’si üzerinden, Needle’ın 20, 16, 8 ve 4 katmanlık alt ağları ise geliştiriciye giden gerçek 2-bit kuantize ikiliyle test edilmiş. Yani Needle en sıkıştırılmış haliyle, rakipler en güçlü haliyle yarışıyor. Bu, bugün gemiye ne koyarsınız sorusuna adil yanıt, ama eşit sıkıştırma karşılaştırması değil; videoda bu ayrım açıkça işaret ediliyor.
Bu çerçevede manşet sonuçlar şöyle: Needle 3, mobil araç çağırma testlerinde kendinden 10 kat büyük modelleri geçiyor, çıkarımda ise 2 ila 3 kat büyüklerle eşleşiyor. Daha çok konuşulan “DeepSeek V4 Flash’i geçiyor” başlığı ise dar bir pencereye ait: DroidCall verisiyle Cactus Platformu’nda yapılan ince ayar her alt ağı 18 ila 36 puan yukarı taşıyor ve 4 katmandan (29 milyon parametre) itibaren ayarlı alt ağ, DroidCall ve Mobile Actions’ta DeepSeek V4 Flash’i geçiyor. Mobile Actions’ta tablo şunu gösteriyor: DeepSeek V4 Flash 88,4, Needle 3 tam 20 katman 86,0, LFM2.5 1.2B 82,4, Qwen3.5 0.8B 76,0, FunctionGemma 270M 65,1 ve Apple cihaz içi model 57,6. Bu, 29 milyon parametreli bir modelin genel zekâda devleri geçtiği anlamına gelmiyor; tek bir dar görevde, o görev için ayarlanınca öne geçtiği anlamına geliyor. Fark önemli, manşet okunurken kolay kayboluyor, ama dar ihtiyacı çevrimdışı ve güvenle çözmek isteyen biri için hâlâ pratik değer taşıyor.
Geliştirici tarafında işler bilerek basit tutulmuş. Standart Python paketi kurulumu, modelin Hugging Face’ten bir kez çekilip yerelde önbelleğe alınması, sonra sıradan bir Python fonksiyonunu süsleyerek araca dönüştürme: imza argüman tiplerini, docstring de modelin okuduğu açıklamayı veriyor. Tek bir run çağrısı döngüyü yönetiyor: Needle hangi aracın çağrılacağına karar veriyor, fonksiyonunuzu çalıştırıyor, sonucu geri besleyip nihai yanıtı ekleriyle döndürüyor. Açıklama tek başına yetmediğinde tetikleyiciler devreye giriyor: kullanıcı cümlesine karşı eşleşen düzenli ifadeler decode’u ilgili araca kilitleyip eşik altı bile olsa çağrıyı garantiliyor — “ışıkları aç” gibi ev komutlarında belirsizliğe yer bırakmıyor. Çıkarımda ise tam tersi akış var: Pydantic modeliyle şemayı tanımlayıp extract çağrısıyla dağınık metni veriyorsunuz, geri gelen şey elle ayrıştırmaya gerek kalmadan kullanıma hazır tipli nesne. Her yanıt tek bir JSON’da geliyor: fonksiyon çağrıları, adım adım gerekçe izi, kalibre edilmiş güven skoru, prefill/decode hızları ve tepe bellek kullanımı. Güven skoru için 0,1 altı bastırılmış çağrılar alanına düşüyor, ekip 0,7 üstünde doğrudan çalıştır, ortada onaya sor, boşsa ret say önerisini veriyor. İnce ayar tarafı LoRA ile dondurulmuş 20 katman taban üzerinde komut satırından yürüyor, sonuç istenen derinlikte 4-bit .cact dosyasına ihraç edilebiliyor.
Yayılım da alışılmadık ölçüde geniş: her biri 1 MB altı önceden derlenmiş motorlar — macOS, beş ayrı Linux mimarisi, Windows, üç Android mimarisi, iOS, tvOS, watchOS, tarayıcı için WebAssembly ve gömülü için WASI hedefi. Bu liste, tek telefon becerisinden çok neredeyse her cihaz kategorisine bırakılabilecek bir araç sinyali veriyor. Needle 3’ün ağırlıkları Hugging Face’te, kaynak kodu ve motor GitHub’da tamamen açık; indirmek ve kurmak ücretsiz. İş modeli ise bir katman yukarıda: Cactus Platformu, seçilmiş veri kümeleri, sevkiyattaki 2-bit kuantizasyon, değerlendirme tasarlama ve takip araçları ile tam derinlikte ince ayar altyapısını kendi hattında sunuyor; 2-bit sevkiyat ve zenginleştirilmiş veriler bu platformda üretiliyor. Yani ücretsiz açık çekirdek güçlü bir başlangıç, platforma geçiş ise kendi ürün araçları ve kullanım durumuna göre şekillendirme için. Açık çekirdek + ücretli altyapı deseni sağlıklı bir işaret: gelir, tek indirmeye değil, derinlemesine inşa etmek isteyen geliştiriciye bağlı ve bu sürdürülebilirliği destekliyor. Kimler için mantıklı sorusuna video net: sesli komut veya kısa metni tamamen çevrimdışı eyleme dönüştürmesi gereken akıllı ev uygulaması, giyilebilir cihaz, ağsız çalışması gereken robot veya donanım kısıtlı gömülü ürün — Needle 3 ciddi aday. Genel sohbet asistanı, uzun diyalog, açık uçlu sorular veya yaratıcı yazım arıyorsanız, bu o araç değil ve Cactus de öyle pazarlamıyor. Ekosistem henüz genç; 17 sürüm etiketi ve günlük aktif geliştirme iyi ivme ama yerleşik uç AI seçeneklerine kıyasla daha küçük ve yeni bir proje. Uzun vadeli bakım, dökümantasyon derinliği ve topluluk desteği kritikse bunu hesaba katmak gerekiyor. Pratik tavsiye ise tabloya bakıp karar vermemek: kendi araç tanımlarınız, kendi şemalarınız ve gerçek kullanım durumunuzla doğrudan test edin; şirketin kendi hazırladığı test paketleri her zaman kendi modeline gülümser, gerçek sınav sizin veriniz.
Mobile Actions Skorları
- DeepSeek V4 Flash88,4
- Needle 3 20L86,0
- LFM2.5 1.2B82,4
- Qwen3.5 0.8B76,0
- FunctionGemma65,1
- Apple57,6
| Model | Skor % |
|---|---|
| DeepSeek V4 Flash | 88,4 |
| Needle 3 20L | 86,0 |
| LFM2.5 1.2B | 82,4 |
| Qwen3.5 0.8B | 76,0 |
| FunctionGemma 270M | 65,1 |
| Apple cihaz içi | 57,6 |
AI yorumu
"Benim gördüğüm kadarıyla Needle 3’ün asıl marifeti boyut değil, mimari tercihlerini pil ve ısı hesabıyla birlikte düşünmesi; zeka merdiveni fikri yıllardır literatürde dolaşıyordu, Cactus bunu cilalı bir ürüne dönüştürüp gerçek bir saatte çalıştırarak iddiayı ölçülebilir hale getirmiş."
AI değerlendirmesi
Karşıt görüşü en güçlü haliyle kurarsak, küçük bir modelin dar bir görevde büyük genel modeli geçmesi sürpriz değil, beklenen bir sonuç. DeepSeek V4 Flash genel sohbet, kodlama, muhakeme ve uzun bağlamda eğitilmiş bir cephe modeli; DroidCall ve Mobile Actions gibi 961 ve 200 satırlık telefon niyetleri paketinde, o genel yetenek büyük ölçüde atıl kalıyor. 29 milyon parametreli bir uzmanı aynı dar paketin verisiyle 18 ila 36 puan yukarı ince ayar yapıp sonra aynı pakette kıyaslamak, uzman lehine doğal bir asimetri yaratıyor. Bu, sonucun değersiz olduğu anlamına gelmez; tam tersine ürün için rasyonel optimizasyon: çevrimdışı tek görev gerekiyorsa, büyük genel modeli çağırmak zaten israf.
Sınırlar tarafında iki nokta öne çıkıyor. Birincisi, tablodaki tüm skorlar Needle tarafında 2-bit kuantize ikiliyle, rakiplerde 16-bit tam hassasiyetle alınmış. Bu, bugün sevkiyatın gerçekliğini ölçmek için doğru tercih, ama sıkıştırma kaybı eşitlenmemiş bir kıyas. 2-bit’in cezalandırmadığı bir mimari, 16-bit’te daha da açılabilir; tersi de mümkün. İkincisi, Needle’ın güçlü olduğu yer tam olarak eğitim dağılımının içi: tüketici cihaz eylemleri, akıllı ev, mobil, giyilebilir, çıkarımsal alan doldurma. BFCL v4’ün Python dışı çağrıları ve kurumsal API yüzeylerinde modelin genelleme payı düşüyor; Java ve JavaScript SDK kategorilerindeki boşluk, tematik dışa taşmada sınırları gösteriyor.
Doğrulanabilirlik açısından tablo dengeli okunmalı. GitHub’da 11.300 yıldız ve Pebble halkasındaki canlı kullanım, benchmark dışı iki bağımsız sinyal ve ikisi de pozitif. Ancak benchmark’ların bir kısmı şirketin kendi kürasyonuyla seçilmiş; kendi paketinde kendi modeline gülümsemek doğal. Ticari sır niteliğindeki 115 milyar token’lık ön eğitim korpusu ve 2-bit Cactus Quants sürecinin kapalı detayları, dışarıdan birebir tekrar üretimi zorlaştırıyor. Platform üzerindeki verilerle ince ayarın ek 18 ila 36 puan getirmesi, aynı verinin dışarıda aynı etkiyi verip vermeyeceği sorusunu açık bırakıyor.
Pratik çıkarım net bir eşikte toplanıyor. Sesli komutun her seferinde ve internetsiz yerine gelmesi gereken akıllı ev, giyilebilir, robot ve gömülü ürünler için Needle 3 ciddi aday; decode grammar’la garantili JSON, güven skoru ve tetikleyici regex’lerle birlikte güvenilir otomasyona yakın duruyor. Uzun sohbet, açık uçlu soru yanıtlama, yaratıcı yazım veya Python dışı geniş API evreninde genel asistanlık gerekiyorsa, bu model o işin aracı değil. En sağlıklı karar, tablodaki Mobile Actions 86,0 ve benzeri skorlara bakarak değil, kendi araç şemanız ve kendi bildirim/fatura metinlerinizle 4 katman ve 20 katman dilimleri arasında doğrudan ölçüm yaparak verilir.
Kaynaklar
6 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — Cactus Compute Needle 3 Tanıtımı
- @cactuscompute.com https://cactuscompute.com/needle
- @huggingface.co https://huggingface.co/Cactus-Compute/needle3
- @github.com https://github.com/cactus-compute/needle
- @gittrend.io https://gittrend.io/repo/cactus-compute/needle
- @cactuscompute.com https://cactuscompute.com/
needle 3 · cactus compute · on-device ai · zeka merdiveni · edge ai