Gündeme dön

Nemotron Labs'te Agent Skill'lerini Ölçmek: SkillEvaluator 300 Skill'i Nasıl Puanladı

NVIDIA Developer'daki Nemotron Labs buluşması, AI agent'larının neden dokümantasyona değil yapılandırılmış skill paketlerine ihtiyaç duyduğunu gösterdi. 30'dan fazla NVIDIA ürününde 300'den fazla doğrulanmış skill, açık kaynak SkillEvaluator ile iki farklı harness'te skillsiz ve skill'li koşular karşılaştırılarak ölçüldü ve ortalama Correctness 46'dan 87'ye çıktı.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — 4rI0zATFxYI
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

NVIDIA Developer kanalındaki 'Ask the Experts: Evaluating Agent Skills | Nemotron Labs' oturumu, tek bir soruya odaklanıyor: Bir AI agent'ına dokümantasyon linki atmak yetiyor mu, yoksa agent'ın görevi için yapılandırılmış bir bilgi paketi mi lazım? Yanıt, sahadaki gözlemle başlıyor. Yetenekli modeller ve iyi yazılmış NVIDIA kütüphaneleri olsa bile agent'lar doğru aracı ararken tur kaybediyor, ölü uçlarda token yakıyor ve uzmanlık isteyen adımlarda takılıyor. Tıpkı iyi bir mutfakta tarif defterini tezgâha bırakmak yerine, her yemeğin adımlarını ve püf noktalarını kartlara paketlemek gibi.

Agent Skill (etmen yetkinliği) bu kart paketi. Tanım sade: Bir AI kod asistanının belirli bir alanda doğru iş akışını bulması için keşfedebileceği yapılandırılmış bir bilgi paketi. NVIDIA'nın Speech NIM için yayınladığı örnekte paket; SKILL.md (tetik cümleleri, yönlendirme kuralları, guardrail'ler), references/ klasöründeki kısa rehberler, skill-card.md ve evals/ klasörüyle birlikte geliyor. Üst seviye SKILL.md bir yönlendirme yüzeyi gibi çalışıyor — asistan o anki göreve göre yalnızca ilgili referansı yüklüyor, bağlam şişmiyor. Kurulum ise agentskills.io düzenini anlayan Claude Code, Codex, Cursor gibi asistanlarda 'npx skills add nvidia/skills' veya plugin eklemek kadar kısa.

SkillEvaluator: Ölçüm Katmanı Nasıl Çalışıyor

Nemotron ekibinin bu videoda merkeze koyduğu araç SkillEvaluator. Açık kaynak bir ölçüm katmanı ve amacı net: Bir skill agent performansını gerçekten iyileştiriyor mu? Bunu üç ayrı tier ile test ediyor. Tier 1 statik tarama: şema ve frontmatter doğrulaması, kalite puanı, prompt injection ve veri sızıntısı için güvenlik taraması, gizli anahtar ve kişisel veri tespiti, lisans kontrolü ve betik lint'i. Tier 2 distinctiveness: Embedding benzerliğiyle tek skill içindeki tekrarlı yönergeleri ve katalog genelindeki örtüşen kapsamı buluyor — aynı işi iki farklı skill anlatıyorsa katalog şişer. Tier 3 ise canlı değerlendirme: Agent, aynı görevde skill yüklüyken ve yüklü değilken iki kez koşuyor ve fark ölçülüyor.

Canlı kısım Harbor (açık kaynak bir değerlendirme çalıştırıcısı) üzerinde izole sandbox'larda dönüyor. Mantık deney gibi kurulmuş: Aynı prompt, aynı model, aynı görev girdileri ve aynı puanlama ölçütleri; tek değişken skill'in yüklü olup olmaması. Her görev bu ikili koşuyla çalıştırılıyor ve bu döngü iki farklı harness'te tekrarlanıyor. Aradaki fark Skill Lift olarak raporlanıyor — yüzde değil puan. Yani Correctness 46'dan 87'ye çıktığında +41 puanlık lift okuyorsunuz. Bu düzen, 'skill anlatımı güzel duruyor' hissini sayıya çeviriyor; aynı labirentte iki koşucuyu aynı kurallarla yarıştırıp süre farkına bakmak gibi.

Veri seti tarafı da konuşmanın can alıcı noktası. Komut satırında 'skillevaluator create-eval-dataset ./my-skill --full' çalıştırıldığında evals/evals.json oluşuyor. Her vaka bir ID, bir prompt ve beklenen çıktıyı taşıyor; --full ile dört tip vaka ekleniyor: explicit (açık istek), implicit (dolaylı istek), contextual (bağlama gömülü istek) ve negative (skill'in yüklenmemesi gereken tuzak istek). Sonra 'skillevaluator tier3 evaluate ./my-skill --agents codex --env-mode docker' ile Harbor demeti kuruluyor, her vaka skill'li ve skillsiz olarak koşup puanlanıyor. İyi yazılmış değerlendirme seti burada kaldıraç oluyor — beklenti net değilse ölçüm de bulanık kalıyor.

300 Skill'in Karnesi: Rakamlar Ne Söylüyor

12 Ağustos 2026 anlık görüntüsündeki (738d79e commit'indeki benchmarks.json) sayılar katalog ortalaması olarak macro-average ile hesaplanmış — yani her skill-harness çifti eşit ağırlıkta. Skillsiz taban skorlar 39 ile 46 arasında geziyor: Correctness (final yanıt doğru mu) 46, Discoverability (doğru skill doğru anda yüklendi mi) 42, Effectiveness (agent hedefe ulaştı ve beklenen iş akışını izledi mi) 39, Efficiency (gereksiz adım ve araç çağrısı olmadan ulaştı mı) 43 ve istisna olarak Security (güvensiz işlem, anahtar sızıntısı yok mu) 97. Security dışındaki dört boyutta ciddi boşluk var ve tam da bu yüzden skill'in katkısı görünür hale geliyor.

Aynı görevler doğrulanmış skill'ler yüklüyken tekrar koştuğunda tablo değişiyor. With-skill skorlar Correctness 87 (+41 lift), Discoverability 82 (+40), Effectiveness 78 (+39), Efficiency 78 (+35) ve Security 98 (+1) oluyor. Toplam ortalamada +31 puan, Security hariç ortalamada +39 puanlık artış. Discoverability ve Efficiency için dikkat: Bu iki boyut skill'in kendine göre puanlandığı için, artış 'skill doğru anda bulundu ve doğru kullanıldı' anlamına geliyor; skillsiz koşuda bu davranış zaten mevcut değil, o yüzden taban skor 0 değil 42-43 civarında kalıyor. Grafikte de görüleceği gibi lift'in tepesinde Correctness ve Discoverability var — bilgi paketinin en net kazancı doğru yanıt ve doğru yönlendirmede.

Harness'lar arası fark da öğretici. Claude Code tüm boyutlarda +34 (Security hariç +42), Codex +29 (Security hariç +36) lift veriyor. Fark yaklaşık 5 puan ve beklenen bir durum: Sistem prompt'ları, bağlam taşıma ve araç çağırma implementasyonları farklı. Daha vurucu varyans ise ürün bazında: Üründen ürüne lift +2 ile +46 arasında savruluyor. Yani agent seçimi değil, alanın zorluğu ve değerlendirme setinin tasarımı sonucu belirliyor. Özetle, chart tek başına harness'e bakmıyor; hangi NVIDIA ürününde hangi görevi ölçtüğünüz hikayeyi yazıyor.

Token ve süre tarafı ayrı izleniyor ve otomatik kazanç yok. İki tek-atış örneği bunu netleştiriyor: jetson-optimize-memory skill'i token'ı 617.306'dan 142.540'a çekerek %76,9 azaltıp süreyi 474,9 saniyeden 220,0 saniyeye (%53,7) indirirken, cuopt-install skill'i token'ı 25.227'den 55.582'ye çıkararak %120,3 artırıp süreyi 34,0'dan 41,1 saniyeye (%20,8) uzatıyor. İlk örnekte skill agent'ı kısayola sokuyor, ikincisinde ise ek bağlam ve adımlar maliyeti şişiriyor. Efficiency puanı artsa bile token/süre ayrı bir optimizasyon hedefi olarak kalıyor — bu yüzden SkillEvaluator ikisini de raporluyor.

Ekosistem entegrasyonu videonun kapanışındaki pratik köprü. OpenClaw, ClawHub'da resmi organizasyonlar için Tier 3 koşularını pilotluyor ve Evals sekmesinde with-skill / without-skill sonuçlarını gösteriyor; geliştirici skill'i kurmadan önce sinyale bakıyor. Nous Research tarafında Hermes Agent kurulum akışına isteğe bağlı SkillSpector taraması eklenmiş: PII, Unicode smuggling, betik lint, lisans ve güvenlik başlıkları dosya-satır seviyesinde raporlanıyor ve kurulum öncesi uyarı veriyor; 29 testten geçen akışta tarama skill başına yaklaşık 1,4-1,5 saniye sürüyor. NVIDIA tarafında ise Claude Code, Codex ve Cursor için plugin'ler ile Skills.sh, ClawHub ve Hermes Hub üzerinden aynı 300+ skill kataloğu sunuluyor. Mesaj net: Doğrulanmış skill, imzalı bir yetkinlik tanımı; 'ne yapar, ne zaman çağrılır, nasıl çağrılır' bilgisi paketlenmiş ve ölçülmüş halde geliyor.

Skill Lift Puanı — En Büyük Kazanım Correctness ve Discoverability

  • Correctness+41
  • Discoverability+40
  • Effectiveness+39
  • Efficiency+35
  • Security+1
Lift puan cinsinden; Correctness ve Discoverability zirvede, Security zaten yüksek tabandan sınırlı artış gösteriyor.
BoyutSkillsizSkill'liArtış
Correctness4687+41
Discoverability4282+40
Effectiveness3978+39
Efficiency4378+35
Security9798+1

AI yorumu

"Benim açımdan bu bölümün değeri, ölçümün kendisi: Skill'ler anlatılmıyor, Harbor sandbox içinde iki kez koşturulup fark puanla kanıtlanıyor. Clayton Christensen'in 'ölçemediğini yönetemezsin' fikrini agent çağına taşıyan bir pratik bu. Rakamlar süslü değil, skill lift puan olarak veriliyor ve ürün bazında +2 ile +46 arası varyans dürüstçe açıklanıyor."

AI değerlendirmesi

Steelman'i kurarsak en güçlü itiraz şu: Skill'ler aslında iyi paketlenmiş prompt mühendisliği, ölçüm de kendi katalogunu kendi cetveliyle yapıyor. Bu eleştiri haksız değil. Fakat skillsiz tabanın 39-46 bandında kalması, dokümantasyonun agent için yetmediğini sayıyla gösteriyor. RAGAS tabanlı metrikler (Tool Call Accuracy, Goal Accuracy, Topic Adherence, Trajectory) ve Harbor izolasyonu aynı labirenti iki kez koşturarak hissi veriye bağlıyor. Yani itirazın nüvesi doğru — paketleme var — ama fark deney düzeninden geliyor.

Sınırlılıklar tablosu da net. Vakaların %85'i tek atışla koşmuş, %15'i iki atış; canlı agent koşuları varyanslı ve güven aralığı raporlanmıyor. İki harness (Claude Code ve Codex) sınırlı bir pencere; Cursor plugin'i katalogda var ama live karşılaştırmada değil. Ürün bazlı liftin +2 ile +46 arası savrulması, bazı skill'lerin dar bir görevde parladığını, bazılarının ise geniş görev setinde seyreldiğini düşündürüyor. Ayrıca 12 Ağustos 2026 snapshot'ı tek anlık görüntü — katalog canlı ve benchmarks.json güncel dosyaya bakmadan genelleme yapmak riskli.

Doğrulanabilirlik ve çıkar dengesi için şeffaflık izlerine bakıyorum. NVIDIA kendi skill'lerini kendi aracıyla ölçtüğü için çıkar sorusu meşru; buna karşılık SkillEvaluator açık kaynak, task demeti Harbor ile paketleniyor ve skorlar with-skill / without-skill ikilisiyle raporlanıyor. OpenClaw'un Evals sekmesi ve Hermes Agent'taki SkillSpector taraması (PII, Unicode smuggling, script lint) bağımsız göz niteliğinde ama bunlar da partner pilotu — dış denetim değil. Pratik doğrulama için üreten ekip 'create-eval-dataset --full' ile yazdığı evals.json'u yayınlayıp negatif vakaları açık tuttuğunda güven artıyor.

Pratik çıkarım ekiplere göre ayrışıyor. NVIDIA ürünleriyle agent kuran bir ekip için verified skill'ler, özellikle Correctness ve Discoverability'de, hızlı kazanç. Ancak genel amaçlı bir ajan veya NVIDIA dışı bir yığın için katalog dışı kalacaksınız; skill lift'i kendi görevinizde yeniden ölçmeden genelleme yapmayın. Token/süre takibi zorunlu — Efficiency puanı artsa bile token faturasını ayrı izleyin; jetson-optimize-memory ve cuopt-install örnekleri zıt yönleri gösteriyor. Security zaten 97'den 98'e oynuyor, buradan büyük hikaye çıkmaz; Distinctiveness taramasını atlamayın, katalog çakışması agent'ın dikkatini dağıtıyor.

Kaynaklar

6 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

nvidia · nemotron · agent skills · skillevaluator · harbor · claude code

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

Nemotron Labs'te Agent Skill'lerini Ölçmek