La session 'Ask the Experts: Evaluating Agent Skills | Nemotron Labs' sur NVIDIA Developer part d'une question simple : un lien vers la documentation suffit-il pour un agent IA, ou faut-il un paquet de connaissances structuré ? La réponse vient du terrain. Même avec de bons modèles et des bibliothèques NVIDIA bien écrites, les agents perdent des tours à chercher le bon outil, brûlent des tokens dans des impasses et butent sur des étapes spécialisées. Comme en cuisine : poser le livre de recettes sur le plan de travail n'équivaut pas à donner des fiches-étapes pour chaque plat.
Un Agent Skill est ce paquet de fiches. Définition simple : un paquet structuré qu'un assistant de code IA peut découvrir pour un domaine, avec règles de routage, références et garde-fous afin d'utiliser le bon workflow sans recoller le contexte à chaque fois. Dans l'exemple Speech NIM de NVIDIA, le paquet contient SKILL.md (phrases déclencheuses, règles de routage, garde-fous), un dossier references/ de guides condensés, skill-card.md et un dossier evals/. SKILL.md agit comme surface de routage — l'assistant ne charge que la référence utile pour la tâche, le contexte reste sobre. L'installation est courte dans tout assistant compatible agentskills.io — Claude Code, Codex ou Cursor — via 'npx skills add nvidia/skills' ou un plugin.
SkillEvaluator : comment fonctionne la couche de mesure
L'outil au centre est SkillEvaluator, une couche de mesure open-source qui demande : un skill améliore-t-il vraiment la performance de l'agent ? Il vérifie en trois tiers. Tier 1 statique : validation du schéma et du frontmatter, scoring qualité, scans sécurité pour prompt injection et exfiltration, détection secrets/PII, vérification licence et lint des scripts. Tier 2 distinctiveness : la similarité d'embeddings repère les instructions dupliquées dans un skill et les chevauchements dans le catalogue — si deux skills enseignent le même job, le catalogue gonfle. Tier 3 évaluation live : l'agent exécute la même tâche avec et sans le skill, et l'écart est mesuré.
La partie live tourne en bacs à sable isolés via Harbor, un runner d'évaluation open-source. Le protocole est expérimental : même prompt, même modèle, mêmes entrées et mêmes critères ; seule variable, le skill installé ou non. Chaque cas tourne en mode apparié, et la boucle se répète sur deux harnais. L'écart est reporté en Skill Lift — en points, pas en pourcent. Quand la Correctness passe de 46 à 87, vous lisez +41 points. On transforme une impression 'ce skill se lit bien' en nombre, comme chronométrer deux coureurs dans le même labyrinthe avec les mêmes règles.
Le dataset est le levier. 'skillevaluator create-eval-dataset ./my-skill --full' crée evals/evals.json. Chaque cas porte un ID, un prompt et un output attendu ; avec --full quatre types apparaissent : explicit, implicit, contextual et negative (pièges où le skill doit rester déchargé). Puis 'skillevaluator tier3 evaluate ./my-skill --agents codex --env-mode docker' construit le bundle Harbor, exécute chaque cas deux fois et note les deux. Un bon jeu d'évaluation est le multiplicateur — si les attentes sont floues, la mesure reste floue.
Bulletin pour 300 skills : que disent les chiffres
Les chiffres de l'instantané du 12 août 2026 (benchmarks.json au commit 738d79e) sont macro-moyennés pour que chaque paire skill-harnais pèse autant. Les baselines sans skill tournent entre 39 et 46 : Correctness (réponse finale correcte) 46, Discoverability (bon skill chargé au bon moment) 42, Effectiveness (but atteint et workflow attendu suivi) 39, Efficiency (sans étapes ou appels d'outils gaspillés) 43, et l'exception Security (pas d'opération dangereuse, pas de fuite) 97. Quatre dimensions montrent une marge ; c'est là que la contribution du skill apparaît.
Relancez les mêmes tâches avec les skills vérifiés et le tableau bouge. Scores avec skill : Correctness 87 (+41), Discoverability 82 (+40), Effectiveness 78 (+39), Efficiency 78 (+35) et Security 98 (+1). Lift moyen +31 points toutes dimensions, +39 sans Security. Pour Discoverability et Efficiency, notez qu'ils sont notés contre le skill lui-même — le lift signifie que le skill a été trouvé et bien utilisé quand présent ; ce comportement n'existe pas sans skill, d'où des baselines à 42-43 plutôt que zéro. Comme le montre le graphique, le lift culmine sur Correctness et Discoverability — le gain net est la bonne réponse et le bon routage.
Les différences entre harnais sont instructives. Claude Code apporte +34 toutes dimensions (+42 sans Security), Codex +29 (+36 sans Security) — environ 5 points d'écart, attendu vu les prompts système et l'implémentation tool-calling différents. La variance plus frappante est par produit : le lift varie d'environ +2 à +46 selon le produit. Le domaine et la conception de l'évaluation pèsent plus que le harnais. Bref, ne lisez pas le graphique comme 'le harnais décide' ; quel produit NVIDIA et quelle tâche vous mesurez écrit l'histoire.
Tokens et temps sont suivis séparément et il n'y a pas de victoire automatique. Deux exemples single-attempt le montrent : jetson-optimize-memory a coupé les tokens de 617 306 à 142 540 (-76,9 %) et le temps de 474,9 s à 220,0 s (-53,7 %), tandis que cuopt-install a augmenté les tokens de 25 227 à 55 582 (+120,3 %) et le temps de 34,0 s à 41,1 s (+20,8 %). Le premier skill raccourcit l'agent, le second ajoute contexte et étapes qui gonflent le coût. Les scores d'Efficiency peuvent monter pendant que le coût en tokens monte, donc SkillEvaluator rapporte les deux — rappel que l'efficacité token mérite sa propre passe d'optimisation.
L'intégration écosystème est le pont pratique à la fin. OpenClaw pilote des runs Tier 3 pour organisations officielles sur ClawHub et affiche les résultats avec/sans skill dans un onglet Evals, afin d'inspecter le signal avant d'installer. Côté Nous Research, Hermes Agent ajoute un scan optionnel SkillSpector au flux d'installation : PII, Unicode smuggling, lint script, licence et sécurité sont rapportés au niveau fichier-ligne avant install, environ 1,4-1,5 s par skill et 29 tests passants. NVIDIA fournit des plugins pour Claude Code, Codex et Cursor, et le même catalogue de 300+ skills est disponible via Skills.sh, ClawHub et Hermes Hub. Message cohérent : un skill vérifié est un descripteur de capacité signé — ce qu'il fait, quand l'appeler, comment l'appeler — packagé et mesuré.
Lift en points — pics sur Correctness & Discoverability
- Correctness+41
- Discoverability+40
- Effectiveness+39
- Efficiency+35
- Security+1
| Dimension | Sans skill | Avec skill | Lift |
|---|---|---|---|
| Correctness | 46 | 87 | +41 |
| Discoverability | 42 | 82 | +40 |
| Effectiveness | 39 | 78 | +39 |
| Efficiency | 43 | 78 | +35 |
| Security | 97 | 98 | +1 |
Commentaire de l’IA
"Pour moi, la valeur est la mesure elle-même : les skills ne sont pas seulement décrits, ils sont exécutés deux fois dans un bac à sable Harbor et l'écart est noté. C'est la maxime 'on ne gère que ce qu'on mesure' transposée à l'ère des agents. Les chiffres sont en points de lift, et la variance par produit de +2 à +46 est assumée."
Évaluation de l’IA
L'objection la plus forte, en steelman : les skills sont du prompt engineering bien emballé, et l'équipe mesure son propre catalogue avec sa propre règle. La critique n'est pas sans fondement. Pourtant, des baselines bloquées à 39-46 montrent que la documentation seule ne porte pas l'agent. Les métriques RAGAS (Tool Call Accuracy, Goal Accuracy, Topic Adherence, Trajectory) plus l'isolation Harbor transforment une impression en expérience appariée — même labyrinthe, deux passages, delta en points. Le cœur de l'objection reste — il y a emballage — mais le lift vient du protocole.
Les limites sont claires. 85 % des cas en single-attempt, 15 % en deux tentatives ; les runs live varient et aucun intervalle de confiance n'est publié. Deux harnais (Claude Code et Codex) forment une fenêtre étroite ; le plugin Cursor existe au catalogue mais pas dans cette comparaison live. Un lift par produit oscillant de +2 à +46 suggère que certains skills brillent sur des tâches étroites et se diluent sur un ensemble large. Et l'instantané du 12 août 2026 n'est qu'un instantané ; le catalogue vit et benchmarks.json évolue, généraliser sans le fichier actuel est risqué.
Pour la vérifiabilité et les incitations, regardez les traces de transparence. NVIDIA mesurant ses propres skills avec son propre outil soulève une question légitime d'incitation ; en revanche SkillEvaluator est open-source, les bundles sont packagés via Harbor et les scores sont publiés en paires avec/sans skill. L'onglet Evals d'OpenClaw et le scan SkillSpector de Hermes Agent (PII, Unicode smuggling, lint) jouent des yeux indépendants, mais ce sont des pilotes partenaires, pas des audits externes. La vérification pratique grandit quand les équipes publient leur evals.json créé avec 'create-eval-dataset --full' et laissent les cas négatifs ouverts.
Le takeaway pratique dépend de l'équipe. Si vous construisez des agents autour de produits NVIDIA, les skills vérifiés offrent des gains rapides, surtout sur Correctness et Discoverability. Pour des agents généralistes ou des stacks non-NVIDIA, le catalogue est hors champ — ne généralisez pas sans remesurer le lift sur vos propres tâches. Suivez tokens et temps séparément même quand l'Efficiency grimpe ; jetson-optimize-memory et cuopt-install pointent en directions opposées. Security passe de 97 à 98, pas de grande histoire ; ne sautez pas le scan Distinctiveness, car des skills qui se chevauchent se disputent l'attention de l'agent.
Sources
6 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Nemotron Labs : Évaluer les Agent Skills
- @developer.nvidia.com https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator
- @docs.nvidia.com https://docs.nvidia.com/nim/speech/latest/resources/agent-skills.html
- @github.com https://github.com/nvidia/skills
- @docs.nvidia.com https://docs.nvidia.com/nemo/microservices/26.3.0/evaluator/metrics/agentic.html
- @docs.ragas.io https://docs.ragas.io/en/latest/concepts/metrics/available_metrics/agents
nvidia · nemotron · agent skills · skillevaluator · harbor · claude code