La sesión 'Ask the Experts: Evaluating Agent Skills | Nemotron Labs' en NVIDIA Developer parte de una pregunta: ¿basta con pasar un link a la documentación a un agente de IA, o necesita un paquete de conocimiento estructurado para la tarea? La respuesta viene del terreno. Aun con modelos capaces y librerías NVIDIA bien escritas, los agentes pierden turnos buscando la herramienta correcta, queman tokens en callejones sin salida y tropiezan en pasos especializados. Como en una cocina: dejar el libro de recetas sobre la encimera no es lo mismo que entregar fichas paso a paso para cada plato.
Un Agent Skill es ese paquete de fichas. Definición simple: un paquete estructurado que un asistente de código con IA puede descubrir para un dominio, con reglas de enrutamiento, referencias y guardrails para usar el flujo correcto sin pegar contexto cada vez. En el ejemplo Speech NIM de NVIDIA el paquete trae SKILL.md (frases disparadoras, reglas, guardrails), una carpeta references/ con guías condensadas, skill-card.md y una carpeta evals/. SKILL.md funciona como superficie de enrutamiento — el asistente carga solo la referencia necesaria para la tarea, manteniendo el contexto ligero. La instalación es breve en cualquier asistente compatible con agentskills.io — Claude Code, Codex o Cursor — vía 'npx skills add nvidia/skills' o un plugin.
SkillEvaluator: cómo funciona la capa de medición
La herramienta central es SkillEvaluator, una capa de medición open-source que pregunta: ¿un skill mejora realmente el rendimiento del agente? Verifica en tres niveles. Tier 1 estático: validación de esquema y frontmatter, scoring de calidad, escaneos de seguridad para prompt injection y exfiltración, detección de secretos y PII, checks de licencia y lint de scripts. Tier 2 distinctiveness: similitud de embeddings detecta instrucciones duplicadas dentro de un skill y solapamientos en el catálogo — si dos skills enseñan el mismo trabajo, el catálogo se infla. Tier 3 evaluación en vivo: el agente ejecuta la misma tarea con y sin el skill y se mide el delta.
La parte en vivo corre en sandboxes aislados vía Harbor, un runner de evaluación open-source. El protocolo es experimental: mismo prompt, mismo modelo, mismas entradas y mismos criterios; la única variable es si el skill está instalado. Cada caso corre en modo pareado y el bucle se repite en dos harnesses. La diferencia se reporta como Skill Lift — en puntos, no en porcentaje. Cuando Correctness pasa de 46 a 87, lees +41 puntos. Convierte una sensación de 'este skill se lee bien' en un número, como cronometrar a dos corredores por el mismo laberinto con idénticas reglas.
El dataset es la palanca. 'skillevaluator create-eval-dataset ./my-skill --full' crea evals/evals.json. Cada caso lleva ID, prompt y salida esperada; con --full aparecen cuatro tipos: explicit, implicit, contextual y negative (trampas donde el skill debe permanecer descargado). Luego 'skillevaluator tier3 evaluate ./my-skill --agents codex --env-mode docker' construye el bundle Harbor, ejecuta cada caso dos veces y califica ambos. Un buen set de evaluación es el multiplicador — si las expectativas son difusas, la medición seguirá difusa.
Boletín para 300 skills: qué dicen los números
Las cifras de la snapshot del 12 de agosto de 2026 (benchmarks.json en commit 738d79e) están macro-promediadas para que cada par skill-harness pese igual. Las baselines sin skill rondan 39-46: Correctness (respuesta final correcta) 46, Discoverability (skill correcto cargado en el momento correcto) 42, Effectiveness (objetivo alcanzado y workflow esperado seguido) 39, Efficiency (sin pasos o llamadas desperdiciadas) 43, y la excepción Security (sin ops inseguras ni fugas) 97. Cuatro dimensiones muestran margen; ahí se vuelve visible la contribución del skill.
Repite las mismas tareas con skills verificados y el cuadro cambia. Scores con skill: Correctness 87 (+41), Discoverability 82 (+40), Effectiveness 78 (+39), Efficiency 78 (+35) y Security 98 (+1). Lift promedio +31 puntos en todas las dimensiones, +39 sin Security. Para Discoverability y Efficiency nótese que se puntúan contra el propio skill — el lift significa que el skill fue encontrado y bien usado cuando estaba presente; ese comportamiento no existe sin skill, de ahí baselines en 42-43 en lugar de cero. Como muestra el gráfico, el lift culmina en Correctness y Discoverability — la ganancia neta es respuesta correcta y enrutamiento correcto.
Las diferencias entre harnesses son instructivas. Claude Code aporta +34 en todas las dimensiones (+42 sin Security), Codex +29 (+36 sin Security) — unos 5 puntos de brecha, esperable por distintos system prompts y tool-calling. La varianza más llamativa es por producto: el lift oscila aprox. de +2 a +46 según el producto. Dominio y diseño de evaluación pesan más que el harness. En breve, no leas el gráfico como 'el harness decide'; qué producto NVIDIA y qué tarea mides escribe la historia.
Tokens y tiempo se siguen por separado y no hay victoria automática. Dos ejemplos single-attempt lo ilustran: jetson-optimize-memory recortó tokens de 617.306 a 142.540 (-76,9 %) y tiempo de 474,9 s a 220,0 s (-53,7 %), mientras cuopt-install aumentó tokens de 25.227 a 55.582 (+120,3 %) y tiempo de 34,0 s a 41,1 s (+20,8 %). El primer skill ataja al agente, el segundo añade contexto y pasos que inflan el coste. Los scores de Efficiency pueden subir mientras el coste en tokens sube, así que SkillEvaluator reporta ambos — recordatorio de que la eficiencia de tokens merece su propia pasada de optimización.
La integración del ecosistema es el puente práctico al cierre. OpenClaw pilota runs Tier 3 para organizaciones oficiales en ClawHub y muestra resultados con/sin skill en una pestaña Evals, para inspeccionar la señal antes de instalar. Del lado de Nous Research, Hermes Agent añade un escaneo opcional SkillSpector al flujo de instalación: PII, Unicode smuggling, lint de scripts, licencia y seguridad se reportan a nivel archivo-línea antes de instalar, unos 1,4-1,5 s por skill y 29 tests pasando. NVIDIA ofrece plugins para Claude Code, Codex y Cursor, y el mismo catálogo de 300+ skills está disponible vía Skills.sh, ClawHub y Hermes Hub. Mensaje consistente: un skill verificado es un descriptor de capacidad firmado — qué hace, cuándo llamarlo, cómo llamarlo — empaquetado y medido.
Lift en puntos — picos en Correctness y Discoverability
- Correctness+41
- Discoverability+40
- Effectiveness+39
- Efficiency+35
- Security+1
| Dimensión | Sin skill | Con skill | Lift |
|---|---|---|---|
| Correctness | 46 | 87 | +41 |
| Discoverability | 42 | 82 | +40 |
| Effectiveness | 39 | 78 | +39 |
| Efficiency | 43 | 78 | +35 |
| Security | 97 | 98 | +1 |
Comentario de la IA
"Para mí, el valor está en la medición misma: los skills no solo se describen, se ejecutan dos veces en un sandbox Harbor y se puntúa el delta. Es el 'no puedes gestionar lo que no mides' llevado a la era de los agentes. Las cifras van en puntos de lift y la varianza por producto de +2 a +46 se reconoce con honestidad."
Evaluación de la IA
La objeción más fuerte en steelman: los skills son prompt engineering bien empaquetado y el equipo mide su propio catálogo con su propia regla. La crítica tiene filo. Aun así, baselines ancladas en 39-46 muestran que solo documentación no sostiene al agente. Métricas basadas en RAGAS (Tool Call Accuracy, Goal Accuracy, Topic Adherence, Trajectory) más el aislamiento de Harbor convierten una impresión en un experimento pareado — mismo laberinto, dos pasadas, delta en puntos. El núcleo de la objeción se sostiene — hay empaquetado — pero el lift viene del diseño experimental.
Las limitaciones son claras. 85% de casos en single-attempt, 15% con dos intentos; los runs en vivo varían y no se publican intervalos de confianza. Dos harnesses (Claude Code y Codex) son una ventana estrecha; el plugin de Cursor existe en el catálogo pero no en esta comparación en vivo. Un lift por producto que oscila de +2 a +46 sugiere que algunos skills brillan en tareas estrechas y se diluyen en conjuntos amplios. Y la snapshot del 12 de agosto de 2026 es solo eso — una snapshot; el catálogo está vivo y benchmarks.json evoluciona, generalizar sin el archivo actual es riesgoso.
Para verificabilidad e incentivos, mire trazas de transparencia. Que NVIDIA mida sus propios skills con su herramienta plantea una pregunta legítima de incentivos; en cambio SkillEvaluator es open-source, los bundles se empaquetan vía Harbor y los scores se reportan en pares con/sin skill. La pestaña Evals de OpenClaw y el scan SkillSpector de Hermes Agent (PII, Unicode smuggling, lint) actúan como ojos independientes, pero son pilotos de partners, no auditorías externas. La verificación práctica crece cuando los equipos publican su evals.json creado con 'create-eval-dataset --full' y mantienen abiertos los casos negativos.
El takeaway práctico depende del equipo. Si construyes agentes alrededor de productos NVIDIA, los skills verificados ofrecen wins rápidos, sobre todo en Correctness y Discoverability. Para agentes de propósito general o stacks no-NVIDIA el catálogo queda fuera de alcance — no generalices sin remediar el lift en tus propias tareas. Sigue tokens y tiempo por separado aunque suba Efficiency; jetson-optimize-memory y cuopt-install apuntan en direcciones opuestas. Security pasa de 97 a 98, sin gran historia; no te saltes el scan de Distinctiveness, porque skills solapados compiten por la atención del agente.
Fuentes
6 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Nemotron Labs: Evaluación de Agent Skills
- @developer.nvidia.com https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator
- @docs.nvidia.com https://docs.nvidia.com/nim/speech/latest/resources/agent-skills.html
- @github.com https://github.com/nvidia/skills
- @docs.nvidia.com https://docs.nvidia.com/nemo/microservices/26.3.0/evaluator/metrics/agentic.html
- @docs.ragas.io https://docs.ragas.io/en/latest/concepts/metrics/available_metrics/agents
nvidia · nemotron · agent skills · skillevaluator · harbor · claude code