Volver al inicio

WikiSkill de Google: enseñar a los agentes las reglas de tu empresa por sí solos

WikiSkill, de Google Research, permite a un agente de IA enseñarse a sí mismo las reglas no escritas de una empresa: escribe cada error en un manual legible y solo conserva el cambio si las puntuaciones mejoran en trabajos nunca vistos. Una demo en un portátil con hojas de ventas desordenadas pasa de una base del setenta por ciento a diez sobre diez, sin fine-tuning.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — ewxQLr7IxzY
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Google Research publicó un estudio llamado WikiSkill que está dando mucho que hablar, y el nombre engaña a primera vista: no es una habilidad única sino un framework para aplicaciones agénticas. La metáfora central es la de un empleado nuevo en su primera semana. El principiante comete errores, anota qué salió mal y deja de repetir el error, todo sin volver a la escuela. Aquí el modelo de lenguaje subyacente nunca se reentrena y no hay fine-tuning; en su lugar, el framework reescribe continuamente el archivo de instrucciones del agente hasta que los resultados se sostienen.

El problema que ataca son las reglas empresariales no escritas. Un recién llegado a finanzas puede dominar las hojas de cálculo de memoria y aun así fracasar el primer mes, porque las convenciones decisivas viven solo en la cabeza de los colegas. En la demo, un caso significa seis unidades donde el estándar habitual sería doce, y un producto devuelto se registra como una cifra de ingresos negativa. Ningún modelo puede inferir tales hábitos locales del conocimiento general, por capaz que sea, porque nunca se escribieron en ningún sitio.

El remedio es un bucle con una prueba de aceptación estricta. Cada vez que el trabajador falla, una lección que describe el fallo entra en el archivo de instrucciones, y el cambio sobrevive solo si las puntuaciones mejoran en trabajos que el agente nunca ha visto. Cada ronda termina, por tanto, con un veredicto de conservar o descartar, y el archivo sigue evolucionando hasta que todo el conjunto aprueba. La automatización sustituye al humano que, de otro modo, editaría las instrucciones a mano después de cada error.

Para la demo, el presentador reconstruyó este bucle en su propio portátil alrededor de una hoja de cierre mensual desordenada de una empresa ficticia, controlándolo todo desde una ventana de chat construida sobre el kit de desarrollo de agentes de Google. Pedirle al agente que se presente revela la arquitectura: un worker que lee los archivos desordenados, escribe un pequeño script de limpieza, lo ejecuta y guarda un archivo limpio; un checker que califica el resultado frente a números conocidos como correctos; un tomador de notas que registra cada fallo; un escritor de manuales que convierte las notas en un único cambio de instrucción; y un gestor estricto que prueba ese cambio en diez hojas nunca vistas y solo lo conserva cuando la puntuación sube.

Los datos de prueba son deliberadamente feos, como se ven las exportaciones de ventas reales. Una tabla mezcla varios formatos de fecha, deja huecos, escribe los nombres de las regiones de forma inconsistente, abrevia las unidades de maneras incompatibles y mezcla mayúsculas en las etiquetas de productos. Las devoluciones aparecen como líneas de ingresos negativos que un principiante malinterpretaría fácilmente. Cualquiera que haya fusionado hojas de cálculo de sucursales reconocerá el género al instante.

La especificación del equipo de finanzas añade una segunda dificultad: exige ordenar por fecha, región e identificador de pedido, además de las convenciones financieras estándar para fechas, unidades, devoluciones y duplicados, pero nadie definió cuál es realmente el estándar local. Ejecutado sin ninguna guía aprendida, con el comportamiento del primer día, el agente detecta los valores de región faltantes y enumera los fallos pero no puede resolverlos, que es exactamente el punto: la detección sin el manual local no lleva a ninguna parte.

Aquí es donde el diagrama del artículo, tres compañeros más un gestor estricto, demuestra su valor, y donde aterriza la comparación con técnicas más antiguas. La recuperación necesita un documento que consultar, pero aquí las reglas no existen en ningún documento. El fine-tuning tarda días y sus lecciones no se pueden releer. La memoria simple registra cosas pero nunca comprueba si la memoria era correcta. WikiSkill aprende de los errores, escribe la lección en prosa legible y solo la retiene cuando demuestra que ayuda, razón por la cual el presentador llama especial al resultado.

El entrenamiento se ejecutó sobre veinte archivos: diez para practicar y diez hojas reservadas para el veredicto del gestor. El marcador visible parte de una base del setenta por ciento, rechaza los intentos undécimo y duodécimo al cuarenta por ciento, y finalmente acepta la séptima iteración con diez sobre diez. Los intentos tres a seis colapsaron por una razón mundana: el cupo de uso agotado en la propia cuenta del presentador, lo cual es un problema de configuración más que un fallo del framework, pero sigue siendo instructivo sobre el coste operativo.

Luego llega la escena del premio: el mismo archivo y el mismo modelo, esta vez con la guía aprendida cargada. La ejecución pasa, cada fila coincide con la verdad esperada, y las devoluciones se manejan con el signo correcto. Lo mejor de todo es que la guía resultante es prosa legible que indica cuándo se aplica cada regla financiera y cuándo no, incluidos hábitos que el agente infirió por sí mismo en lugar de recibirlos ya hechos.

¿Para quién es esto? Para cualquier equipo que ejecute trabajo repetitivo donde los errores provienen de los hábitos internos más que del conocimiento del mundo: el cierre mensual donde la exportación de cada tienda tiene sus propias peculiaridades, o el enrutado de facturas donde solo el equipo de pagos conoce el centro de coste correcto. El presentador montó todo el experimento describiéndolo en lenguaje llano a un asistente de programación, subiendo el artículo y construyendo sobre el kit de agentes de Google, y señala una implementación comunitaria además del enlace al artículo para su replicación. Los agentes de larga duración con rutinas estables son los que más ganan; las tareas puntuales, los que menos.

Visualization: nodesdaily AI

Comentario de la IA

""Lo que me enganchó aquí es el planteamiento: las reglas más difíciles de una empresa son las que nadie escribió, y WikiSkill convierte ese problema en un bucle que el agente ejecuta por sí mismo. La demo me resulta más convincente que las palabras de moda que la rodean.""

Evaluación de la IA

La objeción más sólida que puedo defender es el bloqueo de distribución: las hojas de validación son hermanas de las hojas de entrenamiento, así que una puntuación perfecta puede solo demostrar que el manual memorizó las peculiaridades de una sola familia. Las exportaciones reales de las tiendas cambian cada trimestre, y los cinco conjuntos de evaluación controlada del artículo tampoco miden esa deriva. Un resultado de diez sobre diez en veinte archivos relacionados merece aplausos, no confianza.

Lo que el vídeo no prueba son el coste, la latencia y la seguridad. Cada cambio candidato se vuelve a ejecutar sobre diez hojas nunca vistas, lo cual quema cómputo y tiempo; el propio presentador se quedó sin cupo en su cuenta a mitad de la demo, lo cual cuenta su propia historia. Un worker que escribe y ejecuta sus propios scripts sobre datos financieros es también un riesgo de comando destructivo sin paso de aprobación humana en el bucle que yo vi.

Sobre la verificación: es una demo de una sola persona, donde la misma mano creó el desorden, definió las respuestas correctas y juzgó el resultado, de modo que la comparación del checker puede ser circular. Las cifras del artículo necesitan replicación independiente antes de que yo las cite en una decisión, y el descargo de responsabilidad del empleador del presentador, aunque honesto, deja esto como una historia de fuente única. Querría los números de una segunda implementación antes de comprometer presupuesto.

Mi lectura práctica, en primera persona: para trabajo repetitivo de back-office con formatos estables, esta es una capa de aprendizaje valiosa, y la probaría en modo solo lectura con aprobación humana de cada cambio del manual. Para análisis puntuales o trabajo creativo, el coste de configuración no se amortiza. El manual legible es el verdadero premio para mí, porque un auditor puede inspeccionar un documento de una manera que ninguna actualización de pesos permite.

Fuentes

7 enlaces; 1 de ellos también citados por 1 otra noticia. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

wikiskill · agentes ia · google research · adk · evolución de habilidades · fine-tuning · automatización empresarial

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…