Volver al inicio

¿Y si un millón de agentes de IA compartieran nuestro Internet? ¿Imitan de verdad las simulaciones sociales a las personas?

En su charla en PyData Chicago, Mark Torres trazó un panorama desde las definiciones de agentes pasando por OpenClaw y Moltbook hasta simulaciones urbanas de un millón de agentes y experimentos de pronóstico electoral; el veredicto fue nítido: los agentes son fuertes para predecir encuestas pero débiles para imitar personas.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — J974ioFjVF0
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

La velada de PyData Chicago abrió con la pregunta más provocadora de la noche: qué sucede cuando compartimos un espacio tan sagrado como Internet, diseñado para humanos, con agentes de IA. Mark Torres, investigador de la Universidad Northwestern situado entre la academia y la práctica de la ingeniería, se negó a dejar la pregunta en teoría y la respondió con hallazgos concretos de simulaciones de agentes a gran escala. Tras los agradecimientos al patrocinador Granger, la charla se convirtió en un ensayo de un mundo donde los agentes compran, pagan impuestos y reservan citas. Para mí, ahí está exactamente el valor de esta charla: traslada el debate sobre los agentes de los lanzamientos de productos al terreno de las ciencias sociales.

La hoja de ruta quedó trazada con claridad desde el inicio: primero un estudio de caso actual a través de OpenClaw, luego la terminología para que todos hablen el mismo idioma, luego las formas de hacer que los agentes trabajen juntos a pequeña y gran escala. Torres separó deliberadamente los entornos cerrados dentro de la empresa de las simulaciones de mundo abierto, porque sus leyes de escalado apuntan en direcciones opuestas. En equipos pequeños, el costo de coordinación fija el techo, mientras que en el mundo abierto el techo casi desaparece. Esa distinción se convirtió en la clave de cada hallazgo posterior.

En el centro del estudio de caso estaba OpenClaw, y el momento era revelador: enero, el período en que los chatbots comenzaron a equiparse con capacidades de agente. Ese movimiento de ChatGPT y Claude desencadenó una explosión de proyectos open source de harness y llevó el concepto de agente del laboratorio a la calle. La elección fue acertada porque OpenClaw hace más visible la diferencia entre un modelo y un producto. Un modelo habla, un agente actúa; el harness cierra la brecha.

La segunda sorpresa del mismo período fue Moltbook: una red social donde solo los agentes de IA publican y se responden entre sí, mientras que los humanos son admitidos únicamente como observadores. Pareciendo una reinvención de Facebook para agentes, este experimento salió del círculo de Octane AI a finales de enero y alcanzó fama rápidamente. Su papel en la charla era claro: la primera ventana hacia cómo se comportan las comunidades de agentes en la naturaleza, fuera del laboratorio. Observar cómo surgen normas, facciones e incluso chismes en un feed sin moderación humana es un programa de investigación en sí mismo.

La sección de terminología fue una de las partes más útiles de la charla precisamente porque limpió el desorden conceptual. Un modelo de lenguaje solo produce texto; un agente es un modelo de lenguaje que puede dar pasos hacia un objetivo; un harness es el conjunto de herramientas que autoriza al agente a actuar en el mundo real. Sin un intérprete de código, un entorno de ejecución aislado y acceso al ordenador, ningún agente puede escribir una aplicación. Esta triple distinción sostuvo toda la discusión posterior, porque la mayoría de los fallos no provenían del modelo sino de la elección del harness.

Una captura de pantalla de una entrada del blog de Anthropic publicada esa semana mostraba la arquitectura más común del campo: el patrón orquestador y subagentes, es decir, gerentes y empleados. También era la configuración más frecuente en la práctica de consultoría de Torres, y la razón era simple: dividir el trabajo en piezas, entregar cada pieza a un agente especializado, reunir el todo bajo un orquestador. La popularidad del patrón no es casualidad; es la jerarquía que las organizaciones humanas han usado durante siglos, trasladada a los agentes. Pero los problemas de las jerarquías humanas vinieron con ella.

A medida que crecía la escala, el panorama cambiaba: añadir agentes a una empresa de forma arbitraria funciona muy bien hasta cierto punto, y luego se atasca. La causa del atasco era familiar, el mismo problema que enfrentan los equipos humanos, con la carga de coordinación aumentando con cada unidad añadida. Las leyes límite tomadas de la literatura de sistemas paralelos predecían un techo alrededor de unas dos docenas, dependiendo de qué tan bien se pueda dividir el trabajo. El hallazgo dice que la verdadera destreza no es contratar más agentes sino dividir mejor el trabajo.

Frente al techo del entorno cerrado, el mundo abierto no tenía límite, y aquí llegó el experimento más descabellado de la charla: una capital artificial de un millón de agentes. Presentada como un gemelo digital de Pekín, esta simulación dio a los agentes tareas reales y observó cómo los comportamientos se condensaban en patrones espontáneos. Que millones de agentes en una plataforma abierta puedan producir patrones significativos mientras un equipo cerrado choca con un techo muestra que las leyes de escalado se invierten según el contexto. Torres subrayó este contraste porque no existe una receta única de escalado.

Un segundo ejemplo a menor escala fue la simulación de redes sociales Oasis: un equivalente en miniatura de Facebook, Twitter o Reddit. En este entorno, donde cada agente estaba equipado con un perfil, un feed y el derecho a interactuar, la propagación de la información, la polarización y la formación de comunidades podían estudiarse en condiciones de laboratorio. A diferencia de la simulación urbana de un millón de habitantes, la tarea aquí era estrecha pero la medición era aguda. Leídas juntas, el mensaje de los dos experimentos era claro: estrecha la pregunta y la respuesta se vuelve más nítida.

No hubo, sin embargo, un elogio de las grandes simulaciones; la sección de limitaciones fue la parte más honesta de la charla. La primera trampa es el problema del entrecerrar de ojos: con los ojos entrecerrados puedes ver en cualquier simulación lo que desees. La segunda es el problema de atribución: queda poco claro cuánto del rendimiento logrado proviene de los agentes frente al diseño de prompts, la elección del harness o las preferencias de cómputo. Estas dos advertencias se leen como un filtro que todo el que lea resultados de simulaciones debería llevar en el bolsillo.

Cuando se explicó el diseño de las simulaciones, la abundancia de parámetros apareció como bendición y maldición a la vez: hay un número infinito de perillas que girar, y cada perilla arrastra el resultado. El ejemplo concreto fue el pronóstico electoral: poner los atributos de un votante en el prompt y pedirle al modelo que prediga republicano o demócrata. Más allá de la predicción individual, también se probó si la distribución promedio de un precinct podía capturarse. La idea de que las decisiones de diseño importan tanto como los resultados tomó carne y hueso con este ejemplo.

Bajo todo ese esfuerzo de diseño yacía la premisa de la personalidad: si una inteligencia artificial tiene personalidad, el comportamiento humano puede modelarse a través de ella. Torres no dejó la premisa sin cuestionar; si la personalidad se refleja mejor mediante prompting o tocando los pesos del modelo se debatió por separado en las preguntas y respuestas. Se informó que trabajos de steering que van más allá de la ingeniería de prompts y editan los pesos hacían al modelo genuinamente más complaciente. La personalidad en esta charla no fue una palabra de marketing sino una variable de diseño medible.

Entonces, ¿qué nos enseñaron las simulaciones? El libro de las buenas noticias estaba lleno: los agentes resultaron sorprendentemente exitosos al predecir rasgos de personalidad, respuestas a encuestas y cuestionarios, y resultados de pruebas A/B. En el estudio de Park y colegas, entrevistas de dos horas con mil personas fueron transcritas y colocadas por completo en el prompt, y las predicciones de personalidad del modelo se alinearon fuertemente con los resultados reales. En otro estudio de Stanford, los modelos de lenguaje reprodujeron los resultados de experimentos de psicología pasados. En trabajos de pronóstico estrechos y bien definidos, los agentes se comportaron como sustitutos confiables.

El libro de las malas noticias estaba más concurrido: los agentes eran pobres imitando personas porque se apoyaban en estereotipos y perdían las diferencias individuales y la diversidad de preferencias. Los modos típicos de fallo incluían personas actuando fuera de su personalidad, modelos metiendo a todos en el mismo saco, e inestabilidad ante pequeñas actualizaciones de información. Incluso un perfil humano ordinario de Chicago podía convertirse en caricatura en manos del modelo. Este estrechamiento, conocido como colapso de modo, sacude la afirmación de diversidad de la simulación en su fundamento.

El episodio del pronóstico electoral fue la manifestación más política de estos límites: la mejor manera de predecir el voto de una persona resultó ser ajustar una regresión simple, no preguntar a un agente por su persona. Además, los prompts cargados de personalidad empujaban a los modelos sistemáticamente hacia la izquierda, hacia los demócratas, un sesgo reconocido en las observaciones explicativas. En un experimento donde a un pueblo artificial de mil agentes se le entregaba un nuevo proyecto de ley con una división equitativa republicanos-demócratas, todo el pueblo se volvió conservador en dos días. En dominios de alto riesgo como las elecciones, la factura por confiar en la simulación de agentes era claramente visible en ambos ejemplos.

En la sección de aplicaciones el panorama volvió al mundo real: los agentes ya estaban dentro de la fuerza laboral, y listar dónde no se usaban era más fácil que listar dónde sí. El informe de uso empresarial de OpenAI ofrecía evidencia corporativa de la amplitud de la adopción. Los ejemplos cotidianos eran más coloridos, como un chatbot que se coló en el software de un gimnasio para conseguirle a su dueño un lugar en una clase. Capturas de pantalla de los experimentos Cowork de Anthropic mostraban cómo los agentes a gran escala entran en la cocina corporativa. La teoría había terminado; el cambio había comenzado.

El veredicto final fue duro: la promesa de que las simulaciones de agentes pudieran replicar lo que las personas piensan, sienten y creen simplemente aún no funciona. Las preguntas y respuestas profundizaron más que suavizaron ese veredicto: la dosificación del detalle de personalidad, la diferencia entre prompting y ajuste de pesos, clonarse a uno mismo como agente de QA, y la propia receta práctica de Torres. Esa receta se quedó conmigo: nunca ordenes a un agente un trabajo que no podrías hacer tú mismo, úsalo para amplificar un trabajo que ya harías; esboza el borrador tú mismo, distribúyelo a modelos pequeños baratos y rápidos, termina en colaboración con un modelo potente como Claude. Tratar al agente como una palanca en lugar de un oráculo resume toda la charla.

Visualization: nodesdaily AI

Comentario de la IA

""Valoro esta charla porque rescata el debate sobre los agentes del lenguaje de los eventos de lanzamiento y lo reduce a preguntas medibles; construí este artículo persiguiendo esas preguntas y contrastando cada afirmación con fuentes independientes.""

Evaluación de la IA

Déjame construir el argumento más fuerte contra mí mismo: que las simulaciones no puedan copiar a los humanos uno a uno no las hace inútiles. Los marcos híbridos combinan modelos de lenguaje con modelos clásicos basados en agentes y apuntan a la alineación con datos del mundo real, con resultados tempranos prometedores. Los enjambres de agentes en mercados de pronóstico que exponen puntos ciegos muestra igualmente que incluso espejos defectuosos revelan lugares donde somos ciegos. Mi medida es esta: quien use la simulación como prueba de estrés en lugar de profecía gana.

La lista de aspectos faltantes, sin embargo, es más larga que las propias confesiones de la charla. A gran escala, los parámetros se amplifican entre sí, difuminando qué perilla produjo el resultado, y los estudios de replicación independientes son raros. La dimensión de seguridad y privacidad apenas se abrió: quién audita los derechos de acceso de los agentes que pagan impuestos y reservan citas quedó sin respuesta. El lado del costo también falta; me parece prematuro elogiar la escala sin discutir la factura de cómputo de los experimentos de un millón de agentes.

En el frente de la verificación miro con cuidado quién afirma qué. Junto a los elogios a OpenClaw, su historial de seguridad está problemático; críticos escriben que incluso la mayor actualización no logró cerrar las vulnerabilidades. Los análisis de la prensa técnica sobre el caótico futuro de Moltbook listan los riesgos del crecimiento no moderado de las comunidades de agentes. Y los hallazgos del sesgo electoral no descansan en un solo estudio; la inclinación sistemática hacia la izquierda encontrada por los equipos de Columbia, Chicago y MIT mediante métodos diferentes es exactamente el tipo de afirmación que exige verificaciones independientes al momento de decidir.

Mi veredicto práctico se divide: para ensayos de encuestas, preselección de pruebas A/B y descubrimiento de dinámicas comunitarias usaría estas simulaciones con la conciencia tranquila. Pero no entregaría decisiones de alto riesgo como pronósticos electorales, contratación o diseño de políticas al voto de pueblos artificiales. Estoy de acuerdo con la metáfora de la palanca y añado un paso: la carga que la palanca levanta debe pesarse contra datos independientes cada vez. Veo este artículo como parte de esa balanza.

Fuentes

8 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

agentes de ia · simulación social · openclaw · moltbook · pydata

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…