Volver al inicio

Agente de trading autodidacta Hermes: de un solo prompt a un bucle 24/7

Lewis Jackson construye un agente Hermes a partir de un único prompt que aprende de sus errores, itera con una variable a la vez y funciona de forma continua en Railway con una cadencia de revisión semanal.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — 6njREUQAFdg
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

El video abre con una aspiración clara: no un modelo que nunca se equivoque, sino un sistema que nunca repita el mismo error dos veces. La mayoría de las interacciones siguen siendo unidireccionales: envías un prompt y recibes una respuesta. El bucle propuesto aquí invierte eso. Un prompt genera una estrategia, la estrategia opera y produce un resultado, y ese resultado se convierte en señal de entrenamiento para un nuevo prompt que reescribe al agente. Construido a partir de un único prompt de copiar y pegar y descrito como gratuito de ejecutar, el diseño se plantea como un bucle 24/7 en lugar de un script puntual.

El autor, actuando como arquitecto, ancla el diseño en cuatro criterios: exactitud, fiabilidad, un objetivo bien definido y auto-mejora. Sin los cuatro, incluso un modelo potente no llega a ser un sistema de trading consistente. Programar manualmente el autoaprendizaje en herramientas como Claude se describe como tedioso y frágil. Frente al revuelo en torno a frameworks totalmente autónomos como OpenClaude, Hermes se presenta como una opción más discreta, que funciona en segundo plano y se muestra más ambiciosa en el terreno del autoaprendizaje.

La exactitud empieza en la fuente de datos. El autor dice haber probado todos los grandes modelos en tareas de trading en las últimas semanas y el resultado más llamativo fue la inconsistencia. Modelos que se suponía debían extraer datos de la misma fuente produjeron cifras distintas, y el mismo artículo de noticias llevó a conclusiones diferentes entre agentes. El remedio propuesto es una conectividad API resiliente, una interpretación consistente del flujo de noticias y reglas explícitas que mantengan las conclusiones verificables y objetivas, de modo que precios y narrativas se alineen antes de que el agente razone.

Fiabilidad significa ejecución continua. El agente debe permanecer activo día y noche, incluso cuando la máquina local está apagada. En el video esto se resuelve alojándolo en Railway. Una configuración de una sola vez abre una integración CLI que sincroniza cada actualización de estrategia con un servidor en vivo. Railway se presenta como permaneciendo durante mucho tiempo en un nivel gratuito generoso y soportando cómodamente decenas de proyectos, de modo que el agente sigue activo tras cerrar la terminal y mantiene intacto su calendario.

El tercer criterio es un objetivo definido con precisión. Casi todos los que construyen una estrategia, argumenta el autor, carecen de un destino. Qué cuenta como éxito o fracaso, ¿diez dólares al mes o un millón?, ¿qué Sharpe, qué drawdown máximo? Un ancla deliberadamente imposible, como apuntar a un millón al mes partiendo de diez dólares, ilustra por qué importa la calibración. Cuanto más concreta es la meta, más significativo se vuelve el feedback. Cada resultado se posiciona entonces como hacia el objetivo o alejándose de él, y el bucle se guía con esa brújula hasta alcanzar la meta.

La auto-mejora se plantea como un método científico que funciona sobre esa brújula. El agente recopila y organiza información, analiza el resultado según su proximidad al objetivo, formula una hipótesis sobre por qué se produjo el resultado y formula una segunda hipótesis sobre qué probar a continuación. Solo cambia una variable por iteración, porque cambiar muchas a la vez oculta la causa de cualquier ganancia. Cada mejora se convierte en la nueva línea base para la siguiente serie de pruebas, y el aprendizaje se acumula en lugar de reiniciarse.

Hermes se posiciona junto a un canal de distribución. El corazón de la configuración gratuita vive en una comunidad llamada 01 Systems. Desde el primer enlace de la descripción, la sección de aula contiene prompts listos para usar entre las entradas de YouTube, y el paquete evoluciona con el feedback, de modo que cada descarga entrega la última revisión. Las respuestas positivas a una estrategia previa basada en el método de Markov se muestran como evidencia de que este bucle de feedback comunitario está vivo y responde.

La demo comienza en la terminal. Una nueva sesión se abre con flags permisivos y se pega el prompt de una sola vez. La fase uno es una comprobación del entorno que detecta Mac o Windows y confirma Node.js y Claude Code. La fase dos define la estrategia: cómo un archivo que puntúa cada operación codificará el éxito y el fracaso, y qué activo operar. Solana, dólar, Ethereum y Bitcoin figuran como opciones, con tres caminos ofrecidos: crear una estrategia básica desde cero, construirla junto con el agente de onboarding, o apuntar a una existente. El autor elige un cuarto camino y apunta a su estrategia en vivo.

Esa estrategia se identifica como Wacko Alpha, descrita como un sistema de momentum y rendimiento D Tau que llega con más de un millón y medio de puntos de datos recopilados a lo largo de seis a ocho semanas. Opera con dinero real y se sigue en un panel para un desafío de multiplicar por diez, de cincuenta mil a quinientas mil libras. El sistema escanea el sistema de archivos y extrae los objetivos a una pantalla de confirmación: un objetivo de retorno a treinta días de 4.7, que equivale a alrededor del cuarenta y siete por ciento por intervalo, una perspectiva de multiplicar por diez en seis meses, un Sharpe mínimo de uno y un drawdown limitado. Esos umbrales viajan con el despliegue.

La fase tres prepara el estado para Hermes, creando carpetas y archivos para la revisión. La fase cuatro se omite porque la estrategia ya está en vivo; de lo contrario, se aprovisionarían hooks de API y un flujo de ejecución de TradingView mediante generación de código. El inicio de sesión en Railway choca con una protección de sesión interactiva, así que el autor divide la terminal, pega el comando en la otra parte, completa la autenticación en el navegador y regresa con éxito. La integración CLI toma entonces el control, enviando cada cambio futuro al servicio alojado y manteniendo local y remoto sincronizados, un patrón alineado con la oferta de MCP remoto de Railway.

El panel de cierre es explícito: un registro de veinticuatro operaciones ganadoras y veintidós perdedoras se convierte a un formato legible por Hermes, y un documento de estrategia se completa con un límite de doce posiciones, tolerancia de slippage, reserva de gas y pesos del puntuador. Hermes se instala en segundos y se vuelve invocable como un comando. El despliegue se plantea como funcionando en subredes de Bittensor, con una revisión semanal de Hermes y un rebalanceo diario de más de treinta minutos. El primer ciclo es de solo lectura y produce una revisión en markdown sin escrituras; salir a producción espera un cambio de modo. Un segundo agente llamado Cornelius ajusta semanalmente los parámetros aprendidos en un calendario desfasado tres días respecto a Hermes, y los comandos de registro quedan disponibles un día después de la revisión.

Visualization: nodesdaily AI

Momentos clave

  1. Santo grial: un agente que no repite erroresEl prompt crea la estrategia, la estrategia crea el resultado, el resultado alimenta el siguiente prompt.
  2. Cuatro criterios: exactitud, fiabilidad, objetivo, auto-mejoraSin los cuatro, un modelo potente no se convierte en un sistema consistente.
  3. Prueba de exactitud: misma fuente, cifras distintas entre modelos
  4. Definir el objetivo: qué significan éxito y fracaso en númerosCada resultado se posiciona hacia o lejos del objetivo.
  5. Método científico: una variable por iteraciónCada mejora se convierte en la nueva línea base.
  6. Fases de la demo: comprobación del entorno y selección de estrategia
  7. Wacko Alpha: 1,5 M de puntos de datos y el panel 10xUn objetivo de 4.7 por treinta días se corresponde con el panel.
  8. Configuración de Railway: inicio de sesión en el navegador y sincronización CLI
  9. Cierre: registro de 24 victorias y 22 derrotas y bucle semanalEl primer ciclo de Hermes es de solo lectura y solo revisión.

Comentario de la IA

""En mi opinión, este video no reduce la automatización a un prompt mágico; la vincula a una arquitectura de cuatro partes y a un bucle semanal aprobado por humanos.""

Evaluación de la IA

Dándole el máximo beneficio de la duda, un trader autodidacta de un solo prompt es atractivo pero sigue sin medirse. El estudio AI-Trader de la HKU Business School y el análisis de BurningTheta sobre el mismo trabajo muestran que los grandes modelos ofrecen rendimientos reales débiles y un control de riesgo frágil. Cifras del video como veinticuatro victorias frente a veintidós derrotas y un millón y medio de puntos de datos describen mecánicas, no una prueba de ventaja; la automatización sin verificación puede convertirse en marketing.

La metodología deja huecos. ¿Qué activo, qué periodo, qué costes de operación, qué slippage y qué coste de gas sobre el retorno neto, y qué conjunto de datos está libre de look-ahead? El framework TradingAgents corrigiendo discretamente una fuga de datos anticipada en la v0.3.1 tras superar cien mil estrellas recuerda que los backtests brillantes merecen una segunda mirada. El video subraya con razón un método científico de una variable, pero no muestra un paso de validación independiente, contabilidad de costes ni auditoría externa antes de salir a producción.

En cuanto a incentivos y verificabilidad, los beneficiarios son claros: la comunidad del creador, el framework Hermes, la capa de alojamiento de Railway y las subredes de Bittensor. Afirmaciones como el cuarenta y siete por ciento por treinta días, multiplicar por diez en seis meses, un suelo de Sharpe de uno y un drawdown limitado necesitan replicación independiente. Las primeras evidencias de auto-mejora recursiva reportadas por Weco y la nota de MIT Technology Review de que las ganancias recursivas podrían llegar más despacio moderan ambas las expectativas; sin confirmación de laboratorio, esas cifras siguen siendo objetivos.

En mi opinión, la conclusión práctica es esta: la configuración encaja con los constructores que quieren codificar lógica de trading, mantener memoria entre ejecuciones y revisar semanalmente con una puerta humana. No encaja con quienes persiguen ganancias rápidas o se saltan la contabilidad de costes, slippage y drawdown. Ejecutar en modo papel, simular los costes a fondo y pilotar en vivo con tamaño pequeño antes de cambiar el modo se alinea mejor con la revisión semanal y la disciplina de una sola variable que el propio video defiende.

Fuentes

8 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

hermes · agente de trading · railway · bittensor · wacko alpha

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…