Retour au fil

Agent de trading auto-apprenant Hermes : d'un simple prompt à une boucle 24h/24 et 7j/7

Lewis Jackson construit un agent Hermes à partir d'un prompt unique qui apprend de ses erreurs, itère avec une seule variable à la fois, et tourne en continu sur Railway avec un rythme de revue hebdomadaire.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 6njREUQAFdg
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

La vidéo s'ouvre sur une aspiration claire : non pas un modèle qui ne se trompe jamais, mais un système qui ne répète jamais deux fois la même erreur. La plupart des interactions restent à sens unique : on envoie un prompt et on reçoit une réponse. La boucle proposée ici inverse cette logique. Un prompt génère une stratégie, la stratégie trade et produit un résultat, et ce résultat devient un signal d'entraînement pour un nouveau prompt qui réécrit l'agent. Construit à partir d'un simple prompt à copier-coller et présenté comme gratuit à faire tourner, le dispositif est conçu comme une boucle 24h/24 et 7j/7 plutôt que comme un script ponctuel.

L'auteur, dans un rôle d'architecte, ancre la conception dans quatre critères : l'exactitude, la fiabilité, un objectif clairement défini et l'auto-amélioration. Sans ces quatre éléments, même un modèle puissant ne devient pas un système de trading cohérent. Coder manuellement l'auto-apprentissage dans des outils comme Claude est décrit comme fastidieux et fragile. Face au buzz autour des frameworks entièrement autonomes comme OpenClaude, Hermes est présenté comme une option plus discrète, fonctionnant en arrière-plan, et plus ambitieuse sur le plan de l'auto-apprentissage.

L'exactitude commence à la source des données. L'auteur affirme avoir testé tous les grands modèles sur des tâches de trading ces dernières semaines, et le résultat le plus frappant fut l'incohérence. Des modèles censés s'appuyer sur la même source de données ont produit des chiffres différents, et un même article de presse a conduit à des conclusions différentes selon les agents. Le remède proposé : une connectivité API résiliente, une interprétation cohérente du flux d'actualités et des règles explicites qui maintiennent les conclusions vérifiables et objectives, afin que prix et récits s'alignent avant que l'agent ne raisonne.

La fiabilité signifie une exécution continue. L'agent doit rester actif jour et nuit, même lorsque la machine locale est éteinte. Dans la vidéo, cela est résolu par un hébergement sur Railway. Une configuration en une seule fois ouvre une intégration CLI qui synchronise chaque mise à jour de stratégie vers un serveur en ligne. Railway est présenté comme restant longtemps dans un palier gratuit généreux et supportant confortablement des dizaines de projets, si bien que l'agent reste actif après la fermeture du terminal et conserve son planning intact.

Le troisième critère est un objectif précisément défini. Presque tous ceux qui construisent une stratégie, argue l'auteur, n'ont pas de destination. Qu'est-ce qui compte comme succès ou échec, dix dollars par mois ou un million, quel Sharpe, quel drawdown maximal ? Un repère délibérément impossible, comme viser un million par mois à partir de dix dollars, illustre pourquoi l'étalonnage compte. Plus la cible est concrète, plus le retour d'information devient significatif. Chaque résultat est ensuite positionné comme allant vers l'objectif ou s'en éloignant, et la boucle se dirige grâce à cette boussole jusqu'à ce que la cible soit atteinte.

L'auto-amélioration est présentée comme une méthode scientifique fonctionnant sur cette boussole. L'agent rassemble et organise les informations, analyse le résultat par rapport à sa proximité avec l'objectif, formule une hypothèse sur la raison pour laquelle le résultat s'est produit, puis une seconde hypothèse sur ce qu'il faut tenter ensuite. Une seule variable change par itération, car en changer plusieurs à la fois masque la cause de tout gain. Chaque amélioration devient la nouvelle base de référence pour la série de tests suivante, et l'apprentissage s'accumule au lieu de se réinitialiser.

Hermes est positionné aux côtés d'un canal de distribution. Le cœur de la configuration gratuite se trouve dans une communauté appelée 01 Systems. Depuis le premier lien de la description, la section salle de classe contient des prompts prêts à l'emploi parmi les entrées YouTube, et le paquet évolue avec les retours, de sorte que chaque téléchargement livre la dernière révision. Les réponses positives à une stratégie antérieure basée sur la méthode de Markov sont présentées comme la preuve que cette boucle de retour communautaire est vivante et réactive.

La démo commence dans le terminal. Une nouvelle session s'ouvre avec des drapeaux permissifs et le prompt one-shot est collé. La phase un est une vérification de l'environnement qui détecte Mac ou Windows et confirme Node.js et Claude Code. La phase deux définit la stratégie : comment un fichier qui note chaque transaction encodera le succès et l'échec, et quel actif trader. Solana, dollar, Ethereum et Bitcoin sont listés comme options, avec trois chemins proposés : créer une stratégie de base de zéro, la co-construire avec l'agent d'onboarding, ou pointer vers une stratégie existante. L'auteur choisit un quatrième chemin et pointe vers sa stratégie en direct.

Cette stratégie est identifiée comme Wacko Alpha, décrite comme un système de momentum et de rendement D Tau qui arrive avec plus d'un million et demi de points de données collectés sur six à huit semaines. Elle trade en argent réel et est suivie sur un tableau de bord pour un défi de multiplication par dix, de cinquante mille à cinq cent mille livres. Le système scanne le système de fichiers et tire les cibles vers un écran de confirmation : un objectif de rendement sur trente jours de 4,7, ce qui correspond à environ quarante-sept pour cent par intervalle, une perspective de multiplication par dix en six mois, un Sharpe minimal de un et un drawdown plafonné. Ces seuils accompagnent le déploiement.

La phase trois prépare l'état pour Hermes, en créant les dossiers et fichiers pour la revue. La phase quatre est sautée car la stratégie est déjà en direct ; sinon, des hooks API et un flux d'exécution TradingView seraient provisionnés par génération de code. La connexion à Railway se heurte à un garde-fou de session interactive, l'auteur divise donc le terminal, colle la commande à l'extérieur, termine l'authentification dans le navigateur et revient avec un succès. L'intégration CLI prend alors le relais, poussant chaque changement futur vers le service hébergé et gardant le local et le distant synchronisés, un schéma aligné avec l'offre MCP distante de Railway.

Le tableau final est explicite : un registre de vingt-quatre transactions gagnantes et vingt-deux perdantes est converti dans un format lisible par Hermes, et un document de stratégie est rempli avec un plafond de douze positions, une tolérance de slippage, une réserve de gaz et des pondérations de scoreur. Hermes s'installe en quelques secondes et devient appelable comme une commande. Le déploiement est présenté comme fonctionnant sur des sous-réseaux Bittensor, avec une revue Hermes hebdomadaire et un rééquilibrage quotidien de plus de trente minutes. Le premier cycle est en lecture seule et produit une revue en markdown sans aucune écriture ; le passage en direct attend un basculement de mode. Un second agent nommé Cornelius ajuste chaque semaine les paramètres appris selon un calendrier décalé de trois jours par rapport à Hermes, et les commandes de pointage deviennent disponibles un jour après la revue.

Visualization: nodesdaily AI

Moments clés

  1. Graal absolu : un agent qui ne répète pas les erreursLe prompt crée la stratégie, la stratégie crée le résultat, le résultat alimente le prompt suivant.
  2. Quatre critères : exactitude, fiabilité, objectif, auto-améliorationSans les quatre, un modèle puissant ne devient pas un système cohérent.
  3. Test d'exactitude : même source, chiffres différents selon les modèles
  4. Définir l'objectif : ce que succès et échec signifient en chiffresChaque résultat est positionné vers ou loin de l'objectif.
  5. Méthode scientifique : une variable par itérationChaque amélioration devient la nouvelle base de référence.
  6. Phases de la démo : vérification de l'environnement et choix de la stratégie
  7. Wacko Alpha : 1,5 M de points de données et le tableau de bord 10xUne cible de 4,7 par trente jours correspond au tableau.
  8. Configuration Railway : connexion navigateur et synchronisation CLI
  9. Conclusion : registre de 24 gains et 22 pertes et boucle hebdomadaireLe premier cycle Hermes est en lecture seule et en revue seule.

Commentaire de l’IA

""À mon avis, cette vidéo ne réduit pas l'automatisation à un prompt magique ; elle la relie à une architecture en quatre parties et à une boucle hebdomadaire validée par un humain.""

Évaluation de l’IA

À défendre au mieux, un trader auto-apprenant à prompt unique est séduisant mais reste non mesuré. L'étude AI-Trader de la HKU Business School et l'analyse de BurningTheta du même travail montrent que les grands modèles délivrent des rendements réels faibles et un contrôle des risques fragile. Les chiffres de la vidéo, comme vingt-quatre gains contre vingt-deux pertes et un million et demi de points de données, décrivent des mécanismes, pas une preuve d'avantage ; l'automatisation sans vérification peut devenir du marketing.

La méthodologie laisse des lacunes. Quel actif, quelle période, quels coûts de transaction, quel slippage et quel coût de gaz sur le rendement net, et quel jeu de données est exempt de fuite d'information future ? Le framework TradingAgents corrigeant discrètement une fuite de données anticipative en v0.3.1 après avoir dépassé cent mille étoiles rappelle que les backtests brillants méritent un second regard. La vidéo insiste à juste titre sur une méthode scientifique à une variable, mais elle ne montre pas d'étape de validation indépendante, de comptabilité des coûts ni d'audit externe avant le passage en direct.

Sur les incitations et la vérifiabilité, les bénéficiaires sont clairs : la communauté du créateur, le framework Hermes, la couche d'hébergement Railway et les sous-réseaux Bittensor. Des affirmations comme quarante-sept pour cent par trente jours, une multiplication par dix en six mois, un plancher de Sharpe de un et un drawdown plafonné nécessitent une réplication indépendante. Les premières preuves d'auto-amélioration récursive rapportées par Weco et la note du MIT Technology Review selon laquelle les gains récursifs pourraient arriver plus lentement tempèrent tous deux les attentes ; sans confirmation en laboratoire, ces chiffres restent des cibles.

À mon avis, la leçon pratique est la suivante : cette configuration convient aux bâtisseurs qui veulent encoder une logique de trading, conserver la mémoire entre les exécutions et faire une revue hebdomadaire avec un contrôle humain. Elle ne convient pas à ceux qui courent après le profit rapide ou qui négligent la comptabilité des coûts, du slippage et du drawdown. Tourner en mode papier, simuler soigneusement les coûts et piloter en direct à petite taille avant de basculer le mode s'accorde mieux avec la revue hebdomadaire et la discipline à une variable que la vidéo elle-même préconise.

Sources

8 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

hermes · agent de trading · railway · bittensor · wacko alpha

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…