← Retour au catalogue

FICHE · CAS DOCUMENTÉ

Nous Research — Faire évoluer les skills de Hermes

Une boucle DSPy + GEPA teste et améliore des skills, prompts et descriptions d’outils de Hermes sous contraintes.

Documenté

Cas publiquement documenté, avec entreprise identifiable et source.

La preuve décrit le statut du cas, pas une garantie de résultat.
TailleToutes tailles
SecteurLogiciel
FonctionIT / Data · Produit
SolutionChaîne automatisée
AutonomieAgent supervisé
PreuveDocumenté

ANALYSE ACOLYTE

Pourquoi ce cas mérite d’être regardé

Ce cas documenté permet de regarder concrètement comment un chaîne automatisée répond à « Les skills et prompts d’un agent doivent progresser à partir de traces d’exécution sans modifier directement le système en production. ». Il est surtout utile pour séparer ce que la source rapporte de ce qu’Acolyte peut en déduire.

Le problème traité

Les skills et prompts d’un agent doivent progresser à partir de traces d’exécution sans modifier directement le système en production.

Le mécanisme / workflow

ComparaisonScoringCodeOrchestration

Données et entrées

  • Traces d’exécution
  • Jeu d’évaluation
  • Résultats de tests
  • Skill ou prompt courant

Outils et systèmes

  • Hermes Agent
  • DSPy
  • GEPA
  • pytest
  • Git

Impact observé ou attendu

Résultats rapportés par la source

  • RAPPORTÉLa phase d’optimisation des fichiers SKILL.md est documentée comme implémentée ; les phases tool descriptions, system prompts, code et boucle continue restent planifiées.
  • RAPPORTÉLe dépôt annonce un coût indicatif d’environ 2 à 10 dollars par run d’optimisation.

Valeur attendue dans la fiche

  • QualitéAméliorer une compétence à partir de ses échecs observés.
  • RisqueConserver une revue humaine et des garde-fous avant intégration.

Type d’impact envisagé

  • amélioration continue
  • qualité des workflows
  • réduction de la dérive

ANALYSE ACOLYTE

Ce que ce cas montre

  • L’autonomie peut être progressive : le système prépare et l’humain garde la décision finale.
  • Le cas se lit comme une chaîne de travail : la qualité du résultat dépend aussi des étapes, des exceptions et du contrôle.
  • Les données et les outils sont une partie du cas, pas un détail d’implémentation à découvrir après la promesse.

Limites et risques

  • Optimiser une mauvaise métrique
  • Dérive sémantique d’une skill
  • Sur-ajustement à un jeu d’évaluation
  • Coût d’exécution des boucles
  • Le dépôt décrit un cadre technique et une première phase implémentée ; il ne publie pas de gain métier indépendant ni de benchmark universel.

Résultats et sources

Preuve et source

Nous ResearchOuvrir la source ↗Résultat rapporté par la source.

À retenir de la source

  • L’amélioration d’un agent devient gouvernable quand les variantes passent par des tests, des contraintes et une pull request.
  • Une trace d’échec est plus utile qu’un simple score quand il s’agit de corriger une compétence.

PROVENANCE

Source publique

https://github.com/NousResearch/hermes-agent-self-evolution

CONFIANCE

Élevée

Le niveau de preuve et la confiance ne remplacent pas une revue du contexte.

INFORMATIONS NON DOCUMENTÉES

La fiche ne permet pas d’aller plus loin sur :

  • Prérequis de déploiement

ET CHEZ VOUS ?

Ce que HOCUS ferait ici

Un cas publié ne se recopie pas : il se transpose à vos données, vos équipes et vos contraintes.

PARCOURS · PMEPartir d’un travail réel, pas d’un catalogue