FICHE · CAS DOCUMENTÉ
Nous Research — Faire évoluer les skills de Hermes
Une boucle DSPy + GEPA teste et améliore des skills, prompts et descriptions d’outils de Hermes sous contraintes.
Cas publiquement documenté, avec entreprise identifiable et source.
La preuve décrit le statut du cas, pas une garantie de résultat.ANALYSE ACOLYTE
Pourquoi ce cas mérite d’être regardé
Ce cas documenté permet de regarder concrètement comment un chaîne automatisée répond à « Les skills et prompts d’un agent doivent progresser à partir de traces d’exécution sans modifier directement le système en production. ». Il est surtout utile pour séparer ce que la source rapporte de ce qu’Acolyte peut en déduire.
Le problème traité
Les skills et prompts d’un agent doivent progresser à partir de traces d’exécution sans modifier directement le système en production.
Le mécanisme / workflow
Données et entrées
- Traces d’exécution
- Jeu d’évaluation
- Résultats de tests
- Skill ou prompt courant
Outils et systèmes
- Hermes Agent
- DSPy
- GEPA
- pytest
- Git
Impact observé ou attendu
Résultats rapportés par la source
- RAPPORTÉLa phase d’optimisation des fichiers SKILL.md est documentée comme implémentée ; les phases tool descriptions, system prompts, code et boucle continue restent planifiées.
- RAPPORTÉLe dépôt annonce un coût indicatif d’environ 2 à 10 dollars par run d’optimisation.
Valeur attendue dans la fiche
- QualitéAméliorer une compétence à partir de ses échecs observés.
- RisqueConserver une revue humaine et des garde-fous avant intégration.
Type d’impact envisagé
- amélioration continue
- qualité des workflows
- réduction de la dérive
ANALYSE ACOLYTE
Ce que ce cas montre
- L’autonomie peut être progressive : le système prépare et l’humain garde la décision finale.
- Le cas se lit comme une chaîne de travail : la qualité du résultat dépend aussi des étapes, des exceptions et du contrôle.
- Les données et les outils sont une partie du cas, pas un détail d’implémentation à découvrir après la promesse.
Limites et risques
- Optimiser une mauvaise métrique
- Dérive sémantique d’une skill
- Sur-ajustement à un jeu d’évaluation
- Coût d’exécution des boucles
- Le dépôt décrit un cadre technique et une première phase implémentée ; il ne publie pas de gain métier indépendant ni de benchmark universel.
Résultats et sources
Preuve et source
Nous ResearchOuvrir la source ↗Résultat rapporté par la source.À retenir de la source
- L’amélioration d’un agent devient gouvernable quand les variantes passent par des tests, des contraintes et une pull request.
- Une trace d’échec est plus utile qu’un simple score quand il s’agit de corriger une compétence.
PROVENANCE
Source publique
https://github.com/NousResearch/hermes-agent-self-evolutionCONFIANCE
ÉlevéeLe niveau de preuve et la confiance ne remplacent pas une revue du contexte.
INFORMATIONS NON DOCUMENTÉES
La fiche ne permet pas d’aller plus loin sur :
- Prérequis de déploiement
ET CHEZ VOUS ?
Ce que HOCUS ferait ici
Un cas publié ne se recopie pas : il se transpose à vos données, vos équipes et vos contraintes.
Vérifier que ce cas a du sens chez vous, avec quelles données, et ce qu’il rapporterait.
Découvrir ↗2 · WORKSWorks · Scoring & prédictionDes scores recalculés et expliqués (attrition, valeur, appétence, demande) branchés là où l’action se passe.
Voir ↗3 · EN PARLERÉcrire à HOCUSUne question sur ce cas ou sur votre situation.
hello@hocus.works ↗