Retour à l'accueil

A-Evolve : évolution des agents IA en 3 lignes de code

Le framework A-Evolve automatise l'évolution des agents IA, mutant les prompts et compétences pour des résultats optimaux sur les benchmarks. Atteint 79,4 % sur MCP-Atlas avec Claude Opus. Outil open-source avec suivi git pour les développeurs.

Faites évoluer les agents IA avec A-Evolve : n°1 sur MCP-Atlas
Advertisement 728x90

A-Evolve : Framework pour l'évolution automatique des agents IA basés sur LLM

Le framework A-Evolve, développé par des chercheurs d'Amazon et de l'Université de Pennsylvanie, transforme un agent IA de base en un agent haute performance grâce à des mutations itératives. Le système modifie les prompts, les compétences, la mémoire et les outils, teste les changements sur des benchmarks, et ne conserve que les améliorations. Son lancement nécessite seulement trois lignes de code Python ; le processus est entièrement autonome et utilise Git pour la gestion de versions des mutations.

Cette approche résout le problème de la dégradation des agents dans des environnements changeants : au lieu d'ajuster finement les LLM ou de peaufiner manuellement les prompts, elle déploie un « agent évoluteur ». Il analyse les échecs, effectue des modifications dans le répertoire de travail de l'agent, et relance les évaluations. Cela s'inscrit dans le concept d'« agentic evolution » présenté dans l'article Position: Agentic Evolution is the Path to Evolving LLMs (janvier 2026).

Architecture et fonctionnement

A-Evolve suit les modèles BYOA (Bring Your Own Agent), BYOE (Bring Your Own Environment) et BYO-Algo (Bring Your Own Evolution Algorithm). Le répertoire de travail de l'agent est un dossier standard contenant des fichiers :

Google AdInline article slot
  • manifest.yaml — configuration ;
  • prompts dans des fichiers séparés ;
  • compétences sous forme de scripts ;
  • mémoire dans une base de données vectorielle ou au format journal ;
  • outils sous forme de modules appelables.

Le moteur de mutation édite ces fichiers : reformule les prompts, ajoute/supprime des compétences, optimise la mémoire. Après mutation, il exécute les benchmarks. Les améliorations sont commises dans Git, assurant la reproductibilité.

LLM supportés : Anthropic (Claude), OpenAI, Amazon Bedrock. Benchmarks : MCP-Atlas, SWE-bench Verified, Terminal-Bench 2.0, SkillsBench.

Exemple d'intégration (trois lignes de code) :

Google AdInline article slot
from a_evolve import Evolver
evolver = Evolver(agent_dir="./my_agent", benchmark="mcp-atlas")
evolver.evolve(generations=50)

Résultats sur les benchmarks clés

Les tests ont été conduits sur un agent avec Claude Opus 4.6. L'évolution a permis des gains de performance significatifs :

| Benchmark | Base (%) | Après évolution (%) | Gain (p.p.) |

|-----------------------|----------|---------------------|-------------|

Google AdInline article slot

| MCP-Atlas | 76.0 | 79.4 | +3.4 |

| SWE-bench Verified | 74.2 | 76.8 | +2.6 |

| Terminal-Bench 2.0 | 63.5 | 76.5 | +13.0 |

| SkillsBench | 19.7 | 34.9 | +15.2 |

Sur MCP-Atlas, le score de 79,4 % a propulsé l'agent en première place du classement général. SWE-bench Verified s'est classé autour de la cinquième place. Les gains sur Terminal-Bench et SkillsBench sont particulièrement impressionnants, soulignant l'efficacité sur les tâches d'interface terminal et les évaluations de compétences.

Avantages pour les développeurs

  • Évolutivité : Pas besoin d'itérer manuellement sur les prompts pour chaque agent.
  • Reproductibilité : Les commits Git capturent chaque mutation réussie.
  • Flexibilité : Importer n'importe quel agent ou benchmark sans réécrire de code.
  • Efficacité : Le cycle autonome analyse-mutation-test minimise l'intervention humaine.
  • Open source : Framework prêt pour l'intégration dans des pipelines de production.

Pour les développeurs intermédiaires/seniors, c'est un outil pour automatiser les tests A/B des agents. L'évoluteur s'intègre dans CI/CD, en déclenchant des mutations sur les builds nocturnes.

Points clés

  • A-Evolve porte un agent de base Claude Opus 4.6 à 79,4 % sur MCP-Atlas — en tête du classement.
  • Gains jusqu'à 15 p.p. sur SkillsBench et Terminal-Bench sans fine-tuning du modèle.
  • Trois lignes de code pour démarrer : Evolver(agent_dir, benchmark).evolve().
  • La gestion de versions Git suit toutes les mutations de manière exhaustive.
  • Supporte Anthropic, OpenAI, Bedrock — prêt pour des configurations multi-LLM.

— Editorial Team

Advertisement 728x90

Lire ensuite