A-Evolve: framework do automatycznej ewolucji agentów AI na bazie LLM
Framework A-Evolve od badaczy z Amazon i Uniwersytetu Pensylwanii pozwala przekształcić podstawowego agenta AI w wysokowydajny dzięki iteracyjnym mutacjom. System modyfikuje prompty, skillsy, pamięć i narzędzia, testuje zmiany na benchmarkach i zachowuje tylko ulepszenia. Uruchomienie wymaga trzech linii kodu Python, proces jest w pełni autonomiczny i wykorzystuje git do wersjonowania mutacji.
Podejście to rozwiązuje problem degradacji agentów w zmieniającym się środowisku: zamiast fine-tuningu LLM lub ręcznej konfiguracji promptów wykorzystywany jest „agent-ewolucjoner". Analizuje on porażki, wprowadza poprawki w katalogu roboczym agenta i restartuje ewaluacje. Odpowiada to koncepcji „ewolucji agentów" z artykułu Position: Agentic Evolution is the Path to Evolving LLMs (styczeń 2026).
Architektura i zasada działania
A-Evolve stosuje model BYOA (Bring Your Own Agent), BYOE (Bring Your Own Environment) i BYO-Algo (Bring Your Own Evolution Algorithm). Katalog roboczy agenta to standardowy folder z plikami:
manifest.yaml— konfiguracja;- prompty w oddzielnych plikach;
- skillsy jako skrypty;
- pamięć w formacie baz wektorowych lub logów;
- narzędzia jako moduły callable.
Silnik mutacji edytuje te pliki: parafrazuje prompty, dodaje/usuwaj skillsy, optymalizuje pamięć. Po mutacji następuje przejście przez benchmarki. Ulepszenia są commitowane do git, co zapewnia odtwarzalność.
Obsługiwane LLM: Anthropic (Claude), OpenAI, Amazon Bedrock. Benchmarki: MCP-Atlas, SWE-bench Verified, Terminal-Bench 2.0, SkillsBench.
Przykład integracji (trzy linie kodu):
from a_evolve import Evolver
evolver = Evolver(agent_dir="./my_agent", benchmark="mcp-atlas")
evolver.evolve(generations=50)
Wyniki na kluczowych benchmarkach
Testy przeprowadzono na agencie z Claude Opus 4.6. Ewolucja przyniosła znaczący wzrost wydajności:
| Benchmark | Bazowy (%) | Po ewolucji (%) | Przyrost (p.p.) |
|-------------------|------------|-----------------|-----------------|
| MCP-Atlas | 76.0 | 79.4 | +3.4 |
| SWE-bench Verified | 74.2 | 76.8 | +2.6 |
| Terminal-Bench 2.0 | 63.5 | 76.5 | +13.0 |
| SkillsBench | 19.7 | 34.9 | +15.2 |
Na MCP-Atlas wynik 79,4% wywindował agenta na pierwsze miejsce w ogólnym rankingu. SWE-bench Verified — około piątej pozycji. Przyrost na Terminal-Bench i SkillsBench jest szczególnie zauważalny, co wskazuje na skuteczność w zadaniach z interfejsami terminalowymi i testami umiejętności.
Zalety dla programistów
- Skalowalność: brak potrzeby ręcznej iteracji promptów dla każdego agenta.
- Odtwarzalność: commity git fiksiują każdą udaną mutację.
- Elastyczność: import dowolnego agenta i benchmarku bez przepisywania kodu.
- Wydajność: autonomiczny cykl „analiza-mutacja-test" minimalizuje czynnik ludzki.
- Open-source: framework dostępny do integracji w produkcyjnych pipeline'ach.
Dla middle/senior developerów to narzędzie do automatyzacji A/B-testów agentów. Ewolucjoner może być zintegrowany z CI/CD, uruchamiając mutacje na nightly buildach.
Co ważne
- A-Evolve podnosi podstawowego agenta na Claude Opus 4.6 do 79,4% na MCP-Atlas — prowadzenie w rankingu.
- Przyrost do 15 p.p. na SkillsBench i Terminal-Bench bez fine-tuningu modelu.
- Trzy linie kodu do startu:
Evolver(agent_dir, benchmark).evolve(). - Wersjonowanie mutacji w git zapewnia pełny tracking zmian.
- Obsługa Anthropic, OpenAI, Bedrock — gotowość do środowisk multi-LLM.
— Editorial Team
Brak komentarzy.