Powrót do strony głównej

A-Evolve: ewolucja agentów AI w 3 linie kodu

Framework A-Evolve automatyzuje ewolucję agentów AI, mutując prompty i skille dla topowych wyników na benchmarkach. Osiągnięto 79,4% na MCP-Atlas z Claude Opus. Open-source narzędzie z git-trackingiem dla deweloperów.

Ewoluuj agentów AI z A-Evolve: top-1 na MCP-Atlas
Advertisement 728x90

A-Evolve: framework do automatycznej ewolucji agentów AI na bazie LLM

Framework A-Evolve od badaczy z Amazon i Uniwersytetu Pensylwanii pozwala przekształcić podstawowego agenta AI w wysokowydajny dzięki iteracyjnym mutacjom. System modyfikuje prompty, skillsy, pamięć i narzędzia, testuje zmiany na benchmarkach i zachowuje tylko ulepszenia. Uruchomienie wymaga trzech linii kodu Python, proces jest w pełni autonomiczny i wykorzystuje git do wersjonowania mutacji.

Podejście to rozwiązuje problem degradacji agentów w zmieniającym się środowisku: zamiast fine-tuningu LLM lub ręcznej konfiguracji promptów wykorzystywany jest „agent-ewolucjoner". Analizuje on porażki, wprowadza poprawki w katalogu roboczym agenta i restartuje ewaluacje. Odpowiada to koncepcji „ewolucji agentów" z artykułu Position: Agentic Evolution is the Path to Evolving LLMs (styczeń 2026).

Architektura i zasada działania

A-Evolve stosuje model BYOA (Bring Your Own Agent), BYOE (Bring Your Own Environment) i BYO-Algo (Bring Your Own Evolution Algorithm). Katalog roboczy agenta to standardowy folder z plikami:

Google AdInline article slot
  • manifest.yaml — konfiguracja;
  • prompty w oddzielnych plikach;
  • skillsy jako skrypty;
  • pamięć w formacie baz wektorowych lub logów;
  • narzędzia jako moduły callable.

Silnik mutacji edytuje te pliki: parafrazuje prompty, dodaje/usuwaj skillsy, optymalizuje pamięć. Po mutacji następuje przejście przez benchmarki. Ulepszenia są commitowane do git, co zapewnia odtwarzalność.

Obsługiwane LLM: Anthropic (Claude), OpenAI, Amazon Bedrock. Benchmarki: MCP-Atlas, SWE-bench Verified, Terminal-Bench 2.0, SkillsBench.

Przykład integracji (trzy linie kodu):

Google AdInline article slot
from a_evolve import Evolver
evolver = Evolver(agent_dir="./my_agent", benchmark="mcp-atlas")
evolver.evolve(generations=50)

Wyniki na kluczowych benchmarkach

Testy przeprowadzono na agencie z Claude Opus 4.6. Ewolucja przyniosła znaczący wzrost wydajności:

| Benchmark | Bazowy (%) | Po ewolucji (%) | Przyrost (p.p.) |

|-------------------|------------|-----------------|-----------------|

Google AdInline article slot

| MCP-Atlas | 76.0 | 79.4 | +3.4 |

| SWE-bench Verified | 74.2 | 76.8 | +2.6 |

| Terminal-Bench 2.0 | 63.5 | 76.5 | +13.0 |

| SkillsBench | 19.7 | 34.9 | +15.2 |

Na MCP-Atlas wynik 79,4% wywindował agenta na pierwsze miejsce w ogólnym rankingu. SWE-bench Verified — około piątej pozycji. Przyrost na Terminal-Bench i SkillsBench jest szczególnie zauważalny, co wskazuje na skuteczność w zadaniach z interfejsami terminalowymi i testami umiejętności.

Zalety dla programistów

  • Skalowalność: brak potrzeby ręcznej iteracji promptów dla każdego agenta.
  • Odtwarzalność: commity git fiksiują każdą udaną mutację.
  • Elastyczność: import dowolnego agenta i benchmarku bez przepisywania kodu.
  • Wydajność: autonomiczny cykl „analiza-mutacja-test" minimalizuje czynnik ludzki.
  • Open-source: framework dostępny do integracji w produkcyjnych pipeline'ach.

Dla middle/senior developerów to narzędzie do automatyzacji A/B-testów agentów. Ewolucjoner może być zintegrowany z CI/CD, uruchamiając mutacje na nightly buildach.

Co ważne

  • A-Evolve podnosi podstawowego agenta na Claude Opus 4.6 do 79,4% na MCP-Atlas — prowadzenie w rankingu.
  • Przyrost do 15 p.p. na SkillsBench i Terminal-Bench bez fine-tuningu modelu.
  • Trzy linie kodu do startu: Evolver(agent_dir, benchmark).evolve().
  • Wersjonowanie mutacji w git zapewnia pełny tracking zmian.
  • Obsługa Anthropic, OpenAI, Bedrock — gotowość do środowisk multi-LLM.

— Editorial Team

Advertisement 728x90

Czytaj dalej