Zpět na domů

A-Evolve: evoluce AI agentů za 3 řádky kódu

Framework A-Evolve automatizuje evoluci AI agentů, mutuje prompty a dovednosti pro top výsledky na benchmarkách. Dosaženo 79,4 % na MCP-Atlas s Claude Opus. Open-source nástroj s git-trackingem pro vývojáře.

Evolujte AI agenty s A-Evolve: top-1 na MCP-Atlas
Advertisement 728x90

# A-Evolve: framework pro automatickou evoluci AI agentů na bázi LLM

Framework A-Evolve od výzkumníků Amazonu a Pensylvániuské univerzity umožňuje proměnit základního AI agenta v vysoce výkonný prostřednictvím iterativních mutací. Systém modifikuje prompty, dovednosti, paměť a nástroje, testuje změny na benchmarkech a uchovává pouze zlepšení. Spuštění vyžaduje tři řádky Python kódu, proces je plně autonomní a využívá git pro verzování mutací.

Tento přístup řeší problém degradace agentů v měnícím se prostředí: místo dodobírání LLM nebo ručního ladění promptů se zapojí „agent-evoluční“. Analyzuje neúspěchy, provádí úpravy v pracovní složce agenta a restartuje hodnocení. To odpovídá konceptu „agentní evoluce“ ze studie Position: Agentic Evolution is the Path to Evolving LLMs (leden 2026).

Architektura a princip fungování

A-Evolve následuje model BYOA (Bring Your Own Agent), BYOE (Bring Your Own Environment) a BYO-Algo (Bring Your Own Evolution Algorithm). Pracovní složka agenta je standardní složka s soubory:

Google AdInline article slot
  • manifest.yaml — konfigurace;
  • prompty v samostatných souborech;
  • dovednosti jako skripty;
  • paměť ve formátu vektorových databází nebo logů;
  • nástroje jako callable moduly.

Motor mutací edituje tyto soubory: přeformulovává prompty, přidává/odebírá dovednosti, optimalizuje paměť. Po mutaci následuje průchod benchmarky. Zlepšení se commitují do git, což zajišťuje reprodukovatelnost.

Podporované LLM: Anthropic (Claude), OpenAI, Amazon Bedrock. Benchmarky: MCP-Atlas, SWE-bench Verified, Terminal-Bench 2.0, SkillsBench.

Příklad integrace (tři řádky kódu):

Google AdInline article slot
from a_evolve import Evolver
evolver = Evolver(agent_dir="./my_agent", benchmark="mcp-atlas")
evolver.evolve(generations=50)

Výsledky na klíčových benchmarkech

Testování probíhalo na agentovi s Claude Opus 4.6. Evoluce přinesla významný nárůst výkonu:

| Benchmark | Základní (%) | Po evoluci (%) | Přírůstek (p. b.) |

|-------------------|-------------|----------------|-------------------|

Google AdInline article slot

| MCP-Atlas | 76.0 | 79.4 | +3.4 |

| SWE-bench Verified | 74.2 | 76.8 | +2.6 |

| Terminal-Bench 2.0 | 63.5 | 76.5 | +13.0 |

| SkillsBench | 19.7 | 34.9 | +15.2 |

Na MCP-Atlas výsledek 79,4 % vynesl agenta na první místo v celkovém žebříčku. SWE-bench Verified — přibližně pátá pozice. Nárůst na Terminal-Bench a SkillsBench je obzvláště výrazný, což ukazuje na efektivitu v úkolech s terminálovými rozhraními a testy dovedností.

Výhody pro vývojáře

  • Škálovatelnost: žádná potřeba ručního iterování promptů pro každého agenta.
  • Reprodukovatelnost: git commity fixují každou úspěšnou mutaci.
  • Flexibilita: import libovolného agenta a benchmarku bez přepisování kódu.
  • Efektivita: autonomní cyklus „analýza-mutace-test“ minimalizuje lidský faktor.
  • Open-source: framework je dostupný pro integraci do produkčních pipeline.

Pro middle/senior vývojáře je to nástroj pro automatizaci A/B testování agentů. Evoluční agent se dá integrovat do CI/CD a spouštět mutace na nightly buildech.

Co je důležité

  • A-Evolve zvedne základního agenta na Claude Opus 4.6 na 79,4 % na MCP-Atlas — vedení v žebříčku.
  • Nárůst až o 15 p. b. na SkillsBench a Terminal-Bench bez dodobírání modelu.
  • Tři řádky kódu pro start: Evolver(agent_dir, benchmark).evolve().
  • Git-verzování mutací zajišťuje úplné sledování změn.
  • Podpora Anthropic, OpenAI, Bedrock — připravenost na multi-LLM prostředí.

— Editorial Team

Advertisement 728x90

Číst dál