# A-Evolve: framework pro automatickou evoluci AI agentů na bázi LLM
Framework A-Evolve od výzkumníků Amazonu a Pensylvániuské univerzity umožňuje proměnit základního AI agenta v vysoce výkonný prostřednictvím iterativních mutací. Systém modifikuje prompty, dovednosti, paměť a nástroje, testuje změny na benchmarkech a uchovává pouze zlepšení. Spuštění vyžaduje tři řádky Python kódu, proces je plně autonomní a využívá git pro verzování mutací.
Tento přístup řeší problém degradace agentů v měnícím se prostředí: místo dodobírání LLM nebo ručního ladění promptů se zapojí „agent-evoluční“. Analyzuje neúspěchy, provádí úpravy v pracovní složce agenta a restartuje hodnocení. To odpovídá konceptu „agentní evoluce“ ze studie Position: Agentic Evolution is the Path to Evolving LLMs (leden 2026).
Architektura a princip fungování
A-Evolve následuje model BYOA (Bring Your Own Agent), BYOE (Bring Your Own Environment) a BYO-Algo (Bring Your Own Evolution Algorithm). Pracovní složka agenta je standardní složka s soubory:
manifest.yaml— konfigurace;- prompty v samostatných souborech;
- dovednosti jako skripty;
- paměť ve formátu vektorových databází nebo logů;
- nástroje jako callable moduly.
Motor mutací edituje tyto soubory: přeformulovává prompty, přidává/odebírá dovednosti, optimalizuje paměť. Po mutaci následuje průchod benchmarky. Zlepšení se commitují do git, což zajišťuje reprodukovatelnost.
Podporované LLM: Anthropic (Claude), OpenAI, Amazon Bedrock. Benchmarky: MCP-Atlas, SWE-bench Verified, Terminal-Bench 2.0, SkillsBench.
Příklad integrace (tři řádky kódu):
from a_evolve import Evolver
evolver = Evolver(agent_dir="./my_agent", benchmark="mcp-atlas")
evolver.evolve(generations=50)
Výsledky na klíčových benchmarkech
Testování probíhalo na agentovi s Claude Opus 4.6. Evoluce přinesla významný nárůst výkonu:
| Benchmark | Základní (%) | Po evoluci (%) | Přírůstek (p. b.) |
|-------------------|-------------|----------------|-------------------|
| MCP-Atlas | 76.0 | 79.4 | +3.4 |
| SWE-bench Verified | 74.2 | 76.8 | +2.6 |
| Terminal-Bench 2.0 | 63.5 | 76.5 | +13.0 |
| SkillsBench | 19.7 | 34.9 | +15.2 |
Na MCP-Atlas výsledek 79,4 % vynesl agenta na první místo v celkovém žebříčku. SWE-bench Verified — přibližně pátá pozice. Nárůst na Terminal-Bench a SkillsBench je obzvláště výrazný, což ukazuje na efektivitu v úkolech s terminálovými rozhraními a testy dovedností.
Výhody pro vývojáře
- Škálovatelnost: žádná potřeba ručního iterování promptů pro každého agenta.
- Reprodukovatelnost: git commity fixují každou úspěšnou mutaci.
- Flexibilita: import libovolného agenta a benchmarku bez přepisování kódu.
- Efektivita: autonomní cyklus „analýza-mutace-test“ minimalizuje lidský faktor.
- Open-source: framework je dostupný pro integraci do produkčních pipeline.
Pro middle/senior vývojáře je to nástroj pro automatizaci A/B testování agentů. Evoluční agent se dá integrovat do CI/CD a spouštět mutace na nightly buildech.
Co je důležité
- A-Evolve zvedne základního agenta na Claude Opus 4.6 na 79,4 % na MCP-Atlas — vedení v žebříčku.
- Nárůst až o 15 p. b. na SkillsBench a Terminal-Bench bez dodobírání modelu.
- Tři řádky kódu pro start:
Evolver(agent_dir, benchmark).evolve(). - Git-verzování mutací zajišťuje úplné sledování změn.
- Podpora Anthropic, OpenAI, Bedrock — připravenost na multi-LLM prostředí.
— Editorial Team
Zatím žádné komentáře.