# A-Evolve:基于 LLM 的 AI 代理自动进化框架
亚马逊和宾夕法尼亚大学的研究人员开发的 A-Evolve 框架,通过迭代变异将基础 AI 代理转变为高性能代理。该系统修改提示词、技能、记忆和工具,在基准测试上验证变更,并仅保留改进。启动只需三行 Python 代码;整个过程完全自主,并使用 Git 进行变异版本控制。
这种方法解决了代理在变化环境中性能退化的问题:无需微调 LLM 或手动调整提示词,而是部署一个“进化代理”。它分析失败原因,对代理的工作目录进行编辑,并重新运行评估。这与论文 Position: Agentic Evolution is the Path to Evolving LLMs (2026 年 1 月)中“代理式进化”概念一致。
架构和工作原理
A-Evolve 遵循 BYOA(自带代理)、BYOE(自带环境)和 BYO-Algo(自带进化算法)模式。代理的工作目录是一个标准文件夹,包含以下文件:
manifest.yaml—— 配置;- 提示词存放在单独的文件中;
- 技能以脚本形式实现;
- 记忆以向量数据库或日志格式存储;
- 工具作为可调用模块。
变异引擎编辑这些文件:改写提示词、增删技能、优化记忆。变异后,运行基准测试。改进会被提交到 Git,确保可重现性。
支持的 LLM:Anthropic (Claude)、OpenAI、Amazon Bedrock。基准测试:MCP-Atlas、SWE-bench Verified、Terminal-Bench 2.0、SkillsBench。
示例集成(三行代码):
from a_evolve import Evolver
evolver = Evolver(agent_dir="./my_agent", benchmark="mcp-atlas")
evolver.evolve(generations=50)
关键基准测试结果
使用 Claude Opus 4.6 的代理进行了测试。进化带来了显著的性能提升:
| 基准测试 | 基线 (%) | 进化后 (%) | 提升 (百分点) |
|-----------------------|----------|------------|--------------|
| MCP-Atlas | 76.0 | 79.4 | +3.4 |
| SWE-bench Verified | 74.2 | 76.8 | +2.6 |
| Terminal-Bench 2.0 | 63.5 | 76.5 | +13.0 |
| SkillsBench | 19.7 | 34.9 | +15.2 |
在 MCP-Atlas 上,79.4% 的分数使该代理登上总体排行榜第一名。SWE-bench Verified 排名约第五位。在 Terminal-Bench 和 SkillsBench 上的提升尤为突出,展示了其在终端界面任务和技能评估方面的有效性。
对开发者的益处
- 可扩展性:无需为每个代理手动迭代提示词。
- 可重现性:Git 提交记录每个成功的变异。
- 灵活性:无需重写代码,即可导入任意代理或基准测试。
- 效率:自主的分析-变异-测试循环最大限度减少人为干预。
- 开源:框架可直接集成到生产管道中。
对于中高级开发者,这是一个自动化代理 A/B 测试的工具。进化器可集成到 CI/CD 中,在夜间构建时触发变异。
关键要点
- A-Evolve 将基线 Claude Opus 4.6 代理在 MCP-Atlas 上提升至 79.4% —— 排行榜首位。
- 在 SkillsBench 和 Terminal-Bench 上提升高达 15 个百分点,无需模型微调。
- 启动只需三行代码:
Evolver(agent_dir, benchmark).evolve()。 - Git 版本控制全面追踪所有变异。
- 支持 Anthropic、OpenAI、Bedrock —— 适用于多 LLM 环境。
— Editorial Team
暂无评论。