홈으로 돌아가기

A-Evolve: 3줄 코드로 AI 에이전트의 진화

A-Evolve 프레임워크가 AI 에이전트의 진화를 자동화하며, 프롬프트와 스킬을 변이시켜 벤치마크에서 최고 결과를 얻습니다. Claude Opus로 MCP-Atlas에서 79.4% 달성. 개발자를 위한 git 추적 기능이 있는 오픈소스 도구.

A-Evolve로 AI 에이전트를 진화시키세요: MCP-Atlas에서 1위
Advertisement 728x90

A-Evolve: LLM 기반 AI 에이전트의 자동 진화 프레임워크

아마존과 펜실베이니아 대학교 연구원들이 개발한 A-Evolve 프레임워크는 반복적인 변이를 통해 기본 AI 에이전트를 고성능 에이전트로 변환합니다. 이 시스템은 프롬프트, 스킬, 메모리, 도구를 수정하고, 벤치마크에서 변경 사항을 테스트하며 개선된 부분만 유지합니다. 실행에는 Python 코드 3줄만 필요하며 프로세스는 완전히 자율적이고 변이를 버전 관리하기 위해 Git을 사용합니다.

이 접근법은 변화하는 환경에서 에이전트 성능 저하 문제를 해결합니다. LLM을 파인튜닝하거나 프롬프트를 수동으로 조정하는 대신 "evolver agent"를 배포합니다. 실패를 분석하고 에이전트 작업 디렉토리를 편집하며 평가를 다시 실행합니다. 이는 논문 Position: Agentic Evolution is the Path to Evolving LLMs (2026년 1월)의 "agentic evolution" 개념과 일치합니다.

Architecture and How It Works

A-Evolve는 BYOA(자신의 에이전트 지참), BYOE(자신의 환경 지참), BYO-Algo(자신의 진화 알고리즘 지참) 모델을 따릅니다. 에이전트 작업 디렉토리는 표준 폴더로 다음과 같은 파일을 포함합니다:

Google AdInline article slot
  • manifest.yaml — 설정;
  • 별도 파일의 프롬프트;
  • 스크립트 형태의 스킬;
  • 벡터 데이터베이스나 로그 형식의 메모리;
  • 호출 가능한 모듈 형태의 도구.

변형 엔진은 이러한 파일을 편집합니다: 프롬프트를 재구성하거나 스킬을 추가/제거하고 메모리를 최적화합니다. 변형 후 벤치마크를 실행합니다. 개선 사항은 Git에 커밋되어 재현성을 보장합니다.

지원 LLM: Anthropic(Claude), OpenAI, Amazon Bedrock. 벤치마크: MCP-Atlas, SWE-bench Verified, Terminal-Bench 2.0, SkillsBench.

예제 통합(코드 3줄):

Google AdInline article slot
from a_evolve import Evolver
evolver = Evolver(agent_dir="./my_agent", benchmark="mcp-atlas")
evolver.evolve(generations=50)

Results on Key Benchmarks

Claude Opus 4.6 에이전트로 테스트를 진행했습니다. 진화 과정에서 상당한 성능 향상이 나타났습니다:

| Benchmark | Baseline (%) | After Evolution (%) | Gain (p.p.) |

|-----------------------|--------------|---------------------|-------------|

Google AdInline article slot

| MCP-Atlas | 76.0 | 79.4 | +3.4 |

| SWE-bench Verified | 74.2 | 76.8 | +2.6 |

| Terminal-Bench 2.0 | 63.5 | 76.5 | +13.0 |

| SkillsBench | 19.7 | 34.9 | +15.2 |

MCP-Atlas에서 79.4% 점수는 에이전트를 전체 랭킹 1위로 끌어올렸습니다. SWE-bench Verified는 약 5위에 위치했습니다. Terminal-Bench와 SkillsBench에서의 성과 향상이 두드러지며, 터미널 인터페이스 작업과 스킬 평가에서의 효과성을 보여줍니다.

Benefits for Developers

  • 확장성: 모든 에이전트에 대한 수동 프롬프트 반복 작업이 불필요합니다.
  • 재현성: Git 커밋으로 모든 성공적인 변형을 기록합니다.
  • 유연성: 코드 수정 없이 어떤 에이전트나 벤치마크도 가져올 수 있습니다.
  • 효율성: 자율적인 분석-변형-테스트 사이클로 인간 개입을 최소화합니다.
  • 오픈소스: 프로덕션 파이프라인 통합에 바로 사용할 수 있습니다.

중간/시니어 개발자에게는 에이전트 A/B 테스트를 자동화하는 도구입니다. evolver는 CI/CD에 통합되어 야간 빌드에서 변형을 트리거합니다.

Key Takeaways

  • A-Evolve는 기준 Claude Opus 4.6 에이전트를 MCP-Atlas에서 79.4%로 끌어올려 랭킹 1위를 차지하게 합니다.
  • SkillsBench와 Terminal-Bench에서 최대 15%p.p. 향상, 모델 파인튜닝 없이.
  • 시작에 코드 3줄: Evolver(agent_dir, benchmark).evolve().
  • Git 버전 관리가 모든 변형을 포괄적으로 추적합니다.
  • Anthropic, OpenAI, Bedrock 지원 — 멀티 LLM 환경에 즉시 사용 가능.

— Editorial Team

Advertisement 728x90

다음 읽기