Samoorganizacja agentów LLM: rezygnacja z ról zwiększa efektywność o 14%
System agentów LLM bez sztywnych ról i hierarchii przewyższa tradycyjne podejścia z koordynatorem o 14% według metryki jakości Q (p < 0,001). Eksperyment na 25 000 zadań z 8 modelami i do 256 agentów wykazał, że agenci samodzielnie określają specjalizacje, rezygnują z niepotrzebnych zadań i skalują się bez utraty wydajności. Protokół sekwencyjny, w którym agenci pracują po kolei z dostępem do wyników poprzedników, zapewnia najwyższe rezultaty.
Skala i metodologia eksperymentu
Eksperyment objął ponad 25 000 zadań czterech poziomów złożoności: od weryfikacji API (L1) do scenariuszy konkurencyjnych CEO vs Legal vs CFO (L4). Testowano 8 modeli — Claude, GPT-5.4, GPT-4o, GPT-4.1-mini, DeepSeek v3.2, GLM-5, Gemini-3-flash, GigaChat 2 Max. Liczba agentów wahała się od 4 do 256, całkowite zużycie przekroczyło 1 mld tokenów.
Jakość rozwiązań oceniał model-sędzia według pięciu kryteriów: dokładność, kompletność, spójność, zastosowalność, zgodność z misją. Metryka Q wahała się od 0,25 do 1,0.
Porównano 8 protokołów koordynacji, w tym 4 bioinspirowane. Skupiono się na koordynacji poziomej: jak grupa agentów tworzy jednolity system bez wzmacniania pionowego poszczególnych instancji.
Protokoły koordynacji i ich efektywność
Testowano cztery kluczowe protokoły z identycznymi modelami, zadaniami i liczbą agentów:
- Coordinator: Centralny agent-0 przydziela role, pozostali wykonują równolegle.
- Sequential: Agenci pracują po kolei, każdy analizuje konkretne wyniki poprzednich i decyduje o roli i udziale.
- Broadcast: Agenci ogłaszają intencje, następnie korygują na podstawie cudzych.
- Shared: Pełna niezależność ze wspólną pamięcią.
Wyniki na GPT-4.1-mini (N=8):
| Protokół | Jakość Q |
|--------------|------------|
| Sequential | 0,724 |
| Coordinator | 0,640 |
| Broadcast | 0,510 |
| Shared | 0,503 |
Różnica między najlepszym a najgorszym — 44% (Cohen’s d = 1,86). Przy N=16 na Claude dla złożonych zadań Sequential osiągnął Q=0,875 wobec 0,767 u Coordinator (+14%, p < 0,001).
Sequential wygrywa dzięki dostępowi do rzeczywistych zakończonych wyników, a nie intencji czy ogólnych historii.
Dynamika ról i specjalizacji
8 agentów na setkach zadań wygenerowało 5006 unikalnych ról, z czego 54% użyto jednorazowo. Przy 64 agentach — 5010 ról (różnica 0,1%). Agenci dostosowują funkcje do kontekstu każdego zadania, ignorując stałe profile.
W Sequential role zmieniają się dynamicznie, tworząc rozproszoną sieć. W Coordinator wszystkie połączenia przechodzą przez Agent-0 — jedyny punkt awarii.
Samowycofanie i optymalizacja zasobów
Agenci w Sequential dobrowolnie rezygnują z zadań: „Wszystko kluczowe pokryte, nie dodam wartości”. Z 60 nieaktywnych — 38 samowycofań. To podnosi Q do 0,875 wobec 0,767 przy wymuszonym udziale.
Claude wykazuje 8,6% świadomych rezygnacji — optymalny poziom. System sam określa potrzebną liczbę uczestników, minimalizując tokeny.
Przy skalowaniu:
| N agentów | Q | Tokeny |
|-----------|--------|----------|
| 8 | 0,954 | 3164 |
| 64 | 0,949 | 3537 |
| 256 | 0,967 | — |
Koszt wzrósł o 11,8% przy 8-krotnym zwiększeniu N, ~45% agentów się wycofuje.
Porównanie modeli i koszt
Na złożonych zadaniach:
- Claude Sonnet 4.6: Q=0,875, wysoki koszt.
- DeepSeek v3.2: Q=0,829 (~95% od Claude), koszt ~1/24.
- GLM-5: Q=0,800, ~1/20.
DeepSeek wyprzedza Claude na zadaniach konkurencyjnych (+6,0%), zgodność z misją 4,00/4,00.
Trend: mocne modele (Claude, DeepSeek) zyskują na autonomii (+3,5–10,6%). Kluczowe właściwości:
- Reasoning — łańcuchy rozumowania.
- Self-reflection — ocena kompetencji.
- Instruction following — przestrzeganie protokołu.
- Structured output — stabilny format.
Adaptacja do złożoności zadań
Q spada z L1 do L4 (-37,7%), ale hierarchia spontanicznie się pogłębia (1,22 → 1,56). Agenci sami zwiększają strukturę bez instrukcji.
Co jest ważne
- Protokół sekwencyjny zwiększa Q o 14% dzięki dostępowi do rzeczywistych wyników poprzedników.
- Agenci generują tysiące unikalnych ról, dostosowując się do kontekstu bez stałych profili.
- Dobrowolne samowycofanie optymalizuje zasoby: 45% agentów nie uczestniczy przy N=256.
- DeepSeek v3.2 osiąga 95% jakości Claude za 1/24 kosztu.
- Autonomia jest efektywna na mocnych modelach z rozwiniętym reasoning i self-reflection.
— Editorial Team
Brak komentarzy.