Powrót do strony głównej

Samoorganizacja agentów LLM bez ról +14% jakości

Badanie pokazuje przewagę samoorganizujących się agentów LLM nad systemami z ustalonymi rolami. Protokół Sequential zapewnia +14% jakości Q na 25 000 zadaniach. Silne modele jak Claude i DeepSeek optymalnie wykorzystują autonomię.

Agenci LLM samoorganizują się lepiej niż koordynatory: +14%
Advertisement 728x90

Samoorganizacja agentów LLM: rezygnacja z ról zwiększa efektywność o 14%

System agentów LLM bez sztywnych ról i hierarchii przewyższa tradycyjne podejścia z koordynatorem o 14% według metryki jakości Q (p < 0,001). Eksperyment na 25 000 zadań z 8 modelami i do 256 agentów wykazał, że agenci samodzielnie określają specjalizacje, rezygnują z niepotrzebnych zadań i skalują się bez utraty wydajności. Protokół sekwencyjny, w którym agenci pracują po kolei z dostępem do wyników poprzedników, zapewnia najwyższe rezultaty.

Skala i metodologia eksperymentu

Eksperyment objął ponad 25 000 zadań czterech poziomów złożoności: od weryfikacji API (L1) do scenariuszy konkurencyjnych CEO vs Legal vs CFO (L4). Testowano 8 modeli — Claude, GPT-5.4, GPT-4o, GPT-4.1-mini, DeepSeek v3.2, GLM-5, Gemini-3-flash, GigaChat 2 Max. Liczba agentów wahała się od 4 do 256, całkowite zużycie przekroczyło 1 mld tokenów.

Jakość rozwiązań oceniał model-sędzia według pięciu kryteriów: dokładność, kompletność, spójność, zastosowalność, zgodność z misją. Metryka Q wahała się od 0,25 do 1,0.

Google AdInline article slot

Porównano 8 protokołów koordynacji, w tym 4 bioinspirowane. Skupiono się na koordynacji poziomej: jak grupa agentów tworzy jednolity system bez wzmacniania pionowego poszczególnych instancji.

Protokoły koordynacji i ich efektywność

Testowano cztery kluczowe protokoły z identycznymi modelami, zadaniami i liczbą agentów:

  • Coordinator: Centralny agent-0 przydziela role, pozostali wykonują równolegle.
  • Sequential: Agenci pracują po kolei, każdy analizuje konkretne wyniki poprzednich i decyduje o roli i udziale.
  • Broadcast: Agenci ogłaszają intencje, następnie korygują na podstawie cudzych.
  • Shared: Pełna niezależność ze wspólną pamięcią.

Wyniki na GPT-4.1-mini (N=8):

Google AdInline article slot

| Protokół | Jakość Q |

|--------------|------------|

| Sequential | 0,724 |

Google AdInline article slot

| Coordinator | 0,640 |

| Broadcast | 0,510 |

| Shared | 0,503 |

Różnica między najlepszym a najgorszym — 44% (Cohen’s d = 1,86). Przy N=16 na Claude dla złożonych zadań Sequential osiągnął Q=0,875 wobec 0,767 u Coordinator (+14%, p < 0,001).

Sequential wygrywa dzięki dostępowi do rzeczywistych zakończonych wyników, a nie intencji czy ogólnych historii.

Dynamika ról i specjalizacji

8 agentów na setkach zadań wygenerowało 5006 unikalnych ról, z czego 54% użyto jednorazowo. Przy 64 agentach — 5010 ról (różnica 0,1%). Agenci dostosowują funkcje do kontekstu każdego zadania, ignorując stałe profile.

W Sequential role zmieniają się dynamicznie, tworząc rozproszoną sieć. W Coordinator wszystkie połączenia przechodzą przez Agent-0 — jedyny punkt awarii.

Samowycofanie i optymalizacja zasobów

Agenci w Sequential dobrowolnie rezygnują z zadań: „Wszystko kluczowe pokryte, nie dodam wartości”. Z 60 nieaktywnych — 38 samowycofań. To podnosi Q do 0,875 wobec 0,767 przy wymuszonym udziale.

Claude wykazuje 8,6% świadomych rezygnacji — optymalny poziom. System sam określa potrzebną liczbę uczestników, minimalizując tokeny.

Przy skalowaniu:

| N agentów | Q | Tokeny |

|-----------|--------|----------|

| 8 | 0,954 | 3164 |

| 64 | 0,949 | 3537 |

| 256 | 0,967 | — |

Koszt wzrósł o 11,8% przy 8-krotnym zwiększeniu N, ~45% agentów się wycofuje.

Porównanie modeli i koszt

Na złożonych zadaniach:

  • Claude Sonnet 4.6: Q=0,875, wysoki koszt.
  • DeepSeek v3.2: Q=0,829 (~95% od Claude), koszt ~1/24.
  • GLM-5: Q=0,800, ~1/20.

DeepSeek wyprzedza Claude na zadaniach konkurencyjnych (+6,0%), zgodność z misją 4,00/4,00.

Trend: mocne modele (Claude, DeepSeek) zyskują na autonomii (+3,5–10,6%). Kluczowe właściwości:

  • Reasoning — łańcuchy rozumowania.
  • Self-reflection — ocena kompetencji.
  • Instruction following — przestrzeganie protokołu.
  • Structured output — stabilny format.

Adaptacja do złożoności zadań

Q spada z L1 do L4 (-37,7%), ale hierarchia spontanicznie się pogłębia (1,22 → 1,56). Agenci sami zwiększają strukturę bez instrukcji.

Co jest ważne

  • Protokół sekwencyjny zwiększa Q o 14% dzięki dostępowi do rzeczywistych wyników poprzedników.
  • Agenci generują tysiące unikalnych ról, dostosowując się do kontekstu bez stałych profili.
  • Dobrowolne samowycofanie optymalizuje zasoby: 45% agentów nie uczestniczy przy N=256.
  • DeepSeek v3.2 osiąga 95% jakości Claude za 1/24 kosztu.
  • Autonomia jest efektywna na mocnych modelach z rozwiniętym reasoning i self-reflection.

— Editorial Team

Advertisement 728x90

Czytaj dalej