Samoorganizace LLM agentů: Odstoupení od rolí zvyšuje efektivitu o 14 %
Systém LLM agentů bez pevných rolí a hierarchií překonává tradiční přístupy s koordinátorem o 14 % podle metriky kvality Q (p < 0,001). Experiment na 25 000 úlohách s 8 modely a až 256 agenty ukázal, že agenti samostatně určují specializace, odmítají zbytečné úkoly a škálují se bez ztráty výkonu. Sekvenční protokol, kde agenti pracují postupně s přístupem k výsledkům předchůdců, zajišťuje nejlepší výsledky.
Rozsah a metodologie experimentu
Experiment pokryl více než 25 000 úloh čtyř úrovní složitosti: od ověřování API (L1) až po soutěžní scénáře CEO vs Legal vs CFO (L4). Testováno bylo 8 modelů – Claude, GPT-5.4, GPT-4o, GPT-4.1-mini, DeepSeek v3.2, GLM-5, Gemini-3-flash, GigaChat 2 Max. Počet agentů se pohyboval od 4 do 256, celková spotřeba přesáhla 1 miliardu tokenů.
Kvalita řešení byla hodnocena modelem-soudcem podle pěti kritérií: přesnost, úplnost, soudržnost, použitelnost, soulad s misí. Metrika Q se pohybovala od 0,25 do 1,0.
Porovnávány byly 4 protokoly koordinace, včetně 4 bioinspirovaných. Zaměření na horizontální koordinaci: jak skupina agentů tvoří jednotný systém bez vertikálního posílení jednotlivých instancí.
Protokoly koordinace a jejich efektivita
Testovány byly čtyři klíčové protokoly s identickými modely, úlohami a počtem agentů:
- Koordinátor: Centrální agent-0 přiděluje role, ostatní pracují paralelně.
- Sekvenční: Agenti pracují postupně, každý analyzuje konkrétní výsledky předchozích a rozhoduje o roli a účasti.
- Broadcast: Agenti oznamují záměry, poté upravují na základě cizích.
- Sdílený: Úplná nezávislost se společnou pamětí.
Výsledky na GPT-4.1-mini (N=8):
| Protokol | Kvalita Q |
|--------------|------------|
| Sekvenční | 0,724 |
| Koordinátor | 0,640 |
| Broadcast | 0,510 |
| Sdílený | 0,503 |
Rozdíl mezi nejlepším a nejhorším – 44 % (Cohen’s d = 1,86). Při N=16 na Claude pro složité úlohy dosáhl Sekvenční Q=0,875 oproti 0,767 u Koordinátora (+14 %, p < 0,001).
Sekvenční vítězí díky přístupu ke skutečným dokončeným výsledkům, nikoli záměrům nebo obecným historiím.
Dynamika rolí a specializací
8 agentů na stovkách úloh vygenerovalo 5006 unikátních rolí, z nichž 54 % bylo použito jednorázově. Při 64 agentech – 5010 rolí (rozdíl 0,1 %). Agenti přizpůsobují funkce kontextu každé úlohy, ignorují pevné profily.
V Sekvenčním se role mění dynamicky, tvoří distribuovanou síť. V Koordinátoru všechny vazby procházejí přes Agent-0 – jediný bod selhání.
Samoodstoupení a optimalizace zdrojů
Agenti v Sekvenčním se dobrovolně vzdávají úloh: „Vše klíčové pokryto, nepřidám hodnotu.“ Z 60 neaktivních – 38 samoodstoupení. To zvyšuje Q na 0,875 oproti 0,767 při vynucené účasti.
Claude vykazuje 8,6 % uvědomělých odmítnutí – optimální úroveň. Systém sám určuje potřebný počet účastníků, minimalizuje tokeny.
Při škálování:
| N agentů | Q | Tokeny |
|-----------|--------|----------|
| 8 | 0,954 | 3164 |
| 64 | 0,949 | 3537 |
| 256 | 0,967 | — |
Náklady vzrostly o 11,8 % při 8násobném zvýšení N, ~45 % agentů se samoodstoupí.
Porovnání modelů a náklady
Na složitých úlohách:
- Claude Sonnet 4.6: Q=0,875, vysoké náklady.
- DeepSeek v3.2: Q=0,829 (~95 % od Claude), náklady ~1/24.
- GLM-5: Q=0,800, ~1/20.
DeepSeek předčí Claude na soutěžních úlohách (+6,0 %), soulad s misí 4,00/4,00.
Trend: silné modely (Claude, DeepSeek) těží z autonomie (+3,5–10,6 %). Klíčové vlastnosti:
- Reasoning – řetězce úvah.
- Self-reflection – hodnocení kompetencí.
- Instruction following – dodržování protokolu.
- Structured output – stabilní formát.
Adaptace na složitost úloh
Q klesá z L1 na L4 (-37,7 %), ale hierarchie se spontánně prohlubuje (1,22 → 1,56). Agenti sami navyšují strukturu bez instrukcí.
Co je důležité
- Sekvenční protokol zvyšuje Q o 14 % díky přístupu ke skutečným výsledkům předchůdců.
- Agenti generují tisíce unikátních rolí, přizpůsobují se kontextu bez pevných profilů.
- Dobrovolné samoodstoupení optimalizuje zdroje: 45 % agentů se neúčastní při N=256.
- DeepSeek v3.2 dosahuje 95 % kvality Claude za 1/24 nákladů.
- Autonomie je efektivní na silných modelech s rozvinutým reasoningem a self-reflection.
— Editorial Team
Zatím žádné komentáře.