Zpět na domů

Samoodorganizace agentů LLM bez rolí +14% kvality

Výzkum ukazuje převahu samoodorganizujících se LLM-agentů nad systémy s pevnými rolemi. Sequential-protokol zajišťuje +14% v kvalitě Q na 25 000 úkolech. Silné modely jako Claude a DeepSeek optimálně využívají autonomii.

LLM-agenti se samoodorganizují lépe než koordinátoři: +14%
Advertisement 728x90

Samoorganizace LLM agentů: Odstoupení od rolí zvyšuje efektivitu o 14 %

Systém LLM agentů bez pevných rolí a hierarchií překonává tradiční přístupy s koordinátorem o 14 % podle metriky kvality Q (p < 0,001). Experiment na 25 000 úlohách s 8 modely a až 256 agenty ukázal, že agenti samostatně určují specializace, odmítají zbytečné úkoly a škálují se bez ztráty výkonu. Sekvenční protokol, kde agenti pracují postupně s přístupem k výsledkům předchůdců, zajišťuje nejlepší výsledky.

Rozsah a metodologie experimentu

Experiment pokryl více než 25 000 úloh čtyř úrovní složitosti: od ověřování API (L1) až po soutěžní scénáře CEO vs Legal vs CFO (L4). Testováno bylo 8 modelů – Claude, GPT-5.4, GPT-4o, GPT-4.1-mini, DeepSeek v3.2, GLM-5, Gemini-3-flash, GigaChat 2 Max. Počet agentů se pohyboval od 4 do 256, celková spotřeba přesáhla 1 miliardu tokenů.

Kvalita řešení byla hodnocena modelem-soudcem podle pěti kritérií: přesnost, úplnost, soudržnost, použitelnost, soulad s misí. Metrika Q se pohybovala od 0,25 do 1,0.

Google AdInline article slot

Porovnávány byly 4 protokoly koordinace, včetně 4 bioinspirovaných. Zaměření na horizontální koordinaci: jak skupina agentů tvoří jednotný systém bez vertikálního posílení jednotlivých instancí.

Protokoly koordinace a jejich efektivita

Testovány byly čtyři klíčové protokoly s identickými modely, úlohami a počtem agentů:

  • Koordinátor: Centrální agent-0 přiděluje role, ostatní pracují paralelně.
  • Sekvenční: Agenti pracují postupně, každý analyzuje konkrétní výsledky předchozích a rozhoduje o roli a účasti.
  • Broadcast: Agenti oznamují záměry, poté upravují na základě cizích.
  • Sdílený: Úplná nezávislost se společnou pamětí.

Výsledky na GPT-4.1-mini (N=8):

Google AdInline article slot

| Protokol | Kvalita Q |

|--------------|------------|

| Sekvenční | 0,724 |

Google AdInline article slot

| Koordinátor | 0,640 |

| Broadcast | 0,510 |

| Sdílený | 0,503 |

Rozdíl mezi nejlepším a nejhorším – 44 % (Cohen’s d = 1,86). Při N=16 na Claude pro složité úlohy dosáhl Sekvenční Q=0,875 oproti 0,767 u Koordinátora (+14 %, p < 0,001).

Sekvenční vítězí díky přístupu ke skutečným dokončeným výsledkům, nikoli záměrům nebo obecným historiím.

Dynamika rolí a specializací

8 agentů na stovkách úloh vygenerovalo 5006 unikátních rolí, z nichž 54 % bylo použito jednorázově. Při 64 agentech – 5010 rolí (rozdíl 0,1 %). Agenti přizpůsobují funkce kontextu každé úlohy, ignorují pevné profily.

V Sekvenčním se role mění dynamicky, tvoří distribuovanou síť. V Koordinátoru všechny vazby procházejí přes Agent-0 – jediný bod selhání.

Samoodstoupení a optimalizace zdrojů

Agenti v Sekvenčním se dobrovolně vzdávají úloh: „Vše klíčové pokryto, nepřidám hodnotu.“ Z 60 neaktivních – 38 samoodstoupení. To zvyšuje Q na 0,875 oproti 0,767 při vynucené účasti.

Claude vykazuje 8,6 % uvědomělých odmítnutí – optimální úroveň. Systém sám určuje potřebný počet účastníků, minimalizuje tokeny.

Při škálování:

| N agentů | Q | Tokeny |

|-----------|--------|----------|

| 8 | 0,954 | 3164 |

| 64 | 0,949 | 3537 |

| 256 | 0,967 | — |

Náklady vzrostly o 11,8 % při 8násobném zvýšení N, ~45 % agentů se samoodstoupí.

Porovnání modelů a náklady

Na složitých úlohách:

  • Claude Sonnet 4.6: Q=0,875, vysoké náklady.
  • DeepSeek v3.2: Q=0,829 (~95 % od Claude), náklady ~1/24.
  • GLM-5: Q=0,800, ~1/20.

DeepSeek předčí Claude na soutěžních úlohách (+6,0 %), soulad s misí 4,00/4,00.

Trend: silné modely (Claude, DeepSeek) těží z autonomie (+3,5–10,6 %). Klíčové vlastnosti:

  • Reasoning – řetězce úvah.
  • Self-reflection – hodnocení kompetencí.
  • Instruction following – dodržování protokolu.
  • Structured output – stabilní formát.

Adaptace na složitost úloh

Q klesá z L1 na L4 (-37,7 %), ale hierarchie se spontánně prohlubuje (1,22 → 1,56). Agenti sami navyšují strukturu bez instrukcí.

Co je důležité

  • Sekvenční protokol zvyšuje Q o 14 % díky přístupu ke skutečným výsledkům předchůdců.
  • Agenti generují tisíce unikátních rolí, přizpůsobují se kontextu bez pevných profilů.
  • Dobrovolné samoodstoupení optimalizuje zdroje: 45 % agentů se neúčastní při N=256.
  • DeepSeek v3.2 dosahuje 95 % kvality Claude za 1/24 nákladů.
  • Autonomie je efektivní na silných modelech s rozvinutým reasoningem a self-reflection.

— Editorial Team

Advertisement 728x90

Číst dál