LLM智能体自组织:摒弃角色分工,效率提升14%
一项实验表明,无需固定角色与层级的LLM智能体系统,在质量指标Q上比传统基于协调员的方法高出14%(p < 0.001)。该实验覆盖25,000项任务,涉及8个模型和最多256个智能体,结果显示智能体可自主确定专长、拒绝不必要任务,并在规模扩大时保持性能不降。其中,顺序协议——即智能体依次工作并访问前序结果——表现最佳。
实验规模与方法论
实验涵盖超过25,000项任务,分为四个复杂度级别:从API验证(L1)到对抗性场景如CEO vs 法务 vs CFO(L4)。测试了八个模型——Claude、GPT-5.4、GPT-4o、GPT-4.1-mini、DeepSeek v3.2、GLM-5、Gemini-3-flash、GigaChat 2 Max。智能体数量从4到256不等,总token消耗超过10亿。
解决方案质量由评判模型根据五个标准评估:准确性、完整性、连贯性、适用性和任务对齐度。Q指标范围从0.25到1.0。
比较了八种协调协议,包括四种受生物启发的协议。重点在于水平协调:一组智能体如何在没有垂直强化个体实例的情况下形成统一系统。
协调协议及其有效性
在相同模型、任务和智能体数量下测试了四种关键协议:
- 协调员协议:中央Agent-0分配角色;其他智能体并行执行。
- 顺序协议:智能体依次工作,每个分析前序智能体的具体结果并决定角色与参与。
- 广播协议:智能体宣布意图,然后根据他人宣布调整。
- 共享协议:完全独立,共享内存。
GPT-4.1-mini上的结果(N=8):
| 协议 | 质量 Q |
|------------|--------|
| 顺序协议 | 0.724 |
| 协调员协议 | 0.640 |
| 广播协议 | 0.510 |
| 共享协议 | 0.503 |
最佳与最差协议相差44%(Cohen’s d = 1.86)。在Claude上针对复杂任务,N=16时,顺序协议达到Q=0.875,协调员协议为0.767(+14%,p < 0.001)。
顺序协议胜出,因为它能访问实际完成的结果,而非意图或一般历史记录。
角色与专长动态
八个智能体在数百项任务中生成5006个独特角色,其中54%仅使用一次。64个智能体时——5010个角色(差异0.1%)。智能体根据每项任务的上下文调整功能,忽略固定配置文件。
在顺序协议中,角色动态变化,形成分布式网络。在协调员协议中,所有连接都通过Agent-0——一个单点故障。
自我移除与资源优化
顺序协议中的智能体自愿拒绝任务:“所有关键点已覆盖,我不会增加价值。”在60个非活跃智能体中,38个是自我移除。这使Q提升至0.875,而强制参与时为0.767。
Claude显示8.6%的有意识拒绝——一个最优水平。系统自身确定所需参与者数量,最小化token消耗。
规模扩大时:
| 智能体数 | Q | Token数 |
|----------|--------|---------|
| 8 | 0.954 | 3164 |
| 64 | 0.949 | 3537 |
| 256 | 0.967 | — |
N增加8倍时,成本上升11.8%,约45%的智能体自我移除。
模型比较与成本
在复杂任务上:
- Claude Sonnet 4.6:Q=0.875,成本高。
- DeepSeek v3.2:Q=0.829(约Claude的95%),成本约1/24。
- GLM-5:Q=0.800,成本约1/20。
DeepSeek在对抗性任务上优于Claude(+6.0%),任务对齐度为4.00/4.00。
趋势:强模型(Claude、DeepSeek)受益于自主性(+3.5–10.6%)。关键特性:
- 推理能力——链式思维能力。
- 自我反思——能力评估。
- 指令遵循——协议遵守。
- 结构化输出——稳定格式。
对任务复杂度的适应
Q从L1到L4下降37.7%,但层级自发加深(1.22 → 1.56)。智能体无需指令即可自行构建结构。
关键要点
- 顺序协议因访问前序实际结果,使Q提升14%。
- 智能体生成数千个独特角色,根据上下文适应,无固定配置文件。
- 自愿自我移除优化资源:N=256时,45%的智能体不参与。
- DeepSeek v3.2以1/24的成本达到Claude质量的95%。
- 自主性对具备高级推理和自我反思能力的强模型有效。
— Editorial Team
暂无评论。