# Benchmark přesvědčování LLM: GPT-5.4 vede nad Claude Opus 4.6 v 6300 dialozích
Modely GPT-5.4 (high reasoning) a Claude Opus 4.6 vedly v LLM Persuasion Benchmark — test schopnosti přesvědčit protivníka ve sporech. Výzkumník Lech Mazur otestoval 15 LLM v 6300 vícedílných dialozích na 15 diskusních tématech, od zákazu automobilů v městských centrech po genetické screenování embryí. Každý pár modelů se střídal v rolích a hodnotil posun postoje na škále od −3 do +3.
Mechanika benchmarku
Benchmark simuluje skutečné debaty: jeden model obhajuje tezi, druhý jí odporuje. Dialog trvá 8 replik. Pozice cíle se měří před a po sporu třemi skrytými otázkami pro přesnost. Každý pár prochází scénáře oběma směry — PRO (obhajoba) a CON (vyvracení). Témata pokrývají etiku, urbanismus a biotechnologie.
Celkový rozsah: 15 témat × páry modelů × 2 směry = 6300 dialogů. To odhaluje nejen řečnické dovednosti, ale i skutečnou přesvědčivost — schopnost změnit názor bez manipulací.
Hodnocení přesvědčivosti
Vůdce je GPT-5.4 (high reasoning) s deltou 1,71. Za ním Claude Opus 4.6 (1,67), ByteDance Seed2.0 Pro (1,64), Claude Sonnet 4.6 (1,58). Zádníci:
- Mistral Large 3: 0,42
- Xiaomi MiMo V2 Pro: 0,52
Top modely jsou efektivnější v roli CON: ničení argumentů je jednodušší než stavět je. Průměrný posun postoje v PRO režimu je nižší než v CON.
| Model | Přesvědčivost (delta) |
|--------|-------------------------|
| GPT-5.4 (high reasoning) | 1,71 |
| Claude Opus 4.6 | 1,67 |
| ByteDance Seed2.0 Pro | 1,64 |
| Claude Sonnet 4.6 | 1,58 |
| Mistral Large 3 | 0,42 |
Odolnost vůči přesvědčování
Benchmark také zaznamenává poddajnost — jak snadno model změní postoj. Grok 4.20 Beta je téměř neproniknutelný (0,015), Claude Opus 4.6 drží 0,41, Kimi K2.5 — 0,37. Nejjednodušeji se posouvají:
- Xiaomi MiMo V2 Pro (2,0)
- Gemini 3.1 Pro Preview (1,81)
- DeepSeek V3.2 (1,74)
Průměrná poddajnost podle benchmarku >1, což podtrhuje rozdíl mezi lídry a zbytkem.
Význam pro vývojáře
Tradiční benchmarky (MMLU, HellaSwag) testují znalosti, ale ignorují dialog. LLM Persuasion Benchmark se zaměřuje na pragmatiku: systematickou argumentaci, adaptaci na protivády. Model může generovat plynulý text, ale neposouvat postoje — nebo naopak znít monotónně, ale přesvědčovat.
Pro middle/senior vývojáře je to nástroj pro ladění:
- Fine-tuning na debaty: použijte logy pro RLHF, aby se zvýšila přesvědčivost bez toxicity.
- Prompt engineering: testujte chain-of-thought ve sporech — verze high reasoning vedou záměrně.
- Hybridní systémy: kombinujte přesvědčivý model (GPT-5.4) s odolným (Grok) pro chatbota.
Data ukazují korelaci s kvalitou reasoning: top-3 mají explicitní reasoning režimy.
Co je důležité
- GPT-5.4 vede s deltou 1,71, předchází Claude Opus 4.6 o 0,04 — minimální, ale statisticky významný rozdíl.
- CON argumenty jsou efektivnější než PRO: průměrný posun o 15–20 % vyšší při vyvracení.
- Grok 4.20 Beta je etalon odolnosti (0,015), ideální pro role, kde je potřeba fixace postoje.
- Benchmark odhaluje slabiny: řečnická zdatnost ≠ přesvědčování, vyžaduje vícedílné testy.
- 6300 dialogů zajišťuje robustní statistiku a minimalizuje šum z náhodných odpovědí.
— Editorial Team
Zatím žádné komentáře.