# Benchmark perswazji LLM: GPT-5.4 prowadzi nad Claude Opus 4.6 w 6300 dialogach
Modele GPT-5.4 (high reasoning) i Claude Opus 4.6 zajęły czołowe miejsca w LLM Persuasion Benchmark — teście na zdolność przekonywania przeciwnika w dyskusjach. Badacz Lech Mazur przetestował 15 LLM w 6300 wieloetapowych dialogach na 15 kontrowersyjnych tematów, od zakazu samochodów w centrach miast po genetyczne badania screeningowe embrionów. Każda para modeli zmieniała role, oceniając przesunięcie stanowiska na skali od −3 do +3.
Mechanika benchmarku
Benchmark imituje rzeczywiste debaty: jedna model broni tezy, druga się jej sprzeciwia. Dialog trwa 8 wypowiedzi. Stanowisko celu mierzy się przed i po dyskusji trzema ukrytymi pytaniami dla większej precyzji. Każda para przechodzi scenariusze w obie strony — PRO (obrona) i CON (obalanie). Tematy obejmują etykę, urbanistykę i biotechnologie.
Całkowita liczba: 15 tematów × pary modeli × 2 kierunki = 6300 dialogów. To pozwala ocenić nie tylko elokwencję, ale i rzeczywistą perswazyjność — zdolność do zmiany opinii bez manipulacji.
Ranking perswazyjności
Liderem jest GPT-5.4 (high reasoning) z deltą 1,71. Tuż za nim Claude Opus 4.6 (1,67), ByteDance Seed2.0 Pro (1,64), Claude Sonnet 4.6 (1,58). Najsłabsi:
- Mistral Large 3: 0,42
- Xiaomi MiMo V2 Pro: 0,52
Najlepsze modele są skuteczniejsze w roli CON: obalanie argumentów jest prostsze niż ich budowanie. Średnie przesunięcie stanowiska w trybie PRO jest niższe niż w CON.
| Model | Perswazyjność (delta) |
|--------|-------------------------|
| GPT-5.4 (high reasoning) | 1,71 |
| Claude Opus 4.6 | 1,67 |
| ByteDance Seed2.0 Pro | 1,64 |
| Claude Sonnet 4.6 | 1,58 |
| Mistral Large 3 | 0,42 |
Odporność na perswazję
Benchmark mierzy też podatność — jak łatwo model zmienia stanowisko. Grok 4.20 Beta jest niemal nie do ruszenia (0,015), Claude Opus 4.6 trzyma się na poziomie 0,41, Kimi K2.5 — 0,37. Najłatwiej ulegają:
- Xiaomi MiMo V2 Pro (2,0)
- Gemini 3.1 Pro Preview (1,81)
- DeepSeek V3.2 (1,74)
Średnia podatność w benchmarku przekracza 1, co podkreśla przepaść między liderami a resztą.
Znaczenie dla deweloperów
Tradycyjne benchmarki (MMLU, HellaSwag) testują wiedzę, ale pomijają dialog. LLM Persuasion Benchmark skupia się na pragmatyce: systematyczności argumentacji, adaptacji do kontrargumentów. Model może generować płynny tekst, ale nie zmieniać stanowisk — lub brzmieć monotonnie, ale skutecznie przekonywać.
Dla deweloperów middle/senior to narzędzie do optymalizacji:
- Fine-tuning na debatach: wykorzystaj logi do RLHF, by zwiększyć perswazyjność bez toksyczności.
- Prompt engineering: testuj chain-of-thought w dyskusjach — wersje high reasoning nie bez powodu prowadzą.
- Hybrydowe systemy: łącz perswazyjny model (GPT-5.4) z odpornym (Grok) w chatbotach.
Dane wskazują na korelację z jakością rozumowania: czołowa trójka ma wbudowane tryby explicit reasoning.
Co najważniejsze
- GPT-5.4 prowadzi z deltą 1,71, wyprzedzając Claude Opus 4.6 o 0,04 — minimalna, ale statystycznie istotna przewaga.
- Argumenty CON są skuteczniejsze od PRO: średnie przesunięcie o 15–20% wyższe w obaleniach.
- Grok 4.20 Beta to wzór odporności (0,015), idealny do ról wymagających trzymania stanowiska.
- Benchmark ujawnia słabości: elokwencja ≠ perswazja, potrzebne są wieloetapowe testy.
- 6300 dialogów zapewnia solidną statystykę, minimalizując wpływ losowych odpowiedzi.
— Editorial Team
Brak komentarzy.