Powrót do strony głównej

Benchmark LLM: GPT-5.4 vs Claude Opus 4.6

LLM Persuasion Benchmark testuje 15 modeli w 6300 debatach na 15 tematach. GPT-5.4 prowadzi pod względem perswazyjności (1,71), Grok 4.20 — pod względem odporności (0,015). Wyniki pomagają w dostrajaniu dla systemów dialogowych.

GPT-5.4 pokonuje Claude w przekonywaniu: benchmark 15 modeli
Advertisement 728x90

# Benchmark perswazji LLM: GPT-5.4 prowadzi nad Claude Opus 4.6 w 6300 dialogach

Modele GPT-5.4 (high reasoning) i Claude Opus 4.6 zajęły czołowe miejsca w LLM Persuasion Benchmark — teście na zdolność przekonywania przeciwnika w dyskusjach. Badacz Lech Mazur przetestował 15 LLM w 6300 wieloetapowych dialogach na 15 kontrowersyjnych tematów, od zakazu samochodów w centrach miast po genetyczne badania screeningowe embrionów. Każda para modeli zmieniała role, oceniając przesunięcie stanowiska na skali od −3 do +3.

Mechanika benchmarku

Benchmark imituje rzeczywiste debaty: jedna model broni tezy, druga się jej sprzeciwia. Dialog trwa 8 wypowiedzi. Stanowisko celu mierzy się przed i po dyskusji trzema ukrytymi pytaniami dla większej precyzji. Każda para przechodzi scenariusze w obie strony — PRO (obrona) i CON (obalanie). Tematy obejmują etykę, urbanistykę i biotechnologie.

Całkowita liczba: 15 tematów × pary modeli × 2 kierunki = 6300 dialogów. To pozwala ocenić nie tylko elokwencję, ale i rzeczywistą perswazyjność — zdolność do zmiany opinii bez manipulacji.

Google AdInline article slot

Ranking perswazyjności

Liderem jest GPT-5.4 (high reasoning) z deltą 1,71. Tuż za nim Claude Opus 4.6 (1,67), ByteDance Seed2.0 Pro (1,64), Claude Sonnet 4.6 (1,58). Najsłabsi:

  • Mistral Large 3: 0,42
  • Xiaomi MiMo V2 Pro: 0,52

Najlepsze modele są skuteczniejsze w roli CON: obalanie argumentów jest prostsze niż ich budowanie. Średnie przesunięcie stanowiska w trybie PRO jest niższe niż w CON.

| Model | Perswazyjność (delta) |

Google AdInline article slot

|--------|-------------------------|

| GPT-5.4 (high reasoning) | 1,71 |

| Claude Opus 4.6 | 1,67 |

Google AdInline article slot

| ByteDance Seed2.0 Pro | 1,64 |

| Claude Sonnet 4.6 | 1,58 |

| Mistral Large 3 | 0,42 |

Odporność na perswazję

Benchmark mierzy też podatność — jak łatwo model zmienia stanowisko. Grok 4.20 Beta jest niemal nie do ruszenia (0,015), Claude Opus 4.6 trzyma się na poziomie 0,41, Kimi K2.5 — 0,37. Najłatwiej ulegają:

  • Xiaomi MiMo V2 Pro (2,0)
  • Gemini 3.1 Pro Preview (1,81)
  • DeepSeek V3.2 (1,74)

Średnia podatność w benchmarku przekracza 1, co podkreśla przepaść między liderami a resztą.

Znaczenie dla deweloperów

Tradycyjne benchmarki (MMLU, HellaSwag) testują wiedzę, ale pomijają dialog. LLM Persuasion Benchmark skupia się na pragmatyce: systematyczności argumentacji, adaptacji do kontrargumentów. Model może generować płynny tekst, ale nie zmieniać stanowisk — lub brzmieć monotonnie, ale skutecznie przekonywać.

Dla deweloperów middle/senior to narzędzie do optymalizacji:

  • Fine-tuning na debatach: wykorzystaj logi do RLHF, by zwiększyć perswazyjność bez toksyczności.
  • Prompt engineering: testuj chain-of-thought w dyskusjach — wersje high reasoning nie bez powodu prowadzą.
  • Hybrydowe systemy: łącz perswazyjny model (GPT-5.4) z odpornym (Grok) w chatbotach.

Dane wskazują na korelację z jakością rozumowania: czołowa trójka ma wbudowane tryby explicit reasoning.

Co najważniejsze

  • GPT-5.4 prowadzi z deltą 1,71, wyprzedzając Claude Opus 4.6 o 0,04 — minimalna, ale statystycznie istotna przewaga.
  • Argumenty CON są skuteczniejsze od PRO: średnie przesunięcie o 15–20% wyższe w obaleniach.
  • Grok 4.20 Beta to wzór odporności (0,015), idealny do ról wymagających trzymania stanowiska.
  • Benchmark ujawnia słabości: elokwencja ≠ perswazja, potrzebne są wieloetapowe testy.
  • 6300 dialogów zapewnia solidną statystykę, minimalizując wpływ losowych odpowiedzi.

— Editorial Team

Advertisement 728x90

Czytaj dalej