Zurück zur Startseite

LLM-Benchmark: GPT-5.4 vs. Claude Opus 4.6

LLM-Persuasion-Benchmark testet 15 Modelle in 6300 Debatten zu 15 Themen. GPT-5.4 führt in Überzeugungskraft (1.71), Grok 4.20 — in Widerstandsfähigkeit (0.015). Ergebnisse helfen beim Tuning für Dialogsysteme.

GPT-5.4 schlägt Claude in Überzeugungskraft: Benchmark von 15 Modellen
Advertisement 728x90

## LLM-Überzeugungsbenchmark: GPT-5.4 führt vor Claude Opus 4.6 in 6300 Dialogen

Die Modelle GPT-5.4 (high reasoning) und Claude Opus 4.6 haben den LLM Persuasion Benchmark angeführt – einen Test der Fähigkeit, Gegner in Debatten zu überzeugen. Der Forscher Lech Mazur hat 15 LLMs in 6300 mehrstufigen Dialogen zu 15 kontroversen Themen getestet, von Autoverboten in Stadtzentren bis zur genetischen Untersuchung von Embryonen. Jedes Modellpaar hat die Rollen getauscht und die Positionsverschiebung auf einer Skala von −3 bis +3 bewertet.

Funktionsweise des Benchmarks

Der Benchmark simuliert echte Debatten: Ein Modell verteidigt eine These, das andere widersetzt sich. Der Dialog umfasst 8 Runden. Die Position des Ziels wird vor und nach der Debatte mit drei versteckten Fragen gemessen, um Genauigkeit zu gewährleisten. Jedes Paar durchläuft die Szenarien in beide Richtungen – PRO (Verteidigung) und CON (Widerlegung). Die Themen umfassen Ethik, Stadtplanung und Biotechnologie.

Gesamtumfang: 15 Themen × Modellpaare × 2 Richtungen = 6300 Dialoge. Das zeigt nicht nur Eloquenz, sondern echte Überzeugungskraft – die Fähigkeit, Meinungen ohne Manipulation zu ändern.

Google AdInline article slot

Ranking der Überzeugungskraft

Führend – GPT-5.4 (high reasoning) mit Delta 1.71. Gefolgt von Claude Opus 4.6 (1.67), ByteDance Seed2.0 Pro (1.64), Claude Sonnet 4.6 (1.58). Nachzügler:

  • Mistral Large 3: 0.42
  • Xiaomi MiMo V2 Pro: 0.52

Die Top-Modelle sind im CON-Rolle effektiver: Argumente zerpflücken ist einfacher als sie aufzubauen. Die durchschnittliche Positionsverschiebung im PRO-Modus ist niedriger als im CON-Modus.

| Model | Überzeugungskraft (Delta) |

Google AdInline article slot

|--------|----------------------------|

| GPT-5.4 (high reasoning) | 1.71 |

| Claude Opus 4.6 | 1.67 |

Google AdInline article slot

| ByteDance Seed2.0 Pro | 1.64 |

| Claude Sonnet 4.6 | 1.58 |

| Mistral Large 3 | 0.42 |

Widerstandsfähigkeit gegen Überzeugung

Der Benchmark misst auch die Anfälligkeit – wie leicht ein Modell seine Position ändert. Grok 4.20 Beta ist nahezu unempfänglich (0.015), Claude Opus 4.6 hält bei 0.41 stand, Kimi K2.5 – 0.37. Am leichtesten zu beeinflussen:

  • Xiaomi MiMo V2 Pro (2.0)
  • Gemini 3.1 Pro Preview (1.81)
  • DeepSeek V3.2 (1.74)

Durchschnittliche Anfälligkeit im Benchmark >1, was die Lücke zwischen Führern und dem Rest verdeutlicht.

Implikationen für Entwickler

Traditionelle Benchmarks (MMLU, HellaSwag) testen Wissen, ignorieren aber Dialoge. Der LLM Persuasion Benchmark konzentriert sich auf Pragmatik: systematische Argumentation, Anpassung an Gegenargumente. Ein Modell kann fließenden Text erzeugen, scheitert aber an Positionswechseln – oder klingt monoton, überzeugt aber.

Für Mittel- und Senior-Entwickler ist es ein Feinabstimmungstool:

  • Fine-tuning bei Debatten: Protokolle für RLHF nutzen, um Überzeugungskraft ohne Toxizität zu steigern.
  • Prompt-Engineering: Chain-of-Thought in Debatten testen – high reasoning-Versionen führen nicht umsonst.
  • Hybridsysteme: Überzeugende Modelle (GPT-5.4) mit widerstandsfähigen (Grok) für Chatbots kombinieren.

Die Daten zeigen Korrelation mit Reasoning-Qualität: Top-3 haben explizite Reasoning-Modi.

Wichtige Erkenntnisse

  • GPT-5.4 führt mit 1.71 Delta, schlägt Claude Opus 4.6 um 0.04 – ein minimaler, aber statistisch signifikanter Vorsprung.
  • CON-Argumente schneiden besser ab als PRO: Durchschnittliche Verschiebung 15–20 % höher bei Widerlegungen.
  • Grok 4.20 Beta ist der Maßstab für Widerstandsfähigkeit (0.015), ideal für Rollen mit fester Position.
  • Der Benchmark deckt Schwächen auf: Eloquenz ≠ Überzeugungskraft, erfordert mehrstufige Tests.
  • 6300 Dialoge liefern robuste Statistiken und minimieren Rauschen durch Zufallsantworten.

— Editorial Team

Advertisement 728x90

Weiterlesen