## LLM-Überzeugungsbenchmark: GPT-5.4 führt vor Claude Opus 4.6 in 6300 Dialogen
Die Modelle GPT-5.4 (high reasoning) und Claude Opus 4.6 haben den LLM Persuasion Benchmark angeführt – einen Test der Fähigkeit, Gegner in Debatten zu überzeugen. Der Forscher Lech Mazur hat 15 LLMs in 6300 mehrstufigen Dialogen zu 15 kontroversen Themen getestet, von Autoverboten in Stadtzentren bis zur genetischen Untersuchung von Embryonen. Jedes Modellpaar hat die Rollen getauscht und die Positionsverschiebung auf einer Skala von −3 bis +3 bewertet.
Funktionsweise des Benchmarks
Der Benchmark simuliert echte Debatten: Ein Modell verteidigt eine These, das andere widersetzt sich. Der Dialog umfasst 8 Runden. Die Position des Ziels wird vor und nach der Debatte mit drei versteckten Fragen gemessen, um Genauigkeit zu gewährleisten. Jedes Paar durchläuft die Szenarien in beide Richtungen – PRO (Verteidigung) und CON (Widerlegung). Die Themen umfassen Ethik, Stadtplanung und Biotechnologie.
Gesamtumfang: 15 Themen × Modellpaare × 2 Richtungen = 6300 Dialoge. Das zeigt nicht nur Eloquenz, sondern echte Überzeugungskraft – die Fähigkeit, Meinungen ohne Manipulation zu ändern.
Ranking der Überzeugungskraft
Führend – GPT-5.4 (high reasoning) mit Delta 1.71. Gefolgt von Claude Opus 4.6 (1.67), ByteDance Seed2.0 Pro (1.64), Claude Sonnet 4.6 (1.58). Nachzügler:
- Mistral Large 3: 0.42
- Xiaomi MiMo V2 Pro: 0.52
Die Top-Modelle sind im CON-Rolle effektiver: Argumente zerpflücken ist einfacher als sie aufzubauen. Die durchschnittliche Positionsverschiebung im PRO-Modus ist niedriger als im CON-Modus.
| Model | Überzeugungskraft (Delta) |
|--------|----------------------------|
| GPT-5.4 (high reasoning) | 1.71 |
| Claude Opus 4.6 | 1.67 |
| ByteDance Seed2.0 Pro | 1.64 |
| Claude Sonnet 4.6 | 1.58 |
| Mistral Large 3 | 0.42 |
Widerstandsfähigkeit gegen Überzeugung
Der Benchmark misst auch die Anfälligkeit – wie leicht ein Modell seine Position ändert. Grok 4.20 Beta ist nahezu unempfänglich (0.015), Claude Opus 4.6 hält bei 0.41 stand, Kimi K2.5 – 0.37. Am leichtesten zu beeinflussen:
- Xiaomi MiMo V2 Pro (2.0)
- Gemini 3.1 Pro Preview (1.81)
- DeepSeek V3.2 (1.74)
Durchschnittliche Anfälligkeit im Benchmark >1, was die Lücke zwischen Führern und dem Rest verdeutlicht.
Implikationen für Entwickler
Traditionelle Benchmarks (MMLU, HellaSwag) testen Wissen, ignorieren aber Dialoge. Der LLM Persuasion Benchmark konzentriert sich auf Pragmatik: systematische Argumentation, Anpassung an Gegenargumente. Ein Modell kann fließenden Text erzeugen, scheitert aber an Positionswechseln – oder klingt monoton, überzeugt aber.
Für Mittel- und Senior-Entwickler ist es ein Feinabstimmungstool:
- Fine-tuning bei Debatten: Protokolle für RLHF nutzen, um Überzeugungskraft ohne Toxizität zu steigern.
- Prompt-Engineering: Chain-of-Thought in Debatten testen – high reasoning-Versionen führen nicht umsonst.
- Hybridsysteme: Überzeugende Modelle (GPT-5.4) mit widerstandsfähigen (Grok) für Chatbots kombinieren.
Die Daten zeigen Korrelation mit Reasoning-Qualität: Top-3 haben explizite Reasoning-Modi.
Wichtige Erkenntnisse
- GPT-5.4 führt mit 1.71 Delta, schlägt Claude Opus 4.6 um 0.04 – ein minimaler, aber statistisch signifikanter Vorsprung.
- CON-Argumente schneiden besser ab als PRO: Durchschnittliche Verschiebung 15–20 % höher bei Widerlegungen.
- Grok 4.20 Beta ist der Maßstab für Widerstandsfähigkeit (0.015), ideal für Rollen mit fester Position.
- Der Benchmark deckt Schwächen auf: Eloquenz ≠ Überzeugungskraft, erfordert mehrstufige Tests.
- 6300 Dialoge liefern robuste Statistiken und minimieren Rauschen durch Zufallsantworten.
— Editorial Team
Noch keine Kommentare.