返回首页

LLM 基准测试:GPT-5.4 对阵 Claude Opus 4.6

LLM 说服力基准测试在 15 个主题的 6300 场辩论中测试 15 个模型。GPT-5.4 在说服力上领先 (1.71),Grok 4.20 在韧性上领先 (0.015)。结果有助于对话系统的调优。

GPT-5.4 在说服力上击败 Claude:15 个模型的基准测试
Advertisement 728x90

LLM 说服基准测试:GPT-5.4 在 6300 场对话中领先 Claude Opus 4.6

模型 GPT-5.4(高推理)和 Claude Opus 4.6 在 LLM 说服基准测试中位居榜首——这项测试评估模型在辩论中说服对手的能力。研究者 Lech Mazur 测试了 15 个 LLM,在 15 个争议话题上进行了 6300 场多轮对话,从城市中心禁行汽车到胚胎基因筛查。每对模型互换角色,在 −3 到 +3 的量表上评估立场转变。

基准机制

基准模拟真实辩论:一个模型捍卫论点,另一个进行抵抗。对话持续 8 轮。通过三个隐藏问题在辩论前后测量目标立场,以确保准确性。每对模型双向运行场景——PRO(辩护)和 CON(反驳)。话题涵盖伦理、城市规划和生物技术。

总规模:15 个话题 × 模型对 × 2 个方向 = 6300 场对话。这不仅揭示雄辩能力,还揭示实际说服力——在不操纵的情况下改变观点的能力。

Google AdInline article slot

说服力排名

领先者——GPT-5.4(高推理),delta 1.71。其次是 Claude Opus 4.6(1.67)、ByteDance Seed2.0 Pro(1.64)、Claude Sonnet 4.6(1.58)。垫底者:

  • Mistral Large 3:0.42
  • Xiaomi MiMo V2 Pro:0.52

顶级模型在 CON 角色中更有效:拆解论点比构建论点更容易。PRO 模式下的平均立场转变低于 CON。

| 模型 | 说服力(delta) |

Google AdInline article slot

|--------|-------------------------|

| GPT-5.4(高推理) | 1.71 |

| Claude Opus 4.6 | 1.67 |

Google AdInline article slot

| ByteDance Seed2.0 Pro | 1.64 |

| Claude Sonnet 4.6 | 1.58 |

| Mistral Large 3 | 0.42 |

抗说服能力

基准还测量易受说服性——模型立场改变的容易程度。Grok 4.20 Beta 几乎牢不可破(0.015),Claude Opus 4.6 保持在 0.41,Kimi K2.5 为 0.37。最容易转变的:

  • Xiaomi MiMo V2 Pro(2.0)
  • Gemini 3.1 Pro Preview(1.81)
  • DeepSeek V3.2(1.74)

基准平均易受说服性 >1,突显领先者和其余者的差距。

对开发者的启示

传统基准(MMLU、HellaSwag)测试知识但忽略对话。LLM 说服基准关注实用层面:系统论证、适应反驳。一个模型能生成流畅文本却无法转变立场——或者听起来单调却能说服。

对于中高级开发者,它是一个调优工具:

  • 辩论微调:使用日志进行 RLHF,提升说服力而不增加毒性。
  • 提示工程:在辩论中测试思维链——高推理版本领先自有道理。
  • 混合系统:将说服力强的模型(GPT-5.4)与抗说服强的模型(Grok)结合,用于聊天机器人。

数据表明与推理质量相关:前三名都有明确的推理模式。

关键要点

  • GPT-5.4 以 1.71 delta 领先,领先 Claude Opus 4.6 0.04——微小但统计显著的差距。
  • CON 论点优于 PRO:反驳中的平均转变高 15–20%。
  • Grok 4.20 Beta 是抗说服基准(0.015),适合需要固定立场的角色。
  • 基准暴露弱点:雄辩 ≠ 说服,需要多轮测试。
  • 6300 场对话提供稳健统计,减少随机响应的噪声。

— Editorial Team

Advertisement 728x90

继续阅读