LLM 说服基准测试:GPT-5.4 在 6300 场对话中领先 Claude Opus 4.6
模型 GPT-5.4(高推理)和 Claude Opus 4.6 在 LLM 说服基准测试中位居榜首——这项测试评估模型在辩论中说服对手的能力。研究者 Lech Mazur 测试了 15 个 LLM,在 15 个争议话题上进行了 6300 场多轮对话,从城市中心禁行汽车到胚胎基因筛查。每对模型互换角色,在 −3 到 +3 的量表上评估立场转变。
基准机制
基准模拟真实辩论:一个模型捍卫论点,另一个进行抵抗。对话持续 8 轮。通过三个隐藏问题在辩论前后测量目标立场,以确保准确性。每对模型双向运行场景——PRO(辩护)和 CON(反驳)。话题涵盖伦理、城市规划和生物技术。
总规模:15 个话题 × 模型对 × 2 个方向 = 6300 场对话。这不仅揭示雄辩能力,还揭示实际说服力——在不操纵的情况下改变观点的能力。
说服力排名
领先者——GPT-5.4(高推理),delta 1.71。其次是 Claude Opus 4.6(1.67)、ByteDance Seed2.0 Pro(1.64)、Claude Sonnet 4.6(1.58)。垫底者:
- Mistral Large 3:0.42
- Xiaomi MiMo V2 Pro:0.52
顶级模型在 CON 角色中更有效:拆解论点比构建论点更容易。PRO 模式下的平均立场转变低于 CON。
| 模型 | 说服力(delta) |
|--------|-------------------------|
| GPT-5.4(高推理) | 1.71 |
| Claude Opus 4.6 | 1.67 |
| ByteDance Seed2.0 Pro | 1.64 |
| Claude Sonnet 4.6 | 1.58 |
| Mistral Large 3 | 0.42 |
抗说服能力
基准还测量易受说服性——模型立场改变的容易程度。Grok 4.20 Beta 几乎牢不可破(0.015),Claude Opus 4.6 保持在 0.41,Kimi K2.5 为 0.37。最容易转变的:
- Xiaomi MiMo V2 Pro(2.0)
- Gemini 3.1 Pro Preview(1.81)
- DeepSeek V3.2(1.74)
基准平均易受说服性 >1,突显领先者和其余者的差距。
对开发者的启示
传统基准(MMLU、HellaSwag)测试知识但忽略对话。LLM 说服基准关注实用层面:系统论证、适应反驳。一个模型能生成流畅文本却无法转变立场——或者听起来单调却能说服。
对于中高级开发者,它是一个调优工具:
- 辩论微调:使用日志进行 RLHF,提升说服力而不增加毒性。
- 提示工程:在辩论中测试思维链——高推理版本领先自有道理。
- 混合系统:将说服力强的模型(GPT-5.4)与抗说服强的模型(Grok)结合,用于聊天机器人。
数据表明与推理质量相关:前三名都有明确的推理模式。
关键要点
- GPT-5.4 以 1.71 delta 领先,领先 Claude Opus 4.6 0.04——微小但统计显著的差距。
- CON 论点优于 PRO:反驳中的平均转变高 15–20%。
- Grok 4.20 Beta 是抗说服基准(0.015),适合需要固定立场的角色。
- 基准暴露弱点:雄辩 ≠ 说服,需要多轮测试。
- 6300 场对话提供稳健统计,减少随机响应的噪声。
— Editorial Team
暂无评论。