返回首页

EduBench-RU:俄罗斯学校22个LLM的测试

EduBench-RU — 用于评估俄罗斯学校任务中 LLM 的基准测试:FGOS、科目、教学工具、Chuvash。测试了22个模型,领先者 — Gemini 3.1 Pro。所有模型均在 ChuvashBench 上失败。

22个神经网络测试:谁能应对 FGOS 和 Chuvash?
Advertisement 728x90

EduBench-RU:评估大模型在俄语教育任务中的表现基准

EduBench-RU 开发团队对22个语言模型进行了测试,覆盖50个提示,涵盖联邦国家教育标准(FSES)、学科知识、教学工具以及楚瓦什语。在楚瓦什语任务中,没有任何模型得分超过4分中的3分。Gemini 3.1 Pro 以总分3.42成为领先者。

这一基准填补了关键空白:现有测试如 MERA 侧重于统一国家考试(EGE),而 EduBench 主要针对英语和中文。本项目则聚焦俄罗斯课堂中的真实应用场景。

测试模块结构

提示被划分为四个模块,实现全面评估:

Google AdInline article slot
  • 模块 A(基于 FSES 的教学法,15 个提示):创建课程技术图谱、学生讲解内容、分析 OGE 成绩。
  • 模块 B(学科知识,10 个提示):数学、俄语、物理、生物、历史与文学问题。
  • 模块 C(教师智能助手,10 个提示):制定课程计划(KTP)、学生档案、家长会材料、评分量规及融合教育支持方案。
  • 模块 D(ChuvashBench,15 个提示):楚瓦什语翻译、语法练习、文化背景理解与双语教学设计。

模块 A–C 模拟教师日常工作任务。ChuvashBench 则暴露了区域语言支持的薄弱环节。

测试模型与方法论

根据2026年3月的相关性,共选取22个模型:

  • 前沿模型:Claude Opus 4.6、Claude Sonnet 4.6、GPT-5.4、Gemini 3.1 Pro、Gemini 2.5 Pro。
  • 中端模型:GPT-5.4 Mini、Gemini 2.5 Flash、Grok 4.1 Fast、Kimi K2.5、GLM 5、DeepSeek V3.2。
  • 开源模型:Qwen3(8B、14B、32B、235B)、Qwen3.5 27B、Mistral Large 3、Llama 4 Maverick、Phi-4。

测试通过 OpenRouter API 进行,设置 max_tokens=8192,temperature=0.7,仅使用一个俄语系统提示。总成本为1,500卢布,消耗240万令牌。

Google AdInline article slot

评估采用“大模型作为裁判”机制:GPT-5.4 和 Claude Sonnet 4.6 作为评分员。评分标准为1–4分,涵盖六个维度——教学质量、俄语表达能力、事实准确性、实用性、对俄语语境的理解,以及楚瓦什语使用情况。最终得分取两位裁判平均值,并进行偏差校正(Sonnet 模型加0.49分至 Claude 模型)。

模型综合排名

| # | 模型 | 总分 | 教育领域 | 楚瓦什语 | 类型 |

|---|--------------------|------|----------|----------|--------|

Google AdInline article slot

| 1 | Gemini 3.1 Pro | 3.42 | 3.51 | 3.19 | 封闭 |

| 2 | Claude Opus 4.6 | 3.24 | 3.36 | 2.98 | 封闭 |

| 3 | Claude Sonnet 4.6 | 3.22 | 3.34 | 2.95 | 封闭 |

| 4 | Gemini 3.1 Flash Lite | 3.22 | 3.33 | 2.94 | 封闭 |

| 5 | Gemini 2.5 Pro | 3.21 | 3.31 | 2.98 | 封闭 |

| 6 | DeepSeek V3.2 | 3.15 | 3.28 | 2.85 | 开源 |

| 7 | GLM 5 | 3.15 | 3.28 | 2.84 | 封闭 |

| 8 | Mistral Large 3 | 3.14 | 3.28 | 2.81 | 开源 |

| 9 | GPT-5.4 | 3.09 | 3.23 | 2.78 | 封闭 |

|10 | GPT-5.4 Mini | 2.99 | 3.19 | 2.51 | 封闭 |

封闭模型领先(平均3.30),开源模型落后18%(平均2.80)。Gemini 3.1 Pro 在所有指标上均占优;GPT-5.4 排名第九。

楚瓦什语危机

ChuvashBench 揭示了严重问题:无一模型在准确率上突破3.0。以 GPT-5.4 为裁判的分布情况如下:

  • >3.0(基本正确):0 模型。
  • 2.0–3.0(结果混杂):3 模型。
  • 1.0–2.0(幻觉明显):14 模型。
  • =1.0(完全虚构):5 模型(Qwen3 各版本、Phi-4)。

顶尖表现者:Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro(2.1/4.0)。模型生成的是伪楚瓦什语——夹杂正确词汇如 «Salam»(你好),但整体内容为虚构。楚瓦什语有110万人使用,是楚瓦什共和国官方语言,目前被列入联合国教科文组织濒危语言名单。相关数据已公开(290万句,HuggingFace 上140万条楚瓦什-俄语对照对,CC0许可)。

实际应用建议

对学校而言,3.0–3.5 分的模型可用于起草教案,后续需人工优化。根据《第152-FZ号法律》(本地数据要求),Qwen3.5 27B(3.09分,18GB 显存)具备可行性——仅落后领先者12%。但地区语言(楚瓦什、鞑靼、巴什科尔托斯坦)仍无支持。开发者计划基于 Qwen3-32B 构建 ChuvashLM,用于本地部署。

核心结论

  • Gemini 3.1 Pro 以3.42分领跑,在FSES与楚瓦什语任务上超越Claude与GPT。
  • 开源模型落后18%,最佳为 DeepSeek V3.2(3.15)。
  • ChuvashBench:所有模型均出现楚瓦什语幻觉,最高仅2.1/4.0。
  • 该基准开源:提示、结果与代码均已发布于 GitHub。
  • 楚瓦什语训练数据存在——问题在于开发者优先级未予重视。

— Editorial Team

Advertisement 728x90

继续阅读