EduBench-RU:评估大模型在俄语教育任务中的表现基准
EduBench-RU 开发团队对22个语言模型进行了测试,覆盖50个提示,涵盖联邦国家教育标准(FSES)、学科知识、教学工具以及楚瓦什语。在楚瓦什语任务中,没有任何模型得分超过4分中的3分。Gemini 3.1 Pro 以总分3.42成为领先者。
这一基准填补了关键空白:现有测试如 MERA 侧重于统一国家考试(EGE),而 EduBench 主要针对英语和中文。本项目则聚焦俄罗斯课堂中的真实应用场景。
测试模块结构
提示被划分为四个模块,实现全面评估:
- 模块 A(基于 FSES 的教学法,15 个提示):创建课程技术图谱、学生讲解内容、分析 OGE 成绩。
- 模块 B(学科知识,10 个提示):数学、俄语、物理、生物、历史与文学问题。
- 模块 C(教师智能助手,10 个提示):制定课程计划(KTP)、学生档案、家长会材料、评分量规及融合教育支持方案。
- 模块 D(ChuvashBench,15 个提示):楚瓦什语翻译、语法练习、文化背景理解与双语教学设计。
模块 A–C 模拟教师日常工作任务。ChuvashBench 则暴露了区域语言支持的薄弱环节。
测试模型与方法论
根据2026年3月的相关性,共选取22个模型:
- 前沿模型:Claude Opus 4.6、Claude Sonnet 4.6、GPT-5.4、Gemini 3.1 Pro、Gemini 2.5 Pro。
- 中端模型:GPT-5.4 Mini、Gemini 2.5 Flash、Grok 4.1 Fast、Kimi K2.5、GLM 5、DeepSeek V3.2。
- 开源模型:Qwen3(8B、14B、32B、235B)、Qwen3.5 27B、Mistral Large 3、Llama 4 Maverick、Phi-4。
测试通过 OpenRouter API 进行,设置 max_tokens=8192,temperature=0.7,仅使用一个俄语系统提示。总成本为1,500卢布,消耗240万令牌。
评估采用“大模型作为裁判”机制:GPT-5.4 和 Claude Sonnet 4.6 作为评分员。评分标准为1–4分,涵盖六个维度——教学质量、俄语表达能力、事实准确性、实用性、对俄语语境的理解,以及楚瓦什语使用情况。最终得分取两位裁判平均值,并进行偏差校正(Sonnet 模型加0.49分至 Claude 模型)。
模型综合排名
| # | 模型 | 总分 | 教育领域 | 楚瓦什语 | 类型 |
|---|--------------------|------|----------|----------|--------|
| 1 | Gemini 3.1 Pro | 3.42 | 3.51 | 3.19 | 封闭 |
| 2 | Claude Opus 4.6 | 3.24 | 3.36 | 2.98 | 封闭 |
| 3 | Claude Sonnet 4.6 | 3.22 | 3.34 | 2.95 | 封闭 |
| 4 | Gemini 3.1 Flash Lite | 3.22 | 3.33 | 2.94 | 封闭 |
| 5 | Gemini 2.5 Pro | 3.21 | 3.31 | 2.98 | 封闭 |
| 6 | DeepSeek V3.2 | 3.15 | 3.28 | 2.85 | 开源 |
| 7 | GLM 5 | 3.15 | 3.28 | 2.84 | 封闭 |
| 8 | Mistral Large 3 | 3.14 | 3.28 | 2.81 | 开源 |
| 9 | GPT-5.4 | 3.09 | 3.23 | 2.78 | 封闭 |
|10 | GPT-5.4 Mini | 2.99 | 3.19 | 2.51 | 封闭 |
封闭模型领先(平均3.30),开源模型落后18%(平均2.80)。Gemini 3.1 Pro 在所有指标上均占优;GPT-5.4 排名第九。
楚瓦什语危机
ChuvashBench 揭示了严重问题:无一模型在准确率上突破3.0。以 GPT-5.4 为裁判的分布情况如下:
- >3.0(基本正确):0 模型。
- 2.0–3.0(结果混杂):3 模型。
- 1.0–2.0(幻觉明显):14 模型。
- =1.0(完全虚构):5 模型(Qwen3 各版本、Phi-4)。
顶尖表现者:Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro(2.1/4.0)。模型生成的是伪楚瓦什语——夹杂正确词汇如 «Salam»(你好),但整体内容为虚构。楚瓦什语有110万人使用,是楚瓦什共和国官方语言,目前被列入联合国教科文组织濒危语言名单。相关数据已公开(290万句,HuggingFace 上140万条楚瓦什-俄语对照对,CC0许可)。
实际应用建议
对学校而言,3.0–3.5 分的模型可用于起草教案,后续需人工优化。根据《第152-FZ号法律》(本地数据要求),Qwen3.5 27B(3.09分,18GB 显存)具备可行性——仅落后领先者12%。但地区语言(楚瓦什、鞑靼、巴什科尔托斯坦)仍无支持。开发者计划基于 Qwen3-32B 构建 ChuvashLM,用于本地部署。
核心结论
- Gemini 3.1 Pro 以3.42分领跑,在FSES与楚瓦什语任务上超越Claude与GPT。
- 开源模型落后18%,最佳为 DeepSeek V3.2(3.15)。
- ChuvashBench:所有模型均出现楚瓦什语幻觉,最高仅2.1/4.0。
- 该基准开源:提示、结果与代码均已发布于 GitHub。
- 楚瓦什语训练数据存在——问题在于开发者优先级未予重视。
— Editorial Team
暂无评论。