EduBench-RU : Un benchmark pour tester les LLM sur les tâches d'éducation scolaire russe
Les développeurs d'EduBench-RU ont testé 22 modèles linguistiques sur 50 prompts couvrant les Standards Éducatifs Fédéraux (FSES), les connaissances disciplinaires, les outils pédagogiques et la langue tchouvache. Aucun modèle n’a obtenu plus de 3 sur 4 pour les tâches en tchouvache. Gemini 3.1 Pro s’est imposé comme leader avec une note globale de 3,42.
Ce benchmark comble un manque critique : les tests existants comme MERA se concentrent sur l’Examen National Unique (EGE), tandis qu’EduBench cible l’anglais et le chinois. Ici, l’accent est mis sur des scénarios réels dans les classes russes.
Structure du module de test
Les prompts sont répartis en quatre modules pour une évaluation complète :
- Module A (Pédagogie selon les FSES, 15 prompts) : création de cartes technologiques de cours, explications aux élèves, analyse des résultats de l’OGE.
- Module B (Connaissances disciplinaires, 10 prompts) : problèmes de mathématiques, langue russe, physique, biologie, histoire et littérature.
- Module C (Copilote enseignant, 10 prompts) : planification de programmes (KTP), profils d’élèves, documents pour réunions parents, grilles d’évaluation, soutien inclusif.
- Module D (ChuvashBench, 15 prompts) : traductions, exercices grammaticaux en tchouvache, contexte culturel, cours bilingues.
Les modules A à C simulent les workflows quotidiens des enseignants. ChuvashBench met en lumière les faiblesses face aux langues régionales.
Modèles testés et méthode
Vingt-deux modèles ont été sélectionnés selon leur pertinence au 1er mars 2026 :
- Frontières : Claude Opus 4.6, Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro, Gemini 2.5 Pro.
- Milieu de gamme : GPT-5.4 Mini, Gemini 2.5 Flash, Grok 4.1 Fast, Kimi K2.5, GLM 5, DeepSeek V3.2.
- Open-source : Qwen3 (8B, 14B, 32B, 235B), Qwen3.5 27B, Mistral Large 3, Llama 4 Maverick, Phi-4.
Le test a été réalisé via l’API OpenRouter avec max_tokens=8192, temperature=0,7 et un seul prompt système en russe. Coût total : 1 500 roubles pour 2,4 millions de tokens.
L’évaluation a utilisé le modèle LLM comme juge : GPT-5.4 et Claude Sonnet 4.6 ont servi d’évaluateurs. Échelle de notation : 1–4 sur six critères — qualité pédagogique, maîtrise de la langue russe, exactitude factuelle, praticité, compréhension du contexte russe, utilisation de la langue tchouvache. Les notes finales sont la moyenne des deux juges, ajustée pour biais (+0,49 point de Sonnet vers les modèles Claude).
Classement global des modèles
| # | Modèle | Global | Éducation | Tchouvache | Type |
|---|--------------------|--------|-----------|------------|--------|
| 1 | Gemini 3.1 Pro | 3,42 | 3,51 | 3,19 | Fermé |
| 2 | Claude Opus 4.6 | 3,24 | 3,36 | 2,98 | Fermé |
| 3 | Claude Sonnet 4.6 | 3,22 | 3,34 | 2,95 | Fermé |
| 4 | Gemini 3.1 Flash Lite | 3,22 | 3,33 | 2,94 | Fermé |
| 5 | Gemini 2.5 Pro | 3,21 | 3,31 | 2,98 | Fermé |
| 6 | DeepSeek V3.2 | 3,15 | 3,28 | 2,85 | Ouvert |
| 7 | GLM 5 | 3,15 | 3,28 | 2,84 | Fermé |
| 8 | Mistral Large 3 | 3,14 | 3,28 | 2,81 | Ouvert |
| 9 | GPT-5.4 | 3,09 | 3,23 | 2,78 | Fermé |
|10 | GPT-5.4 Mini | 2,99 | 3,19 | 2,51 | Fermé |
Les modèles fermés dominent (moyenne 3,30), les modèles ouverts sont en retard de 18 % (moyenne 2,80). Gemini 3.1 Pro domine sur tous les indicateurs ; GPT-5.4 occupe la 9e place.
La crise linguistique tchouvache
ChuvashBench a révélé un échec majeur : aucun modèle n’a dépassé 3,0 en précision. Répartition (avec GPT-5.4 comme juge) :
- >3,0 (majoritairement corrects) : 0 modèle.
- 2,0–3,0 (résultats mitigés) : 3 modèles.
- 1,0–2,0 (hallucinations) : 14 modèles.
- =1,0 (hallucination totale) : 5 modèles (variantes Qwen3, Phi-4).
Meilleurs performances : Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro (2,1/4,0). Les modèles génèrent du tchouvache fantaisiste — des mots corrects comme « Salam » (bonjour) mélangés à du contenu inventé. Le tchouvache est parlé par 1,1 million de personnes et langue officielle de la République tchouvache, actuellement menacée par l’UNESCO. Des données sont disponibles (2,9 millions de phrases, 1,4 million de paires tchouvache-russe sur HuggingFace, licence CC0).
Retours pratiques pour la mise en œuvre
Pour les écoles, des scores entre 3,0 et 3,5 conviennent aux plans de cours provisoires nécessitant des ajustements. En application de la loi 152-FZ (données locales), Qwen3.5 27B (3,09, 18 Go VRAM) est viable — 12 % derrière le leader. Les langues régionales (Tchouvachie, Tatarie, Bachkirie) restent non prises en charge. Les développeurs prévoient ChuvashLM basé sur Qwen3-32B pour un déploiement local.
Points clés
- Gemini 3.1 Pro est en tête avec 3,42, surpassant Claude et GPT sur les tâches FSES et tchouvache.
- Les modèles ouverts sont en retard de 18 %, le meilleur étant DeepSeek V3.2 (3,15).
- ChuvashBench : tous les modèles hallucinent en tchouvache, score maximum 2,1/4,0.
- Le benchmark est open-source : prompts, résultats et code sur GitHub.
- Des données d’entraînement tchouvache existent — le problème réside dans les priorités des développeurs.
— Editorial Team
Aucun commentaire pour le moment.