EduBench-RU: benchmark pro testování LLM v rámci ruského školství
Vývojáři EduBench-RU otestovali 22 jazykových modelů na 50 promptů, které pokrývají RVP, předmětové znalosti, pedagogické nástroje a čuvaštinu. Žádná z modelů nepřekročila 3 body z 4 v čuvaštině. Lídrem se stal Gemini 3.1 Pro s celkovým hodnocením 3,42.
Benchmark naplňuje mezeru: stávající testy jako MERA se zaměřují na maturitu (EGE), EduBench je zaměřený na angličtinu a čínštinu. Zde je důraz na reálné scénáře ruských škol.
Struktura testovacích modulů
Prompty jsou rozděleny do čtyř modulů pro komplexní ověření:
- Modul A (Pedagogika podle RVP, 15 promptů): tvorba technologických plánů výuky, vysvětlení pro žáky, analýza výsledků OGE.
- Modul B (Předmětové znalosti, 10 promptů): úlohy z matematiky, ruštiny, fyziky, biologie, historie, literatury.
- Modul C (Učitel-kopilot, 10 promptů): vytváření kalendářních tematických plánů (KTP), charakteristiky žáků, materiály na rodičovské schůzky, rubriky hodnocení, podpora inkluzivní výuky.
- Modul D (ChuvashBench, 15 promptů): překlady, cvičení z gramatiky čuvaštiny, kulturní kontext, dvoujazyčné vyučovací hodiny.
Moduly A–C imitují každodenní práci učitele. ChuvashBench odhaluje slabiny v regionálních jazycích.
Testované modely a metodologie
Vybráno 22 modelů aktuálních k březnu 2026:
- Frontier: Claude Opus 4.6, Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro, Gemini 2.5 Pro.
- Mid-tier: GPT-5.4 Mini, Gemini 2.5 Flash, Grok 4.1 Fast, Kimi K2.5, GLM 5, DeepSeek V3.2.
- Open-source: Qwen3 (8B, 14B, 32B, 235B), Qwen3.5 27B, Mistral Large 3, Llama 4 Maverick, Phi-4.
Testování prostřednictvím OpenRouter API s parametry max_tokens=8192, temperature=0,7, jednotný systémový prompt v ruštině. Celková cena – 1500 rublů za 2,4 milionu tokenů.
Hodnocení metodou LLM-as-judge: GPT-5.4 a Claude Sonnet 4.6 jako soudci. Skóre 1–4 podle šesti kritérií: pedagogická kvalita, ruština, faktická přesnost, praktičnost, znalost ruského kontextu, použití čuvaštiny. Konzensus = průměr dvou soudců, korekce předsudků (+0,49 bodu od Sonnet k Claude-modelům).
Celkové hodnocení modelů
| # | Model | Celkem | Vzdělání | Čuvašština | Typ |
|---|---------------------|--------|----------|------------|--------|
| 1 | Gemini 3.1 Pro | 3,42 | 3,51 | 3,19 | Closed |
| 2 | Claude Opus 4.6 | 3,24 | 3,36 | 2,98 | Closed |
| 3 | Claude Sonnet 4.6 | 3,22 | 3,34 | 2,95 | Closed |
| 4 | Gemini 3.1 Flash Lite | 3,22 | 3,33 | 2,94 | Closed |
| 5 | Gemini 2.5 Pro | 3,21 | 3,31 | 2,98 | Closed |
| 6 | DeepSeek V3.2 | 3,15 | 3,28 | 2,85 | Open |
| 7 | GLM 5 | 3,15 | 3,28 | 2,84 | Closed |
| 8 | Mistral Large 3 | 3,14 | 3,28 | 2,81 | Open |
| 9 | GPT-5.4 | 3,09 | 3,23 | 2,78 | Closed |
|10 | GPT-5.4 Mini | 2,99 | 3,19 | 2,51 | Closed |
Zavřené modely vedou (průměr 3,30), otevřené ztrácí 18 % (2,80). Gemini 3.1 Pro dominuje ve všech metrikách, GPT-5.4 je na 9. místě.
Katastrofa s čuvaštinou
ChuvashBench ukázal selhání: žádný model nepřekročil 3,0 v přesnosti. Rozložení (GPT-5.4 jako soudce):
- >3,0 (převážně správně): 0 modelů.
- 2,0–3,0 (směs): 3 modely.
- 1,0–2,0 (halucinace): 14 modelů.
- =1,0 (úplná halucinace): 5 modelů (Qwen3-výběry, Phi-4).
Nejlepší – Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro (2,1/4,0). Modely generují pseudocuvaštinu: správná slova jako „Salam“ (ahoj) se míchají s vymyšlenými. Čuvašština je jazyk 1,1 milionu lidí, oficiální v Čuvašské republice, ohrožený podle UNESCO. Data jsou dostupná (2,9 milionu vět, 1,4 milionu čuvaško-ruských párových dvojic na HuggingFace, CC0).
Praktické závěry pro nasazení
Pro školy kvalita 3,0–3,5 je vhodná pro koncepty hodin s následnou úpravou. Pod zákonem 152-FZ (lokální data) – Qwen3.5 27B (3,09, 18 GB VRAM), odstup od lídra 12 %.
Regionální jazyky (Čuvašsko, Tatarstán, Baškortostán) nejsou podporovány. Vývojáři plánují ChuvashLM na základě Qwen3-32B pro lokální nasazení.
Co je důležité
- Gemini 3.1 Pro je lídr s 3,42 body, překonává Claude a GPT při úlohách RVP a čuvaštiny.
- Otevřené modely ztrácejí 18 %, nejlepší je DeepSeek V3.2 (3,15).
- ChuvashBench: všechny modely halucinují čuvaštinu, maximálně 2,1/4,0.
- Benchmark je otevřený: prompty, výsledky, kód na GitHubu.
- Data pro finální trénink čuvaštiny jsou k dispozici, problém je v prioritách vývojářů LLM.
— Editorial Team
Zatím žádné komentáře.