Zpět na domů

EduBench-RU: test 22 LLM pro školy Ruska

EduBench-RU — benchmark pro hodnocení LLM na úkolech ruských škol: ruský federální státní vzdělávací standard, předměty, pedagogické nástroje, čuvaština. Otestováno 22 modelů, lídr — Gemini 3.1 Pro. Všechny selhaly ChuvashBench.

Test 22 neuronových sítí: kdo zvládne ruský federální státní vzdělávací standard a čuvaštinu?
Advertisement 728x90

EduBench-RU: benchmark pro testování LLM v rámci ruského školství

Vývojáři EduBench-RU otestovali 22 jazykových modelů na 50 promptů, které pokrývají RVP, předmětové znalosti, pedagogické nástroje a čuvaštinu. Žádná z modelů nepřekročila 3 body z 4 v čuvaštině. Lídrem se stal Gemini 3.1 Pro s celkovým hodnocením 3,42.

Benchmark naplňuje mezeru: stávající testy jako MERA se zaměřují na maturitu (EGE), EduBench je zaměřený na angličtinu a čínštinu. Zde je důraz na reálné scénáře ruských škol.

Struktura testovacích modulů

Prompty jsou rozděleny do čtyř modulů pro komplexní ověření:

Google AdInline article slot
  • Modul A (Pedagogika podle RVP, 15 promptů): tvorba technologických plánů výuky, vysvětlení pro žáky, analýza výsledků OGE.
  • Modul B (Předmětové znalosti, 10 promptů): úlohy z matematiky, ruštiny, fyziky, biologie, historie, literatury.
  • Modul C (Učitel-kopilot, 10 promptů): vytváření kalendářních tematických plánů (KTP), charakteristiky žáků, materiály na rodičovské schůzky, rubriky hodnocení, podpora inkluzivní výuky.
  • Modul D (ChuvashBench, 15 promptů): překlady, cvičení z gramatiky čuvaštiny, kulturní kontext, dvoujazyčné vyučovací hodiny.

Moduly A–C imitují každodenní práci učitele. ChuvashBench odhaluje slabiny v regionálních jazycích.

Testované modely a metodologie

Vybráno 22 modelů aktuálních k březnu 2026:

  • Frontier: Claude Opus 4.6, Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro, Gemini 2.5 Pro.
  • Mid-tier: GPT-5.4 Mini, Gemini 2.5 Flash, Grok 4.1 Fast, Kimi K2.5, GLM 5, DeepSeek V3.2.
  • Open-source: Qwen3 (8B, 14B, 32B, 235B), Qwen3.5 27B, Mistral Large 3, Llama 4 Maverick, Phi-4.

Testování prostřednictvím OpenRouter API s parametry max_tokens=8192, temperature=0,7, jednotný systémový prompt v ruštině. Celková cena – 1500 rublů za 2,4 milionu tokenů.

Google AdInline article slot

Hodnocení metodou LLM-as-judge: GPT-5.4 a Claude Sonnet 4.6 jako soudci. Skóre 1–4 podle šesti kritérií: pedagogická kvalita, ruština, faktická přesnost, praktičnost, znalost ruského kontextu, použití čuvaštiny. Konzensus = průměr dvou soudců, korekce předsudků (+0,49 bodu od Sonnet k Claude-modelům).

Celkové hodnocení modelů

| # | Model | Celkem | Vzdělání | Čuvašština | Typ |

|---|---------------------|--------|----------|------------|--------|

Google AdInline article slot

| 1 | Gemini 3.1 Pro | 3,42 | 3,51 | 3,19 | Closed |

| 2 | Claude Opus 4.6 | 3,24 | 3,36 | 2,98 | Closed |

| 3 | Claude Sonnet 4.6 | 3,22 | 3,34 | 2,95 | Closed |

| 4 | Gemini 3.1 Flash Lite | 3,22 | 3,33 | 2,94 | Closed |

| 5 | Gemini 2.5 Pro | 3,21 | 3,31 | 2,98 | Closed |

| 6 | DeepSeek V3.2 | 3,15 | 3,28 | 2,85 | Open |

| 7 | GLM 5 | 3,15 | 3,28 | 2,84 | Closed |

| 8 | Mistral Large 3 | 3,14 | 3,28 | 2,81 | Open |

| 9 | GPT-5.4 | 3,09 | 3,23 | 2,78 | Closed |

|10 | GPT-5.4 Mini | 2,99 | 3,19 | 2,51 | Closed |

Zavřené modely vedou (průměr 3,30), otevřené ztrácí 18 % (2,80). Gemini 3.1 Pro dominuje ve všech metrikách, GPT-5.4 je na 9. místě.

Katastrofa s čuvaštinou

ChuvashBench ukázal selhání: žádný model nepřekročil 3,0 v přesnosti. Rozložení (GPT-5.4 jako soudce):

  • >3,0 (převážně správně): 0 modelů.
  • 2,0–3,0 (směs): 3 modely.
  • 1,0–2,0 (halucinace): 14 modelů.
  • =1,0 (úplná halucinace): 5 modelů (Qwen3-výběry, Phi-4).

Nejlepší – Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro (2,1/4,0). Modely generují pseudocuvaštinu: správná slova jako „Salam“ (ahoj) se míchají s vymyšlenými. Čuvašština je jazyk 1,1 milionu lidí, oficiální v Čuvašské republice, ohrožený podle UNESCO. Data jsou dostupná (2,9 milionu vět, 1,4 milionu čuvaško-ruských párových dvojic na HuggingFace, CC0).

Praktické závěry pro nasazení

Pro školy kvalita 3,0–3,5 je vhodná pro koncepty hodin s následnou úpravou. Pod zákonem 152-FZ (lokální data) – Qwen3.5 27B (3,09, 18 GB VRAM), odstup od lídra 12 %.

Regionální jazyky (Čuvašsko, Tatarstán, Baškortostán) nejsou podporovány. Vývojáři plánují ChuvashLM na základě Qwen3-32B pro lokální nasazení.

Co je důležité

  • Gemini 3.1 Pro je lídr s 3,42 body, překonává Claude a GPT při úlohách RVP a čuvaštiny.
  • Otevřené modely ztrácejí 18 %, nejlepší je DeepSeek V3.2 (3,15).
  • ChuvashBench: všechny modely halucinují čuvaštinu, maximálně 2,1/4,0.
  • Benchmark je otevřený: prompty, výsledky, kód na GitHubu.
  • Data pro finální trénink čuvaštiny jsou k dispozici, problém je v prioritách vývojářů LLM.

— Editorial Team

Advertisement 728x90

Číst dál