Powrót do strony głównej

EduBench-RU: test 22 LLM dla szkół Rosji

EduBench-RU — benchmark do oceny LLM na zadaniach rosyjskich szkół: federalny państwowy standard edukacyjny, przedmioty, narzędzia pedagogiczne, czuwaski. Przetestowano 22 modele, lider — Gemini 3.1 Pro. Wszystkie zawiodły w ChuvashBench.

Test 22 sieci neuronowych: kto poradzi sobie z federalnym państwowym standardem edukacyjnym i czuwaskim?
Advertisement 728x90

EduBench-RU: benchmark do testowania LLM w kontekście rosyjskiego nauczania szkolnego

Rozwój EduBench-RU obejmował testowanie 22 modeli językowych na 50 promptach, które obejmowały standardy FGOS, wiedzę przedmiotową, narzędzia pedagogiczne oraz język czuwański. Żaden model nie osiągnął wyniku powyżej 3 z 4 w zakresie języka czuwańskiego. Liderem okazał się Gemini 3.1 Pro z ogólnym wynikiem 3,42.

Benchmark uzupełnia lukę: istniejące testy, takie jak MERA, skupiają się głównie na egzaminie maturalnym (EGÉ), podczas gdy EduBench koncentruje się na języku angielskim i chińskim. Tutaj głównym celem są rzeczywiste scenariusze pracy w rosyjskich szkołach.

Struktura modułów testowych

Prompty zostały podzielone na cztery moduły do kompleksowej oceny:

Google AdInline article slot
  • Moduł A (Pedagogika zgodna z FGOS, 15 promptów): tworzenie kart technologicznych lekcji, wyjaśnienia dla uczniów, analiza wyników OGE.
  • Moduł B (Wiedza przedmiotowa, 10 promptów): zadania z matematyki, języka rosyjskiego, fizyki, biologii, historii, literatury.
  • Moduł C (Nauczyciel-kopilot, 10 promptów): opracowywanie planów dydaktycznych (KTP), charakterystyki uczniów, materiały do spotkań z rodzicami, kryteria oceniania, wsparcie dla inkluzji.
  • Moduł D (ChuvashBench, 15 promptów): tłumaczenia, ćwiczenia gramatyczne w języku czuwańskim, kontekst kulturowy, lekcje dwujęzyczne.

Moduły A–C symulują codzienną pracę nauczyciela. ChuvashBench wykrywa słabości w językach regionalnych.

Testowane modele i metodyka

Wybrano 22 modele aktualne na marzec 2026 roku:

  • Frontier: Claude Opus 4.6, Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro, Gemini 2.5 Pro.
  • Średnia klasa: GPT-5.4 Mini, Gemini 2.5 Flash, Grok 4.1 Fast, Kimi K2.5, GLM 5, DeepSeek V3.2.
  • Otwarte źródła: Qwen3 (8B, 14B, 32B, 235B), Qwen3.5 27B, Mistral Large 3, Llama 4 Maverick, Phi-4.

Testowanie przeprowadzone przez API OpenRouter z parametrami max_tokens=8192, temperature=0,7, jednolity systemowy prompt po rosyjsku. Całkowity koszt: 1500 zł za 2,4 miliona tokenów.

Google AdInline article slot

Ocena metodą LLM-as-judge: GPT-5.4 i Claude Sonnet 4.6 jako sądy. Skala od 1 do 4 punktów według sześciu kryteriów: jakość pedagogiczna, język rosyjski, trafność faktów, praktyczność, znajomość kontekstu rosyjskiego, wykorzystanie języka czuwańskiego. Konsekwencja — średnia dwóch sądów, korygująca uprzedzenia (+0,49 punktu od Sonnet do modeli Claude).

Ogólny ranking modeli

| # | Model | Ogólny | Edukacja | Czuwański | Typ |

|---|---------------------|--------|----------|-----------|--------|

Google AdInline article slot

| 1 | Gemini 3.1 Pro | 3,42 | 3,51 | 3,19 | Zamknięty |

| 2 | Claude Opus 4.6 | 3,24 | 3,36 | 2,98 | Zamknięty |

| 3 | Claude Sonnet 4.6 | 3,22 | 3,34 | 2,95 | Zamknięty |

| 4 | Gemini 3.1 Flash Lite | 3,22 | 3,33 | 2,94 | Zamknięty |

| 5 | Gemini 2.5 Pro | 3,21 | 3,31 | 2,98 | Zamknięty |

| 6 | DeepSeek V3.2 | 3,15 | 3,28 | 2,85 | Otwarty |

| 7 | GLM 5 | 3,15 | 3,28 | 2,84 | Zamknięty |

| 8 | Mistral Large 3 | 3,14 | 3,28 | 2,81 | Otwarty |

| 9 | GPT-5.4 | 3,09 | 3,23 | 2,78 | Zamknięty |

|10 | GPT-5.4 Mini | 2,99 | 3,19 | 2,51 | Zamknięty |

Modele zamknięte dominują (średnio 3,30), modele otwarte odstają o 18% (2,80). Gemini 3.1 Pro prowadzi we wszystkich kategoriach, GPT-5.4 zajmuje 9. miejsce.

Katastrofa z językiem czuwańskim

ChuvashBench wykazał klęskę: żaden model nie osiągnął wyniku powyżej 3,0 w trafności. Rozkład (GPT-5.4 jako sąd):

  • >3,0 (głównie poprawnie): 0 modeli.
  • 2,0–3,0 (mieszanka): 3 modele.
  • 1,0–2,0 (halucynacje): 14 modeli.
  • =1,0 (pełna halucynacja): 5 modeli (warianty Qwen3, Phi-4).

Najlepsze: Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro (2,1/4,0). Modele generują fałszywy język czuwański: prawidłowe słowa, np. «Salam» (cześć), mieszają się z wymysłami. Język czuwański jest używany przez 1,1 mln osób, oficjalny w Republiki Czuwańskiej, zagrożony według UNESCO. Dane są dostępne (2,9 mln zdań, 1,4 mln par czuwańsko-rosyjskich na HuggingFace, CC0).

Wnioski praktyczne dla wdrożenia

Dla szkół jakość 3,0–3,5 nadaje się do roboczych wersji lekcji z późniejszą korektą. Zgodnie z ustawą 152-FZ (dane lokalne) — najlepszy wybór to Qwen3.5 27B (3,09, 18 GB VRAM), odstaje od lidera o 12%.

Języki regionalne (Czuwańska Republika, Tatarstan, Baszkiria) nie są obsługiwane. Deweloperzy planują stworzenie ChuvashLM opartego na Qwen3-32B do lokalnego wdrożenia.

Co ważne

  • Gemini 3.1 Pro prowadzi z wynikiem 3,42, wyprzedzając Claude i GPT w zadaniach FGOS i języku czuwańskim.
  • Modele otwarte odstają o 18%, najlepszy to DeepSeek V3.2 (3,15).
  • ChuvashBench: wszystkie modele halucynują język czuwański, maksimum 2,1/4,0.
  • Benchmark jest otwarty: prompty, wyniki, kod na GitHubie.
  • Dostępne dane do dopracowania języka czuwańskiego — problem polega na priorytetach deweloperów modeli LLM.

— Editorial Team

Advertisement 728x90

Czytaj dalej