EduBench-RU: benchmark do testowania LLM w kontekście rosyjskiego nauczania szkolnego
Rozwój EduBench-RU obejmował testowanie 22 modeli językowych na 50 promptach, które obejmowały standardy FGOS, wiedzę przedmiotową, narzędzia pedagogiczne oraz język czuwański. Żaden model nie osiągnął wyniku powyżej 3 z 4 w zakresie języka czuwańskiego. Liderem okazał się Gemini 3.1 Pro z ogólnym wynikiem 3,42.
Benchmark uzupełnia lukę: istniejące testy, takie jak MERA, skupiają się głównie na egzaminie maturalnym (EGÉ), podczas gdy EduBench koncentruje się na języku angielskim i chińskim. Tutaj głównym celem są rzeczywiste scenariusze pracy w rosyjskich szkołach.
Struktura modułów testowych
Prompty zostały podzielone na cztery moduły do kompleksowej oceny:
- Moduł A (Pedagogika zgodna z FGOS, 15 promptów): tworzenie kart technologicznych lekcji, wyjaśnienia dla uczniów, analiza wyników OGE.
- Moduł B (Wiedza przedmiotowa, 10 promptów): zadania z matematyki, języka rosyjskiego, fizyki, biologii, historii, literatury.
- Moduł C (Nauczyciel-kopilot, 10 promptów): opracowywanie planów dydaktycznych (KTP), charakterystyki uczniów, materiały do spotkań z rodzicami, kryteria oceniania, wsparcie dla inkluzji.
- Moduł D (ChuvashBench, 15 promptów): tłumaczenia, ćwiczenia gramatyczne w języku czuwańskim, kontekst kulturowy, lekcje dwujęzyczne.
Moduły A–C symulują codzienną pracę nauczyciela. ChuvashBench wykrywa słabości w językach regionalnych.
Testowane modele i metodyka
Wybrano 22 modele aktualne na marzec 2026 roku:
- Frontier: Claude Opus 4.6, Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro, Gemini 2.5 Pro.
- Średnia klasa: GPT-5.4 Mini, Gemini 2.5 Flash, Grok 4.1 Fast, Kimi K2.5, GLM 5, DeepSeek V3.2.
- Otwarte źródła: Qwen3 (8B, 14B, 32B, 235B), Qwen3.5 27B, Mistral Large 3, Llama 4 Maverick, Phi-4.
Testowanie przeprowadzone przez API OpenRouter z parametrami max_tokens=8192, temperature=0,7, jednolity systemowy prompt po rosyjsku. Całkowity koszt: 1500 zł za 2,4 miliona tokenów.
Ocena metodą LLM-as-judge: GPT-5.4 i Claude Sonnet 4.6 jako sądy. Skala od 1 do 4 punktów według sześciu kryteriów: jakość pedagogiczna, język rosyjski, trafność faktów, praktyczność, znajomość kontekstu rosyjskiego, wykorzystanie języka czuwańskiego. Konsekwencja — średnia dwóch sądów, korygująca uprzedzenia (+0,49 punktu od Sonnet do modeli Claude).
Ogólny ranking modeli
| # | Model | Ogólny | Edukacja | Czuwański | Typ |
|---|---------------------|--------|----------|-----------|--------|
| 1 | Gemini 3.1 Pro | 3,42 | 3,51 | 3,19 | Zamknięty |
| 2 | Claude Opus 4.6 | 3,24 | 3,36 | 2,98 | Zamknięty |
| 3 | Claude Sonnet 4.6 | 3,22 | 3,34 | 2,95 | Zamknięty |
| 4 | Gemini 3.1 Flash Lite | 3,22 | 3,33 | 2,94 | Zamknięty |
| 5 | Gemini 2.5 Pro | 3,21 | 3,31 | 2,98 | Zamknięty |
| 6 | DeepSeek V3.2 | 3,15 | 3,28 | 2,85 | Otwarty |
| 7 | GLM 5 | 3,15 | 3,28 | 2,84 | Zamknięty |
| 8 | Mistral Large 3 | 3,14 | 3,28 | 2,81 | Otwarty |
| 9 | GPT-5.4 | 3,09 | 3,23 | 2,78 | Zamknięty |
|10 | GPT-5.4 Mini | 2,99 | 3,19 | 2,51 | Zamknięty |
Modele zamknięte dominują (średnio 3,30), modele otwarte odstają o 18% (2,80). Gemini 3.1 Pro prowadzi we wszystkich kategoriach, GPT-5.4 zajmuje 9. miejsce.
Katastrofa z językiem czuwańskim
ChuvashBench wykazał klęskę: żaden model nie osiągnął wyniku powyżej 3,0 w trafności. Rozkład (GPT-5.4 jako sąd):
- >3,0 (głównie poprawnie): 0 modeli.
- 2,0–3,0 (mieszanka): 3 modele.
- 1,0–2,0 (halucynacje): 14 modeli.
- =1,0 (pełna halucynacja): 5 modeli (warianty Qwen3, Phi-4).
Najlepsze: Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro (2,1/4,0). Modele generują fałszywy język czuwański: prawidłowe słowa, np. «Salam» (cześć), mieszają się z wymysłami. Język czuwański jest używany przez 1,1 mln osób, oficjalny w Republiki Czuwańskiej, zagrożony według UNESCO. Dane są dostępne (2,9 mln zdań, 1,4 mln par czuwańsko-rosyjskich na HuggingFace, CC0).
Wnioski praktyczne dla wdrożenia
Dla szkół jakość 3,0–3,5 nadaje się do roboczych wersji lekcji z późniejszą korektą. Zgodnie z ustawą 152-FZ (dane lokalne) — najlepszy wybór to Qwen3.5 27B (3,09, 18 GB VRAM), odstaje od lidera o 12%.
Języki regionalne (Czuwańska Republika, Tatarstan, Baszkiria) nie są obsługiwane. Deweloperzy planują stworzenie ChuvashLM opartego na Qwen3-32B do lokalnego wdrożenia.
Co ważne
- Gemini 3.1 Pro prowadzi z wynikiem 3,42, wyprzedzając Claude i GPT w zadaniach FGOS i języku czuwańskim.
- Modele otwarte odstają o 18%, najlepszy to DeepSeek V3.2 (3,15).
- ChuvashBench: wszystkie modele halucynują język czuwański, maksimum 2,1/4,0.
- Benchmark jest otwarty: prompty, wyniki, kod na GitHubie.
- Dostępne dane do dopracowania języka czuwańskiego — problem polega na priorytetach deweloperów modeli LLM.
— Editorial Team
Brak komentarzy.