Zurück zur Startseite

EduBench-RU: Test von 22 LLMs für Schulen in Russland

EduBench-RU — Benchmark zur Bewertung von LLMs bei Aufgaben russischer Schulen: FGOS, Fächer, pädagogische Werkzeuge, Chuvash. 22 Modelle getestet, Spitzenreiter — Gemini 3.1 Pro. Alle gescheitert an ChuvashBench.

Test von 22 neuronalen Netzwerken: Wer schafft FGOS und Chuvash?
Advertisement 728x90

EduBench-RU: Benchmark für LLMs im russischen Schulunterricht

Entwickler von EduBench-RU testeten 22 Sprachmodelle an 50 Prompt-Aufgaben, die sich auf die staatlichen Bildungsstandards (FSES), Fachwissen, pädagogische Werkzeuge und die Tschuwasch-Sprache beziehen. Kein Modell erreichte mehr als 3 von 4 Punkten bei den Tschuwasch-Aufgaben. Gemini 3.1 Pro setzte sich mit einer Gesamtpunktzahl von 3,42 als Spitzenreiter durch.

Dieser Benchmark schließt eine kritische Lücke: Bestehende Tests wie MERA konzentrieren sich auf die zentrale Abschlussprüfung (EGE), während EduBench bisher vor allem Englisch und Chinesisch abdeckt. Hier liegt der Fokus auf realen Szenarien im russischen Klassenzimmer.

Aufbau der Testmodule

Die Prompts sind in vier Module unterteilt, um eine umfassende Bewertung zu ermöglichen:

Google AdInline article slot
  • Modul A (Pädagogik nach FSES, 15 Prompts): Erstellung von Unterrichtstechnologie-Plänen, Schülererklärungen und Analyse von OGE-Ergebnissen.
  • Modul B (Fachwissen, 10 Prompts): Aufgaben aus Mathematik, Russisch, Physik, Biologie, Geschichte und Literatur.
  • Modul C (Lehrer-Copilot, 10 Prompts): Entwicklung von Lehrplänen (KTP), Schülerprofilen, Materialien für Elterngespräche, Beurteilungsraster und Inklusionsunterstützung.
  • Modul D (ChuvashBench, 15 Prompts): Übersetzungen, Grammatikübungen in Tschuwasch, kultureller Kontext und zweisprachige Unterrichtsstunden.

Module A–C simulieren den täglichen Arbeitsablauf von Lehrkräften. ChuvashBench offenbart Schwächen bei regionalen Sprachen.

Getestete Modelle und Methodik

Zweiundzwanzig Modelle wurden aufgrund ihrer Relevanz per März 2026 ausgewählt:

  • Frontier: Claude Opus 4.6, Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro, Gemini 2.5 Pro.
  • Mid-tier: GPT-5.4 Mini, Gemini 2.5 Flash, Grok 4.1 Fast, Kimi K2.5, GLM 5, DeepSeek V3.2.
  • Open Source: Qwen3 (8B, 14B, 32B, 235B), Qwen3.5 27B, Mistral Large 3, Llama 4 Maverick, Phi-4.

Die Tests wurden über die OpenRouter-API durchgeführt mit max_tokens=8192, temperature=0,7 und einem einzigen systemseitigen Prompt auf Russisch. Gesamtkosten: 1.500 Rubel für 2,4 Millionen Tokens.

Google AdInline article slot

Die Bewertung erfolgte mittels LLM-as-judge: GPT-5.4 und Claude Sonnet 4.6 dienten als Beurteiler. Skala: 1–4 über sechs Kriterien – pädagogische Qualität, Beherrschung der russischen Sprache, faktische Richtigkeit, Praktikabilität, Verständnis des russischen Kontexts und Einsatz der Tschuwasch-Sprache. Endpunktzahlen sind der Durchschnitt zweier Urteile, korrigiert um Bias (+0,49 Punkte von Sonnet zu Claude-Modellen).

Gesamtrangliste der Modelle

| # | Modell | Gesamt | Bildung | Tschuwasch | Typ |

|---|--------------------|--------|---------|------------|--------|

Google AdInline article slot

| 1 | Gemini 3.1 Pro | 3,42 | 3,51 | 3,19 | Closed |

| 2 | Claude Opus 4.6 | 3,24 | 3,36 | 2,98 | Closed |

| 3 | Claude Sonnet 4.6 | 3,22 | 3,34 | 2,95 | Closed |

| 4 | Gemini 3.1 Flash Lite | 3,22 | 3,33 | 2,94 | Closed |

| 5 | Gemini 2.5 Pro | 3,21 | 3,31 | 2,98 | Closed |

| 6 | DeepSeek V3.2 | 3,15 | 3,28 | 2,85 | Open |

| 7 | GLM 5 | 3,15 | 3,28 | 2,84 | Closed |

| 8 | Mistral Large 3 | 3,14 | 3,28 | 2,81 | Open |

| 9 | GPT-5.4 | 3,09 | 3,23 | 2,78 | Closed |

|10 | GPT-5.4 Mini | 2,99 | 3,19 | 2,51 | Closed |

Closed-Modelle führen (Durchschnitt 3,30), Open-Modelle liegen 18 % zurück (Durchschnitt 2,80). Gemini 3.1 Pro dominiert in allen Metriken; GPT-5.4 rangiert auf Platz 9.

Die Tschuwasch-Sprachkrise

ChuvashBench zeigte einen gravierenden Misserfolg: Kein Modell erreichte mehr als 3,0 Punkte Genauigkeit. Verteilung (mit GPT-5.4 als Beurteiler):

  • >3,0 (meist korrekt): 0 Modelle.
  • 2,0–3,0 (gemischte Ergebnisse): 3 Modelle.
  • 1,0–2,0 (Halluzinationen): 14 Modelle.
  • =1,0 (vollständige Halluzination): 5 Modelle (Qwen3-Varianten, Phi-4).

Beste Leistung: Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro (2,1/4,0). Modelle generieren Pseudo-Tschuwasch – korrekte Wörter wie »Salam« (Hallo) werden mit erfundenem Inhalt vermischt. Tschuwasch wird von 1,1 Millionen Menschen gesprochen und ist offizielle Sprache in der Tschuwaschischen Republik, aktuell unter UNESCO-Gefährdung. Daten sind verfügbar (2,9 Millionen Sätze, 1,4 Millionen Tschuwasch-Russisch-Paare auf HuggingFace, CC0-Lizenz).

Praktische Erkenntnisse für die Umsetzung

Für Schulen sind Punktzahlen zwischen 3,0 und 3,5 für Entwürfe von Unterrichtsplänen geeignet, die noch weiter verfeinert werden müssen. Unter dem 152-FZ-Gesetz (lokale Daten) ist Qwen3.5 27B (3,09, 18 GB VRAM) praktikabel – nur 12 % hinter dem Leader. Regionale Sprachen (Tschuwaschien, Tatarstan, Baschkirien) bleiben unberücksichtigt. Entwickler planen ChuvashLM basierend auf Qwen3-32B für lokale Implementierung.

Wichtige Erkenntnisse

  • Gemini 3.1 Pro führt mit 3,42, übertrifft Claude und GPT bei FSES und Tschuwasch-Aufgaben.
  • Open-Modelle hinken um 18 % hinterher, bestes ist DeepSeek V3.2 (3,15).
  • ChuvashBench: Alle Modelle halluzinieren Tschuwasch, Höchstwert 2,1/4,0.
  • Der Benchmark ist Open Source: Prompts, Ergebnisse und Code auf GitHub.
  • Tschuwasch-Daten existieren – das Problem liegt in den Prioritäten der Entwickler.

— Editorial Team

Advertisement 728x90

Weiterlesen