EduBench-RU: Benchmark para probar modelos LLM en tareas de educación escolar rusa
Los desarrolladores de EduBench-RU evaluaron 22 modelos de lenguaje en 50 preguntas que abarcan los Estándares Federales de Educación (FSES), conocimiento disciplinario, herramientas pedagógicas y el idioma chuvash. Ningún modelo obtuvo más de 3 sobre 4 en tareas chuvash. Gemini 3.1 Pro se destacó como líder con una puntuación global de 3,42.
Este benchmark cubre una brecha crítica: las pruebas existentes como MERA se enfocan en el Examen Estatal Unificado (EGE), mientras que EduBench prioriza inglés y chino. Aquí, el enfoque está en escenarios del mundo real dentro de aulas rusas.
Estructura del módulo de prueba
Las preguntas se dividen en cuatro módulos para una evaluación completa:
- Módulo A (Pedagogía según FSES, 15 preguntas): Creación de mapas tecnológicos de lecciones, explicaciones para estudiantes y análisis de resultados del OGE.
- Módulo B (Conocimiento disciplinario, 10 preguntas): Problemas de matemáticas, lengua rusa, física, biología, historia y literatura.
- Módulo C (Copiloto del profesor, 10 preguntas): Elaboración de planes curriculares (KTP), perfiles de estudiantes, materiales para reuniones con padres, rúbricas de calificación y apoyo inclusivo.
- Módulo D (ChuvashBench, 15 preguntas): Traducciones, ejercicios gramaticales en chuvash, contexto cultural y clases bilingües.
Los módulos A–C simulan flujos diarios de trabajo docente. ChuvashBench revela debilidades en idiomas regionales.
Modelos evaluados y metodología
Se seleccionaron 22 modelos por relevancia a marzo de 2026:
- Líderes: Claude Opus 4.6, Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro, Gemini 2.5 Pro.
- Medio rango: GPT-5.4 Mini, Gemini 2.5 Flash, Grok 4.1 Fast, Kimi K2.5, GLM 5, DeepSeek V3.2.
- De código abierto: Qwen3 (8B, 14B, 32B, 235B), Qwen3.5 27B, Mistral Large 3, Llama 4 Maverick, Phi-4.
La prueba se realizó mediante la API OpenRouter con max_tokens=8192, temperatura=0,7 y un único mensaje de sistema en ruso. Costo total: 1.500 rublos por 2,4 millones de tokens.
La evaluación usó LLM como juez: GPT-5.4 y Claude Sonnet 4.6 actuaron como evaluadores. Escala de puntuación: 1–4 en seis criterios — calidad pedagógica, dominio del ruso, precisión factual, utilidad práctica, comprensión del contexto ruso y uso del idioma chuvash. Las puntuaciones finales son el promedio de dos jueces, ajustado por sesgo (+0,49 puntos de Sonnet a modelos Claude).
Clasificación general de modelos
| # | Modelo | Global | Educación | Chuvash | Tipo |
|---|--------------------|--------|-----------|---------|--------|
| 1 | Gemini 3.1 Pro | 3,42 | 3,51 | 3,19 | Cerrado |
| 2 | Claude Opus 4.6 | 3,24 | 3,36 | 2,98 | Cerrado |
| 3 | Claude Sonnet 4.6 | 3,22 | 3,34 | 2,95 | Cerrado |
| 4 | Gemini 3.1 Flash Lite | 3,22 | 3,33 | 2,94 | Cerrado |
| 5 | Gemini 2.5 Pro | 3,21 | 3,31 | 2,98 | Cerrado |
| 6 | DeepSeek V3.2 | 3,15 | 3,28 | 2,85 | Abierto |
| 7 | GLM 5 | 3,15 | 3,28 | 2,84 | Cerrado |
| 8 | Mistral Large 3 | 3,14 | 3,28 | 2,81 | Abierto |
| 9 | GPT-5.4 | 3,09 | 3,23 | 2,78 | Cerrado |
|10 | GPT-5.4 Mini | 2,99 | 3,19 | 2,51 | Cerrado |
Los modelos cerrados lideran (promedio 3,30), mientras que los abiertos quedan rezagados un 18% (promedio 2,80). Gemini 3.1 Pro domina en todos los aspectos; GPT-5.4 ocupa el puesto 9.
La crisis del idioma chuvash
ChuvashBench reveló un fracaso grave: ningún modelo superó 3,0 en precisión. Distribución (con GPT-5.4 como juez):
- >3,0 (mayormente correcto): 0 modelos.
- 2,0–3,0 (resultados mixtos): 3 modelos.
- 1,0–2,0 (alucinaciones): 14 modelos.
- =1,0 (alucinación total): 5 modelos (variantes Qwen3, Phi-4).
Mejores desempeños: Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro (2,1/4,0). Los modelos generan pseudo-chuvash: palabras correctas como «Salam» (hola) mezcladas con contenido inventado. El chuvash es hablado por 1,1 millones de personas y oficial en la República Chuvash, actualmente bajo amenaza de UNESCO. Los datos están disponibles (2,9 millones de oraciones, 1,4 millones de pares chuvash-ruso en HuggingFace, licencia CC0).
Conclusiones prácticas para implementación
Para escuelas, puntuaciones entre 3,0 y 3,5 son adecuadas para borradores de planes de clase que requieren revisión. Bajo la ley 152-FZ (datos locales), Qwen3.5 27B (3,09, 18 GB VRAM) es viable — solo un 12% detrás del líder. Los idiomas regionales (Chuvashia, Tatarstán, Bashkortostán) siguen sin soporte. Los desarrolladores planean lanzar ChuvashLM basado en Qwen3-32B para despliegue local.
Puntos clave
- Gemini 3.1 Pro lidera con 3,42, superando a Claude y GPT en tareas FSES y chuvash.
- Los modelos abiertos se retrasan un 18%, el mejor es DeepSeek V3.2 (3,15).
- ChuvashBench: todos los modelos alucinan en chuvash, puntuación máxima 2,1/4,0.
- El benchmark es de código abierto: preguntas, resultados y código en GitHub.
- Los datos para entrenar chuvash existen — el problema está en las prioridades de los desarrolladores.
— Editorial Team
Aún no hay comentarios.