Volver al inicio

EduBench-RU: prueba de 22 LLMs para escuelas en Rusia

EduBench-RU — benchmark para evaluar LLMs en tareas de escuelas rusas: FGOS, asignaturas, herramientas pedagógicas, Chuvash. Probados 22 modelos, líder — Gemini 3.1 Pro. Todos fallaron ChuvashBench.

Prueba de 22 redes neuronales: ¿quién se las arreglará con FGOS y Chuvash?
Advertisement 728x90

EduBench-RU: Benchmark para probar modelos LLM en tareas de educación escolar rusa

Los desarrolladores de EduBench-RU evaluaron 22 modelos de lenguaje en 50 preguntas que abarcan los Estándares Federales de Educación (FSES), conocimiento disciplinario, herramientas pedagógicas y el idioma chuvash. Ningún modelo obtuvo más de 3 sobre 4 en tareas chuvash. Gemini 3.1 Pro se destacó como líder con una puntuación global de 3,42.

Este benchmark cubre una brecha crítica: las pruebas existentes como MERA se enfocan en el Examen Estatal Unificado (EGE), mientras que EduBench prioriza inglés y chino. Aquí, el enfoque está en escenarios del mundo real dentro de aulas rusas.

Estructura del módulo de prueba

Las preguntas se dividen en cuatro módulos para una evaluación completa:

Google AdInline article slot
  • Módulo A (Pedagogía según FSES, 15 preguntas): Creación de mapas tecnológicos de lecciones, explicaciones para estudiantes y análisis de resultados del OGE.
  • Módulo B (Conocimiento disciplinario, 10 preguntas): Problemas de matemáticas, lengua rusa, física, biología, historia y literatura.
  • Módulo C (Copiloto del profesor, 10 preguntas): Elaboración de planes curriculares (KTP), perfiles de estudiantes, materiales para reuniones con padres, rúbricas de calificación y apoyo inclusivo.
  • Módulo D (ChuvashBench, 15 preguntas): Traducciones, ejercicios gramaticales en chuvash, contexto cultural y clases bilingües.

Los módulos A–C simulan flujos diarios de trabajo docente. ChuvashBench revela debilidades en idiomas regionales.

Modelos evaluados y metodología

Se seleccionaron 22 modelos por relevancia a marzo de 2026:

  • Líderes: Claude Opus 4.6, Claude Sonnet 4.6, GPT-5.4, Gemini 3.1 Pro, Gemini 2.5 Pro.
  • Medio rango: GPT-5.4 Mini, Gemini 2.5 Flash, Grok 4.1 Fast, Kimi K2.5, GLM 5, DeepSeek V3.2.
  • De código abierto: Qwen3 (8B, 14B, 32B, 235B), Qwen3.5 27B, Mistral Large 3, Llama 4 Maverick, Phi-4.

La prueba se realizó mediante la API OpenRouter con max_tokens=8192, temperatura=0,7 y un único mensaje de sistema en ruso. Costo total: 1.500 rublos por 2,4 millones de tokens.

Google AdInline article slot

La evaluación usó LLM como juez: GPT-5.4 y Claude Sonnet 4.6 actuaron como evaluadores. Escala de puntuación: 1–4 en seis criterios — calidad pedagógica, dominio del ruso, precisión factual, utilidad práctica, comprensión del contexto ruso y uso del idioma chuvash. Las puntuaciones finales son el promedio de dos jueces, ajustado por sesgo (+0,49 puntos de Sonnet a modelos Claude).

Clasificación general de modelos

| # | Modelo | Global | Educación | Chuvash | Tipo |

|---|--------------------|--------|-----------|---------|--------|

Google AdInline article slot

| 1 | Gemini 3.1 Pro | 3,42 | 3,51 | 3,19 | Cerrado |

| 2 | Claude Opus 4.6 | 3,24 | 3,36 | 2,98 | Cerrado |

| 3 | Claude Sonnet 4.6 | 3,22 | 3,34 | 2,95 | Cerrado |

| 4 | Gemini 3.1 Flash Lite | 3,22 | 3,33 | 2,94 | Cerrado |

| 5 | Gemini 2.5 Pro | 3,21 | 3,31 | 2,98 | Cerrado |

| 6 | DeepSeek V3.2 | 3,15 | 3,28 | 2,85 | Abierto |

| 7 | GLM 5 | 3,15 | 3,28 | 2,84 | Cerrado |

| 8 | Mistral Large 3 | 3,14 | 3,28 | 2,81 | Abierto |

| 9 | GPT-5.4 | 3,09 | 3,23 | 2,78 | Cerrado |

|10 | GPT-5.4 Mini | 2,99 | 3,19 | 2,51 | Cerrado |

Los modelos cerrados lideran (promedio 3,30), mientras que los abiertos quedan rezagados un 18% (promedio 2,80). Gemini 3.1 Pro domina en todos los aspectos; GPT-5.4 ocupa el puesto 9.

La crisis del idioma chuvash

ChuvashBench reveló un fracaso grave: ningún modelo superó 3,0 en precisión. Distribución (con GPT-5.4 como juez):

  • >3,0 (mayormente correcto): 0 modelos.
  • 2,0–3,0 (resultados mixtos): 3 modelos.
  • 1,0–2,0 (alucinaciones): 14 modelos.
  • =1,0 (alucinación total): 5 modelos (variantes Qwen3, Phi-4).

Mejores desempeños: Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro (2,1/4,0). Los modelos generan pseudo-chuvash: palabras correctas como «Salam» (hola) mezcladas con contenido inventado. El chuvash es hablado por 1,1 millones de personas y oficial en la República Chuvash, actualmente bajo amenaza de UNESCO. Los datos están disponibles (2,9 millones de oraciones, 1,4 millones de pares chuvash-ruso en HuggingFace, licencia CC0).

Conclusiones prácticas para implementación

Para escuelas, puntuaciones entre 3,0 y 3,5 son adecuadas para borradores de planes de clase que requieren revisión. Bajo la ley 152-FZ (datos locales), Qwen3.5 27B (3,09, 18 GB VRAM) es viable — solo un 12% detrás del líder. Los idiomas regionales (Chuvashia, Tatarstán, Bashkortostán) siguen sin soporte. Los desarrolladores planean lanzar ChuvashLM basado en Qwen3-32B para despliegue local.

Puntos clave

  • Gemini 3.1 Pro lidera con 3,42, superando a Claude y GPT en tareas FSES y chuvash.
  • Los modelos abiertos se retrasan un 18%, el mejor es DeepSeek V3.2 (3,15).
  • ChuvashBench: todos los modelos alucinan en chuvash, puntuación máxima 2,1/4,0.
  • El benchmark es de código abierto: preguntas, resultados y código en GitHub.
  • Los datos para entrenar chuvash existen — el problema está en las prioridades de los desarrolladores.

— Editorial Team

Advertisement 728x90

Leer después