에두벤치-루: 러시아 학교 교육 과제를 위한 LLM 성능 평가 기준
에두벤치-루 개발팀은 50개의 프롬프트를 통해 연방 국가 교육 표준(FSES), 과목 지식, 교육학적 도구, 그리고 초바시어를 포함한 22개 언어 모델을 테스트했다. 초바시어 과제에서 어느 모델도 4점 만점에 3점을 넘지 못했다. 점수는 3.42로 가장 높았으며, 지니 메이 3.1 프로가 선두를 달렸다.
기존의 테스트(예: MERA)는 통합국가시험(EGE) 중심이지만, 에두벤치는 영어와 중국어에 집중해 왔다. 반면 이 평가 기준은 러시아 교실의 실제 상황을 중심으로 한다.
테스트 모듈 구조
프롬프트는 종합적인 평가를 위해 네 가지 모듈로 나뉜다:
- 모듈 A (FSES 기반 교육학, 15개 프롬프트): 수업 기술 맵 작성, 학생 설명, 오게 결과 분석
- 모듈 B (과목 지식, 10개 프롬프트): 수학, 러시아어, 물리, 생물, 역사, 문학 문제
- 모듈 C (교사 코파일럿, 10개 프롬프트): 교육과정 계획(KTP), 학생 프로필, 부모 회의 자료, 평가 기준, 포괄적 지원 방안 개발
- 모듈 D (초바시벤치, 15개 프롬프트): 번역, 초바시어 문법 연습, 문화적 맥락, 양어문 수업 설계
모듈 A~C는 교사의 일상 업무를 시뮬레이션하며, 초바시벤치는 지역 언어의 약점을 드러낸다.
테스트 대상 모델 및 방법론
2026년 3월 기준 관련성이 높은 22개 모델을 선정했다:
- 선도급: 클로드 오퍼스 4.6, 클로드 손넷 4.6, GPT-5.4, 지니 메이 3.1 프로, 지니 메이 2.5 프로
- 중간급: GPT-5.4 미니, 지니 메이 2.5 플래시, 그록 4.1 패스트, 카미 K2.5, 글름 5, 딥시크 V3.2
- 오픈소스: Qwen3 (8B, 14B, 32B, 235B), Qwen3.5 27B, 미스트랄 라지 3, 람다 4 마버릭, 피파-4
OpenRouter API를 통해 테스트를 진행했으며, max_tokens=8192, temperature=0.7, 단일 러시아어 시스템 프롬프트 사용. 총 비용은 240만 토큰당 1,500루블.
평가에는 LLM-as-judge 방식을 적용했으며, GPT-5.4와 클로드 손넷 4.6가 평가자 역할을 수행했다. 평가 척도는 1~4점이며, 교육학적 품질, 러시아어 능력, 사실 정확성, 실용성, 러시아 문화 이해, 초바시어 활용 등 6가지 기준을 기준으로 삼았다. 최종 점수는 두 평가자의 평균값이며, 클로드 모델에 대해 +0.49점의 편향 보정이 적용되었다.
전체 모델 순위
| # | 모델 | 전반 점수 | 교육 점수 | 초바시 점수 | 유형 |
|---|--------------------|---------|-----------|---------|--------|
| 1 | 지니 메이 3.1 프로 | 3.42 | 3.51 | 3.19 | 폐쇄 |
| 2 | 클로드 오퍼스 4.6 | 3.24 | 3.36 | 2.98 | 폐쇄 |
| 3 | 클로드 손넷 4.6 | 3.22 | 3.34 | 2.95 | 폐쇄 |
| 4 | 지니 메이 3.1 플래시 라이트 | 3.22 | 3.33 | 2.94 | 폐쇄 |
| 5 | 지니 메이 2.5 프로 | 3.21 | 3.31 | 2.98 | 폐쇄 |
| 6 | 딥시크 V3.2 | 3.15 | 3.28 | 2.85 | 오픈 |
| 7 | 글름 5 | 3.15 | 3.28 | 2.84 | 폐쇄 |
| 8 | 미스트랄 라지 3 | 3.14 | 3.28 | 2.81 | 오픈 |
| 9 | GPT-5.4 | 3.09 | 3.23 | 2.78 | 폐쇄 |
|10 | GPT-5.4 미니 | 2.99 | 3.19 | 2.51 | 폐쇄 |
폐쇄형 모델이 평균 3.30점으로 선도하고 있으며, 오픈소스 모델은 평균 2.80점으로 18% 뒤처진다. 지니 메이 3.1 프로는 모든 항목에서 우위를 차지하며, GPT-5.4는 9위에 머물렀다.
초바시어 위기의 진실
초바시벤치는 심각한 실패를 드러냈다: 어떤 모델도 정확도 3.0을 넘지 못했다. 평가자로 GPT-5.4를 사용한 결과 분포는 다음과 같다:
- >3.0 (대부분 정확함): 0개 모델
- 2.0–3.0 (혼합 결과): 3개 모델
- 1.0–2.0 (환각 현상): 14개 모델
- =1.0 (완전한 환각): 5개 모델 (Qwen3 변종, 피파-4)
최고 성과: 클로드 오퍼스 4.6, GPT-5.4, 지니 메이 3.1 프로 (2.1/4.0). 대부분의 모델은 가짜 초바시어를 생성하며, '살람'(안녕하세요) 같은 올바른 단어와 함께 창작된 내용을 혼합한다. 초바시어는 110만 명이 사용하며, 초바시 공화국의 공식 언어로 지정되어 있지만, 유네스코의 위기 언급 대상이다. 데이터는 존재한다(290만 문장, 허깅페이스에 140만 개의 초바시-러시아어 쌍, CC0 라이선스).
구현을 위한 실용적 통찰
학교에서는 3.0~3.5점의 모델이 수정이 필요한 초안 수업 계획에 적합하다. 152-FZ 법(지역 데이터 보호)에 따라, Qwen3.5 27B(3.09점, 18GB VRAM)는 실용 가능하다. 선두 모델보다 12% 뒤처지지만, 지역 언어(초바시아, 타타르스탄, 바슈코르토스탄)는 여전히 지원되지 않는다. 개발팀은 Qwen3-32B 기반의 지역 배포용 '초바시LM' 개발을 계획 중이다.
주요 결론
- 지니 메이 3.1 프로가 3.42점으로 선두, FSES 및 초바시어 과제에서 클로드와 GPT를 앞서며 우세.
- 오픈소스 모델은 평균 18% 뒤처지며, 최고 성과는 딥시크 V3.2(3.15점).
- 초바시벤치: 모든 모델이 초바시어에 환각 현상을 보이며, 최고 점수 2.1/4.0.
- 평가 기준은 오픈소스: GitHub에서 프롬프트, 결과, 코드 모두 공개.
- 초바시어 학습 데이터는 존재하나, 문제는 개발자들의 우선순위에 있다.
— Editorial Team
아직 댓글이 없습니다.