Kimi K2.5 a čínské LLM vedou v testech dostupných z Ruska
Čínské modely Kimi K2.5, MiniMax M2.7 a MiMo V2 Omni dosahují výsledků srovnatelných s globálními lídry v benchmarku 54 LLM podle 32 praktických scénářů v ruštině. Testování využilo prompty od skutečných manažerů a dva kalibrované LLM soudce. Rozdíl oproti GPT-5.4 činí 0,06 bodu – což je v rámci statistického šumu.
Top dostupných modelů bez VPN
Pět lídrů mezi modely fungujícími z Ruska bez omezení:
| Model | Skóre | Vývojář |
|--------|------|-------------|
| Kimi K2.5 | 4,74 | Moonshot AI |
| MiniMax M2.7 | 4,69 | MiniMax |
| MiMo V2 Omni (API) | 4,62 | Xiaomi |
| Qwen3.5 Plus | 4,56 | Alibaba |
| Qwen3.5 397B | 4,55 | Alibaba |
Všechny jsou zdarma pro základní použití. MiMo V2 Omni stojí 0,40 $/M vstupních tokenů – třikrát levněji než Gemini 2.5 Pro (1,25 $/M), při skóre 4,62 proti 4,46.
Globální top 10 v benchmarku:
- GPT-5.4 – 4,80
- Claude Sonnet 4.5 – 4,78
- GPT-5.2 Pro – 4,78
- Claude Opus 4.5 – 4,78
- Claude Sonnet 4.6 – 4,77
- Kimi K2.5 – 4,74
- MiniMax M2.7 – 4,69
- GPT-5 Mini – 4,69
- GPT-5.2 – 4,69
- GPT-5.4 Mini – 4,63
Specializace modelů podle úkolů
Claude Sonnet 4.5 vede v analytice: vytváří rozhodovací matice, stromy podmínek, prahy revize. Vhodné pro plánování projektů, analýzu rozhodnutí, řízení týmu.
GPT-5.4 a GPT-5 Mini dominují ve vyhledávání informací a komunikaci. GPT-5 Mini (0,002 $/dotaz) dosáhl 4,78 v komunikaci – výše než GPT-5.2 Pro.
MiniMax M2.7 – nejlepší v řízení týmu: detailní plány pohovorů, kariérního růstu, změn s termíny a formulacemi. Artefakty jako čínské znaky v ruštině neovlivňují podstatu.
Mezi dostupnými Kimi a MiniMax zaostávají za lídry o 0,1–0,2 bodu v kategoriích. VPN není pro kvalitu potřeba.
Praktický příklad: rozdělení rozpočtu
Scénář: 100K $ na čtyři iniciativy – software (30K $), dodavatel (45K $), školení (20K $), marketing (40K $). Srovnání přístupů:
- Kimi K2.5 (4,74): Kategorie portfolia (základní aktivum, asymetrická sázka, zajištění, rezerva). Odstraní dodavatele jako "operativní záplatu". Prahy: CAC > 200 $ – odstranit marketing; míra chyb > 5 % – odstranit software. Podmíněná logika, scénáře, metriky.
- MiniMax M2.7 (4,69): Očekávaná hodnota, fázový plán s kritérii přechodu.
- Qwen3.5 Plus (4,56): Finanční analýza s hidden costs, ale náchylná k politicky výhodným variantám.
- GigaChat-Ultra (3,26): Python kód pro aritmetiku, financoval dodavatele, vyloučil marketing bez frameworku.
- Alice AI (3,86): Strukturuje, ale obírá odpovědi na 40–60 %.
Rozdíl 1 bodu určuje, zda je výstup připraven na schůzku.
Výsledky ruských modelů
GigaChat-Ultra (3,26): povrchní analýza, chyby v číslech, záměna kontextu na ruský trh. V regionálních úkolech (TK RF, daně) – halucinace, spletla MCI s MRP.
Alice AI (3,86): nejlepší ruský výsledek, ale rozdíl oproti Kimi – 0,88 bodu. YandexGPT Pro 5.1 (3,13) odmítá úkoly kvůli "nedostatku dat".
Kimi K2.5 v regionálních scénářích – 3,85, zná kazachstánské daňové právo lépe než lokální modely.
Co je důležité:
- Čínské modely stahují rozdíl s topem na 0,06 bodu, dostupné zdarma bez VPN.
- Ruské LLM (GigaChat, YandexGPT) zaostávají o 1+ bod v praktických úkolech.
- Kvalita závisí na promptu: strukturovaný dotaz snižuje rozdíl na polovinu.
- Claude pro analytiku, GPT pro komunikaci, MiniMax pro řízení.
- Top 5 dostupných – všechny čínské, s cenou 3x nižší než analogy.
Rozdíl se každé čtvrtletí zmenšuje díky dostupnosti čínských LLM.
— Editorial Team
Zatím žádné komentáře.