Benchmark-first
Первый артефакт — проверочная поверхность на русском языке: доменные вопросы, аудитории, уровни сложности, эталонные критерии и понятная схема публикации. Корпус и карточка модели идут позже.
Методология
Подход общий для всех треков: сначала фиксируется проверяемый доменный бенчмарк, затем прогоняются базовые модели, публикуется leaderboard и только после этого принимаются решения о дообучении.
Первый артефакт — проверочная поверхность на русском языке: доменные вопросы, аудитории, уровни сложности, эталонные критерии и понятная схема публикации. Корпус и карточка модели идут позже.
Основной формат — свободный профессиональный ответ, без выбора из готовых вариантов. Так ближе к реальному использованию: тренер, учитель, функционер или методист спрашивает модель и оценивает качество самого ответа.
Ответы оцениваются по доменной рубрике. Для Sport это точность, полнота, полезное дополнительное наблюдение и русский язык. Для EduBench — педагогическое качество, язык, фактическая точность, применимость и российский контекст.
Если модель-судья оценивает кандидата из своей же семьи, такой self-judging выделяется отдельно. Мы показываем self-score, cross-score и delta, чтобы читатель видел, где оценка может сдвигаться.
Раскрытие зависит от трека. Где золотой набор публичный (Спорт, EduBench) — публикуются вопросы, сырые ответы, оценки и снимок лидерборда целиком. Где набор задач намеренно закрыт, чтобы его нельзя было выучить (Архитектор — задачи собраны из рабочих сессий), сейчас публично только: лидерборд, состав судей и хеш замороженного набора. Полная конфигурация прогона — манифесты, sha харнесса, бюджет вывода, параметры сэмплирования — сейчас не публикуется. Даже в полном виде такой режим даёт проверяемость конфигурации, а не независимую перепроверку балла — и так и должен называться. Сайт не ходит в GitHub во время запроса; он публикует зафиксированную версию.
Sport, Education, Legal или Clinical отличаются корпусом, рубрикой и safety-границами, но не каркасом. Это позволяет масштабировать bench.csylabs.com без переписывания методологии для каждого нового трека.
Русский спортивный трек построен от анализа пробелов SportQA: российские федерации, ФССП, РУСАДА/ВАДА, спортивная методология, аудитории тренера, спортсмена, СШОР, медика, аналитика и функционера.
Образовательный трек покрывает ФГОС-педагогику, предметные знания, copilot-сценарии учителя и ChuvashBench как маркер локализации для национальных языков России.
Архитектор-трек оценивает founder/architect работу на русском: стратегия, архитектурные решения, specs, research distillation и deal prep.
Сравнение открытых моделей по ruAIME-2025 и ruMMLU из MERA на RTX PRO 6000; скорость сознательно вынесена за скобки.
Каждый live-трек явно показывает, какие judge-модели или проверочные наборы использовались. Это часть методологии, потому что состав жюри и объём проверки влияют на результат так же, как корпус и рубрика.
| Трек | Судьи / eval |
|---|---|
| ЛИИ-Спорт-Bench-RU | google/gemini-3.1-pro-previewanthropic/claude-opus-4.7openai/gpt-5.5 |
| EduBench-RU | GPT-5.4Claude Sonnet 4.6Gemini 3.1 Pro |
| ЛИИ-Архитектор-Bench-RU | geminigpt51opus48 |
| RU-Model-Ladder | ruAIME-2025ruMMLU (MERA) |
Для Sport сейчас опубликована доля вопросов по каждой модели, где разногласие между судьями было достаточно высоким для флага. Для EduBench это будет добавлено после публикации upstream leaderboard JSON.
| Модель | Флаги | Всего | % |
|---|---|---|---|
| claude-opus-4.7 | 26 | 199 | 13.1% |
| gemini-3.1-pro-preview | 26 | 199 | 13.1% |
| gpt-5.5 | 8 | 199 | 4% |
| deepseek-v4-flash | 40 | 199 | 20.1% |
| qwen3.5-27b | 29 | 199 | 14.6% |
| gemma-4-31b-it | 14 | 199 | 7% |
| qwen3.6-27b | 50 | 199 | 25.1% |