csylabs.bench
Публичные LLM-бенчмарки

Методология

Единая методология публичных бенчмарков ЛИИ

Подход общий для всех треков: сначала фиксируется проверяемый доменный бенчмарк, затем прогоняются базовые модели, публикуется leaderboard и только после этого принимаются решения о дообучении.

Benchmark-first

Первый артефакт — проверочная поверхность на русском языке: доменные вопросы, аудитории, уровни сложности, эталонные критерии и понятная схема публикации. Корпус и карточка модели идут позже.

Свободный профессиональный ответ

Основной формат — свободный профессиональный ответ, без выбора из готовых вариантов. Так ближе к реальному использованию: тренер, учитель, функционер или методист спрашивает модель и оценивает качество самого ответа.

Рубрика и судейский ансамбль

Ответы оцениваются по доменной рубрике. Для Sport это точность, полнота, полезное дополнительное наблюдение и русский язык. Для EduBench — педагогическое качество, язык, фактическая точность, применимость и российский контекст.

Публикуем смещение, а не прячем

Если модель-судья оценивает кандидата из своей же семьи, такой self-judging выделяется отдельно. Мы показываем self-score, cross-score и delta, чтобы читатель видел, где оценка может сдвигаться.

Воспроизводимые артефакты

Раскрытие зависит от трека. Где золотой набор публичный (Спорт, EduBench) — публикуются вопросы, сырые ответы, оценки и снимок лидерборда целиком. Где набор задач намеренно закрыт, чтобы его нельзя было выучить (Архитектор — задачи собраны из рабочих сессий), сейчас публично только: лидерборд, состав судей и хеш замороженного набора. Полная конфигурация прогона — манифесты, sha харнесса, бюджет вывода, параметры сэмплирования — сейчас не публикуется. Даже в полном виде такой режим даёт проверяемость конфигурации, а не независимую перепроверку балла — и так и должен называться. Сайт не ходит в GitHub во время запроса; он публикует зафиксированную версию.

Доменный слой поверх общего каркаса

Sport, Education, Legal или Clinical отличаются корпусом, рубрикой и safety-границами, но не каркасом. Это позволяет масштабировать bench.csylabs.com без переписывания методологии для каждого нового трека.

Текущие треки

Live v0.1

ЛИИ-Спорт-Bench-RU

Русский спортивный трек построен от анализа пробелов SportQA: российские федерации, ФССП, РУСАДА/ВАДА, спортивная методология, аудитории тренера, спортсмена, СШОР, медика, аналитика и функционера.

Live public summary

EduBench-RU

Образовательный трек покрывает ФГОС-педагогику, предметные знания, copilot-сценарии учителя и ChuvashBench как маркер локализации для национальных языков России.

Live 2026-08-16

ЛИИ-Архитектор-Bench-RU

Архитектор-трек оценивает founder/architect работу на русском: стратегия, архитектурные решения, specs, research distillation и deal prep.

Live 2026-07-07

RU-модели

Сравнение открытых моделей по ruAIME-2025 и ruMMLU из MERA на RTX PRO 6000; скорость сознательно вынесена за скобки.

Судьи и проверочные наборы

Каждый live-трек явно показывает, какие judge-модели или проверочные наборы использовались. Это часть методологии, потому что состав жюри и объём проверки влияют на результат так же, как корпус и рубрика.

ТрекСудьи / eval
ЛИИ-Спорт-Bench-RU
google/gemini-3.1-pro-previewanthropic/claude-opus-4.7openai/gpt-5.5
EduBench-RU
GPT-5.4Claude Sonnet 4.6Gemini 3.1 Pro
ЛИИ-Архитектор-Bench-RU
geminigpt51opus48
RU-Model-Ladder
ruAIME-2025ruMMLU (MERA)

Флаги разногласий судей

Для Sport сейчас опубликована доля вопросов по каждой модели, где разногласие между судьями было достаточно высоким для флага. Для EduBench это будет добавлено после публикации upstream leaderboard JSON.

МодельФлагиВсего%
claude-opus-4.72619913.1%
gemini-3.1-pro-preview2619913.1%
gpt-5.581994%
deepseek-v4-flash4019920.1%
qwen3.5-27b2919914.6%
gemma-4-31b-it141997%
qwen3.6-27b5019925.1%

Внутренние документы, из которых собрана публичная версия

Методология — csylabs.bench