csylabs.bench
Публичные LLM-бенчмарки
Архитектор — liveЛИИ-Архитектор-Bench-RU / 2026-08-28

ЛИИ-Архитектор-Bench-RU: рейтинг LLM для работы архитектора и основателя.

ЛИИ-Архитектор-Bench-RU сравнивает модели на русскоязычных architect-задачах: стратегия, архитектурные решения, спецификации, research distillation и deal prep. Публичный срез: 8 моделей протестировано, 50 реальных задач, 3 судейские модели.

Рейтинг моделей

Основная таблица сортируется по score; pass, tok/s, TTFT и ₽/solved показаны только там, где метрики есть в source-of-truth.

МестоМодельScorePasstok/sTTFT s₽/solved
#1
Qwen3.8-Flash-Next · Q3_K_XL · арендованная RTX PRO 6000
NEW 2026-08-28 · bench v1, n=3 (0.797/0.766/0.794). Новая архитектура-превью Qwen4: 125B/6B-active MoE + 51B n-gram embedding + 4B MTP. llama.cpp-only (unsloth-фок PR, у vLLM/SGLang пока нет поддержки новых операций) — реальный операционный минус против текущей продакшн-раскладки. Полный нативный контекст 262144 умещается целиком на карте (73.2 ГБ из 96 ГБ), запас 24.7 ГБ VRAM. Практически неотличимо от продакшн Qwen3.8-27B по баллу (0.786 vs 0.769, разница внутри разброса 0.043), но на 13% быстрее декодом — активируется только 6 из 125B параметров на токен.
0,786
43/50 (среднее)79,1
#2
Qwen3.8-Flash-Next · Q4_K_XL · арендованная RTX PRO 6000
NEW 2026-08-28 · bench v1, n=3 (0.761/0.795/0.800). Тот же чекпойнт, точнее квант (KLD 0.045 vs Q3's 0.100 по данным unsloth). Тоже влезает в 96 ГБ целиком на полном контексте, но впритык — 93.6 ГБ, запас всего 4.3 ГБ. Статистически неотличим от Q3_K_XL (0.785 vs 0.786) — более точный квант НЕ дал измеримого прироста качества на этом наборе, только съел почти весь запас VRAM.
0,785
44/50 (среднее)77,4
#3
Qwen3.8-27B · тот же вес по API
NEW 2026-08-16 · bench v1. Та же модель, что и продакшн-строка ниже. У модели один провайдер на весь OpenRouter, его P99 по сквозной задержке 788 с.
0,785
44/5015,0134,88₽1,793
#4
Qwen3.8-27B · NVFP4 · арендованная RTX PRO 6000
ИСПРАВЛЕНО 2026-08-28 · bench v1, n=3 (0.777/0.765/0.764, разброс всего 0.007 — самый стабильный результат из всех строк). Прежнее значение 0.789/46 было получено на другой раздаче (сторонний unsloth-чекпойнт, MTP выключен, через давно закрытый туннель) и не соответствовало реальному продакшену. Это правильная строка: официальный чекпойнт Qwen3.8-27B-NVFP4A16, MTP включён (num_speculative_tokens=7), делит карту с Ornith-1.5-35B-A3B в проде (utilization 0.56/0.38). Счётчик reasoning-токенов недоступен: vLLM отдаёт трейс, но не разбивку в usage. ₽/задачу не считаю: карта арендована помесячно, маржинальная стоимость запроса близка к нулю, но сама карта — нет.
0,769
41/50 (среднее)70,0
#5
Ornith-1.5-35B-A3B · NVFP4 · арендованная RTX PRO 6000
NEW 2026-08-28 · bench v1, n=2 (0.729/0.734, разброс 0.004 — крайне стабильно). MoE, активных параметров на токен около трёх. Декод в 3.4 раза быстрее лидеров (238 ток/с vs ~78) при балле на 0.05 ниже — реальный компромисс скорость/качество, не шум. Прогон отдельно от продакшн-конфигурации (полная карта, а не совместно с Qwen).
0,732
42/50 (среднее)238,1
#6
DeepSeek V4 Flash 0731
NEW 2026-08-16 · bench v1. GA-чекпойнт, 304B/13B-active, MIT. Самая дешёвая строка. Отстала от 28B-модели, которая влезает в одну карту: 166.9 ГБ чекпойнта в две карты по 96 ГБ помещаются только под 32K контекста.
0,731
42/5053,315,95₽0,032
#7
DeepSeek V4 Flash 0731 · IQ2_XXS · арендованная RTX PRO 6000
NEW 2026-08-26 · bench v1. 2-битное сжатие экспертов (маршрутизатор и общие эксперты — выше точность). Минус 0.034 балла и минус 7 пройденных задач против той же модели по API на полной точности — реальная цена квантования, не шум. Судьи цитируют конкретное: выдуманные цифры производительности, рекомендация, прямо противоречащая условию задачи.
0,697
35/5066,88,48
#8
Ornith-1.5-9B · fp8 · арендованная RTX PRO 6000
ОБНОВЛЕНО 2026-08-28 · bench v1, n=3 (0.554/0.628/0.589). Плотная модель, не MoE. Первый прогон в этой серии (0.466) был испорчен исчерпанием кредита судейского API в середине прогона и не учитывается — с самого начала не входил в среднее.
0,590
30/50 (среднее)121,4

Основная таблица — только строки на замороженном наборе из 50 задач, поэтому баллы в ней сравнимы между собой. Ансамбль из трёх судей на каждой строке. Инструментальный разброс при одинаковой конфигурации — 0.043: разница меньше этого порога значения не имеет. Пять строк ниже (Qwen3.8-27B на арендованной карте, оба кванта Qwen3.8-Flash-Next, Ornith-1.5-35B-A3B, Ornith-1.5-9B) прогнаны 2026-08-28 по 2-3 раза на идентичной конфигурации — статистика (среднее, стандартное отклонение) указана в столбце «Прогонов»; это первые строки с честной оценкой инструментального разброса, а не однократным измерением. Остальные строки — по одному прогону: этого хватает для решения, но не для публикации как измеренного факта. Во время серии прогонов 28.08 несколько раз ловили временную блокировку судейского API (OpenRouter, всплеск запросов), 403 «Access denied by security policy» на 3-18 задачах одного прогона одновременно у всех трёх судей — не деградация модели: ответы кандидата были содержательными и полными (finish_reason=stop), просто судьи не отвечали. Каждый раз ждали восстановления, пересуживали именно эти задачи и помечали как исправлено. Строки от 2026-08-16 дополнительно пишут манифест провенанса (bench v1): хеш набора задач, sha харнесса, эффективный бюджет вывода, параметры сэмплирования. Что публично сейчас: эта таблица, методика и хеш замороженного набора. Что нет: сами 50 задач, рубрики и сырые ответы — публичный золотой набор можно выучить. Поэтому балл нельзя перепроверить своей рукой, и я этого не обещаю. Полная конфигурация прогона сейчас не публикуется.

Исторические прогоны (v0, без манифеста)

2026-06-24 — 2026-07-07

МестоМодельScorePasstok/sTTFT s₽/solved
DeepSeek V4 Flash (preview 0423)
2026-07-07, 50 задач, без манифеста. Предыдущий чекпойнт: пере-пост-тренировка 0731 дала +0.014 — внутри инструментального разброса 0.043, то есть прироста как измеренного факта здесь нет.
0,717
41/5031,74,72₽0,022
GLM-5.2
Корона качества на этом наборе, но 22 с до первого токена — режим «отправь и жди».
0,809
26/2938,422,43₽0,669
Qwen3.6-35B-A3B
Прежний value-чемпион: пропускная способность и цена.
0,779
25/2967,116,80₽0,101
Gemma-4-31B
Практический выбор на каждый день: почти топ, мгновенный ответ, самый дешёвый.
0,772
27/2923,91,24₽0,018
DeepSeek V4-Pro
Крупный открытый якорь; ниже топ-3 на RU-архитектурных задачах.
0,698
19/2939,2₽0,260
Kimi-K2.6
Дорогой открытый якорь в широком поле.
0,663
20/2940,7₽1,080
Ведущая RU облачная LLM1
Закрытая RU-облачная базовая линия; публикуется категорией, потому что условия API запрещают брендовые сравнения.
0,477
13/2990,60,76
1 названа по категории — условия API запрещают публикацию сравнений под брендом

Прогнаны до заморозки набора задач и до манифестов провенанса: ни хеша набора, ни sha харнесса, ни зафиксированного бюджета вывода. Часть — на более раннем наборе из 29 задач, часть — на 50. Знаменатель по каждой строке виден в столбце «Прошло». С основной таблицей напрямую не сравниваются и показаны без ранжирования — место не проставлено намеренно — это история, а не конкуренты.

Методология

50 реальных architect-задач замайнены из собственных рабочих сессий Daniel и оценены ансамблем gemini+gpt51+opus48; задача трека — проверить не coding, а качество архитектурно-стратегической работы на русском.

Методика и провенанс

Сейчас публично: сама таблица, методика и хеш замороженного набора задач. Не публикуется: набор из 50 задач, рубрики и сырые ответы — иначе бенч можно выучить. Значит, повторить замер своей рукой нельзя, и я это не обещаю. Полная конфигурация прогона — манифесты, sha харнесса, бюджет вывода, параметры сэмплирования — сейчас не публикуется.

# сейчас публично: таблица + методика + хеш набора
# приватно: 50 задач, рубрики, сырые ответы (защита от переобучения)
# не публикуется: манифесты, sha харнесса, бюджеты, сэмплирование
# seed_sha256: 2012195e… · ensemble: gemini+gpt51+opus48
pnpm --filter @csylabs/bench type-check
pnpm --filter @csylabs/bench build
Методика
ЛИИ-Архитектор-Bench-RU — csylabs.bench