ЛИИ-Архитектор-Bench-RU: рейтинг LLM для работы архитектора и основателя.
ЛИИ-Архитектор-Bench-RU сравнивает модели на русскоязычных architect-задачах: стратегия, архитектурные решения, спецификации, research distillation и deal prep. Публичный срез: 8 моделей протестировано, 50 реальных задач, 3 судейские модели.
Рейтинг моделей
Основная таблица сортируется по score; pass, tok/s, TTFT и ₽/solved показаны только там, где метрики есть в source-of-truth.
| Место | Модель | Score | Pass | tok/s | TTFT s | ₽/solved |
|---|---|---|---|---|---|---|
| #1 | Qwen3.8-Flash-Next · Q3_K_XL · арендованная RTX PRO 6000 NEW 2026-08-28 · bench v1, n=3 (0.797/0.766/0.794). Новая архитектура-превью Qwen4: 125B/6B-active MoE + 51B n-gram embedding + 4B MTP. llama.cpp-only (unsloth-фок PR, у vLLM/SGLang пока нет поддержки новых операций) — реальный операционный минус против текущей продакшн-раскладки. Полный нативный контекст 262144 умещается целиком на карте (73.2 ГБ из 96 ГБ), запас 24.7 ГБ VRAM. Практически неотличимо от продакшн Qwen3.8-27B по баллу (0.786 vs 0.769, разница внутри разброса 0.043), но на 13% быстрее декодом — активируется только 6 из 125B параметров на токен. | 0,786 | 43/50 (среднее) | 79,1 | — | — |
| #2 | Qwen3.8-Flash-Next · Q4_K_XL · арендованная RTX PRO 6000 NEW 2026-08-28 · bench v1, n=3 (0.761/0.795/0.800). Тот же чекпойнт, точнее квант (KLD 0.045 vs Q3's 0.100 по данным unsloth). Тоже влезает в 96 ГБ целиком на полном контексте, но впритык — 93.6 ГБ, запас всего 4.3 ГБ. Статистически неотличим от Q3_K_XL (0.785 vs 0.786) — более точный квант НЕ дал измеримого прироста качества на этом наборе, только съел почти весь запас VRAM. | 0,785 | 44/50 (среднее) | 77,4 | — | — |
| #3 | Qwen3.8-27B · тот же вес по API NEW 2026-08-16 · bench v1. Та же модель, что и продакшн-строка ниже. У модели один провайдер на весь OpenRouter, его P99 по сквозной задержке 788 с. | 0,785 | 44/50 | 15,0 | 134,88 | ₽1,793 |
| #4 | Qwen3.8-27B · NVFP4 · арендованная RTX PRO 6000 ИСПРАВЛЕНО 2026-08-28 · bench v1, n=3 (0.777/0.765/0.764, разброс всего 0.007 — самый стабильный результат из всех строк). Прежнее значение 0.789/46 было получено на другой раздаче (сторонний unsloth-чекпойнт, MTP выключен, через давно закрытый туннель) и не соответствовало реальному продакшену. Это правильная строка: официальный чекпойнт Qwen3.8-27B-NVFP4A16, MTP включён (num_speculative_tokens=7), делит карту с Ornith-1.5-35B-A3B в проде (utilization 0.56/0.38). Счётчик reasoning-токенов недоступен: vLLM отдаёт трейс, но не разбивку в usage. ₽/задачу не считаю: карта арендована помесячно, маржинальная стоимость запроса близка к нулю, но сама карта — нет. | 0,769 | 41/50 (среднее) | 70,0 | — | — |
| #5 | Ornith-1.5-35B-A3B · NVFP4 · арендованная RTX PRO 6000 NEW 2026-08-28 · bench v1, n=2 (0.729/0.734, разброс 0.004 — крайне стабильно). MoE, активных параметров на токен около трёх. Декод в 3.4 раза быстрее лидеров (238 ток/с vs ~78) при балле на 0.05 ниже — реальный компромисс скорость/качество, не шум. Прогон отдельно от продакшн-конфигурации (полная карта, а не совместно с Qwen). | 0,732 | 42/50 (среднее) | 238,1 | — | — |
| #6 | DeepSeek V4 Flash 0731 NEW 2026-08-16 · bench v1. GA-чекпойнт, 304B/13B-active, MIT. Самая дешёвая строка. Отстала от 28B-модели, которая влезает в одну карту: 166.9 ГБ чекпойнта в две карты по 96 ГБ помещаются только под 32K контекста. | 0,731 | 42/50 | 53,3 | 15,95 | ₽0,032 |
| #7 | DeepSeek V4 Flash 0731 · IQ2_XXS · арендованная RTX PRO 6000 NEW 2026-08-26 · bench v1. 2-битное сжатие экспертов (маршрутизатор и общие эксперты — выше точность). Минус 0.034 балла и минус 7 пройденных задач против той же модели по API на полной точности — реальная цена квантования, не шум. Судьи цитируют конкретное: выдуманные цифры производительности, рекомендация, прямо противоречащая условию задачи. | 0,697 | 35/50 | 66,8 | 8,48 | — |
| #8 | Ornith-1.5-9B · fp8 · арендованная RTX PRO 6000 ОБНОВЛЕНО 2026-08-28 · bench v1, n=3 (0.554/0.628/0.589). Плотная модель, не MoE. Первый прогон в этой серии (0.466) был испорчен исчерпанием кредита судейского API в середине прогона и не учитывается — с самого начала не входил в среднее. | 0,590 | 30/50 (среднее) | 121,4 | — | — |
Основная таблица — только строки на замороженном наборе из 50 задач, поэтому баллы в ней сравнимы между собой. Ансамбль из трёх судей на каждой строке. Инструментальный разброс при одинаковой конфигурации — 0.043: разница меньше этого порога значения не имеет. Пять строк ниже (Qwen3.8-27B на арендованной карте, оба кванта Qwen3.8-Flash-Next, Ornith-1.5-35B-A3B, Ornith-1.5-9B) прогнаны 2026-08-28 по 2-3 раза на идентичной конфигурации — статистика (среднее, стандартное отклонение) указана в столбце «Прогонов»; это первые строки с честной оценкой инструментального разброса, а не однократным измерением. Остальные строки — по одному прогону: этого хватает для решения, но не для публикации как измеренного факта. Во время серии прогонов 28.08 несколько раз ловили временную блокировку судейского API (OpenRouter, всплеск запросов), 403 «Access denied by security policy» на 3-18 задачах одного прогона одновременно у всех трёх судей — не деградация модели: ответы кандидата были содержательными и полными (finish_reason=stop), просто судьи не отвечали. Каждый раз ждали восстановления, пересуживали именно эти задачи и помечали как исправлено. Строки от 2026-08-16 дополнительно пишут манифест провенанса (bench v1): хеш набора задач, sha харнесса, эффективный бюджет вывода, параметры сэмплирования. Что публично сейчас: эта таблица, методика и хеш замороженного набора. Что нет: сами 50 задач, рубрики и сырые ответы — публичный золотой набор можно выучить. Поэтому балл нельзя перепроверить своей рукой, и я этого не обещаю. Полная конфигурация прогона сейчас не публикуется.
Исторические прогоны (v0, без манифеста)
2026-06-24 — 2026-07-07
| Место | Модель | Score | Pass | tok/s | TTFT s | ₽/solved |
|---|---|---|---|---|---|---|
| — | DeepSeek V4 Flash (preview 0423) 2026-07-07, 50 задач, без манифеста. Предыдущий чекпойнт: пере-пост-тренировка 0731 дала +0.014 — внутри инструментального разброса 0.043, то есть прироста как измеренного факта здесь нет. | 0,717 | 41/50 | 31,7 | 4,72 | ₽0,022 |
| — | GLM-5.2 Корона качества на этом наборе, но 22 с до первого токена — режим «отправь и жди». | 0,809 | 26/29 | 38,4 | 22,43 | ₽0,669 |
| — | Qwen3.6-35B-A3B Прежний value-чемпион: пропускная способность и цена. | 0,779 | 25/29 | 67,1 | 16,80 | ₽0,101 |
| — | Gemma-4-31B Практический выбор на каждый день: почти топ, мгновенный ответ, самый дешёвый. | 0,772 | 27/29 | 23,9 | 1,24 | ₽0,018 |
| — | DeepSeek V4-Pro Крупный открытый якорь; ниже топ-3 на RU-архитектурных задачах. | 0,698 | 19/29 | 39,2 | — | ₽0,260 |
| — | Kimi-K2.6 Дорогой открытый якорь в широком поле. | 0,663 | 20/29 | 40,7 | — | ₽1,080 |
| — | Ведущая RU облачная LLM1 Закрытая RU-облачная базовая линия; публикуется категорией, потому что условия API запрещают брендовые сравнения. | 0,477 | 13/29 | 90,6 | 0,76 | — |
| 1 названа по категории — условия API запрещают публикацию сравнений под брендом | ||||||
Прогнаны до заморозки набора задач и до манифестов провенанса: ни хеша набора, ни sha харнесса, ни зафиксированного бюджета вывода. Часть — на более раннем наборе из 29 задач, часть — на 50. Знаменатель по каждой строке виден в столбце «Прошло». С основной таблицей напрямую не сравниваются и показаны без ранжирования — место не проставлено намеренно — это история, а не конкуренты.
Методология
50 реальных architect-задач замайнены из собственных рабочих сессий Daniel и оценены ансамблем gemini+gpt51+opus48; задача трека — проверить не coding, а качество архитектурно-стратегической работы на русском.
Методика и провенанс
Сейчас публично: сама таблица, методика и хеш замороженного набора задач. Не публикуется: набор из 50 задач, рубрики и сырые ответы — иначе бенч можно выучить. Значит, повторить замер своей рукой нельзя, и я это не обещаю. Полная конфигурация прогона — манифесты, sha харнесса, бюджет вывода, параметры сэмплирования — сейчас не публикуется.
# сейчас публично: таблица + методика + хеш набора
# приватно: 50 задач, рубрики, сырые ответы (защита от переобучения)
# не публикуется: манифесты, sha харнесса, бюджеты, сэмплирование
# seed_sha256: 2012195e… · ensemble: gemini+gpt51+opus48
pnpm --filter @csylabs/bench type-check
pnpm --filter @csylabs/bench buildМетодика