Экономика инференса и MoE-архитектура: почему монолитные LLM разоряют бизнес

Данный аналитический отчёт посвящён исследованию фундаментального сдвига в архитектуре больших языковых моделей (LLM). Мы разбираем, почему экономика инференса классических плотных (dense) моделей заходит в тупик, как математика MoE-архитектуры (Mixture of Experts) решает эту проблему, какие законы масштабирования эффективности она задаёт, с какими сложностями межузловой коммуникации и балансировки нагрузки сталкиваются инженеры, а также даём практическое руководство для руководителей компаний по выбору технологического стека ИИ.

1. Финансовый тупик «плотных» (Dense) ИИ-архитектур

Развитие генеративного искусственного интеллекта в период с 2022 по 2026 год выявило фундаментальную уязвимость классических ИТ-стратегий при масштабировании больших языковых моделей (LLM). Традиционная экономическая модель программного обеспечения (SaaS) базируется на эффекте масштаба: создание первой копии продукта требует значительных инвестиций (R&D), тогда как маржинальные издержки обслуживания каждого последующего пользователя стремятся к нулю. В сфере генеративного ИИ на базе монолитных (dense) архитектур эта закономерность нарушена: стоимость инференса нейросети растёт почти вместе с числом пользователей. Каждое обращение к традиционной плотной нейросети требует активации 100% её параметров и выполнения триллионов математических операций, из-за чего операционные расходы (OPEX) растут пропорционально росту пользовательской базы, а нередко и опережают его.

Ярким примером этой экономической аномалии является финансовая отчётность компании OpenAI на пике масштабирования плотной модели GPT-4. При прогнозируемой выручке в 3,7 млрд долларов в 2024 году компания столкнулась с чистыми убытками в размере 5 млрд долларов. При этом прямые затраты исключительно на аренду и обслуживание вычислительных мощностей составили 6 млрд долларов. Анализ финансовой модели показал, что на каждый доллар выручки OpenAI тратила примерно 2,35 доллара. Линейный рост числа плотных параметров (от десятков миллиардов у GPT-3 до сотен миллиардов у GPT-4) привёл к тому, что обслуживание пользовательских запросов стало экономически нерентабельным без радикального повышения тарифов на API, что, в свою очередь, отсекает значительную долю корпоративных клиентов.

Вектор технологического соперничества сместился в сторону сублинейного масштабирования, при котором вычислительная сложность инференса растёт в разы медленнее, чем общая ёмкость знаний модели. Масштабным подтверждением этого сдвига стал выпуск китайской открытой модели DeepSeek-R1. Стоимость её разработки и финального цикла обучения составила около 6 млн долларов — по сравнению с 500 млн долларов, которые, по оценкам рынка, были затрачены на создание логической модели OpenAI o1. Драматическая разница наблюдается и в операционных расходах: стоимость обработки 1 миллиона токенов у дистиллированной версии DeepSeek-R1 составляет 2,19 доллара, тогда как аналогичный объём вычислений у закрытой o1 обходится бизнесу в 60 долларов. В основе этой экономической революции лежит архитектурный переход к MoE-архитектуре (Mixture of Experts).

2. Механика Mixture of Experts (MoE): сублинейное масштабирование вычислений

Интуитивное понимание Mixture of Experts (смеси экспертов) напоминает разделение труда в человеческом мозге или структуру крупной корпорации: для решения конкретной узкой задачи нет необходимости активировать весь штат сотрудников или задействовать все зоны коры головного мозга. Например, нейроны, отвечающие за математические вычисления или написание программного кода, бездействуют, когда модель выполняет перевод художественного текста или отвечает на базовые вопросы.

В архитектурном плане слой MoE заменяет стандартные полносвязные блоки прямого распространения (Feed-Forward Networks, FFN) в блоках трансформера на набор параллельных ветвей — «экспертов» (каждый из которых представляет собой независимую FFN-подсеть) — и обучаемую сеть шлюзов (router/маршрутизатор). Маршрутизатор принимает векторное представление каждого входящего токена и динамически распределяет его для обработки только по 1–2 наиболее подходящим экспертам. Остальные эксперты в этот момент остаются неактивными, не потребляя вычислительные ресурсы процессора (FLOPs).

Это позволяет разделить два ключевых понятия, определяющих мощность и экономику языковых моделей:

  • Общий объём параметров (Total Parameters) — сумма всех весов во всех экспертных блоках и общих слоях внимания. Общий объём параметров определяет «ёмкость памяти» модели, её способность удерживать сложные факты, редкие языковые закономерности и предметные концепции.
  • Активные параметры (Active Parameters) — количество весов, которые реально участвуют в математических вычислениях при обработке одного токена на прямом проходе (forward pass). Этот показатель жёстко определяет время отклика (latency), требования к вычислительной мощности чипа и итоговую себестоимость инференса.

Для количественной оценки этого преимущества исследователями из Ant Group введено понятие коэффициента эффективности использования вычислений — Efficiency Leverage (EL). Данный коэффициент математически измеряет, во сколько раз больше вычислительных ресурсов в эквиваленте FLOPs потребовалось бы затратить на обучение и инференс монолитной плотной (dense) модели, чтобы достичь такого же значения функции потерь (loss), которое показывает разреженная MoE-конфигурация. Более высокий показатель EL означает, что MoE-архитектура обеспечивает кратно лучший «рычаг эффективности» на единицу затраченной энергии и процессорного времени. Эмпирические законы масштабирования MoE показывают, что преимущества разреженных моделей прогрессивно усиливаются по мере роста общего масштаба вычислений.

3. Ключевые архитектурные параметры разреженных сетей

Проектирование высокопроизводительной MoE-модели требует от инженеров и CTO тонкой балансировки трёх ключевых архитектурных параметров: разреженности, гранулярности и структуры общих слоёв. Ошибки в этих параметрах могут привести к нестабильности сходимости модели при обучении или к резкому падению скорости инференса на реальном оборудовании.

Разреженность и коэффициент активации

Разреженность (Sparsity) модели определяется количеством экспертов, одновременно активируемых на один токен (параметр top-k). Отношение активных параметров к общей ёмкости модели называется коэффициентом активации (Activation Ratio). Исследования показывают наличие чёткой дуги компромисса: при слишком низкой разреженности (когда активируются почти все эксперты) модель вырождается в дорогую плотную сеть; при экстремально высокой разреженности (например, при активации только 1 мелкого эксперта из 1000) ёмкости отдельной подсети не хватает для удержания сложных связей. Оптимальная точка выбирается исходя из вычислительного бюджета и требований к задержке. Последний мировой тренд — движение к сверхразреженным архитектурам. Если в ранней модели Mixtral 8x7B (2023 г.) разреженность составляла 4.0 (из 8 экспертов активировались 2), то в модели Kimi K2 (2025 г.) разреженность доведена до рекордных 42.8 (активируются только 8 маршрутизируемых экспертов из 384 доступных).

Гранулярность (Granularity, G)

Этот параметр отражает физический размер каждого отдельного эксперта. Гранулярность рассчитывается как отношение размерности экспертного слоя к общей скрытой размерности модели (d_model). Исторически в первых MoE-моделях использовались крупные эксперты (гранулярность Mixtral составляет всего 0.571). Однако современная инженерная практика доказала, что гораздо выгоднее разделять тот же параметрический бюджет на множество мелких экспертов с высокой гранулярностью — это даёт маршрутизатору гибкость в комбинировании микро-навыков. В модели DeepSeek V3 гранулярность повышена до 7.0 (256 маршрутизируемых экспертов), а в Qwen3-Next-80B-A3B — до 8.0 (512 экспертов), что позволило существенно снизить финальную потерю при обучении на аналогичном объёме токенов.

Концепция общих экспертов (Shared Experts)

При высокой степени гранулярности возникает риск дублирования информации: базовые правила синтаксиса, пунктуации и элементарной логики начинают независимо обучаться внутри каждого из сотен специализированных экспертов, что снижает эффективность использования параметров. Для решения этой проблемы в архитектуру внедряются постоянно активные общие эксперты (Shared Experts), которые не проходят процедуру маршрутизации. Они берут на себя обработку общеязыкового фонового шума, позволяя остальным экспертам максимально глубоко специализироваться на своих узких доменах (например, на написании SQL-запросов или анализе медицинских карт). Внедрение всего одного или двух общих экспертов (как это сделано в DeepSeek V3 и Kimi K2) радикально стабилизирует процесс сходимости модели.

4. Балансировка нагрузки экспертов MoE и управление маршрутизацией

Главным фактором риска при эксплуатации MoE является феномен «экспертного коллапса» (expert collapse). Если маршрутизатор на ранних этапах обучения случайно начнёт отдавать предпочтение одному конкретному эксперту, его веса будут обновляться чаще, он станет более универсальным, и в итоге система начнёт направлять к нему 100% входящего трафика. В результате модель фактически схлопывается в плоскую сеть меньшего размера, остальные эксперты простаивают, а реальная ёмкость модели деградирует.

Для предотвращения этого в функцию потерь маршрутизатора встраивается дополнительный штраф за дисбаланс — Auxiliary Load Balancing Loss (LBL):

L_Bal = α · Σ (i=1…N_r) (f_i · P_i)

где f_i — доля токенов, направленных к эксперту i; P_i — суммарная вероятностная масса распределения маршрутизатора для этого эксперта; α — весовой коэффициент силы штрафа. При идеально равномерной нагрузке f_i = P_i = 1 / N_r.

Анализ команды разработчиков Qwen выявил критическую деталь: эффективность балансировки жёстко зависит от области вычисления статистики. Большинство базовых фреймворков (включая ранние версии NVIDIA Megatron) по умолчанию рассчитывают f_i и P_i локально — по микробатчу каждого конкретного графического процессора. При обучении с длинным контекстом локальный батч токенов оказывается узким и тематически однородным (например, содержит только программный код), из-за чего локальная статистика становится смещённой, а навязанная балансировка искусственно разрушает специализацию экспертов. Разработчики доказали необходимость перехода на глобальное агрегирование статистики по всему вычислительному кластеру, что обеспечивает сочетание равномерной загрузки ядер и глубокой доменной специализации.

Революционным шагом в архитектуре DeepSeek-V3 стал полный отказ от штрафных функций балансировки на этапе инференса. Вместо усложнения математики оптимизатора авторы внедрили алгоритм балансировки без вспомогательных потерь (Auxiliary-Loss-Free Routing). Система динамически отслеживает уровень загрузки экспертов и в режиме реального времени добавляет небольшой адаптивный коэффициент смещения (bias) к логике маршрутизатора: если эксперт перегружен, его оценка в softmax временно занижается, если недогружен — повышается. Это гарантирует аппаратную стабильность без деградации качества генерации ответов.

5. Инфраструктурные барьеры инференса и межузловая коммуникация

Несмотря на выдающуюся экономичность MoE по числу математических операций, её внедрение сопряжено с серьёзными системными вызовами на уровне кремния и сетевой инфраструктуры. Разреженная модель требует кратно большего объёма физической памяти по сравнению со своим плотным аналогом с таким же количеством активных параметров. Все эксперты должны одновременно находиться в оперативной или видеопамяти (VRAM), так как маршрутизатор распределяет токены динамически, а задержка при подгрузке весов с диска уничтожит любую интерактивность. Это делает локальное развёртывание крупных MoE-моделей на персональных компьютерах практически невозможным, смещая технологию в сторону облачных провайдеров с мощными фермами GPU.

Второй барьер — накладные расходы на синхронизацию между CPU и GPU. Поскольку запуск конкретных экспертных ядер планируется на основе решений маршрутизатора прямо во время работы модели, стандартные реализации MoE требуют постоянного обмена сигналами между центральным процессором и видеокартой на каждой итерации. Это создаёт задержки, особенно критичные при обработке коротких запросов. При оптимизации ядер DeepSeek MoE в рамках проекта MakoGenerate эта проблема была решена за счёт перестройки механизма маршрутизации. Разработчикам удалось сократить число запускаемых ядер с 1043 до 533, а количество точек CPU-GPU-синхронизации — с 67 до всего 3 на один проход, что снизило накладные расходы на синхронизацию на 97% и сократило общую задержку (latency) инференса на 44%.

На уровне больших вычислительных кластеров (сотни и тысячи видеокарт) главным бутылочным горлышком становится сетевая коммуникация. В плотных моделях для синхронизации градиентов используется алгоритм All-Reduce, который масштабируется чрезвычайно эффективно и практически не теряет в пропускной способности при росте числа узлов. В моделях MoE распределение экспертов по разным физическим серверам требует постоянных All-to-All-транзакций для пересылки токенов между узлами, а пропускная способность All-to-All деградирует логарифмически с ростом сети. Для преодоления этого барьера передовые ИИ-лаборатории используют библиотеку NVSHMEM: она объединяет память всех GPU кластера в единое разделённое глобальное адресное пространство (PGAS) и поддерживает асинхронные операции передачи данных, инициируемые непосредственно видеокартами, полностью минуя стек управления CPU.

Отечественным примером успешного преодоления этих инфраструктурных ограничений является семейство моделей GigaChat от Сбера. Разработчики перевели линейку своих моделей на блок-разреженную архитектуру MoE. За счёт использования оптимизированных ядер STK Triton и селективного контроля контрольных точек активаций (selective activation checkpointing) при обработке контекста объёмом до 131 тысячи токенов команда добилась двукратного ускорения процесса обучения и сокращения задержки инференса на 40% по сравнению с плотными моделями сопоставимого масштаба (такими как 8-миллиардная Llama 3).

6. Прагматичный чек-лист для CEO и CTO: плотная модель или MoE-архитектура

Принимая стратегическое решение о выборе архитектуры ИИ-продукта, топ-менеджмент должен опираться на три прагматичных фактора: целевую среду развёртывания, уровень экспертизы команды и жёсткость временных рамок проекта. Идеальное — враг хорошего, и MoE не является универсальной таблеткой для любого бизнеса.

Блок-схема принятия решений

  • Шаг 1. Анализ целевой среды развёртывания. Если вы разрабатываете приложение для запуска непосредственно на смартфонах клиентов, локальных компьютерах, бортовых компьютерах дронов или промышленных контроллерах — ваш выбор жёстко ограничен плотными моделями (Dense) или компактными гибридными архитектурами (SLM). Жёсткие лимиты оперативной памяти не позволят удерживать MoE-модель в фоновом режиме, даже если её активная часть потребляет минимум энергии.
  • Шаг 2. Оценка масштаба и трафика. Если вы планируете развёртывать ИИ в облачной инфраструктуре для обслуживания миллионов запросов одновременно (например, в корпоративной поисковой системе, RAG-ассистенте техподдержки или аналитическом хабе), MoE-архитектура становится безальтернативным выбором, так как обеспечивает колоссальную экономию OPEX за счёт сублинейной стоимости вычислений.
  • Шаг 3. Оценка инженерной экспертизы и сроков. Обучение и тонкая настройка (Fine-Tuning) плотных трансформеров полностью стандартизированы, стабильны и поддерживаются любыми базовыми библиотеками (например, Hugging Face Trainer) «из коробки». Плотные модели прощают широкий диапазон ошибок в гиперпараметрах, скоростях обучения и размерах батчей. Разреженные MoE-модели, напротив, обладают чрезвычайно хрупкими ландшафтами оптимизации, требуют сложного распределения памяти (Zero-3, Tensor Parallelism) и глубокого понимания межузловой сетевой инженерии. Если у вас нет высококлассных специалистов по распределённому обучению и жёсткие сроки запуска (до 3 месяцев) — выбирайте плотную модель. Если у вас есть опытная команда и гибкие сроки — внедряйте MoE.

7. Сравнительный анализ архитектурных решений

Для систематизации изложенного материала ниже приведены сводные аналитические таблицы, сопоставляющие экономические и технические параметры плотных моделей и смеси экспертов.

Таблица 1. Экономическое сопоставление плотных (Dense) и разреженных (MoE) архитектур

Критерий сравнения Плотная архитектура (Dense) Смесь экспертов (MoE)
Активные параметры при выводе 100% от общего числа параметров модели Только малая часть (~10–20% весов экспертов)
Потребление энергии и задержка Растут линейно с увеличением размера сети Остаются на уровне компактных моделей
Расход видеопамяти (VRAM) Пропорционален размеру активных параметров Высокий (требуется загрузка всех экспертов одновременно)
Простота и стабильность обучения Высокая, стандартизированные фреймворки Низкая, высокая чувствительность к гиперпараметрам
Эффективность масштабирования Линейный рост затрат ограничивает масштаб Сублинейный рост затрат (Efficiency Leverage > 3)
Оптимальная сфера применения Edge-устройства, телефоны, локальный инференс Высоконагруженные облачные API, SaaS-платформы

Таблица 2. Архитектурные параметры ведущих мировых и отечественных MoE-моделей

Модель Общие параметры Активные параметры Всего экспертов (top-k активных) Гранулярность (G)
Mixtral-8x7B (2023) 47B 12.9B 8 (2) 0.571 (крупные эксперты)
GigaChat-A3B (2025) 20B 3.3B 64 routed + 2 shared (8) 4.0 (оптимальный компромисс)
DeepSeek-V2 (2024) 236B 21B 160 routed + 2 shared (6) 6.6 (высокая специализация)
DeepSeek-V3 (2024) 671B 37B 256 routed + 1 shared (8) 7.0 (сверхмелкие эксперты)
Kimi K2 (2025) 1T 32B 384 routed + 1 shared (8) 7.0 (максимальная разреженность)
Qwen3-Next (2025) 300B+ 30B+ 512 routed + 1 shared (10) 8.0 (ультра-гранулярность)
MiniMax-01 (2025) 456B 45.9B Гибридная MoE — (линейное внимание + MoE)

8. Часто задаваемые вопросы

Чем MoE отличается от dense-модели?

Главное отличие — в количестве параметров, участвующих в вычислении одного токена. В dense-модели активируются 100% параметров при каждом запросе, тогда как в MoE-архитектуре маршрутизатор задействует лишь небольшую часть экспертов (обычно 1–2 из десятков или сотен), что кратно снижает стоимость инференса нейросети при сопоставимой ёмкости знаний.

Как снизить стоимость инференса LLM без потери качества?

Основной путь — переход на MoE-архитектуру, где активная часть параметров кратно меньше общей. Дополнительно снижают затраты глобальная (а не локальная) балансировка нагрузки экспертов, отказ от вспомогательных штрафных функций на этапе инференса (Auxiliary-Loss-Free Routing) и оптимизация CPU-GPU-синхронизации: например, проект MakoGenerate на архитектуре DeepSeek MoE сократил задержку инференса на 44%.

Что такое гранулярность экспертов в MoE?

Гранулярность — это отношение размера одного эксперта к общей скрытой размерности модели. Чем выше гранулярность (то есть чем мельче и многочисленнее эксперты), тем гибче маршрутизатор комбинирует узкие микро-навыки. Например, у Mixtral 8x7B гранулярность составляет всего 0.571, а у DeepSeek V3 — уже 7.0.

Что выбрать стартапу: dense-модель или MoE-архитектуру?

Если продукт работает офлайн на устройстве пользователя (смартфон, дрон, промышленный контроллер), выбора фактически нет — только плотная модель или компактная SLM. Если сервис размещается в облаке и обслуживает большой поток запросов, а в команде есть опыт распределённого обучения, MoE-архитектура почти всегда выгоднее по OPEX.

9. Заключение

Mixture of Experts перестала быть просто академическим экспериментом, превратившись в доминирующий индустриальный стандарт. Снижение издержек на инференс на 50–90%, продемонстрированное лидерами рынка, делает MoE-архитектуру единственным жизнеспособным путём коммерциализации генеративного ИИ в промышленных масштабах. Понимание тонкостей балансировки, гранулярности и сетевой топологии позволяет бизнесу строить устойчивые, масштабируемые решения, превращая вычислительную мощность из статьи расходов, сжигающей бюджет, в управляемый и высокоэффективный актив.