Дообучение LLM без миллионных бюджетов: дистилляция знаний и перенос весов (LEP) для бизнеса

Ещё недавно дообучение LLM ассоциировалось исключительно с бюджетами технологических гигантов первого эшелона. Однако бережливые методы адаптации — дистилляция знаний, LoRA, QLoRA и перенос весов (LEP) — позволяют бизнесу получить приватный интеллект, сфокусированный на конкретной задаче, без затрат на предобучение модели с нуля. В этом руководстве разберём, как работают эти технологии и какую экономику они дают компании.

1. Экономический тупик «обучения с нуля» и концепция бережливого ИИ (Frugal AI)

Внедрение генеративного искусственного интеллекта в корпоративную практику долгое время ассоциировалось с колоссальными бюджетами, доступными исключительно технологическим гигантам первого эшелона. Первичные этапы разработки больших языковых моделей требуют запредельной концентрации вычислительных мощностей. Например, для предварительного обучения модели Llama 2 на 7 млрд параметров потребовалось около 184 тысяч GPU-часов работы ускорителей NVIDIA A100, что эквивалентно сотням тысяч долларов прямых облачных затрат. Полный цикл предобучения современных флагманских систем с нуля (pre-training from scratch) обходится в миллионы долларов США, создавая непреодолимый барьер для 99% предприятий мирового рынка.

Полносвязное обучение базовой модели с нуля превратилось в экономическую ловушку. С ростом объёмов обучающих наборов данных и числа параметров затраты на вычисления растут экспоненциально, тогда как прирост практической ценности для конкретных бизнес-приложений начинает подчиняться закону убывающей отдачи. Бизнесу не нужен универсальный «космический сверхразум», знающий все языки мира и способный писать стихи. Компании требуют жёстко сфокусированной функциональности, безупречного понимания отраслевого контекста (юридического, финансового, медицинского или технического) и минимальной стоимости инференса на единицу транзакции.

В ответ на этот экономический вызов зародилась концепция бережливого ИИ (Frugal AI), переносящая фокус с экстенсивного наращивания вычислительного масштаба на технологии точечного переноса интеллекта и оптимизации параметров. Ярким доказательством доминирования этой парадигмы в 2025–2026 годах стал успех дистиллированных версий открытых моделей. Дистиллированные модели рассуждения, такие как DeepSeek-R1-Distill-Qwen-32B, продемонстрировали выдающиеся логические способности на сложнейших математических бенчмарках (72,6% на тесте AIME 2024), обойдя по качеству многие закрытые коммерческие системы. При этом стоимость их создания составила лишь ничтожную долю от затрат на R&D родительских моделей рассуждений — за счёт заимствования цепочек рассуждений на этапе обучения.

Бизнес-акцент: две парадигмы инвестиций в ИИ 

- Предобучение с нуля (Pre-training from scratch): создание фундаментальных онтологических связей. Требует триллионы токенов и миллионы долларов CapEx. Оправдано для 0,1% компаний на планете.
- Бережливая инженерия (Frugal AI): использование открытых весов сильных базовых моделей и их точечное дообучение, сжатие или математический перенос весов. Снижает затраты на внедрение ИИ на 2–3 порядка.

2. Дистилляция знаний ИИ (Knowledge Distillation): перенос «цифрового опыта»

Дистилляция знаний ИИ (Knowledge Distillation) — это метод сжатия моделей, при котором компактная модель («студент») обучается воспроизводить поведение и внутренние логические зависимости гораздо более крупной и сложной модели («учителя»). Родоначальником этого подхода в глубоком обучении считается Джеффри Хинтон, который показал, что обученная нейросеть хранит внутри себя огромный пласт скрытых знаний (dark knowledge), не выражаемых жёсткими метками классов.

В традиционном контролируемом обучении (SFT) модель штрафуется на основе жёстких целей (hard targets) — фактически правильных ответов. Например, если в тексте пропущено слово, жёсткая цель кодируется вектором-заглушкой (one-hot vector), где правильный токен имеет вероятность 1,0, а остальные — 0,0. Однако такой подход игнорирует внутренние сомнения и логическую структуру распределения вероятностей, вычисленную сильной моделью-учителем. Дистилляция знаний опирается на мягкие цели (soft targets) — полные выходные распределения вероятностей (логиты) учителя. Мягкие цели содержат бесценную структурную информацию: модель-учитель сообщает студенту не просто правильный ответ, но и то, насколько близкими по смыслу она считает другие варианты и какие ошибки считает абсолютно недопустимыми.

Математически дистилляция по выходам оптимизирует функцию потерь, объединяющую классическую кросс-энтропию со сдвинутыми целями и KL-дивергенцию (Кульбака — Лейблера) между распределениями вероятностей учителя и студента. Чтобы сделать скрытые знания более явными, логиты перед подачей в функцию softmax масштабируются с помощью температурного коэффициента T. При повышенных значениях T распределение вероятностей сглаживается, позволяя студенту улавливать даже тонкие нюансы логики учителя в малозначительных токенах.

Три типа дистилляции знаний

  • Дистилляция по выходу (Response-based KD) — студент максимально точно имитирует финальные предсказания учителя (распределение вероятностей на выходном слое softmax). Это самый простой в реализации и самый популярный метод.
  • Дистилляция по внутренним слоям (Feature-based KD) — студент обучается воспроизводить промежуточные представления и скрытые состояния (activation maps) слоёв учителя. Метод передаёт не только ответы, но и промежуточные этапы абстракции информации.
  • Дистилляция по связям (Relation-based KD) — студент оптимизирует параметры так, чтобы геометрические и топологические связи между эмбеддингами разных токенов в его латентном пространстве соответствовали структуре латентного пространства учителя.

Кроме того, критическим прорывом стало появление on-policy дистилляции (например, метод GOLD — General On-Policy Logit Distillation). В отличие от классического off-policy подхода, где студент пассивно учится на заранее собранных логах учителя, on-policy дистилляция заставляет студента генерировать собственные ответы «на лету», которые в режиме реального времени корректируются и перевзвешиваются логитами учителя. Это радикально ускоряет сходимость и повышает стабильность модели на сложных логических задачах.

3. Learned Embedding Propagation (LEP): языковая адаптация LLM без SFT-дообучения

Одной из острейших прикладных задач для бизнеса в СНГ остаётся адаптация мощных открытых англоязычных моделей (таких как Llama 3 или Mistral) для безупречной работы с русским языком. Традиционный пайплайн адаптации включает расширение словаря, инициализацию новых эмбеддингов, долгое продолженное предобучение (CPT) на русскоязычном корпусе и повторное инструктивное дообучение (SFT) для выравнивания модели.

Проблема когнитивного забывания при языковой адаптации

Классический процесс адаптации чрезвычайно дорог и сопряжён с риском когнитивного забывания (catastrophic forgetting): модель может начать говорить по-русски, но полностью утратить рассуждающие способности, приобретённые на английском языке. Группа исследователей из МГУ имени М.В. Ломоносова предложила метод Learned Embedding Propagation (LEP), который переносит инструктивные способности из англоязычного контура в русскоязычный напрямую, минуя стадию повторного дорогостоящего SFT.

Математическая суть метода LEP

На входе — базовая модель LLM_base, состоящая из матрицы входных эмбеддингов I_base, внутренних весов W_base и выходной проекционной головы O_base:

LLM_base = I_base × W_base × O_base

В результате классического англоязычного инструктивного дообучения получаем выровненную модель LLM_base_to_inst, в которой изменены все три компонента:

LLM_base_to_inst = I_inst × W_inst × O_inst = I_base × D_inst × W_inst × U_inst × O_base

Здесь D_inst и U_inst — операторы трансформации входных и выходных эмбеддингов при переходе к инструктивной версии.

Если провести обычную языковую адаптацию базовой модели к русскому языку (через токенизатор SentencePiece и CPT на русском корпусе), получаем русскоязычную базовую модель LLM_base_to_ru с новыми русскими эмбеддингами I_ru и O_ru, построенными на базе матриц преобразования словарей T_ru:

LLM_base_to_ru = T_ru × I_base × W_base × O_base × T_ruᵀ = I_ru × W_base × O_ru

Цель — получить русскоязычную инструктивную модель LLM_ru_to_inst. Исследователи МГУ доказали, что траектория обновления весов при тонкой настройке аппроксимируется линейными преобразованиями параметров базовой модели. Это означает, что не требуется проводить SFT-обучение внутренних слоёв W_ru_to_inst: можно взять готовые инструктивные веса оригинальной английской модели W_inst и применить к новым русским эмбеддингам скорректированные операторы преобразования D^ru_inst и U^ru_inst:

LLM_ru_to_inst = T_ru × I_base × D^ru_inst × W_ru_to_inst × U^ru_inst × O_base × T_ruᵀ

Для нахождения оптимальных D^ru_inst и U^ru_inst исследователи используют метод наименьших квадратов и псевдообратные матрицы на пересекающемся подмножестве токенов (common tokens) C:

D^ru_inst = (T_ru × I_base)⁻¹ × T_ru × I_inst

U^ru_inst = O_inst × T_ruᵀ × (O_base × T_ruᵀ)⁻¹

Метод позволяет мгновенно «привить» выровненное инструктивное поведение новой русскоязычной модели без единого шага градиентного спуска по её внутренним слоям. Как показывают результаты тестирования на бенчмарке Darumeru (см. Таблицу 2 в Разделе 5), LEP-модели восстанавливают и превосходят исходное качество генерации, полностью сохраняя когнитивный потенциал родительских сетей.

4. LoRA и QLoRA дообучение: как снизить барьер входа при адаптации LLM

Когда компании всё же требуется провести тонкую настройку модели под узкоспецифичные корпоративные данные (например, обучить модель фирменному стилю общения с клиентами или строгому следованию внутренним регламентам безопасности), полносвязное обучение (Full Fine-Tuning) становится экономически нерациональным. Изменение всех миллиардов весов требует колоссального объёма видеопамяти для хранения градиентов и состояний оптимизатора: для AdamW требуется в 4 раза больше памяти, чем весят сами веса модели.

Эту проблему решает концепция Parameter-Efficient Fine-Tuning (PEFT) и её флагманская технология — низкоранговая адаптация LoRA (Low-Rank Adaptation), предложенная Эдвардом Ху из Microsoft. LoRA базируется на гипотезе о том, что изменение весов модели в процессе тонкой настройки под конкретную задачу имеет низкую внутреннюю размерность (low intrinsic dimensionality).

Вместо изменения исходной матрицы весов W размерностью d × k, LoRA полностью замораживает её, предотвращая любые изменения базовых знаний. Рядом с ней параллельно внедряются две небольшие матрицы низкого ранга: матрица A размерностью d × r и матрица B размерностью r × k, где ранг r является гиперпараметром (r ≪ min(d, k), обычно выбирается r = 8 или r = 16).

Исходное вычисление выходного сигнала y = W × x заменяется на:

y = W × x + (alpha / r) × B × A × x

Здесь alpha — коэффициент масштабирования, стабилизирующий обучение при изменении ранга r.

Матрица A инициализируется случайными значениями из нормального распределения, а матрица B — нулями. В самом начале обучения добавочный член равен нулю, и модель ведёт себя ровно так же, как исходная замороженная сеть. В процессе обучения настраиваются только параметры матриц A и B. Это позволяет сократить количество обучаемых параметров на 99% (например, со 124 млн до 2,7 млн для моделей класса GPT-2), снижая требования к оборудованию до уровня одной пользовательской видеокарты.

От LoRA к QLoRA: три технологических прорыва

Развитием этой технологии стал метод QLoRA (квантованная LoRA), разработанный Тимом Деттмерсом. QLoRA объединяет три технологических прорыва:

  • 4-битное квантование в формате Double Quantized NF4 (NormalFloat 4): базовые веса модели сжимаются в высокоэффективный 4-битный формат без значимой потери точности, что позволяет загрузить модель класса 70B на один сервер.
  • 16-битные LoRA-адаптеры (bfloat16) поверх квантованной базы — для вычисления градиентов во время обратного прохода.
  • Постраничные оптимизаторы (Paged Optimizers) — механизм подкачки памяти в реальном времени, предотвращающий критические ошибки нехватки памяти (OOM) при обработке длинных пакетов данных за счёт бесшовного обмена между RAM и VRAM.
Важнейший технологический синергизм: LoRA и QLoRA 

- LoRA замораживает базовую модель и оптимизирует матрицы низкого ранга, сокращая размер адаптера до нескольких мегабайт.
- QLoRA позволяет дообучать модели класса 70B на потребительском оборудовании, сжимая базовые веса в NF4 и сохраняя высокую точность градиентного спуска.

5. Компаративный анализ и стратегическая матрица принятия решений

Для систематизации рассмотренных бережливых методов ниже представлено сопоставление их технико-экономических параметров, полученное на основе практических данных исследований МГУ, Hugging Face SmolLM3 и DeepSeek.

Таблица 1. Технико-экономический баланс методов адаптации и оптимизации LLM

Метод оптимизации Доля обучаемых параметров Требуемый объём VRAM Необходимый объём данных Относительная стоимость разработки
Full Fine-Tuning 100% Высокий (≥160 ГБ для 7B) 10k – 100k инструкций Высокая (100%)
LoRA (PEFT) 0,1% – 1,0% Средний (40 ГБ для 7B) 1k – 10k инструкций Низкая (~10%)
QLoRA (NF4) < 0,1% Низкий (16 ГБ для 7B) 1k – 10k инструкций Ультранизкая (~5%)
LEP (МГУ) 0,0% (без SFT) Ультранизкий (только инференс) Не требуются SFT-данные Критически низкая (<1%)
Knowledge Distillation Сжатие до SLM (100% студента) Зависит от размера студента 100k – 1M токенов учителя Средняя (~15%)

Таблица 2. Результаты zero-shot оценки LEP на русскоязычном бенчмарке Darumeru

Данные получены на основе репрезентативной выборки академического отчёта МГУ. LEP-Extended версии моделей показывают полное сохранение когнитивных способностей при переносе на русский язык:

Модель / архитектура DaruMMLU (логика) DaruMERA (эрудиция) DaruSum (суммаризация) Micro-Avg (среднее)
Mistral-7B (базовый уровень) 0.543 0.526 0.322 0.607
Vikhr-5.2 (Mistral-7B CPT+SFT) 0.494 0.573 0.308 0.587
Mistral-7B + LEP-Extended 0.571 0.548 0.315 0.612
LLaMa-3-8B (Instruct Original) 0.571 0.510 0.322 0.610
Saiga (LLaMa-3-8B SFT) 0.574 0.514 0.320 0.608
LLaMa-3-8B + LEP-Extended 0.572 0.512 0.321 0.609

Стратегический компас руководителя: 3-шаговый алгоритм принятия решений

  • Шаг 1. Оценка применимости Prompting + RAG. Прежде чем приступать к обучению, верифицируйте задачу по методу А. Тюльканова: важна ли достоверность? Если да, умеет ли человек находить ошибки в выводе и готов ли взять юридическую ответственность? Внедрите архитектуру извлечения контекста (RAG) на базе сильных готовых API. В 85% корпоративных сценариев (поиск по базам документов, извлечение сущностей) RAG решает задачу без тонкой настройки моделей.
  • Шаг 2. Переход к PEFT (LoRA/QLoRA). Если бизнес-задача требует специфического форматирования ответов, следования сложному стилю (tone-of-voice), строгого соблюдения конфиденциальности или работы со специализированным локальным ПО, используйте QLoRA на базе открытых моделей (Gemma, Llama 3.1 8B). Это позволит ИТ-команде дообучить модель на одной видеокарте RTX 4090 или A100 в течение нескольких часов, потратив менее $100.
  • Шаг 3. Использование LEP и CPT для узкоспециализированных задач. Если нужно адаптировать англоязычную модель под редкий язык или узкоотраслевую терминологию, используйте Learned Embedding Propagation (LEP) от МГУ для переноса инструктивных весов без этапа SFT. При создании экспертных научных ИИ (Sci-LLMs) в регулируемых секторах проводите продолженное предобучение (CPT) только на очищенных, верифицированных базах данных с использованием фильтрации MinHash и дедупликации.

6. Часто задаваемые вопросы

Как дообучить LLM на русском языке без потери логики?

Классический путь — расширение словаря, продолженное предобучение (CPT) и повторное SFT — дорог и рискует вызвать катастрофическое забывание рассуждающих способностей модели. Метод Learned Embedding Propagation (LEP), разработанный в МГУ имени М.В. Ломоносова, переносит уже готовые инструктивные веса англоязычной модели на новые русские эмбеддинги через линейные операторы преобразования, минуя этап SFT. По данным тестов на бенчмарке Darumeru, LEP-модели сохраняют и даже превосходят исходное качество генерации родительской сети.

Чем LoRA отличается от QLoRA?

LoRA замораживает исходные веса модели и обучает только две небольшие матрицы низкого ранга, сокращая число обучаемых параметров на 99%. QLoRA добавляет к этой идее 4-битное квантование базовых весов (NF4), 16-битные LoRA-адаптеры и постраничные оптимизаторы памяти, что позволяет дообучать модели класса 70B на одном потребительском GPU вместо серверного кластера.

Что такое Learned Embedding Propagation (LEP)?

LEP — метод переноса инструктивного поведения между языковыми версиями одной модели без градиентного дообучения внутренних слоёв. Он опирается на предположение, что траектория обновления весов при тонкой настройке аппроксимируется линейным преобразованием, поэтому эмбеддинги нового языка можно скорректировать операторами, вычисленными методом наименьших квадратов.

Можно ли дообучить модель на одной видеокарте?

Да, если применять QLoRA: 4-битное квантование сжимает базовые веса настолько, что модель класса 7B помещается в 16 ГБ видеопамяти. Дообучение на карте уровня RTX 4090 или A100 обычно занимает несколько часов и обходится компании менее чем в $100.