Машинное обучение (Machine Learning)

Машинное обучение (Machine Learning) — процесс автоматического обучения и совершенствования поведения системы искусственного интеллекта на основе обработки массива обучающих данных без явного программирования.

Машинное обучение классифицируется на два больших раздела:

Классическое машинное обучение (Classic Machine Learning, Classic ML), основанное на «неглубоких» алгоритмах и методах математической статистики.

Глубокое обучение (Deep Learning), основанное на архитектурах и технологии искусственных нейронных сетей. 

Базовые термины в области машинного обучения

Алгоритмы машинного обучения (Machine Learning Algorithms) — математические методы моделирования, используемые для изучения или выявления внутренних закономерностей и правил, заложенных в данных.

Метод машинного обучения (Machine Learning Methods) – это конкретный метод тренировки алгоритма машинного обучения, зависящий от наличия или отсутствия разметки данных.

Модель машинного обучения (Machine learning model) — представление алгоритма или ансамбля алгоритмов машинного обучения с фиксированными весами, полученными в результате его обучения.

Упакованная модель машинного обучения (ML model packaging) – совокупность самой модели машинного обучения, блока проверки входных признаков для модели и выходных данных модели, а также блока обработки признаков и формирования расчетных признаков, объединенных единым программным кодом.

Термин «Признаки» и связанные с ними определения

Для создания моделей машинного обучения необходимы данные в виде значений признаков, представляющие собой примеры решений, статистики, расчеты, показатели или исторические события, а также алгоритмы машинного обучения в качестве инструментов самого обучения.

Признак (Features) — достаточное условие для принадлежности объекта некоторому классу. В менее строгих науках слово «признак» употребляется, как описание фактов, позволяющих сделать вывод о наличии интересующего явления».

Входные признаки для модели (Input Data) — это данные, которые подаются на вход упакованной модели. Входные признаки для модели могут состоят из входных признаков для алгоритма и дополнительных признаков, из которых формируются входные признаки для алгоритма.

Расчетные признаки — это входные признаки для алгоритма, значения которых формируются внутри упакованной модели на основе входных данных.

Обязательные признаки — это перечень входных признаков, наличие значений которых обязательно для построения прогноза с помощью упакованной модели.

Термины в области алгоритмов машинного обучения

Ансамбль алгоритмов (Ensemble learning) — подход, который использует несколько алгоритмов машинного обучения с целью получения лучшей эффективности прогнозирования, чем можно было бы получить от каждого алгоритма по отдельности.

Бустинг (Boosting) — метод построения ансамбля однородных алгоритмов, в котором каждый следующий алгоритм стремится компенсировать недостатки композиции всех предыдущих алгоритмов.

Бэггинг (Bagging) — метод построения ансамбля однородных алгоритмов, в котором обучение базовых алгоритмов производится параллельно на отдельной выборке, сформированной из исходного набора данных с помощью бутстрэпинга.

Cтекинг (Stacking) — метод построения ансамбля, в котором происходит обучение нескольких разнородных алгоритмов на исходных данных и передача их результатов на вход последнему, который называют мета-алгоритмом.