Машинное обучение (Machine Learning)
Машинное обучение (Machine Learning) — процесс автоматического обучения и совершенствования поведения системы искусственного интеллекта на основе обработки массива обучающих данных без явного программирования.
Машинное обучение классифицируется на два больших раздела:
Классическое машинное обучение (Classic Machine Learning, Classic ML), основанное на «неглубоких» алгоритмах и методах математической статистики.
Глубокое обучение (Deep Learning), основанное на архитектурах и технологии искусственных нейронных сетей.
Базовые термины в области машинного обучения
Алгоритмы машинного обучения (Machine Learning Algorithms) — математические методы моделирования, используемые для изучения или выявления внутренних закономерностей и правил, заложенных в данных.
Метод машинного обучения (Machine Learning Methods) – это конкретный метод тренировки алгоритма машинного обучения, зависящий от наличия или отсутствия разметки данных.
Модель машинного обучения (Machine learning model) — представление алгоритма или ансамбля алгоритмов машинного обучения с фиксированными весами, полученными в результате его обучения.
Упакованная модель машинного обучения (ML model packaging) – совокупность самой модели машинного обучения, блока проверки входных признаков для модели и выходных данных модели, а также блока обработки признаков и формирования расчетных признаков, объединенных единым программным кодом.
Термин «Признаки» и связанные с ними определения
Для создания моделей машинного обучения необходимы данные в виде значений признаков, представляющие собой примеры решений, статистики, расчеты, показатели или исторические события, а также алгоритмы машинного обучения в качестве инструментов самого обучения.
Признак (Features) — достаточное условие для принадлежности объекта некоторому классу. В менее строгих науках слово «признак» употребляется, как описание фактов, позволяющих сделать вывод о наличии интересующего явления».
Входные признаки для модели (Input Data) — это данные, которые подаются на вход упакованной модели. Входные признаки для модели могут состоят из входных признаков для алгоритма и дополнительных признаков, из которых формируются входные признаки для алгоритма.
Расчетные признаки — это входные признаки для алгоритма, значения которых формируются внутри упакованной модели на основе входных данных.
Обязательные признаки — это перечень входных признаков, наличие значений которых обязательно для построения прогноза с помощью упакованной модели.
Термины в области алгоритмов машинного обучения
Ансамбль алгоритмов (Ensemble learning) — подход, который использует несколько алгоритмов машинного обучения с целью получения лучшей эффективности прогнозирования, чем можно было бы получить от каждого алгоритма по отдельности.
Бустинг (Boosting) — метод построения ансамбля однородных алгоритмов, в котором каждый следующий алгоритм стремится компенсировать недостатки композиции всех предыдущих алгоритмов.
Бэггинг (Bagging) — метод построения ансамбля однородных алгоритмов, в котором обучение базовых алгоритмов производится параллельно на отдельной выборке, сформированной из исходного набора данных с помощью бутстрэпинга.
Cтекинг (Stacking) — метод построения ансамбля, в котором происходит обучение нескольких разнородных алгоритмов на исходных данных и передача их результатов на вход последнему, который называют мета-алгоритмом.
