
64
Применение подобного регуляризатора позволяет проводить отбор признаков.
Кроме того, модель, использующая L
1
-регуляризацию, менее подвержена
влиянию «выбросов» в ходе обучения.
Модель логистической регрессии, применяемая в данной работе, по
умолчанию использует L
2
-регуляризатор.
При использовании отложенной выборки для оценки качества следует
учитывать тот факт, что существует угроза переобучения модели на ней,
поскольку из всего семейства алгоритмов отбирается тот, который предоставляет
на ней лучшую оценку качества. Для избежания подобного эффекта рационально
использовать усложненную модель разбиения.
В случае использования отложенной выборки разбиение выполняется на
три части: обучающую, валидационную и контрольную. Каждый алгоритм,
подготовленный на основе обучающей выборки, проходит оценку качества на
валидационной. Алгоритм, показавший наилучшие оценки качества,
проверяется на контрольной выборке во избежание явления переобучения на
валидационной выборке.
При использовании стратегии кросс-валидации целесообразно проводить
разбиение на две части, первая из которых применяется для обучения
алгоритмов и усредненной оценки качества, вторая используется в качестве
контрольной. Для применения стратегии кросс-валидации необходимо
импортировать соответствующие модули библиотеки Scikit-Learn:
cross_validation и cross_validate (рис 20). Кроме того, необходимо импортировать
модуль linear_model, непосредственно для построения линейной модели, а также
модуль metrics для оценки качества алгоритмов.
Рис. 20. Импорт библиотек, необходимых для построения и оценки линейной модели
Следующим этапом выполняется разбиение выборки на обучающую и
контрольную выборку в соотношении 0.7/0.3 (рис. 21):