26
прогноз), для чего применяется рандомизация — использование различных
подвыборок из обучающей выборки. Способность решающих деревьев сильно
изменять прогноз при небольшом изменении обучающей выборки позволяет
получить алгоритмы с отличающимся ответом. [15]
Одним из самых популярных методов рандомизации является бутстрап. Он
заключается в формировании подвыборки длинной ℓ путем случайного взятия с
возвращением объектов из обучающей выборки той же длины ℓ. В результате
отдельные объекты попадут в новую выборку два или более раз, другие не
попадут вовсе. В среднем, новая выборка содержит 63% объектов исходной
выборки.
Другой метод рандомизации — формирование случайного подмножества
на основе обучающей выборки. При этом дополнительной задачей при
построении модели является подбор размера обучающей подвыборки.
Для повышения качества ответов композиции алгоритмов необходимо,
чтобы они как можно меньше коррелировали друг с другом. Это позволяет
уменьшить разброс ответов базовых алгоритмов. Поскольку обучение
проводится на одной выборке, то корреляция неизбежна. Для уменьшения
степени корреляции на практике зачастую применяется метод случайных
подпространств. Он заключается в случайном выборе при формировании
подмножества признаков для каждого базового алгоритма. При использовании
данного метода появляется задача подбора размера этого подмножества.
Один из наиболее распространенных методов объединения решающих
деревьев в композиции носит название случайного леса. [13]
При построении модели на основе случайного леса для повышения
качества применяется рандомизация на этапе построения базового алгоритма.
При этом для разбиения подмножества, пришедшего в очередную вершину, на
два поддерева подбор оптимального значения параметра j идет с использованием
случайного подмножества признаков размерности q. Данный подход позволяет
снизить степень корреляции между базовыми алгоритмами.