Диплом: Применение анализа больших данных и алгоритмов машинного обучения в медицинской практике

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
73
метода трапеций, который использует линейную интерполяцию и может быть
слишком оптимистичным (рис. 36).
Рис.36. Средний показатель точности
Еще одной метрикой качества, при использовании модели классификации
на основе логистической регрессии, служит логистическая функция потерь,
которая определяется следующим образом:
где ŷ — ответ алгоритма на i-м объекте, y - истинная метка класса на данном
объекте, l - размер выборки.
Интуитивно можно представить минимизацию данной метрики как задачу
максимизации доли правильных ответов путем штрафа за ошибочные
предсказания. При этом стоит отметить, что уровень штрафа коррелирует с
уверенностью алгоритма в неправильном ответе.
Для расчета логистической функции потерь используется функция log_loss
модуля metrics, которой на вход необходимо передать вероятности меток классов
(рис. 37).
Рис.38 Оценка логистической функции потерь
3.7 Алгоритм случайного леса
Для задачи бинарной классификации можно применить алгоритмы на
основе решающих деревьев, в частности — случайный лес.
74
С этой целью необходимо выполнить импорт модуля ensemble из
библиотеки Scikit-Learn (рис. 39). [13]
Рис.39. Импорт модуля для работы с композициями деревьев
С помощью данного модуля создается объект класса
RandomForestClassifier, представляющий собой классификатор на основе
алгоритма случайного леса (рис. 40).
Рис.40 Создание объекта решающего дерева
Данный класс принимает на входе такие параметры, как количество
деревьев и их максимальная глубина.
Далее выполняется обучение модели с помощью метода fit (рис. 41).
Рис.41. Обучение модели случайного леса
Для оценки качества полученной модели применяется та же стратегия
кросс-валидации, что и в случае использования линейной модели (рис. 42).
Рис.42. Оценка полученной модели с помощью кросс-валидации
Оценка предсказательной способности модели выполняется с помощью
отложенной тестовой выборки, (рис. 43) при этом рассматриваются те же
показатели, что и в случае применения классификатора на основе логистической
регрессии.
75
Рис. 43 Построение предсказаний на основе полученной модели
Для расчета матрицы ошибок так же применяется функция
confusion_matrix модуля metrics (рис. 44).
Рис. 44. Построение матрицы совпадений
Оценка параметра точности для объектов группы риска (рис 45).
Рис. 45. Оценка параметра accuracy для объектов первого класса
Оценка параметра полноты для объектов группы риска (рис. 46).
Рис. 46. Оценка параметра recall для объектов первого класса
Выполнение интегративной оценки — F-меры (рис. 47).
Рис. 47. Оценка F-меры модели на основе алгоритма случайного леса
Проведем сравнительную характеристику двух использованных
алгоритмов машинного обучения. Для этого выведем сводные таблицы оценок
качества обоих алгоритмов (рис. 48).
Рис. 48. Расчет сводной таблицы
76
На приведенной таблице видно, что алгоритмы обладают примерно
одинаковыми показателями метрик качества, с незначительными
преимуществами на стороне линейной модели (рис. 49).
Рис. 49 Сводная таблица метрик качества.
Полученные результаты позволяют использовать приведенные модели в
качестве скрининга для выявления части пациентов, находящихся в группе
риска, с целью проведения дальнейшей диагностики и проведения
превентивного лечения, позволяющего избежать наступления нарушения
мозгового кровообращения.
К преимуществам данной методики относится ее малозатратность на этапе
как стратификации риска, так и получения данных о новом пациенте, поскольку
модель учитывает доступные параметры, не требующие дорогостоящего
обследования.
Для повышения качества алгоритма необходим ряд мер, в частности
увеличение объема выборки, включение в число параметров результатов
объективных исследований, таких как биохимических (например, липидный
профиль крови, маркеры воспаления), инструментальных (ультразвуковая
доплерография), генетических.
77
ЗАКЛЮЧЕНИЕ
Целью данной выпускной квалификационной работы было изучение
применения методов машинного обучения в медицинской практике на основе
построения модели, позволяющей выявить пациентов из группы высокого риска
по развитию острого нарушения мозгового кровообращения. Для ее достижения
были рассмотрены этапы развития машинного обучения; изучены основные
алгоритмы машинного обучения, применяемые на сегодняшний день, такие как
линейная регрессия, решающие деревья и их композиции, нейронные сети, метод
k-ближайших соседей, самоорганизующиеся карты Кохонена.
Изучены особенности медицинской информации, имеющие практическую
значимость, такие как неоднородность, большие объемы, трудность
интерпретации.
Для построения практической модели был выбран набор данных, проведен
его анализ. Изучена актуальность темы предотвращения инсульта за счет
проведения превентивной терапии.
Проведено изучение инструментария, необходимого для построения
моделей, их обучения, визуализации и оценки качества. В качестве средств
разработки выбраны язык программирования Python, библиотеки Sci-Kit Learn,
NumPy, Pandas, MatPlotLib. В качестве среды разработки и визуализации выбран
пакет Anaconda.
Построены две модели классификаторов на основе различных алгоритмов
машинного обучения: линейная модель на основе логистической регресии и
модель на основе композиции решающих деревьев в форме «случайного леса».
Была дана характеристика различным метрикам качества, таким как доля
правильных ответов, точность, полнота, площадь под кривой ошибок, кривая
точности-полноты, приведена их интерпретация. Проведена сравнительная
оценка построенных моделей на основе данных метрик.
78
В процессе выполнения квалификационной работы достигнута основная
цель — разработана математическая модель на основе алгоритмов машинного
обучения, имеющая практическую применимость. Модель имеет
удовлетворительные характеристики точности и полноты в рамках
предоставленной для обучения выборки, и позволяет выявить часть пациентов,
относящихся к группе высокого риска. Ее применение в медицинской практике
не требует больших финансовых затрат, поскольку основано на применении
признаков, не требующих проведения дорогостоящих исследований.
Дальнейшее увеличение объема выборки на этапе применения может
способствовать дальнейшему повышению качества модели.
Применение данной модели в качестве скринингового метода способно
выявить часть пациентов, требующих проведения превентивного лечения, что
позволит предотвратить наступление инвалидизации и летального исхода.
79
БИБЛИОГРАФИЯ
1. Аладышев А.В. и др. Основы медицинской информатики: учебно-
методическое пособие / Издательство Алтайский государственный
медицинский университет, 2008. - 140 с.
2. Бринк Х. Машинное обучение СПб.: Питер, 2017. — 336 с.
3. Вандер Плас Дж. Python для сложных задач. Наука о данных и машинное
обучение. СПб.: Питер, 2018. — 576 с.
4. Воронцов К.В. Математические методы обучения по прецедентам
(теория обучения машин), 2008 — 141 с.
5. Вьюгин В.В. Математические основы теории машинного обучения и
прогнозирования М.: МЦНМО, 2013. — 390 с.
6. Гелиг А. Введение в математическую теорию обучаемых распознающих
систем и нейронных сетей. Учебное пособие. - СПбГУ, 2014. - 224 с.
7. Гудфеллоу Я., Бенджио И., Курвилль А. Глубокое обучение. - М.: ДМК-
Пресс, 2018 — 652 с.
8. Гусев Е.И. (ред.) Неврология. Национальное руководство. М:. ГЭОТАР-
Медиа. - 2009. - 1035 с.
9. Доноской В.П. Алгоритмические модели обучения классификации:
обоснование, сравнение, выбор. - Симферополь: ДИАЙПИ, 2014. -228 с.
10. Жерон О. Прикладное машинное обучение с помощью Scikit-Learn и
TensorFlow. Концепции, инструменты и техники для создания
интеллектуальных систем. М.: O'Reilly Media, 2018. — 688 с.
11. Королюк И.П.. Медицинская информатика : Учебник - 2 изд., перераб. и
доп. - Самара : ООО «Офорт» : ГБОУ ВПО «СамГМУ». 2012.— 244 с.
12. Матвеев С.В. Неврология. Цикл лекций. СЗГМУ им. Мечникова. - 2013. -
176 с.
13. Мюллер А., Гидо С. Введение в машинное обучение с помощью Python
М.: O'Reilly Media, 2017. — 392 с.
80
14. Назаренко Г.И., Г.С. Осипова. Медицинские информационные системы:
теория и практика - М. : ФИЗМАТЛИТ, 2005. - 320 с.
15. Ричарт В. Построение систем машинного обучения на языке Python. - М.:
ДМК-Пресс. - 2015. - 302 с.
16. Силен Д., Мейсман А., Али М. Основы Data Science и Big Data. Python и
наука о данных СПб.: Питер, 2017. — 336 с.
17. Стаховская Л. В. Инсульт : руководство для врачей. - М. : Мед. информ.
агентство, 2014. - 397 c.
18. Хант Э. Искусственный интеллект. - М.: Мир, 1978. — 558 с.
19. Хейдт М. Изучаем Pandas. М.: ДМК-Пресс. - 2015. - 432 с.
20. Щепин О.П. Общественное здоровье и здравоохранение: учебник /. -
2011. - 592 с.
21. Holland J.H. Adaptation in Natural and Artificial Systems. An Introductory
Analysis with Applications to Biology, Control, and Artificial Intelligence. -
MIT Press, 1992. — 225 p.
22. Mitchell Tom. Machine Learning. - McGraw Hill, 1997. - 432 p.
23. Большие данные и машинное обучение: новые возможности для
медицины. [Электронный ресурс]. 22 октября 2017 - URL
https://habr.com/company/spbifmo/blog/340668/ (дата обращения:
28.06.2018)
24. Гогина О. А. Основные стандарты и модели интеграции медицинских
информационных систем // Молодой ученый. — 2017. — №18. — С. 8-11.
лектронный ресурс]. URL https://moluch.ru/archive/152/43122/ (дата
обращения: 28.06.2018).
25. Зайдулин Р. Будущее уже наступило: как искусственный интеллект
применяется в медицине. [Электронный ресурс]. vc.ru — 2018. URL
https://vc.ru/32237-budushchee-uzhe-nastupilo-kak-iskusstvennyy-intellekt-
primenyaetsya-v-medicine (дата обращения 22.07.2018)

Смотрите также:

"Автоматизация обработки заявок ООО "Проектно-Строительная Компания"
"Автоматизация процесса аттестации персонала для ООО "Нэт Бай Нэт Холдинг"
"Анализ интернет-активности конкурентов ( на примере конкурентов "Газпром нефть")
"Бухгалтерский учёт и аудит расчётов с подотчётними лицами в организации на примере ООО "ЛОЦ 10""
«Психологическое сопровождение персонала в организации на примере ООО «Крокус»
Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR как средство продвижения организации (на примере ПАО "Тамбовский завод "Комсомолец им. Н.С. Артемова")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран