Диплом: Применение анализа больших данных и алгоритмов машинного обучения в медицинской практике

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
3
СОДЕРЖАНИЕ
ВВЕДЕНИЕ ……………………………………………………………………....….5
ГЛАВА 1. ОБЩИЕ ВОПРОСЫ МАШИННОГО ОБУЧЕНИЯ..…….…………....8
1.1 История развития машинного обучения…..……….……….………………….8
1.1.1 Золотой век искусственного интеллекта……………………………....8
1.1.2 Кризис машинного бучения……………..……………………...……12
1.1.3 Возрождение интереса к машинному обучению………..…………...13
1.2 Характеристика основных методов машинного обучения…………………..15
1.2.1 Обучение с учителем………………………………………………….15
1.2.1.1 Линейная регрессия…………………………………………..16
1.2.1.2 Линейная классификация…………………………………….20
1.2.1.3 Решающие деревья…………………………………...……….22
1.2.1.4 Случайный лес………………………………………………...25
1.2.1.5 Градиентный бустинг…………………………………………27
1.2.1.6 Нейронные сети……………………………………………….29
1.2.2 Обучение без учителя………………………………………….........……....33
1.2.2.1 Метод k-средних………………………………………………33
1.2.2.2 Самоорганизующиеся карты Кохонена……………………..35
ГЛАВА 2. ОСОБЕННОСТИ МЕДИЦИНСКИХ ДАННЫХ.................................38
2.1 Определение и классификация медицинской информации…………………38
2.2 Особенности сбора медицинской информации……………………………....40
2.3 Особенности хранения и передачи медицинских данных…………………...42
4
ГЛАВА 3. ПРИМЕНЕНИЕ МАШИННОГО ОБУЧЕНИЯ ДЛЯ ВЫЯВЛЕНИЯ
ПАЦИЕНТОВ ИЗ ГРУППЫ РИСКА ПО РАЗВИТИЮ
ИНСУЛЬТА.………...................................................................................................45
3.1 Характеристика понятия инсульт...............................…………………….…..45
3.2 Описание датасета………………………………………………………….…..48
3.3 Применяемый инструментарий……………………...…………………….….49
3.4 Загрузка данных и их подготовка…………………….……………………...52
3.5 Разбиение выборки. …………………………………………………………....61
3.6. Метрики качества……………………………………………………………...65
3.7 Алгоритм случайного леса…………………………………………………….73
ЗАКЛЮЧЕНИЕ …………………………………………………………….............77
БИБЛИОГРАФИЯ……………………………..………...............………................79
5
ВВЕДЕНИЕ
Начало XXI века в области информационных технологий характеризуется
все более широким применением технологий машинного обучения, что
обусловлено развитием вычислительных мощностей, взрывным ростом объемов
доступной информации, развитием технологий ее хранения и передачи, а также
высоким спросом на данные технологии со стороны бизнес-сообщества. Успех
большинства крупных современных компаний, таких как Google, Amazon,
Microsoft в значительной степени связан с развитием и применением технологий
обработки информации. Широкое применение модели на основе машинного
обучения получили в банковской сфере, где их внедрение позволило
минимизировать риски при выдаче займов; в страховом бизнесе. Применение
рекомендательных систем в электронной коммерции позволяет значительно
увеличить объем продаж, в сравнении с более традиционными методиками
ведения бизнеса.
Благодаря все большей доступности, и видимым успехам от внедрения,
технологии машинного обучения стали проникать в столь консервативную
область человеческой деятельности, как медицина. Их применение позволяет
выявлять заболевания на ранней стадии, например, в таких областях как
онкология, что значительно повышает шансы на успешный исход лечения. К
подобным системам относятся такие проекты как Google Deep Health и IBM
Watson. По оценке корпорации Google, каждый десятый пациент страдает от
неверной интерпретации информации. Применение решений, основанных на
машинном обучении, в качестве рекомендательных систем, цифровых
ассистентов докторов позволяет минимизировать подобные ошибки [25].
В частности, IBM Watson применяется в таких областях, как онкология,
кардиология, флебология. Проект Google Deep Health работает в четырех
крупных клиниках США и Великобритании, занимаясь интерпретацией
визуальной информации, полученной в результате выполнения
инструментальных методов исследования.
6
Спрос на подобные разработки активно растет: по прогнозам агентства
Frost & Sullivan, объем одного только рынка медицинских разработок,
использующих машинное обучение и большие данные, увеличивается на 40%
ежегодно и к 2021 году составит 6,6 миллиардов долларов [23]. То же агентство
отмечает, что технологии машинного обучения повышают точность постановки
диагнозов на 30 — 40%, при этом стоимость медобслуживания снижается на
половину.
Целью данной выпускной квалификационной работы является изучение
возможностей применения алгоритмов машинного обучения в медицинской
практике на основе разработки математической модели, предназначенной для
выявления пациентов из группы высокого риска, угрожаемых по развитию
острого нарушения мозгового кровообращения.
Для достижения поставленной цели необходимо выполнить следующие задачи:
изучить развитие технологий машинного обучения
изучить основные алгоритмы машинного обучения
изучить особенности медицинской информации
изучить предметную область применения модели классификации
изучить инструментарий, необходимый для построения математической
модели
разработать и обучить модели машинного обучения, основанные на
различных алгоритмах; сравнить результаты их работы
Объектом исследования в данной работе является применение алгоритмов
машинного обучения в медицинской практике с целью выявления пациентов из
группы высокого риска для проведения превентивного лечения.
Предметом исследования является создание математической модели,
инструменты и методы ее разработки.
Практическая значимость данной работы — потенциальное выявление
пациентов из группы высокого риска с целью проведения превентивного
лечения, что позволит избежать инвалидизации или летального исхода из-за
инсульта.
7
Выбранная тема является актуальной, поскольку инсульт является
преобладающей причиной инвалидизации населения, а уровень заболеваемости
среди населения остается высоким и составляет до 740 случаев на 100 000
населения.
Для изучения темы работы исследовались многочисленные источники
информации, как отечественных, так и зарубежных авторов.
8
ГЛАВА 1. ОБЩИЕ ВОПРОСЫ МАШИННОГО ОБУЧЕНИЯ
1.1 История развития машинного обучения
1.1.1 Золотой век искусственного интеллекта
Одной из первых работ, определивших такое направление науки, как
«искусственный интеллект» стала статья «Вычислительные машины и разум»,
написанная британским ученым Аланом Тьюрингом, и опубликованная в
журнале «Mind» в 1950 году. Основной вопрос работы автор сформулировал
следующим образом: «Способны ли машины думать?». [29] В ходе рассуждений
Алан Тьюринг видоизменяет вопрос, сводя его к следующей формулировке:
«Способна ли машина выполнять действия, которые сторонний наблюдатель не
сможет отличить от обдуманных?». Сам автор отвечает на данный вопрос
утвердительно. В тексте работы автор представляет тест, названный позже
«тестом Тьюринга», прохождение которого и является критерием, позволяющим
ответить на центральный вопрос работы.
В 1956 году ряд американских ученых под руководством Джона Маккарти
организовали семинар продолжительностью в два месяца в Дартмунде, который
был представлен следующим описанием: «Мы предлагаем двухмесячный
исследовательский семинар в составе десяти человек для исследования
искусственного интеллекта в течение лета 1956 года в Дортмундском колледже
Гановера, Нью-Хэмпшир. Отправной точкой исследования является убеждение
в том, что все аспекты обучения, и других проявлений интеллекта, могут быть
настолько точно описаны, что машина может запрограммирована на их
выполнение. Будет сделана попытка выяснить, как машины могут использовать
язык, делать абстракции, решать различные виды задач, которые пока решает
лишь человек, и самообучаться. Мы полагаем, что возможно существенное
продвижение в этом вопросе, если тщательно отобранная группа ученых будет
совместно работать над ним в течение лета.» [30]. Данный семинар, прошедший
с участием десяти ученых из разных университетов, являлся одним из ключевых
9
событий периода становления понятия «машинное обучение». В качестве
основных докладчиков выступили два сотрудника технологического института
Карнеги: Аллен Ньюэлл и Герберт Саймон, представившие программу «Logic
Theorist», которую порой называют «первой программой, на основе
искусственного интеллекта». «Logic Theoretic» имитировал поведение человека
при решении задач, благодаря чему программа смогла выполнить доказательство
38 из 52 теорем, представленных в книге «Принципы математики», найдя при
этом более короткое решение для ряда из них.
Одним из следствий данного семинара стало появление термина
«искусственный интеллект», предложенного Джоном Маккарти.
Другой широко применимый термин - «машинное обучение» - был
впервые озвучен Артуром Самуэлем в 1959 г. В его представлении «машинное
обучение», как дисциплина, изучает те разновидности алгоритмов, которые
способны учиться и делать прогнозы на основании полученных данных, в
отличие от алгоритмов, предусматривающих прямое решение задачи. В своей
работе «Some studies in machine learning using game of chekers» он рассматривает
подобные алгоритмы на примере программы, моделирующей игру в шашки [28].
Артур Самуэль выбрал эту игру, поскольку считал, что ее правила достаточно
просты (что было крайне важно в условиях ограниченных вычислительных
мощностей компьютеров середины 20-го века), но в тоже время обладает
достаточной вариативностью стратегии.
В основе алгоритма Самуэля лежало дерево поиска игровых позиций,
доступных из имеющегося состояния. В связи с небольшим объемом доступной
памяти (первая версия программы работала на ЭВМ IBM 701, имевшей память
2048 или 4096 36-разрядных слов) в программе применялся алгоритм альфа бета
отсечения, позволяющий сократить количество узлов, подлежащих оценке.
Алгоритм оценивал предстоящий ход на основе минимаксной стратегии. Веса
применяемой оценочной функции корректировались на основе анализа партий в
10
исполнении профессиональных игроков и при игре с заведомо более сильной
стороной.
Принципиальным моментом, продемонстрированным Самуэлем, является
способность компьютерной программы к самообучению путем применения
математических методов.
Одно из формальных определений самого понятия обучения в недавнем
прошлом дано Томом Митчеллом и Хиллом Макгроу и звучит следующим
образом: говорят, что программа обучается на опыте E относительно класса
задач T в смысле меры качества L, если при решении задачи T качество,
измеряемое мерой L, возрастает при демонстрации нового опыта E [22].
В 1957 году произошло сразу два знаменательных события в области
машинного обучения, значимость которых хорошо видна в наши дни: советский
математик Андрей Николаевич Колмогоров сформулировал теорему, согласно
которой, любая непрерывная функция n аргументов на единичном кубе [0, 1]
n
представима в виде суперпозиции непрерывных функций одного аргумента и
операции сложения. И примерно в тоже время американский нейрофизиолог
Фрэнк Розенблатт предложил математическую модель нейрона, названную им
«перцептроном».
Оба этих открытия послужили основной для развития популярного в
настоящий момент алгоритма машинного обучения, определяемого как
«нейронные сети».
Работа Розенблатта была дальнейшим развитием исследований
биологических нейронов, проводимых такими учеными, как Д.О. Хебб и Уоррен
МакКалох. Именно Маккалох (совместно с Питтсом) первыми описали
концепцию нейронных сетей. Они разработали модель МП-нейрона, которая
основывается на том обстоятельстве, что нерв проводит импульс лишь в том
случае, если будет превышено некое пороговое значение «раздражителя». МП-
нейроны имели детерминированные пороговые значения, и потому не обладали
11
способностью обучаться. Они являлись «жесткими» логическими устройствами,
которые продемонстрировали, что сети простых элементов, имитирующих
нейроны, способны заниматься вычислениями.
Поскольку МП-нейроны не имели механизма обучения, они были крайне
ограничены в моделировании функций более гибкой и адаптивной нервной
системой человека.
Перцептрон Розенблатта был лишен этого недостатка [31].
Первоначально модель перцептрона была создана на ЭВМ IBM 704 в 1957
году, а два года спустя Розенблатт представил Mark-I - первый нейрокомпьютер.
Данное вычислительное устройство было способно распознавать отдельные
буквы английского алфавита, что показывало практическую применимость
данной модели.
В 1969 году Марвин Минский и Сеймур Паперт издали книгу
«Перцептроны: вступление в вычислительную геометрию». В данной работе
были подробно рассмотрены ограничения перцептронов. Указывалось, что они
принципиально неспособны обучиться ряду функций.
Позднее была показана несостоятельность значительной части критики, и
отсутствие подобного рода ограничений при использовании многослойных
нейронных сетей. Однако авторитет авторов оказал значительное влияние в тот
период, «сдвинув» фокус исследований в области машинного обучения с
нейронных сетей на «символьный подход».
Параллельно с нейросетями развивались иные методы машинного
обучения. В частности, в 1951 году Фикс и Ходжес впервые описали метод К-
ближайших соседей. [18]. Данный алгоритм, обладая относительной простотой
реализации, показывает высокую точность, например, в задачах распознавания
образов. Метод К-ближайших соседей позволяет реализовать в машинном
обучении концепцию «рассуждения на основе прецедентов», предложенную на
основе работ Роджера Шэнка в начале восьмидесятых годов.
12
В 1972 году Аланом Колмеро и Филиппом Руссе был создан язык
программирования Prolog, основанный на применении предикатов
математической логики дизъюнктов Хорна, представляющий собой
подмножество логики предикатов первого порядка. Данный язык включает в
себя ограниченный набор основных механизмов, таких как сопоставление с
образцом, автоматический перебор с возвратами, древовидное представление
структур данных. Prolog успешно применяется в областях, в которых для
решения задач рассматриваются объекты и связи между ними. Он по сей день
находит ограниченное применение в области искусственного интеллекта.
В 1975 году выходит книга Джона Холланда «Адаптация в естественных и
искусственных условиях», которая пробудила широкий интерес к
использованию генетических алгоритмов.
В основе этой группы алгоритмов лежит идея, что решение задачи ищется
не одной последовательностью приближенных решений, а некоторой
популяцией приближенных решений. Каждая итерация алгоритма
подразумевает «эволюционный» отбор лучших приближений, дающих начало
новой популяции. С целью повышения эффективности алгоритмов
периодически применяется «мутация» решений. [21]
1.1.2 Кризис машинного обучения
В 1969 году Марвин Минский и Сеймур Паперт издали книгу под
названием «Перцептрон. Введение в вычислительную геометрию», в которой, в
том числе, подвергли критике возможности перцептронов, в частности была
указана невозможность реализовать функцию XOR. Данный труд обрел
большую известность, распространив скептическое отношение к подобной
модели нейрона. Кроме того, снижение популярности данного алгоритма
отчасти было связано с низкими вычислительными возможностями
компьютеров той эпохи, что значительно ограничивало практическое
применение перцептронов. В результате, основной акцент исследований в

Смотрите также:

"Автоматизация обработки заявок ООО "Проектно-Строительная Компания"
"Автоматизация процесса аттестации персонала для ООО "Нэт Бай Нэт Холдинг"
"Анализ интернет-активности конкурентов ( на примере конкурентов "Газпром нефть")
"Бухгалтерский учёт и аудит расчётов с подотчётними лицами в организации на примере ООО "ЛОЦ 10""
«Психологическое сопровождение персонала в организации на примере ООО «Крокус»
Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR как средство продвижения организации (на примере ПАО "Тамбовский завод "Комсомолец им. Н.С. Артемова")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран