Диплом: Применение анализа больших данных и алгоритмов машинного обучения в медицинской практике

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
43
основной проблемой является единая семантическая модель данных. Сегменты
и поля добавляются по запросам пользователей, не разработан механизм
добавления расширенной информации без необходимости выпуска новой
версии.
Следующая версия стандарта - HL7 V3. При этом следует учесть, что он
лишен обратной совместимости с V2 Это семейство стандартов, в основе
которого лежит эталонная информационная модель, модель типов данных,
терминологические словари и осознанная методология разработки стандартов.
При этом сложность стандарта и его реализации послужили препятствием к его
широкому распространению.
Новейшей на сегодняшний день версией стандарта является HL7
FHIR - ресурсы для обмена медицинской информацией. На данный момент эта
версия имеет статус проекта стандарта для пробного использования (DSTU), но
некоторые большие компании уже начинают его практическое внедрение на
открытой платформе. [26]
Поскольку значительную часть медицинских данных составляет
визуальная информация, такая как результаты лучевых методов диагностики, то
для упорядочивания работы с нею Американским Колледжем Радиологии и
Национальной ассоциацией производителей электронного оборудования был
разработан отраслевой стандарт DICOM (Digital Imaging and Communications in
Medicine). Данный стандарт формализует создание, хранение, передачу и
визуализацию всех упомянутых изображений и различных документов. DICOM
описывает технологию передачи радиологических изображений и другой
медицинской информации между системами на основе модели OSI. Это
позволяет обеспечить связь между медицинским оборудованием и
информационными системами различных производителей. Рабочие станции,
магнитно-резонансные томографы, архивы, и прочее оборудование,
территориально удаленное друг от друга, могут обмениваться данными на
44
основе стандарта DICOM с использованием открытых сетей по стандартным
протоколам, например, TCP/IP. [24]
45
ГЛАВА 3. ПРИМЕНЕНИЕ МАШИННОГО ОБУЧЕНИЯ ДЛЯ
ВЫЯВЛЕНИЯ ПАЦИЕНТОВ ИЗ ГРУППЫ РИСКА ПО РАЗВИТИЮ
ИНСУЛЬТА
3.1 Характеристика понятия «инсульт».
Инсульт - клинический синдром, развивающийся вследствие острого
нарушения мозгового кровообращения и характеризующийся очаговыми
неврологическими и (или) общемозговыми расстройствами, которые
сохраняются не менее 24 часов или приводят к смерти больного.
Инсульты встречаются от 150 до 740 случаев на 100000. [12]
Актуальность проблемы обусловлена высокой долей в структуре
заболеваемости и смертности населения, значительными показателями
временных трудовых потерь и первичной инвалидизацией. В острой стадии
инсультов смертность достигает 35%. [12] Инсульт — преобладающая причина
инвалидизации населения. По данным, предоставленным Национальным
регистром инсульта, у 31% пациентов, перенесших инсульт, существует
необходимость в посторонней помощи для ухода за собой, 20% лишены
способности самостоятельно ходить. Лишь у 8% пациентов, выживших после
перенесенного острого нарушения мозгового кровообращения, сохраняется
возможность вернуться к прежней работе. Несмотря на то, что за последнее
время заболеваемость и смертность от инсульта в Западной Европе несколько
снизилась, ожидается, что и там, вследствие демографического старения
населения и недостаточно эффективного контроля над основными факторами
риска количество пациентов, перенесших инсульт будет возрастать. [8]
Сосудистые заболевания головного мозга причиняют значительный ущерб
экономике государства, с учетом расходов на непосредственно лечение,
реабилитацию и потери в сфере производства. Например, в США прямые и
косвенные расходы на каждого пациента, перенесшего инсульт, составляют от
55 до 73 тысяч долларов в год. В России экономический ущерб особенно высок
в связи с более высокой частотой встречаемости нарушения мозгового
кровообращения среди населения.
46
По данным на 2013 год, стоимость лечения пациента, перенесшего
инсульт, составляет 127 тыс. рублей в год (сюда включаются расходы на
стационарное лечение, медико-социальную реабилитацию и вторичную
профилактику). Таким образом, общая сумма прямых расходов составляет 57,15
рублей в год (в пересчете на 450 тысяч случаев нарушения мозгового
кровообращения в год). Косвенные расходы, которые оцениваются по потере
ВВП вследствие преждевременной смертности, инвалидизации и временной
нетрудоспособности населения, составляют около 304 млрд рублей в год. По
данным, предоставленным Министерством здравоохранения Российской
Федерации, общие расходы (как прямые, так и косвенные), связанные с данной
нозологией в России, составляют 361 млрд. рублей в год. По оценке Всемирной
организации здравоохранения, потери ВВП в России из-за преждевременных
смертей сосудистого генеза могут составлять 8,2 млн. рублей. [17]
Выделяют два вида инсульта: ишемический и геморрагический.
Ишемический инсульт — это острое нарушение мозгового
кровообращения, сопровождающееся повреждением ткани мозга и нарушением
его функций вследствие затруднения, или прекращения поступления крови в
связи с поражением сосудистого русла.
Геморрагический инсульт — нарушение целостности или проницаемости
сосуда, вызывающее кровоизлияние в мозг.
Обе формы нарушения мозгового кровообращения имеют факторы риска,
способствующие их наступлению. Их принято разделять на экзогенные и
эндогенные. К эндогенным относят, в том числе: гипертоническую болезнь,
ишемическую болезнь сердца, гиперлипидемию, перенесенную транзиторную
ишемическую атаку.
К экзогенным относятся: курение, злоупотребление алкоголем, прием
оральных контрацептивов. [12]
Учитывая тяжесть патологии, сложность реабилитации и ее ограниченные
перспективы, основную роль в борьбе с инсультом играет профилактика данного
заболевания.
47
Основной целью профилактики является как снижение общей
заболеваемости инсультом, так и уменьшение частоты летальных исходов. При
этом мероприятия, направленные на первичную профилактику,
классифицируются на две большие группы:
массовая стратегия — направленная на достижение позитивных
изменений у каждого индивидуума в популяции путем воздействия на
модифицируемые факторы риска.
Стратегия высокого риска (медицинская профилактика) — раннее
выявление пациентов из группы высокого риска по развитию инсульта
(например с артериальной гипертензией, или гемодинамически значимым
стенозом внутренней сонной артерии) с последующим проведением
превентивного медикаментозного лечения, или хирургических
мероприятий, что позволяет снизить заболеваемость инсультом на 50%.
Профилактика должна быть персонализированной, и включающей в себя
как мероприятия немедикаментозного характера, так и целенаправленное
медикаментозное или ангиохирургическое исследование. [8]
Применение методов машинного обучения позволяет выполнять
прогнозирование на основе признакового описания, включающего в себя как
образ жизни индивидуума, так и имеющуюся патологию. Раннее отнесение
пациентов, угрожаемых по развитию инсульта, к группе риска, с проведением
последующих лечебных мероприятий, позволяет предотвратить наступление
неблагоприятного события, что предоставляет возможность сохранить человеку
работоспособность и образ жизни, а также несет прямой благоприятный
экономический эффект. Применение автоматизированных методов позволяет
проводить этот процесс массово, в короткие сроки и на регулярной основе.
Перечисленные факторы определяют высокий уровень перспективы
применимости данных методик в рутинной медицинской практике.
Широкое распространение устройств, контролирующих уровень
физической активности и отдельных витальных показателей, таких как фитнесс-
браслеты, также способствуют все более активному применению методик,
48
основанных на машинном обучении, в процессах диагностики и стратификации
рисков.
3.2 Описание датасета
Датасетом принято называть статистическую выборку, содержащую
признаковое описание группы объектов, предназначенную для обработки и
анализа с помощью вычислительных машин и алгоритмов машинного обучения.
Данная выборка, имеющая название «Healthcare Dataset Stroke Data»
предоставлена сайтом Kaggle.
Kaggle - это платформа, предоставляющая возможности сбора и анализа
данных различного характера, использующая в своей работе принципы
краудсорсинга (привлечение для решения тех или иных проблем широкого круга
лиц). Данный сайт был создан в 2010 году. На нем представлены те, кто может
предоставить информацию, и те, кто занимаются ее обработкой. На сегодняшний
день на платформе представлены более 46 тысяч человек, среди которых
аналитики, ученые, математики.
Работа платформы организована следующим образом:
1. создается новый проект кем-либо из участников, предоставляющим
данные и формулирующим задачу
2. платформа предлагает консультантов
3. выполняется поиск модели, наилучшим образом решающей поставленную
задачу
4. оценивается точность прогноза
5. определяется победитель
6. компания-заказчик выплачивает вознаграждение
Платформа применяется для решения задач из различных областей, таких
как финансы, маркетинг, медицина, научные исследования, и т.д.
Проекты и задачи, представленные на платформе, разделены на публичные и
закрытые. В первом случае участие принимают все желающие; публикуются
модели с открытым исходным кодом. Во втором — к участию приглашается
49
ограниченное число консультантов, выбранных заказчиком. На основании
достигнутых результатов для участников формируется единый рейтинг
платформы.
Часть данных на сайте предоставлены с тренировочными и научными
целями.
«Healthcare Dataset Stroke Data» предоставлен участником Saumya Agarwal
17 апреля 2018 года. Он включает в себя признаковое описание 43400 объектов
(людей), из которых 548 перенесли инсульт.
Признаки включают носят как числовой, так и категориальный характер, и
включают в себя:
1. Идентификационный номер (id)
2. Пол (gender)
3. Возраст (age)
4. Наличие или отсутствие артериальной гипертензии (hypertension)
5. Наличие или отсутствие сердечных заболеваний (heart_disease)
6. Семейное положение (ever_married)
7. Род деятельности (work_type)
8. Область проживания (Residence_type)
9. Средний уровень глюкозы (avg_glucose_level)
10. Индекс массы тела (bmi)
11. Статус курильщика или его отсутствие (smoking_status)
12. Наличие или отсутствие инсульта (stroke)
Таким образом, на основании представленного описания можно
попытаться создать математическую модель, позволяющую классифицировать
новые объекты на две группы: группа высокого риска по заболеваемости
инсультом (stroke == 1) и низкого риска (stroke == 0).
Следовательно, данная задача носит характер бинарной классификации.
3.3 Применяемый инструментарий
50
Для построения математических моделей применялись библиотеки Scikit-
Learn, Pandas, NumPy, MatplotLib для языка Python в среде Anaconda.
Python - интерпретируемый высокоуровневый язык программирования общего
назначения, ориентированный на повышение производительности разработчика
программного обеспечения, а также на высокую степень читаемости кода.
Данный язык программирования поддерживает несколько парадигм, включая
структурное, объектно-ориентированное, функциональное, императивное,
аспектно-ориентированное. Он обладает динамической типизацией,
автоматическим управлением памятью, полной интроспекцией, механизмом
обработки исключений, удобными высокоуровневыми структурами данных.
Он был впервые представлен в 1991 году голландским разработчиком
Гвидо Ван Россумом. В данной работе применяется версия 3.xx, представленная
в 2008 году. Благодаря наличию специализированных библиотек данный язык
программирования находит широкое применение в сфере анализа данных и
машинного обучения. В частности, он поддерживается наиболее популярными
фреймворками построения нейронных сетей — TensorFlow, Caffe.
Согласно данным сайта Kaggle, Python обошел по частоте применения
специализированный язык программирования R, также широко применяющийся
для анализа данных.
NumPy - библиотека для языка Python, реализующая поддержку больших
многомерных массивов и матриц, а также включающая высокоуровневые
математические функции для операций над массивами. [13]
Версия 1.0 представлена в 2006 году разработчиком Трэвисом Олифантом.
Изначально являлась частью пакета SciPy, предназначенного для научных
вычислений. Позже выделена в отдельный проект. Текущая версия имеет номер
1.15.0.
Pandas - высокоуровневая библиотека, построенная поверх библиотеки
NumPy и реализующая поддержку специальных структур данных и операций для
работы с таблицами и временными рядами. Также содержит средства
51
визуализации данных. Представлена разработчиком Уэсом МакКини в 2008
году. Текущая версия имеет номер 0.23.2. [19]
MatPlotLib - библиотека языка Python, реализующая визуализацию
средствами двумерной и трехмерной графики при активном взаимодействии с
NumPy. Разработан по образцу графических средств популярной среды
MATLAB. Впервые представлена Джоном Д. Хантером в 2003 году. Текущая
версия — 2.0.xx.
Библиотека поодерживает следующие средства визуализации:
Графики (line plot)
Диаграммы разброса (scatter plot)
Столбчатые диаграммы (bar chart) и гистограммы (histogram)
Круговые диаграммы (pie chart)
Ствол-лист диаграммы (stem plot)
Контурные графики (contour plot)
Поля градиентов (quiver)
Спектральные диаграммы (spectrogram)
Anaconda - дистрибутив языков Python и R, включающий в себя множество
библиотек и инструментов для обработки данных, в частности все
перечисленные библиотеки. Данные проект создан Трэвисом Олифантом,
разработчиком NumPy. [15]
В состав Anaconda входит собственная версия интерпретатора, полностью
совместимая с основной реализацией Cpython, создаваемой разработчиками
языка. Кроме того, Anaconda поддерживает собственный менеджер пакетов
Conda, который позволят реализовать зависимости не только внутри экосистемы
Python, но и за ее пределами.
В состав дистрибутива входят эффективные средства разработки, такие как
Microsoft Visual Studio Code, R Studio, Spyder, Jupyter Notebook.
Jupyter Notebook - это оболочка для разработки, выполнения
интерактивных вычислений и визуализации данных. Она позволяет работать с
52
различными языками программирования, такими как Julia, R, Haskell, Ruby,
Python.
Данный инструмент позволяет хранить вместе код, комментарии, формулы
и графики, что позволяет создавать высокоинформативные аналитические
отчеты.
3.4 Загрузка данных и их подготовка.
Для построение математической модели в среде Python на начальном этапе
необходимо подключить необходимые библиотеки. Это выполняется при
помощи команды import.
Для первоначальной обработки данных нам понадобятся библиотеки
NumPy, Pandas, matplotlib (рисунок 1).
Рис. 1 Импорт основных библиотек
После этого выполняем загрузку данных в оперативную память. Для этого
используется функция read_csv библиотеки pandas. [19]
CSV - Comma-Separated Values - формат текстовых файлов,
предназначенный для хранения табличных данных. Он обладает
следующими характеристиками:
каждая строка табличных данных записывается в виде одной строки файла.
данные, принадлежащие к различным столбцам отделяются разделителем,
в качестве которого чаще всего выступает символ запятой. Также широко
применяются точка с запятой и символ табуляции.
Данные, включающие зарезервированные символы (например, точка с
запятой), отделяются двойными кавычками.

Смотрите также:

"Автоматизация обработки заявок ООО "Проектно-Строительная Компания"
"Автоматизация процесса аттестации персонала для ООО "Нэт Бай Нэт Холдинг"
"Анализ интернет-активности конкурентов ( на примере конкурентов "Газпром нефть")
"Бухгалтерский учёт и аудит расчётов с подотчётними лицами в организации на примере ООО "ЛОЦ 10""
«Психологическое сопровождение персонала в организации на примере ООО «Крокус»
Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR как средство продвижения организации (на примере ПАО "Тамбовский завод "Комсомолец им. Н.С. Артемова")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран