Диплом: Применение анализа больших данных и алгоритмов машинного обучения в медицинской практике

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
33
с последующей корректировкой значений весовых коэффициентов.
К недостаткам данного метода обучения относятся возможность
нахождения локального минимума вместо глобального и способность нейронной
сети к переобучению, что требует применения регуляризации.
1.2.2 Обучение без учителя
Обучение без учителя— группа методов машинного обучения, при
котором отсутствуют «правильные» ответы, и алгоритм анализа данных
выстраивается на основе поиска взаимосвязей и закономерностей между
объектами обучающей выборки. К преимуществам данных методов относится
возможность применения неструктурированных данных. К наиболее ярким
недостаткам относится сложность выбора метрики качества, в связи с
недоступностью интуитивно понятных параметров, используемых в задачах
обучения с учителем. [2]
К наиболее распространенным задачам обучения без учителя относятся
кластеризация и визуализация данных (частным случаем последней можно
представить задачу снижения размерности данных). В рамках этих задач широко
применяются такие алгоритмы, как метод k-средних и нейронные сети Кохонена.
1.2.2.1 Метод k-средних
Метод k-средних (k-means) позволяет проводить кластеризацию выборки
при известном числе классов. Это итеративный алгоритм, который состоит из
следующих шагов:
1. Произвольным образом выбираются геометрические центры кластеров.
2. Каждому объекту присваивается принадлежность к определенному
кластеру на основе оценки расстояния до ближайшего центра.
3. Производится переоценка геометрических центров кластеров путем
расчета среднего арифметического входящих в его состав объектов.
34
4. Алгоритм повторяется, начиная со 2 пункта, до достижения критериев
сходимости. [15]
При наличии выборки большого объема с целью ускорения проведения
вычислительных процессов пересчет центров кластеров на основе среднего
арифметического проводится не на всей выборке, а на случайном ее
подмножестве. Данная модификация алгоритма носит название Mini-Batch k-
means. Применение подобной модификации на больших выборках позволяет
добиться тех же уровней сходимости, что и классическая реализация алгоритма.
Сходимость данного метода в значительной степени зависит от начального
выбора объектов, определяемых в качестве центров кластеров. Для ситуации с
k=2 оптимальным решением будет выбор в качестве первых центров кластеров
наиболее удаленных друг от друга объектов. Для иных случаев рационально
использовать модификацию с названием k-means++, при которой
первоначальные центры выбираются следующим образом: первый центр
выбирается случайным образом из равномерного распределения на выборке. Для
последующих центров создается вероятностное распределение, при котором
вероятность объекта оказаться центром нового кластера прямо пропорционально
квадрату расстояния до ближайшего к нему центра.
В качестве метрики качества при выполнении задач кластеризации
применяется среднее внутрикластерное расстояние, которое определяется
следующим выражением:
F
0
= ∑[yi=yj]ρ(xi, xj) / ∑[yi=yj] → min
i<j i<j
При наличии данных о расположении центров кластеров можно
использовать метрику, которая предоставляет среднее расстояние до центра
кластера:
Φ
0
=∑ (1/|K
y
|) ∑ ρ
2
(x
i
, μ
y
)→min
35
yY i : y
i
= y
Существует модификация k-means, при которой происходит перерасчет
центров кластера при переходе объекта из одного кластера в другой. Данная
версия алгоритма позволяет находить локальный минимум функционала Φ
0
.
1.2.2.2 Самоорганизующиеся карты Кохонена
Самоорганизующиеся карты Кохонена (Self Organization Map) — данный
метод машинного обучения основан на введении в правило обучения нейрона
информации о его расположении, то есть составляются карты размещения
нейронов. Данный метод применяется при решении задач моделирования,
кластеризации, визуализации. [10]
Данный алгоритм выглядит следующим образом: допустим имеется
множество векторов размерности N, представляющих собой обучающую
выборку.
X=[x
1
,x
2
,...,x
N
] .
Карта Кохонена представляет собой комплекс из M нейронов,
расположенных на плоскости, как правило в виде прямоугольной сетки. Для
каждой пары можно вычислить геометрическое расстояние. При этом, каждый
нейрон характеризуется вектором весов размерности N, совпадающей с
размерностью векторов признаков.
W
m
=[w
m
1
,w
m
2
,...,w
m
N
],
где w
m
n
являются действительными числами.
Алгоритм непосредственного обучения сети представлен следующим
итеративным процессом:
36
1. Инициализация векторов множества W
m
случайными числами, того же
порядка, что и признаковое описание.
2. Вводится параметр времени t = 1.
3. Выбирается произвольный вектор из обучающего множества X.
4. Вычисляется нейрон, наиболее близкий к обучающему вектору, с
использованием нормы разницы. Он определяется как «нейрон-
победитель». Данный нейрон обозначим как W
m*
, где m* - номер данного
нейрона.
5. Проводим коррекцию всех весов нейронов по формуле:
w
m
n
=w
m
n
+ η(t)h(t, ρ(m, m*))[x
n
-w
m
n
],
где η(t) = η
0
exp(-at), h(t, ρ)=exp[-(ρ
2
) / (2σ(t))], σ(t)=σ
0
exp(-bt). Через ρ(m, m*)
обозначено расстояние между нейронами на плоскости для нейронов с номерами
m и m*.
6. t = t + 1
7. Если параметр t превышает заранее определенную величину, то
выполняется выход из цикла
8. Возврат к шагу 3
После построения карты ее необходимо градуировать. С этой целью из
множества объектов выбираются те, что содержат эталонные значения входных
данных и проецируются на карту (выбирается нейрон, ближе всего
расположенный к эталонному значению).
После этого карта готова к применению. При этом для произвольного
вектора множетсва объектов определяется ближайший нейрон, и его
расположение на карте показывает область, к которой он относится.
37
При выполнении задачи кластеризации можно использовать графовые
методы для определения количества и положения кластеров на карте. С этой
целью применяется, например, поиск в ширину по отношению к некоторому
нейрону-победителю, в результате которого вычисляются все близлежащие
нейроны-победители, составляющие единый кластер.
38
ГЛАВА 2. ОСОБЕННОСТИ МЕДИЦИНСКИХ ДАННЫХ
2.1 Определение и классификация медицинской информации.
Согласно ГОСТ 7.0 — 99, информация — это сведения, воспринимаемые
человеком и (или) специальными устройствами как отражение фактов
материального или духовного мира процессе коммуникации. В современной
литературе под медицинской информацией подразумеваются два понятия.
Первое: медицинская информация — это любая информация, относящаяся к
медицине. В более узком смысле, медицинская информация — это информация,
относящаяся непосредственно к состоянию пациента, то есть информация о его
здоровье, особенностях организма, перенесенных заболеваниях. [14] В рамках
данного исследования используется термин пределах второго понятия.
Биологически активные процессы, протекающие в организме человека,
сопровождаются выработкой различных сигналов — электромагнитных,
механических, звуковых. Кроме того, сигналами в медицине являются сведения
о состоянии человека — росте, массе тела, показателях, характеризующих состав
крови, его субъективные жалобы. В области организации здравоохранения в
качестве сигналов служат статистические показатели, такие как смертность,
заболеваемость, финансовые затраты и прочее.
Зарегистрированные сигналы определяются как «данные» и могут быть
подвергнуты обработке.
Медико-биологические данные могут быть классифицированы
следующим образом:
1. Количественные данные (параметры) — те данные, которые можно
выразить дискретными величинами: например, рост человека,
концентрация лейкоцитов в крови и т.д.
2. Качественные данные (признаки) — те данные, которые не могут быть
количественно оценены, но при этом могут быть ранжированы. К ним
относятся, напрмер, цвет кожных покровов, наличие болей и т.д.
39
3. Статические картины органов человека или всего тела — результаты
лучевой диагностики, фотографии микропрепаратов, эндоскопические
изображения.
4. Динамические картины органов — получаются в результате непрерывной
регистрации сигналов, например, при ультразвуковом исследовании, МРТ,
и т.д.
5. Динамические данные физиологических функций: электрокардиограмма,
электроэнцефалограмма, и т. д. [11]
Таким образом, основной особенностью медицинской информации
является разнородность данных, которые могут быть представлены как
количественными (числовыми непрерывными или дискретными), так и
качественными (категориальными порядковыми и номинальным) признаками.
При этом одно и тоже исследование может выступить в качестве источника
данных, относящихся к разным группам.
Основной ее особенностью является разнородность данных, которые могут
быть представлены как количественными (числовыми непрерывными или
дискретными), так и качественными (категориальными порядковыми и
номинальным) переменными. Другая особенность - длительный срок хранения
медицинских данных. Также стоит отметить, что задача хранения медицинских
данных осложняется некоторыми аспектами: юридической значимостью
информации, большим объемом, неоднородностью и сложной структурой.
[26]
По типу регистрируемых сигналов информация классифицируется
следующим образом:
1. алфавитно-цифровая информация;
2. визуальная информация:
а) статическая;
б) динамическая;
3. звуковая информация
40
4. комбинированные виды информации
2.2 Особенности сбора медицинской информации
Применение терминов «сбор данных» или «получение информации» могут
быть подвергнуты некорректной трактовке, что медицинская информация
имеется в окружающем мире состоянии, доступном для ее обработки в
диагностических или лечебных целях. Вопреки этой убежденности, отдельные
объективные параметры, например, биологическая дозировка, могут быть
интерпретируемыми (то есть являться информацией) только в контексте либо
мотивации назначения, либо условий получения образца крови, и так далее.
Клинический симптом или радиологический признак — это итог
комплексного процесса принятия решений.
Таким образом, медицинская информация содержится только в
интерпретируемой среде, и существует необходимость в ее постоянном
обновлении с целью избежать диагностических и лечебных ошибок.
Возникающие у медицинского персонала предположения являются
определяющими в направлении сбора информации и выбора критериев оценки
«полезности» информации. Фактор субъективности играет значительную роль в
медицине. Данные условия позволяют частично объяснить неисчерпаемую
природу медицинской информации. Информация может не существовать по той
причине, что пациенту не был задан вопрос, либо потому, что ответ не был
зарегистрирован. По данным Bensten (1976) до 40% проблем, выявленных в ходе
исследований, обусловлены тем, что медицинская информация не была
корректно сохранена. [1]
Вероятностный характер медицинской информации дает основание
полагать, что повышение качества медицинской помощи может быть достигнуто
путем повышения объемов одновременно оцениваемой информации
41
(увеличения числа объектов в выборке) и количества анализируемых признаков.
[14]
На сегодняшний день источники медицинской информации принято
объединять в следующие группы [20]:
1. электронные истории больных;
2. результаты лабораторных диагностических исследований;
3. финансово-экономическая информация;
4. базы данных по лекарственным препаратам;
5. базы данных материальных ресурсов;
6. базы данных трудовых ресурсов;
7. экспертные системы;
8. стандарты диагностики и лечения больных и др.
Большое количество источников информации и ее разнородность
обуславливают низкий уровень структурированности данных, что становится
серьезной проблемой на этапе их анализа. Например, данные для двух отдельных
профилей обследования могут иметь абсолютно различную структуру.
Некоторая часть медицинской информации, обладая структурой, сохраняет ее в
неявном виде. Например, медицинские информационные системы могут
включать значительное число медицинских показателей, не имеющих
общепринятой классификации. В ряде случаев медицинская информация имеет
структуру, и для ее хранения используются традиционные системы управления
базами данных. При этом создаются методы ассоциации структурированных
данных с оставшимися. Кроме того, к особенностям источников медицинских
данных следует отнести их изменчивость. Примером могут служить
периодические медицинские отчеты, в которых могут исчезать одни показатели
и появляться другие. [27].
Еще одной особенностью медицинских данных, которую следует
учитывать при работе с ними, является ее конфиденциальность. Данный аспект
42
регулируется Основами законодательства РФ об охране здоровья граждан от
22.07.93, которое гласит, что граждане имеют право на конфиденциальность
информации о факте обращения за медицинской помощью и иных передаваемых
ими при обращении за медицинской помощью сведений.
2.3 Особенности хранения и передачи медицинских данных.
Широкое внедрение медицинских информационных систем и активный
обмен информацией посредством компьютерных сетей, а также особенности
медицинских данных вызвали необходимость в разработке стандартов для
хранения и передачи соответствующей информации. К наиболее
востребованным стандартам относятся Health Level 7 (HL 7) и DICOM.
Health Level 7 (HL7) — стандарт обмена, управления и интеграции
электронной медицинской информации. HL7 работает по аналогии с семью
уровнями взаимодействия сетевой модели OSI и способствует выполнению
следующих задач:
структурирование передаваемых данных;
возможность проектирования систем;
достижение согласованности передач;
безопасность;
идентификация участников;
доступность.
За период существования модели HL7 было разработано три поколения
стандартов.
HL7 V1. Первая версия стандарта, чье предназначение - проверка
концепции и определение содержания и структуры данных.
Широкое практическое применение стандарта началось с появления
версии HL7 V2. Данная версия декларирует обмен административной,
финансовой и клинической информацией в формате текстовых сообщений.
Версия HL7 V2.5 является самой применимой на сегодняшний день. При этом

Смотрите также:

"Автоматизация обработки заявок ООО "Проектно-Строительная Компания"
"Автоматизация процесса аттестации персонала для ООО "Нэт Бай Нэт Холдинг"
"Анализ интернет-активности конкурентов ( на примере конкурентов "Газпром нефть")
"Бухгалтерский учёт и аудит расчётов с подотчётними лицами в организации на примере ООО "ЛОЦ 10""
«Психологическое сопровождение персонала в организации на примере ООО «Крокус»
Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR как средство продвижения организации (на примере ПАО "Тамбовский завод "Комсомолец им. Н.С. Артемова")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран