Диплом: Разработка интеллектуальной системы проверки контрагентов с использованием механизма нечеткого вывода

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
34
Глава 2. Методика построения системы проверки контрагентов
2.1. Основа системы проверки контрагентов
Технической основой мультиагентной интеллектуальной системы
контекстно-зависимого анализа контрагентов на основе технологии блокчейн
для мониторинга состояния контрагента составляют подсистемы агрегации
данных по контрагентам из внешних и внутренних по отношению
к компании-пользователю источников и подсистем кластеризации
с заданным набором общих и индивидуальных нечетких продукционных
правил с соответствующими коэффициентами истинности, а также набор
подсистем дефаззификации методами левого и правого модальных значений
и дополнительных предустановленных нечетких продукционных правил
и коэффициентов истинности по основным отраслям с функциями
распределенного хранения данных по контрагентам и методам их анализа.
Концептуальным положениями, составляющими основу проекта,
являются:
1. Повышение качества и скорости комплексного анализа контрагента,
описанного количественными и качественными данными,
а также точности анализа за счет данных, как из внешних,
так и внутренних источников;
2. Повышение защищенности механизмов работы и хранимых данных
по обрабатываемым контрагентам на основе технологии блокчейн.
Рассмотрим подробнее концептуальное положение о повышении
качества и скорости комплексного анализа контрагента. [30]
Качество анализа будет повышено посредством двух основных
инструментов. Во-первых, в отличие от конкурентов, которые анализируют
информацию, собираемую только из внешних источников,
в разрабатываемую интеллектуальную систему будет предусмотрена
возможность ввода информации из внутренних по отношению к компании-
пользователю источников. При этом контрагент будет описываться
количественными (числовыми) и качественными (категориальными)
35
данными. Во-вторых, в существующих на рынке информационных системах
собираемая информация оценивается примитивно (по принципу «пяти
звездочек», при этом оценка некоторых данных, по нашему мнению, не
всегда выполняется верно; например, если организация имеет уставной
капитал более 100 тыс. руб., то ей присваивается по этому критерию
максимальная оценка по надежности) или вообще эта функция передается в
ручной режим пользователю (анализ выполняется человеком). Это открывает
возможность построения интеллектуальной системы контекстно-зависимой
аналитики, которая будет разрабатываться с применением наборов общих
и индивидуальных отраслевых (групповых) нечетких продукционных
правил, соответствующих отрасли (или группе контрагентов),
с индивидуальными коэффициентами истинности. Это будет достигаться
путем работы в два этапа. На первом этапе будет осуществляться контекстно-
зависимая кластеризация по отраслям на основе данных из внутренних
(в данном случае приоритетных) и внешних (в данном случае
второстепенных) по отношению к компании-пользователю легитимных
источников. Далее консолидированные данные по контрагенту с данными
от первого этапа кластеризации поступают в систему нечеткого вывода.
Рассмотрим подробнее концептуальное положение о повышении
защищенности механизмов работы системы (наборов правил, коэффициентов
и т. п.) и хранимых данных по обрабатываемым объектам (контрагентам).
В этом направлении в разработку закладывается возможность последующей
коррекции термов лингвистических переменных и коэффициентов
истинности нечетких продукционных правил, а также введение своих групп
траслей) для первого этапа кластеризации. Для того чтобы защитить
компанию, которая доверит аналитику контрагентов интеллектуальной
системе, от технических сбоев, а также внутренних и внешних взломов
системы правил или коэффициентов, предлагается применить технологию
блокчейн. При этом предлагается два основных направления с вариациями.
36
В рамках первого направления – хранение данных, в том числе и всех
изменений по контрагентам в блокчейн – будут следующие вариации:
а) внутри распределенной структуры самой компании; б) внутри
распределенной структуры всех пользователей нашей системы.
В рамках второго направления – хранение данных, в том числе и всех
изменений по общим и индивидуальным нечетким продукционным
правилам, а также наборов термов лингвистических переменных и
коэффициентов истинности нечетких продукционных правил – будут
следующие вариации: а) внутри распределенной структуры самой компании;
б) внутри распределенной структуры всех пользователей нашей системы.
Таким образом, в результате выполнения проекта будет достигнута
возможность проведения более качественного контекстно-зависимого
анализа контрагента, разработаны механизмы адаптивной аналитики. Также
будет обеспечен механизм защиты данных по контрагентам и, что важно,
при использовании внутренней информации (контекста) компании-
пользователя. [31]
Функциональную основу системы проверки контрагентов составляют
следующие возможности:
1. Возможность описания контрагента количественными (числовыми)
и качественными (категориальными) данными.
2. Возможность формирования индивидуальных аналитических правил
в зависимости от группы контрагента и использование для оценки
контрагентов не только внешней информации, но и внутренней
(контекста).
3. Возможность использования и модификации алгоритмического
обеспечения, основанного на нечетком логическом выводе, по оценке
рисков неплатежей (потерь) в ситуации возникновения задолженности
со стороны контрагента, где риск является численной характеристикой
возможности потерь, выступая как субъективной оценкой объективной
неопределенности – неустранимого качества рыночной среды.
37
4. Возможность применения технологии блокчейн для хранения данных
по контрагентам, всех изменений по общим и индивидуальным нечетким
продукционным правилам, а также наборов термов лингвистических
переменных и коэффициентов истинности нечетких продукционных
правил.
5. Возможность хранения данных с применением технологии блокчейн
внутри распределенной структуры самой компании или внутри
распределенной структуры всех пользователей нашей системы.
6. Возможность человеко-понятной классификации контрагентов
на основе интерпретации данных из баз 1С (финансовые данные)
и баз юридических прецедентов (корпоративные хранилища).
7. Возможность по рисковому ранжированию контрагентов
с использованием инструментария нечеткой логики на основе агрегации
данных из разнородных источников.
8. Возможность введения пользовательских аналитических правил
и отслеживания их эффективности. [32]
2.2. Использование механизма нечеткого вывода
Метод кластерного анализа применяется для разделения множества
исследуемых признаков и объектов на кластеры или однородные группы
в соответствующем понимании. Это значит, что задача классификации
данных решается и выявляется соответствующая структура в ней.
Управление дебиторской задолженностью является основной задачей
финансового менеджмента любой организации. Возможность применения
кластерного анализа в управлении дебиторской задолженность является
малоизученной и пока не нашла широкого отклика среди предпринимателей,
поэтому рассматриваемая проблема является актуальной.
Кластерный анализ может быть использован циклически. В таком
случае производится исследование до тех пор, пока не будут достигнуты
нужные результаты. При этом каждый цикл, при этом использовании, может
выдавать такую информацию, которая способна сильным образом изменить
38
подходы и направление дальнейшего применения метода кластерного
анализа. Данный процесс может иметь вид системы с обратной связью.
Большое преимущество кластерного анализа в том, что он производит
разбиение объектов не по одному параметру, а по набору признаков в целом.
Кроме того, кластерный анализ не накладывает ограничения на вид
рассматриваемых объектов, в отличие от большинства экономико-
математических методов, и позволяет рассмотреть, практически
произвольной природы, большое количество исходных данных.
Кластерный анализ так же имеет свои недостатки и ограничения,
а именно: количество и состав кластеров зависимы от разбиения выбираемых
критериев. При сведении большого объема исходных данных к компактному
виду возможны разные искажения, а также могут потеряться конкретные
черты некоторых объектов, за счет изменения характеристик обобщенных
значений различных параметров кластера. [33]
Например, пусть Q включает n государств, одна из которых имеет ВНП
на душу населения (В1), числом H автомобилей на 1 тыс. человек (В2),
потреблением электроэнергии на душу (В3), потреблением меди на душу (В4)
и т.д. Тогда Y
1
(вектор измерений) будет представлять собой набор
перечисленных характеристик для первого государства, Y
2
– для второго, Y
3
для третьего, и т. д. В задаче необходимо разбить государства по уровню
развития. Решением данной задачи будет – разбиение, удовлетворяющее
определенному критерию оптимальности. Этот критерий, как правило,
представляет собой функционал, который выражает уровни желательности
различных группировок и разбиений и называется – целевой функцией.
Здесь, самым трудным считается определить однородности объектов,
задаваемых введением расстояний между объектами y
i
и y
j
(b (y
i
, y
j
)).
Однородными объекты будут в случае b (y
i
, y
j
) ≤ b
поp
, где b
поp
– заданное
пороговое значение.
Основным моментом исследования является выбор расстояния (b),
от этого расстояния зависят варианты разбиения в окончательном виде.
39
Наиболее распространенными являются две процедуры: метод «ближнего
соседа» и метод «дальнего соседа».
Метод «ближайшего соседа» основывается на наибольшей близости
объектов по совокупности исследуемых признаков в различных кластерах.
Эта близость должна группировать объекты вместе для формирования
кластеров, в этом случае, результирующие кластеры могут быть
представлены длинными «цепочками».
В методе «дальнего соседа» наоборот, расстояния между двумя
любыми объектами в разных кластерах должно быть максимальным, тем
самым определять расстояние между этими кластерами. Данный метод, как
правило, работает хорошо в том случае, когда объекты различны. Если же
кластеры схожи или их тип – «цепочечный», этот метод непригоден». [34]
В задачах, решаемых методом кластерного анализа, достаточно часто
применяют евклидово и хемингово расстояния.
Евклидово расстояние:
p
E
(x
i
,x
j
)
????




????
. (1)
С помощью этой формулы, берется в сравнении приближенность двух
объектов по наибольшему числу признаков.
Хемингово расстояние:
p
E
(x
i
,x
j
)






, (2)
где k – количество признаков; i, j – признаки.
Формула используется как измерение различия объектов, задаваемых
атрибутивными признаками.
Существует большое количество методов кластерного анализа.
Опишем некоторые из них.
40
1. Объединение (древовидная кластеризация). Типичным примером
такой кластеризации является иерархическое дерево (рис. 1).
Рисунок 1 Иерархическое дерево
На рисунке диаграмма начинается с каждого объекта в своем классе
(в левой части рисунка). Предположим, что постепенно мы «понижаем»
критерий об уникальности объекта, связываем вместе все большее и большее
число объектов и агрегируем (объединяем) все больше число кластеров,
состоящих из все сильнее различающихся элементов. В результате,
на последнем шаге все объекты объединяются вместе.
На этом рисунке вертикальные оси означают расстояние объединения
(в горизонтальных древовидных диаграммах горизонтальные оси означают
расстояние объединения). Следовательно, для каждого узла в графе
(там, где формируется новый кластер) мы можем видеть величину
расстояния, при котором соответствующие элементы связываются в новый
единственный кластер. [35
Когда данные будут иметь понятную «структуру» в терминах кластеров
объектов, сходных между собой, тогда эта структура, должна быть отражена
в иерархическом дереве различными ветвями. В результате, если анализ
методом объединения будет успешен, появится возможность обнаружить
кластеры (ветви) и интерпретировать их.
2. Двухходовое объединение. Суть данного метода лучше показать на
примере. Финансовому менеджеру необходимо собрать данные о различных
41
характеристиках (переменные) финансового состояния контрагентов
(наблюдений), которые имеют задолженность. Он может кластеризовать
наблюдения (контрагентов) для определения кластеров контрагентов
с похожим финансовым состоянием. В то же время, он может кластеризовать
переменные (характеристики) для определения кластеров переменных,
которые связаны со схожим финансовым состоянием. Двухходовое
объединение позволяет провести кластеризацию в обоих направлениях.
Так же, это объединение используется (достаточно редко) в обстоятельствах,
когда ожидается, что и наблюдения и переменные одновременно могут
вносить вклад в обнаружение осмысленных кластеров. Двухходовое
объединение, как правило, наименее используемый метод.
Однако некоторые исследователи считают, что он предлагает мощное
средство разведочного анализа данных.
3. Метод K-средних. Данный метод кластеризации сильно отличается от
методов объединения описанных выше. Весь исходный набор примеров
разбивается на k-классы таким образом, что максимизируется евклидово
расстояние между классами и минимизируется евклидово расстояние между
объектами внутри классов. [36]
Выделение кластеров можно рассмотреть на примере.
Необходимо вычислить коэффициент ненадежности (табл. 2)
проблемных дебиторов, который учитывает время, сумму заказа и сумму
задолженности: K
нен
.= 1000 × ущерб / сумма заказа.
Таблица 2
Коэффициент ненадежности проблемных дебиторов
1-й
дебитор
2-й
дебитор
3-й
дебитор
5-й
дебитор
Kоэффициент
ненадежности
6
38
86
378
На основании коэффициента ненадежности проведем кластерный
42
анализ проблемных контрагентов. Анализ будем проводить методом
объединения (древовидная кластеризация). Выделяем расстояние р между
коэффициентами по следующей формуле (1) (табл. 3).
Таблица 3
Расстояние p между коэффициентами
1
2
3
4
5
6
1
0
33
80
109
373
414
2
33
0
47
76
340
382
3
80
47
0
29
293
334
4
109
76
29
0
264
306
5
373
340
293
264
0
42
6
414
382
334
306
42
0
Считаем по принципу ближнего и дальнего соседа.
Принцип ближнего соседа.
Рисунок 2 Принцип ближнего соседа.
Рmin = Р3,4 = 29 (S1, S2, S3,4, S5, S6); Рmin = Р1,2 = 33 (S1,2, S3,4, S5,
S6); Рmin = Р5,6 = 42 (S1,2, S3,4, S5,6); Рmin = Р1,2,3,4 = 47 (S1,2,3,4, S5,6).
В результате проведения кластерного анализа по принципу ближнего
43
соседа получили два кластера (рис. 3).
Рисунок 3 Дендрограмма по принципу «ближнего соседа»
Принцип дальнего соседа.
Рисунок 4 Принцип дальнего соседа.
Рmin = Р3,4 = 29 (S1, S2, S3,4, S5, S6); Рmin = Р1,2 = 33 (S1,2, S3,4, S5,
S6); Рmin = Р5,6 = 42 (S1,2, S3,4, S5,6); Рmin = Р1,2,3,4 = 109 (S1,2,3,4, S5,6).
Таким образом, при проведении кластерного анализа по принципу
дальнего соседа получили два кластера (рис. 5).
Проводим кластерный анализ только по проблемным контрагентам.

Смотрите также:

"Автоматизация обработки заявок ООО "Проектно-Строительная Компания"
"Автоматизация процесса аттестации персонала для ООО "Нэт Бай Нэт Холдинг"
"Анализ интернет-активности конкурентов ( на примере конкурентов "Газпром нефть")
"Бухгалтерский учёт и аудит расчётов с подотчётними лицами в организации на примере ООО "ЛОЦ 10""
«Психологическое сопровождение персонала в организации на примере ООО «Крокус»
Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR как средство продвижения организации (на примере ПАО "Тамбовский завод "Комсомолец им. Н.С. Артемова")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран