Диплом: Машинное обучение в задачах синтаксического анализа естественных языков

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
22
газонокосильщики; спасатели; хирурги. Общая численность роботов в мире
превысила десять миллионов.
Современные системы распознавания речи, основанные на
статистических методах вроде скрытых марковских моделей, являются
довольно точными для практического использования. Персональные
цифровые помощники (например, Siri — приложение Apple) реагируют на
голосовые команды, могут отвечать на простые вопросы и выполнять действия
по запросу. Широко распространено и развивается оптическое распознавание
рукописного и машинописного текста — на нем основаны, в частности,
приложения для сортировки почты и оцифровки исторических документов.
Однако остаются несовершенными системы машинного перевода, хоть
они и вполне пригодны для определенных целей. В ранних версиях, где
использовался метод КИИ и которые базировались на правилах, был создан
принцип кодировки в ручном режиме для грамматик всех естественных
языков — работа проводилась самыми высококвалифицированными
лингвистами. Новые системы основаны уже на статистических методах
машинного обучения, автоматически выстраивающих статистические модели
на основе наблюдаемых ими закономерностей использования слов и фраз.
Программы выводят параметры этих моделей, анализируя корпус текстов на
двух языках. Такой подход позволяет не привлекать лингвистов, а
программисты, разрабатывающие эти системы, могут даже не владеть
языками, с которыми работают.
Системы распознавания лиц за последнее время были до такой степени
усовершенствованы, что сейчас ими успешно пользуются пограничные
службы в Европе и Австралии. Автоматическая идентификационная система
работает в Госдепартаменте США. В системах наблюдения применяются все
более совершенные методы ИИ и самые передовые технологии по извлечению
информации, с их помощью осуществляют интеллектуальный анализ речевых,
текстовых и видеоматериалов — большинство из них привлекается из
23
всемирных коммуникационных сетей и огромных центров сбора и обработки
данных.
Автоматическое доказательство теорем и решение уравнений стало
настолько обыденным фактом, что уже не воспринимается как разработка
искусственного интеллекта. Устройства для решения уравнений встроены в
научные компьютерные программы, например, в систему Mathematica.
Формальные методы проверки, включая системы автоматического
доказательства теорем, повсюду используются производителями
микропроцессоров для проверки функционирования схемы перед выпуском в
производство.
Американские военные и разведывательные ведомства широко и
успешно внедряют так называемые боевые роботы — саперы для нахождения
и обезвреживания бомб и мин; беспилотные летательные аппараты для
разведки, и для боевых действий; прочие автоматические виды вооружений.
Сегодня эти устройства по большей части управляются дистанционно
операторами-специалистами, однако постоянно идёт разработка для
расширения их автономной деятельности.
Значительный успех достигнут в области интеллектуального
планирования и снабжения. Во время операции «Буря в пустыне» в 1991 году
была развернута система DART для обеспечения автоматизированного
планирования поставок и составления графиков перевозок. Программа
оказалась крайне эффективной: по данным Агентства по перспективным
оборонным научно-исследовательским разработкам США (Defense Advanced
Research Projects Agency in the United States, DARPA), она одна окупила
тридцатилетнее финансирование Министерством обороны работ в области
ИИ. Сложные программы календарного планирования и тарификации
используют для систем бронирования авиабилетов. Организации активно
применяют различные методы ИИ с целью контролировать складских запасов.
24
Автоматические системы телефонного бронирования и линии
поддержки, которые связаны с программами распознавания речи, могут
помочь пользователю достичь цели, не прибегая к помощи «живого»
оператора, и работая в качестве первой линии поддержки, оставляя сложные
вопросы и коммуникационные задачи для прямого общения.
Технологии искусственного интеллекта являются основой
внушительного числа сервисов в интернете. Мировой трафик электронной
почты проверяется специальным ПО — причем байесовская фильтрация
спама, несмотря на постоянные попытки спамеров обойти защиту, в основном
выполняет с задачу и защищает пользователей электронной почты от лишнего
контента. Электронные программы, пользуясь компонентами ИИ,
обеспечивают безопасность операций по банковским картам: отвечают за их
автоматическое одобрение или отклонение и постоянно отслеживают
действия по счету с целью обнаружить малейшие признаки мошенничества.
Системы поиска информации также активно используют машинное обучение.
А поисковая система Google, является на данный момент величайшей из когда-
либо созданных систем искусственного интеллекта.
Однако, некоторые из перечисленных выше программ могли бы скорее
считаться приложениями многофункциональных программных обеспечений,
нежели интеллектуальными системами. Существуют системы, которые имеют
ограниченный набор когнитивных возможностей (вне зависимости ИИ или
нет), и существуют системы, обладающие инструментами, подходящими для
решения широкого спектра общих задач. Большинство используемых сейчас
системых относятся к первому типу — узкодиапазонному. Тем не менее во
многих из них содержатся компоненты, которые способны либо сильно
повлиять на создание будущего искусственного интеллекта, который будет
отличаться высоким общим уровнем развития, либо стать его частью, — это
относится к таким компонентам, как классификаторы, алгоритмы поиска,
модули планирования, решатели задач и схемы представлений.
25
Системы искусственного интеллекта успешно работают еще в одной
области, где ставки крайне высоки, а конкуренция очень жестока, — это
мировой финансовый рынок. Автоматизированные системы торговли акциями
повсеместно используют крупные инвестиционные банки. И, несмотря на то,
что некоторые из них всего лишь помогают автоматизировать исполнение
заказов на покупку и продажу, полученных от управляющей компании, другие
реализуют сложные торговые стратегии, способные приспосабливаться к
меняющимся условиям рынка. Чтобы изучать закономерности и тенденции
фондового рынка, определять зависимость динамики котировок от внешних
переменных, таких как, например, ключевые позиции в сводках финансовых
новостей, — для всего этого в аналитических системах используется большой
набор методик интеллектуального анализа данных и временных
последовательностей. Последние потоковые котировки, которые выпускают
агентства финансовой информации, специально приспособлены под
интеллектуальные автоматизированные системы. Иные системы созданы либо
для поиска возможностей с целью совершения арбитражных операций на
определенном или сразу нескольких рынках ценных бумаг, либо с помощью
алгоритмического высокочастотного трейдинга, целью которого является
получение прибыли на незначительных колебаниях цен в пределах нескольких
милисекунд (на таких временных интервалах начинают играть роль задержки
в поступлении информации даже в оптоволоконных сетях, где она
распространяется со скоростью света, и преимущество получают те, чьи
компьютеры находятся в непосредственной близости от биржи). На долю
алгоритмических высокочастотных трейдингов приходится более половины
оборота фондового рынка США.
Успех, достигнутый на двух магистральных направлениях: во-первых,
создание более прочного статистического и информационно-теоретического
основания для машинного обучения; во-вторых, практическая и коммерческая
эффективность различных конкретных приложений, узкоспециальных с точки
26
зрения решаемых проблем и областей применения, — привел к тому, что
пошатнувшийся было престиж исследований искусственного интеллекта
удалось несколько восстановить. Однако, у научного сообщества, имеющего
отношение к этой теме, от прошлых неудач остался довольно горький опыт,
вынуждающий многих ведущих исследователей отказываться от собственных
устремлений и больших задач. Поэтому один из основателей направления
Нильс Нильсон укоряет своих нынешних коллег в отсутствии той творческой
дерзости, которая отличала поколение первопроходцев:
Соображение «благопристойности», на мой взгляд, оказывает дурное
влияние на некоторых исследователей, выхолащивая саму идею
искусственного интеллекта. Я будто слышу, как они говорят: «ИИ
критиковали за отсутствие результатов. Теперь, добившись видимого успеха,
мы не хотим рисковать собственной репутацией». Подобная
осмотрительность приведет к тому, что все интересы ученых будут
ограничены созданием программ, предназначенных предоставлять помощь
человеку в его в интеллектуальной деятельности, то есть уровнем, который мы
называем «слабый ИИ». Это неизбежно отвлечет их от усилий реализовать
машинный аналог человеческого разума — то есть то, что мы называем
«сильный ИИ». Нильсону вторят такие патриархи, как Марвин Мински, Джон
Маккарти и Патрик Уинстон.
В последние годы заметно, как возрождается интерес к искусственному
интеллекту, что вполне может превратиться в новые попытки создать
универсальный ИИ (по Нильсонусильный ИИ). Эти проекты будут
поддерживаться, с одной стороны, созданием новых аппаратных средств, с
другой — научным прогрессом в информатике и разработке ПО, во многих
специализированных предметных сферах в частности, а также в смежных
областях. Себастиан Трун и Питер Норвиг подготовили в Стэнфордском
университете на осень 2011 года бесплатный онлайновый вводный курс по
искусственному интеллекту. Реакцию на объявление о нем можно
27
рассматривать как самый убедительный показатель неудовлетворенного
спроса на качественную информацию и образование — на курс записались
около 160 тысяч человек со всего мира (окончили его 23 тысячи).
Существует множество вариантов экспертных оценок относительно
будущего, уготованного искусственному интеллекту. Разногласия касаются и
времени его появления, и того вида, в каком он когда-нибудь предстанет перед
миром. Как заметили авторы одного недавнего исследования, прогнозы
перспектив развития ИИ «различны настолько, насколько они категоричны».
Ник Быстром и коллеги обратились к представителям нескольких
экспертных сообществ с вопросом, когда они ожидают появления
искусственного интеллекта человеческого уровня (ИИЧУ) — причем уровень
определялся как «способность освоить большинство профессий, по крайней
мере тех, которыми мог бы владеть среднестатистический человек».
Респондентов просили строить свои предположения на основании того, что
«научная деятельность в этом направлении будет продолжаться без серьезных
сбоев». По данным выборки получились следующие средние оценки:
2022 годсредний прогноз с 10-процентной вероятностью;
2040 годсредний прогноз с 50-процентной вероятностью;
2075 годсредний прогноз с 90-процентной вероятностью.
Так как размер выборки слишком мал, и относительно генеральной
совокупности опрошенных ее нельзя считать репрезентативной, то результаты
стоит рассматривать с некоторой долей скептицизма. Однако они согласуются
с результатами других опросов.
Данные приведенного выше опроса также соответствуют мнению
примерно двух десятков исследователей, интервью с которыми появились за
последние несколько лет. Стоит выделить из них Нильса Нильсона, которые
многие годы успешно занимался фундаментальными вопросами ИИ (методы
поиска, автоматическое планирование, системы представления знаний,
робототехника), написал несколько учебников, недавно завершил самую
28
подробную историю исследований ИИ,когда его спросили о сроках
появления ИИЧУ, Нильсон дал следующее заключение:
2030 годсредний прогноз с 10-процентной вероятностью;
2050 годсредний прогноз с 50-процентной вероятностью;
2100 годсредний прогноз с 90-процентной вероятностью.
Согласно опубликованным интервью, названное профессором
Нильсоном распределение вероятности вполне репрезентативно — многие
эксперты придерживались такого мнения. Однако они расходились довольно
значительно, поскольку отдельные специалисты были уверены, что ИИЧУ
будет создан за период 2020–2040 годов, а некоторые ученые придерживались
позиции, что либо этого не произойдёт никогда, либо это возможно случится
в неопределенно далеком будущем. Более того, одни опрошенные говорили,
что определение «человеческого уровня» по отношению к искусственному
интеллекту выражено некорректно и может вводить в заблуждение, а другие
воздержались от прогнозов.
История показывает, что исследователи не могут похвастаться
способностью предсказывать ни успехи в разработках искусственного
интеллекта, ни формы его воплощения. С одной стороны, выяснилось, что
некоторые задачи, например, игра в шахматы, могут быть решены при помощи
очень простых программ, и скептики, утверждавшие, что машины «никогда»
не смогут делать те или иные вещи, оказываются удивлены. В то же время,
ИИЧУ в 2075, и тем более в 2100 году (даже при условии, что «научная
деятельность в этом направлении будет продолжаться без серьезных сбоев»)
представляется слишком низкой.
В ходе одного из опросов были заданы еще два вопроса, актуальные для
нашего исследования. Респондентов спросили, сколько, по их мнению,
потребуется времени после создания ИИЧУ, чтобы машина смогла развить
сверхразум. Второй вопрос касался темы долговременного воздействия на
человечество, которое будет оказывать ИИЧУ (см. Таблицу 1).
29
Таблица 1. Сколько времени пройдет между созданием искусственного
интеллекта человеческого уровня и появлением сверхразума
Меньше двух лет
Меньше 30 лет
Топ-100
5%
50%
В среднем
10%
75%
30
ГЛАВА 2. ПРИКЛАДНОЕ МАШИННОЕ ОБУЧЕНИЕ
2.1. Анализ текста, виды анализа текста.
Самые большие возможности и высокое качество анализа текстов можно
получить, проведя его полный анализ. Однако сложности, возникающие при
создании подобного анализа таковы, что на практике до сих пор не
реализованы все теоретические положения, разработанные на данный момент.
Основными проблемами здесь являются сложность синтаксического анализа
текста и сложность создания полноценной экспертной системы, реализующей
полноценную модель окружающего мира. Сложность анализа текста
заключается в том, что текст эллиптичен, неполон и насквозь пронизан
умолчаниями. В тексте встречаются конструкции, предназначенные скорее
для живого воображения, чем для формальной обработки: «давить мух»,
«сделать ноги». Анализ подобных текстов может составить серьезную
проблему не только для ЭВМ, но и для человека, так как большинство
ситуаций имело под собой какую-то реальную или вымышленную основу и
вставка их в текст служит как бы ссылкой на такую ситуацию (хотя зачастую
большинство может уже и не помнить о чем идет речь, а просто
восстанавливает истинный смысл фразы). Для полноценной работы система
анализа текста должна иметь возможность проанализировать тест, поданный
пользователем на вход, с точки зрения синтаксиса (структуры предложений),
семантики (понятий, применяемых в тексте) и прагматики (правильности
употребления понятий и целей их употребления). Далее система должна
сгенерировать свой отклик во внутреннем представлении, пригодном для
логического вывода, и просинтезировать свой отклик на естественном языке.
В целом система, поддерживающая полный анализ, должна содержать в себе
следующие модули:
Графематический анализ – обеспечивает выделение синтаксических или
структурных единиц из входного текста, который может представлять собой
31
линейную структуру, содержащую единый фрагмент текста. Однако в более
общем случае текст может состоять из многих структурных единиц: основного
текста, заголовков, вставок, врезок, комментариев и т.д. При машинном
переводе ставится задача сохранить подобную структуру текста. Однако в
случае диалоговых систем обычно используется первый вариант (без вставок).
Но и в этом случае графематический анализ должен выделять синтаксические
единицы: абзацы, предложения, отдельные слова и знаки препинания. В ряде
случаев здесь же проводится предморфологический анализ – объединение
неразрывных неизменяемых словосочетаний в одну единицу: «_что_-_то_»,
«_таким_образом_», «_и_так_далее_», ....
Морфологический анализ – обеспечивает определение нормальной
формы, от которой была образована данная словоформа, и набора параметров,
приписанных данной словоформе. Это делается для того, чтобы
ориентироваться в дальнейшем только на нормальную форму, а не на все
словоформы, использовать параметры, например, для проверки согласования
слов. Предсинтаксический анализ отвечает за две противоположные задачи:
объединение отдельных лексических единиц в одну синтаксическую или,
наоборот, ее разделение на несколько. В одну синтаксическую единицу
объединяются изменяемые неразрывные словосочетания (например, «бить
баклуши»). Делением слов особенно необходимо заниматься, например, в
немецком языке, где несколько произвольных связанных между собой слов
могут объединяться в одно сложное «на лету», а помещать в морфологический
анализ все подобные сочетания не представляется возможным. Еще одной
задачей предсинтаксического анализа является проведение синтаксической
сегментации. Её задачей является разметка линейного текста на фрагменты,
привязанные правилам следующего этапа – синтаксического анализа, который
является задачей с экспоненциальным ростом сложности. В связи с этим
любая помощь при его проведении может привести к существенному
ускорению его работы.

Смотрите также:

"Автоматизация обработки заявок ООО "Проектно-Строительная Компания"
"Автоматизация процесса аттестации персонала для ООО "Нэт Бай Нэт Холдинг"
"Анализ интернет-активности конкурентов ( на примере конкурентов "Газпром нефть")
"Бухгалтерский учёт и аудит расчётов с подотчётними лицами в организации на примере ООО "ЛОЦ 10""
«Психологическое сопровождение персонала в организации на примере ООО «Крокус»
Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR как средство продвижения организации (на примере ПАО "Тамбовский завод "Комсомолец им. Н.С. Артемова")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран