Диплом: Машинное обучение в задачах синтаксического анализа естественных языков

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
62
Пара из лексемы и лексического класса определяет синтаксическую
парадигму, которая определяет весь спектр допустимых синтаксических
возможностей.
Парадигма - это набор синтаксических уровней, каждый из которых
определяет какой-то аспект синтаксической структуры. Логично, что
парадигма представляет собой конъюнкцию уровней: составляющая должна
соответствовать всем. Некоторые уровни универсальны (напр. определены для
частей ерчи), некоторые лексиколизованны (напр. определены дляветвей
семантической иерархии).
Синтаксический уровень представляет собой набор синтаксических
форм, каждая из которых определяет специфическую синтаксическую
конфигурацию. Логично, что уровень представляет собой дизъюнкцию форм:
составляющая должна соответствовать по крайней мере одной из них.
Уровни связаны с категориями синтаксиса; формы, связанные с
конкретными граммемами. Если составляющая соответствует форме, она
получает соответствующую граммему.
Синтаксическая форма может влиять на:
• грамматическому выражению, которое соответствует
грамматическому значению составляющей,
ноль или более поверхностных слотов, которые необходимо заполнить,
• для каждого поверхностного слота, набор семантических слотов,
доступных в качестве его семантической интерпретации.
Есть синтаксические категории, которые параллельны
морфологическим категориям. Например, глаголы имеют морфологическое
время. Но в аналитических формах, Время морфологически выражается через
вспомогательный глагол. Таким образом, у нас есть синтаксическую
категориию SyntacticTense. Когда главный глагол личный, его SyntacticTense
исходит из его Времени; но когда вспомогательный глагол личный, смысловой
глагол копирует значение по SyntacticTense по согласованию.
63
Пример разбора предложения «Иван Михайлович родился 10 октября
1990 года».Пример правила, извлекающего дату из текста:
// Иван Михайлович родился 10 октября 1990 г.
this "DAY_NUMBER" [ month "MONTH_PERIOD" [ year "YEAR" [year_n
"DIGITAL_NUMBER"] ] ]
Левая часть правила – шаблон на дереве разбора
● "DAY_NUMBER" – семантические классы
● month – названия переменных
● [] – переход к дочернему узлу в дереве
Правая часть правила – набор утверждений:
● О существовании объекта класса момент времени
● О заполнении атрибутов – года, дня и т.д.
● Об аннотировании объектов – привязка созданного объекта к
определенным составляющим в тексте
PointOfTime point(this),
point.year == Num(year_n),
point.day == Num(this),
annotation(point, this.core, month.core, year.core, year_n.core
64
ЗАКЛЮЧЕНИЕ
Основные результаты, полученные в рамках дипломной работы:
1. Изучена история развития искусственного интеллекта и машинного
обучения в том числе в задачах, связанных с анализом естественного языка.
2. Рассмотрено состояние развития машинного обучения в настоящее
время.
3. Дано описание существующих способов автоматического анализа
естественного языка.
4. Изучены методы синтаксического анализа естественного языка в
рамках машинного обучения, дана их краткая характеристика.
5. Исследованы синтаксические анализаторы MaltParser, AOT, ABBYY
Compreno, определены их основные характеристики.
65
СПИСОК ИСПОЛЬЗОВАННОЙ ЛИТЕРАТУРЫ
1. Смирнов И. В., Шелманов А. О. Семантико-синтаксический
анализ естественных языков. Часть I. Обзор методов синтаксического и
семантического анализа текстов // Искусственный интеллект и принятие
решений. — 2013. — No 1. — С. 41–54.
2. Relational–situational method for intelligent search and analysis of
scientific publications / Gennady Osipov, Ivan Smirnov, Ilya Tikhomirov, Artem
Shelmanov // Proceedings of the Workshop on Integrating IR technologies for
Professional Search, in conjunction with the 35th European Conference on
Information Retrieval (ECIR’13). — Vol. 968. — CEUR Workshop Proceedings,
2013.
3. Семантико-синтаксический анализ естественных языков Часть II.
Метод семантико-синтаксического анализа текстов / И. В. Смирнов, А. О.
Шелманов, Е. С. Кузнецова, И. В. Храмоин // Искусственный интеллект и
принятие решений. — No 1. — С. 1124.
4. Shelmanov A. O., Smirnov I. V. Methods for semantic role labeling of
Russian texts // Computational Linguistics and Intellectual Technologies. Papers
from the Annual International Conference "Dialogue" (2014). — No. 13. — 2014.
P. 607 620.
5. Осипов Г. С., Шелманов А. О. Метод повышения качества
синтаксического анализа на основе взаимодействия синтаксических и
семантических правил // Труды шестой международной конференции
"Системный анализ и информационные технологии" (САИТ). Т. 1. 2015.
— С. 229240.
6. Шелманов А. О. Метод автоматического выделения
многословных терминов из текстов научных публикаций // Труды
тринадцатой национальной конференции по искусственному интеллекту с
66
международным участием КИИ-2012. — Т. 1. — Белгород, 2012. — С. 268
274.
7. Шелманов А. О., Смирнов И. В. «Программа лингвистического
анализа неструктурированной текстовой информации на русском и
английском языках» // Свидетельство о государственной регистрации
программ для ЭВМ. No 2013613430. — 2013.
8. ETAP parser: state of the art / L. Iomdin, V. Petrochenkov, V. Sizov,
L. Tsinman // Papers from the Annual International Conference "Dialogue" (2012).
2012. P. 830853.
9. Syntactic and semantic parser based on ABBYY Compreno linguistic
technologies/ K. V. Anisimovich, K. Ju. Druzhkin, F. R. Minlos et al. // Papers from
the Annual International Conference "Dialogue" (2012). — Vol. 2. — 2012. — P.
91103.
10. Chomsky N. Three models for the description of language // IRE
Transactions on Information Theory. — 1956. — Vol. 2, no. 3. — P. 113–124.
11. Tesnière L. Elements de syntaxe structurale. — Editions Klincksieck,
1959.
12. Mel’cuk I. A. Dependency syntax: theory and practice. — ŠUNY
Press, 1988. — P. 428.
13. Chomsky N. Syntactic structures. The Hague : Mouton, 1957. P.
117.
14. Partee B., Ter Meulen A., Wall R. Mathematical methods in linguistics.
Springer, 1990. — Vol. 30 of Studies in Linguistics and Philosophy.
15. Huybregts R. The weak inadequacy of context-free phrase structure
grammars // Van Periferie naar Kern. — 1984. — P. 81–99.
16. Shieber S. M. Evidence against the context-freeness of natural language
// The Formal Complexity of Natural Language. — 1987. — Vol. 33. — P. 320–
334.
17. Hudson R. Word grammar. — Blackwell Oxford, 1984.
67
18. Karlsson F. Constraint grammar as a framework for parsing running
text // Proceedings of the 13th conference on Computational linguistics. — Vol. 3.
Association for Computational Linguistics, 1990. — P. 168–173.
19. Universal dependency annotation for multilingual parsing / Ryan
Mcdonald, Joakim Nivre, Yvonne Quirmbach-brundage et al. // Proceedings of the
51st Annual
Meeting of the Association for Computational Linguistics. — Vol. 2. —
2013. — P. 92-97
20. Nivre J. Dependency grammar and dependency parsing // MSI report. —
2005. — Vol. 5133, no. 1959. — P. 1–32.
21. Non-projective dependency parsing using spanning tree algorithms /
Ryan McDonald, Fernando Pereira, Kiril Ribarov, Jan Hajic // Proceedings of the
conference on Human Language Technology and Empirical Methods in Natural
Language Processing. — Association for Computational Linguistics, 2005. — P.
523–530.
22. Тестелец Я.Г.Введение в общий синтаксис.—М.: Издательство
РГГУ, 2001.
23. Jurafsky D., Martin J. H. Speech & language processing. — Pearson
Education, 2000.
24. Сулейманова Е. А. О комплексном подходе к разрешению
реляционно- аппозитивных неоднозначностей // Программные системы:
теория и приложения. — 2014. — Т. 5, No 4. — С. 41–66.
25. Kasami T. An efficient recognition and syntax analysis algorithm for
context-free languages. — 1965. — Technical report.
26. Younger D. H. Recognition and parsing of context-free languages in
time n^3 // Information and control. — 1967. — Vol. 10, no. 2. — P. 189208.
27. Earley J. An efficient context-free parsing algorithm //
Communications of the ACM. — 1970. — Vol. 13, no. 2. — P. 94102.
68
28. Kay M.Algorithm schemata and data structures in syntactic
processing//Technical Report CSL80-12. — 1980.
29. Tomita M.LR parsers for natural languages//Proceedings of the 10th
international conference on Computational linguistics. — Association for
Computational Linguistics, 1984. — P. 354–357.
30. Collins M. Head-driven statistical models for natural language parsing
// Computational linguistics. — 2003. — Vol. 29, no. 4.
31. Marcus M.P., Marcinkiewicz M.A., Santorini B. Building a large
annotated corpus of English the Penn treebank // Computational Linguistics. —
1993. — Vol. 19, no. 2. — P. 313330.
32. Collins M. Three generative, lexicalised models for statistical parsing
// Proceedings of the 35th Annual Meeting of the Association for Computational
Linguistics and Eighth Conference of the European Chapter of the Association for
Computational Linguistics. — Association for Computational Linguistics, 1997.
P. 16–23.
33. Hays D. G. Dependency theory: A formalism and some observations
// Language. — 1964. — Vol. 40. — P. 511525.
34. Gaifman H. Dependency systems and phrase-structure systems //
Information and control. — 1965. — Vol. 8, no. 3. — P. 304–337.
35. Holan T., Kubon V., Plátek M. A prototype of a grammar checker for
Czech // Proceedings of the fifth conference on Applied natural language processing.
Association for Computational Linguistics, 1997. — P. 147–154.
36. Lombardo V., Lesmo L. An Earley-type recognizer for dependency
grammar // Proceedings of the 16th conference on Computational linguistics. —
Association for Computational Linguistics, 1996. — P. 723728.
37. Maruyama H. Structural disambiguation with constraint
propagation//Proceedings of the 28th annual meeting on Association for
Computational Linguistics. — Association for Computational Linguistics, 1990.
P. 31–38.
69
38. Covington M. A. A fundamental algorithm for dependency parsing //
Proceedings of the 39th annual ACM Southeast Conference. 2001. P. 95102.
39. Eisner J. M. Three new probabilistic models for dependency parsing:
An exploration // Proceedings of the 16th conference on Computational linguistics.
Vol. 1. Association for Computational Linguistics, 1996. — P. 340–345.
40. McDonald R., Crammer K., Pereira F. Online large-margin training of
dependency parsers // Proceedings of the 43rd annual meeting on Association for
Computational Linguistics. — Association for Computational Linguistics, 2005.
P. 91–98.
41. ChuY.-J.,LiuT.-H.On shortest arborescence of a directed
graph//ScientiaSinica. — 1965. — Vol. 14, no. 10. — P. 1396.
42. Edmonds J. Optimum branchings // Journal of Research of the National
Bureau of Standards, Section B: Mathematics and Mathematical Physics. — 1967.
Vol. 71B, no. 4. — P. 233–240.
43. Mcdonald R., Pereira F. Online learning of approximate dependency
parsing algorithms // Proceedings of European Chapter of the Association for
Computational Linguistics. — Association for Computational Linguistics, 2006.
44. Nakagawa T. Multilingual dependency parsing using global
features//Proceedings of the CoNLL Shared Task Session of EMNLP-CoNLL 2007.
Association for Computational Linguistics, 2007. — P. 952–956.
45. Carreras X. Experiments with a higher-order projective dependency
parser // Proceedings of the CoNLL Shared Task Session of EMNLP-CoNLL 2007.
Association for Computational Linguistics, 2007. — P. 957–961.
46. Zhang H., McDonald R. Generalized higher-order dependency parsing
with cube pruning // Proceedings of the 2012 Joint Conference on Empirical
Methods in Natural Language Processing and Computational Natural Language
Learning. — Association for Computational Linguistics, 2012. — P. 320–331.
47. McDonald R., Satta G. On the complexity of non-projective data-
driven dependency parsing // Proceedings of the 10th International Conference on
70
Parsing Technologies. — Association for Computational Linguistics, 2007. — P.
121–132.
48. Kudo T., Matsumoto Y. Japanese dependency structure analysis based
on support vector machines // Proceedings of the 2000 Joint SIGDAT conference on
Empirical methods in natural language processing and very large corpora: held in
conjunction
with the 38th Annual Meeting of the Association for Computational
Linguistics. — Vol. 13. — Association for Computational Linguistics, 2000. — P.
18–25.
49. Yamada H., Matsumoto Y. Statistical dependency analysis with
support vector machines // Proceedings of 8th International Workshop on Parsing
Technologies. — 2003. — P. 195–206.
50. Nivre J., Hall J., Nilsson J. Memory-based dependency parsing //
Proceedings of CoNLL. — 2004. — P. 49–56.
51. Nivre J. Inductive Dependency Parsing of Natural Language Text :
Ph.D. thesis / Joakim Nivre ; School of Mathematics and Systems Engineering,
Växjö University. — 2005.
52. Nivre J., Nilsson J. Pseudo-projective dependency parsing //
Proceedings of the 43rd Annual Meeting on Association for Computational
Linguistics. — Association for Computational Linguistics, 2005. — P. 99–106.
53. MaltParser: A language-independent system for data-driven
dependency parsing / Joakim Nivre, Johan Hall, Jens Nilsson et al. // Natural
Language Engineering. — 2007. — Vol. 13, no. 2. — P. 95–135.
54. Nivre J., Hall J., Nilsson J. MaltParser: A data-driven parser-generator
for dependency parsing // Proceedings of the International Conference on Language
Resources and Evaluation (LREC). — Vol. 6. — 2006. — P. 2216–2219.
55. Nivre J., Boguslavsky I. M., Iomdin L. L. Parsing the SynTagRus
treebank of Russian // Proceedings of the 22nd International Conference on

Смотрите также:

"Автоматизация обработки заявок ООО "Проектно-Строительная Компания"
"Автоматизация процесса аттестации персонала для ООО "Нэт Бай Нэт Холдинг"
"Анализ интернет-активности конкурентов ( на примере конкурентов "Газпром нефть")
"Бухгалтерский учёт и аудит расчётов с подотчётними лицами в организации на примере ООО "ЛОЦ 10""
«Психологическое сопровождение персонала в организации на примере ООО «Крокус»
Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR как средство продвижения организации (на примере ПАО "Тамбовский завод "Комсомолец им. Н.С. Артемова")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран