42
но недопустимы с точки зрения семантики. Чтобы выбирать правильные
варианты разбора необходима возможность их ранжировать. С одной стороны,
это позволяет найти лучший в соответствии с некоторым критерием результат,
а с другой стороны, это может ускорить разбор, поскольку анализатор в случае
неоднозначности будет направляться в наиболее весомые ветви, и, таким
образом, скорее будет построено наиболее адекватное синтаксическое дерево.
Для ранжирования вариантов синтаксического разбора широкое применение
нашли статистические подходы. Наиболее известным статистическим
подходом к задаче построения деревьев составляющих является применение
стохастических контекстно- свободных (СКС) грамматик. СКС-грамматики
отличаются от обычных КС- грамматик тем, что каждому правилу грамматики
назначена вероятность. Задачей синтаксического анализатора в этом случае
является нахождение наиболее вероятного варианта разбора предложения.
СКС-грамматики автоматически строятся на основе банков синтаксических
деревьев – корпусов, в которых предложениям вручную или
полуавтоматически сопоставлены синтаксические деревья. Например, для
английского языка наиболее известным подобным банком является Penn
Treebank. Для разбора предложений на ЕЯ по СКС-грамматикам в основном
применяют модификации, ранее представленных в этом разделе алгоритмов,
использующих принципы динамического программирования (CYK, Эрли,
«chart-parser»). Подходы, предложенные исследователями, различаются в
основном методами моделирования вероятностей синтаксических деревьев, а
также способами решения задачи поиска дерева с максимальной
вероятностью.
Первые СКС-грамматики в основном опирались на синтаксические
правила взаимодействия частей речи. Однако эксперименты показали, что
статистической информации о сочетаемости частей речи недостаточно для
разрешения неоднозначности ЕЯ. Оценки качества подобных анализаторов
были значительно ниже, чем у анализаторов, использующих большие наборы