Диплом: Методы поисковой оптимизации ВЕБ-сайтов в Российском сегменте сети интернет (на примере ОАО "ЭЛТЕЗА")

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
12
Помимо вхождения в текст одиночных слов запроса учитывается вхож-
дение пар слов запроса в документ. После экспериментов с различными спо-
собами учета в Яндекс выделили четыре варианта учета пар и определили
соответствующие веса. За разные случаи дается разный вес: так, например,
пара будет учтена, в случае, когда слова запроса расположены в тексте под-
ряд (+1), через слово (+0.5) или в обратном порядке (+0.5). Таже предусмот-
рен особый случай ─ слова, идущие в запросе через одно, в тексте встреча-
ются подряд (+0.1).
Учет всех слов запроса в документе, учет фраз.
Кроме перечисленных факторов не маловажным выступает присут-
ствие абсолютно всех слов запроса в документе. За выполнение этого усло-
вия предусмотрен определенный бонус, который пропорционален сумме idf
слов запроса. При этом в случае, когда в документе находятся не все искомые
слова, за каждое отсутствующее слово WAllWords домножается на коэффи-
циэнт 0.03.
Проблемой является такой момент, как отсутствие в документе боль-
шого числа слов из заданного запроса [5]. Если говорить об эффективности,
то логично было бы удалить документы, не имеющие даже половины (считая
по сумме idf) слов запроса. Однако удалять документы нельзя, поскольку для
выполнения условия полноты поиска требуется как можно большее число
всех возможных релевантных документов. В тексте документа кроме нали-
чия слов запроса можно учесть наличие запроса в полном объеме.
За содержание в тексте предложений, содержащих значительное коли-
чество слов запроса, предусмотрен, так называемый, «бонус» [53]. Под «зна-
чительным» понимаются случаи, когда сумма idf слов запроса в предложении
больше половины суммы idf всех слов запроса.
Pscudo–relcvancc feedback
Для дальнейшего улучшения результатов поиска используется метод
PRF (pseudo–relevance feedback) [60]. Если указанный метод relevance
13
feedback используется без приставки «псевдо–», то он подразумевает, что по-
иск производится в два этапа. На первом этапе пользователь получает
найденные документы и отмечает среди них те, что релевантны запросу. На
втором – эти оценки используются при поиске.
Метод relevance feedback можно применять традиционным способ – для
этого необходимо новые слова, встречающиеся в релевантных документах,
поместить в запрос. Однако поскольку это требует повторного исполнения
всего запроса (более сложного, чем изначальный), то это довольно сложно на
практике.
В Яндекс используется другой способ – документы, которые схожи с
теми, которые пометил эксперт, получают бонус. При этом мера похожести
может быть любой. Используется мера похожести, основанием которой вы-
ступают теги, присвоенные каждому документу [25].
Использование метода relevance feedback [35] реально и без непосред-
ственного участия пользователя в ситуации, когда система работает довольно
хорошо и выводит на первые позиции релевантные документы. В этом случае
первые N документов просто объявляются релевантными, и ранг похожих на
них документов растет. Допускается зависимость релевантности от позиции
документа в поиске.
Для того, что бы выявить и рассчитать похожесть нужны признаки до-
кументов, по которым будет определяться похожесть. Используется два вида
наборов тегов.
Первый из них не что иное, как автоматическая классификация доку-
ментов по темам Яндекс.Каталога. При этом создание классификации проис-
ходит посредством алгоритма Байеса в интерпретации Пола Грэма [54]. Под-
борка документов, на основе которой настраивался автомат, создана по сле-
дующим принципам [43]. Автомат присваивает каждому из документов одну
тему. Точность алгоритма – 63%, полнота – 46%, F1 – 54% (величины – мик-
роусредненные, измерены по рубрикам 2-го уровня Яндекс.Каталога). До-
14
полнительный бонус по итогам PRF присваивается документам по той же
теме, что и первые документы в поиске[41].
Второй набор признаков использует слова, которые попадаются в до-
кументе [33]. Смысл в том, что бы найти группы слов, которые часто нахо-
дятся вместе, и назначить им признаки. После этого каждому документу
можно назначить признак, если в нем расположено большое количество слов
из группы этого признака. Создание подобных групп связано с применением
принципа минимальной длины описания (Minimal Description Length, MDL)
[42].
Рассматривалась матрица, которая по столбцам содержала слова, а по
строкам – документы. Если документ включал данное слово, то на пересече-
ние записывалась 1, если нет – 0. После чего посредством групп слов требу-
ется создать максимально возможное компактное описание данной матрицы.
Использовалось описание в следующем виде. Для каждой группы слов
предусмотрен список слов, а для каждого документа используется список
слов этого документа, также имеется список «поправочных» слов [43]. Со-
единение слов документа дает нам ряд «предсказанных» слов для документа.
Под «поправочными» словами понимаются слова, присутствующие в доку-
менте, но отсутствующие в «предсказанных»; или, напротив , слова, которые
можно найти в «предсказанных», но не обнаружить в документе. Описание
исходной матрицы было подобрано оптимально согласно количеству инфор-
мации. В итоге сформировались группы слов и списки документов, в кото-
рых используются эти группы слов. Они и были включены во второй набор
признаков. В результате PRF со вторым набором признаков документы, ис-
пользующие сходную с лидерами лексику, удостаиваются дополнительного
бонуса.
Все эти выкладки описывают подход к определению релевантности до-
кументов на основе анализа их текста [9]. Однако, как показало время, анали-
за одной текстовой составляющей для качественного поиска недостаточно. С
15
ростом популярности поисковые системы превратились в неплохой источник
трафика для веб-сайтов, и веб–мастера для его привлечения наполняли доку-
менты словами, которые используют посетители поисковых систем в запро-
сах. Результаты поиска ухудшались, необходим был технологический про-
рыв, который уменьшил бы влияние на результаты поиска со стороны веб–
мастеров. В 1996 году Сергей Брин и Лэрри Пэйдж, основатели поисковой
системы Google [11], придумали модель ссылочного ранжирования, которая
использовалась для оценки релевантности документа и при этом не зависела
от наличия в нем слов запроса или их плотности. Основная идея состояла в
том, что, посчитав количество гиперссылок на веб-сайт (далее – ссылок),
можно определить степень его популярности. По аналогии с научными рабо-
тами, когда автор в статье ссылается на ранее опубликованные работы, а ко-
личество таких ссылок для конкретной работы служит мерилом влияния и
авторитета автора. Далее Пейдж развил свою идею: ссылки бывают разные,
некоторые из них обладают большей значимостью («весом»), другие – мень-
шим. Как определить, какая ссылка более значима? Очень просто. Более зна-
чимыми считаются те сайты, на которые направлено большее число ссылок.
Программу определения значимости Пэйдж назвал Page Rank (PR) – от англ,
«страница» и «ранжировать». Для каждой страницы, проиндексированной
Google, рассчитывается PR, который зависит, от числа ссылок в Интернете на
эту страницу (естественно, проиндексированных Google) и важности ссыла-
ющихся страниц. Следует отметить, что не все ссылки могут учитываться –
отфильтровываются ссылки с сайтов, специально предназначенных для
«накрутки» PR (к примеру, неструктурированные веб-сайты, содержащие
большое количество ссылок на ресурсы разнообразной тематики) [55]. Более
того, некоторые ссылки могут давать отрицательный вклад при расчете PR
[10]. Естественно, речь идет о «внешних» ссылках, т.е. указывающих на до-
кумент другого веб-сайта (домена; http://site.ru и http://dopsite.site.ru – раз-
ные домены).
16
Поскольку ссылающихся документов может быть много, и общее их
количество, проиндексированное поисковой системой Google, измеряется
миллионами и постоянно растет, то представлять PR в абсолютных значени-
ях было бы неудобно [47], для этого все PR страниц уложили в шкалу от 0 до
10. Нужно отметить, что пересчет PR – длительный процесс, требующий
больших машинных ресурсов. Он происходит раз в 2–4 месяца и длится око-
ло недели.
Таким образом, к внешним факторам были причислены ссылки и свя-
занные с ними характеристики: их количество, вес, анкор (от англ, anchor –
«якорь», текст, нажатие на который приводит к переходу на другой доку-
мент). Анкор ссылки имеет решающее значение при прочих равных услови-
ях. Принято считать, что если на документ стоит ссылка с анкором «образо-
вание», то есть некоторая вероятность, что в нем можно найти информацию
об образовании. Документ, содержащий ссылку, именуется донором; доку-
мент, на который ведет ссылка, – акцептором [59]. В случае, если акцептор не
содержит слов из запроса пользователя в поисковой системе, он все равно
может показываться в результатах, т.к. анкоры указывающих на этот доку-
мент ссылок содержат* слова запроса. В этой ситуации со ссылкой можно
увидеть слова «найден по ссылке» (Яндекс) или «слова присутствуют только
в ссылках на эту страницу» (Google) [16].
После этого веб–мастера стали проставлять множество ссылок для ма-
нипулирования результатами поиска, образовались биржи по покупке и про-
даже ссылок. Да, ссылочное ранжирование претерпело изменения и стало бо-
лее сложным, однако оно считается одним из главных факторов, влияющих
на ранжирования в поисковых системах. В последние несколько лет можно
наблюдать новые запросные факторы, например, геозависимость, т.е. для ка-
чественного ответа, поисковая система учитывает регион, из которого был
задан запрос.
1.2 Поисковые системы Рунет
17
В 1996 году в Рунет появились поисковые системы Апорт
(www.aport.ru) и Рамблер (www.ramblеr.ru). 23 сентября 1997 года был от-
крыт Яндекс (www.yandex.ru). Поисковая система Google (www.google.com)
заработала для студентов и преподавателей США осенью 1997 года.
Активный рост Рунета и расширение объемов информации, которая
индексировалась поисковыми системами, привел к необходимости мощных
дата–центров. Качество поиска и зависящий от этого имидж поисковой си-
стемы зависит от частоты обновления поискового индекса, которое также
требует существенных мощностей. В последнее время в большей степени
Апорт, и немногим менее Рамблер превратились в каталог сайтов – т.е. редко
изменяемый список документов, т.к. обновления поисковой базы происходят
крайне редко (для Рамблер 1 раз в 2 месяца, Апорт – и того реже). В то время,
как Яндекс был единственным сервером, который устанавливался под столом
одного из разработчиков Дмитрия Тейбшома, а после чего стал разветвлен-
ной независимой сетью дата–центров, которая включает в себя тысячи серве-
ров [30] и регулярно увеличивается на несколько новых.
Поисковая система Google также прошла путь от одного сервера к
огромному распределенному дата–центру, включающему на сегодняшний
день свыше 100 тысяч серверов. Google – самая популярная поисковая си-
стема в мире, которая осуществляет поиск и по Рунет (www.gооgle.ru). На се-
годняшний день в России наиболее востребованы, актуальны и перспективны
лишь две поисковые системы – Яндекс и Google, которые и рассматриваются
в данной работе.
1.3 Яндекс
18
Для поисковой системы Яндекс доступна индексация и поиск по сле-
дующим форматам документов: HTML, PDF, RTF, DOC, XLS. Также можно
выделить параллельный поиск Яндекс, позволяющий проводить поиск и по
основной базе, и по другим сервисам, в которые включены новости, картин-
ки, фото, видео, блоги, карты и маркет (платные рекламные объявления). Та-
кие дополнительные результаты могут находиться, как над результатами ос-
новного поиска, так и справа от них, и даже внутри. Для работы поисковой
системы Яндекс используется обширная группа индексирующих роботов
(табл. 1.1). Распознать их можно через лог–файлы веб–сервера по полю User–
agent, Так как IP–адреса роботов регулярно меняются, то проводить иденти-
фикацию по ним нелогично.
Основной индексирующий робот – индексирует основной объем тек-
стовой информации, находящейся в сети. Он индексирует HTML и прочие
типы документов в форме текстовых данных.
«Зеркальщик»это робот, определяющий зеркала сайтов, в том числе
и как отображать веб-сайт, с «www» или без (к примеру, http://www.site.ru
или http://site.ru). Апдейт зеркальщика – учет изменений, найденных робо-
том, происходит довольно редко, 1 раз в 1–2 месяца.
Индексатор Яндекс.Картинок – занимается индексацией картинок во
всех популярных форматах в Интернет. Апдейт происходит в среднем раз в
неделю, иногда чаще.
Индексатор Яндекс.Видео – зона ответственности которого, поиск ви-
део. Ранжирование проводится посредством анализа текста, окружающего
файл с видео на странице, а также популярности ролика в блогах и т.д.
Робот, индексирующий мультимедийные данные – а именно, докумен-
ты в формате Adobe Flash (flv–файлы).
Робот, обращающийся к странице при добавлении ее через форму «До-
бавить URL» (http://webmaster.yandex.ru/addurl.xml) – при добавлении нового
веб-сайта или документа через форму на странице Яндекс происходит обра-
19
щение данного робота к сайту. Посещение основного индексирующего робо-
та может занять от нескольких дней до нескольких месяцев.
Робот, индексирующий страницы сайтов, участвующих в Рекламной
сети Яндекса – робот индексирующий веб-сайты на которых показываются
рекламные объявления Яндекс (Яндекс.Директ).
«Простукивалка» Яндекс.Директа – робот, проверяющий работоспо-
собность веб-сайтов, размещающих на своих страницах рекламные объявле-
ния Яндекс.Директ, а также веб-сайты, рекламирующиеся в нем.
Робот Яндекс.Метрики – робот, проверяющий работоспособность
страниц, на которых установлен код Яндекс.Метрики (позволяет анализиро-
вать поведение посетителя на веб-сайте).
«Простукивалка» Яндекс.Каталога – робот, проверяющий на работо-
способность веб-сайты, размещенные в Яндекс.Каталоге.
Индексатор Яндекс.Новостей – специальный робот, индексирующий
часто обновляемые новостные ресурсы, которые участвуют в проекте Ян-
декс.Новости (http://news.yandex.ru/).
Робот мобильных сервисов – информация об этом роботе на официаль-
ном блоге Яндекс отсутствует, однако можно предположить, что такой робот
индексирует wap–сайты.
Кроме роботов, которые упомянуты выше, предусмотрен «быстрый ро-
бот» (далее – быстроробот), который работает параллельно с основным ин-
дексирующим. Он необходим для оперативного обнаружения и индексации
актуальных страниц. Представители Яндекс [55] информируют о том, что
быстрый робот использует некую информацию о востребованных пользова-
телями документах и на основании этого находит новые и измененные стра-
ницы, после чего они становятся доступными в результатах поиска в течение
небольшого промежутка времени, которое фиксируется в минутах. Следует
добавлять по 1 новому, уникальному документу ежедневно, что бы быстро-
робот посещал веб-сайт.
20
Работу и функционирование каждого из роботов, упомянутых выше, за
исключением быстроробота и Индексатора Яндекс.Новостей, можно увидеть
лишь после обновления поисковой базы (т.н. «апдейта»). Апдейты в Яндекс
чаще всего происходят с периодичностью 1–2 раза в неделю. Их можно объ-
единить в две большие группы: текстовые и ссылочные. В первом случае в
основную базу, по которой осуществляется поиск, добавляются новые стра-
ницы. Логично добавить, что данные из базы быстроробота удаляются и пе-
ремещаются в основную базу. Происходит изменение количества ссылок на
веб-сайты, поскольку в основной базе обновляются измененные и появляют-
ся новые документы. Эти ссылки на данном этапе не участвуют, т.е. не влия-
ют на ссылочное ранжирование. В ссылочный апдейт происходит учет
найденных ранее ссылок, без добавления в основную базу новых документов.
Язык поисковых запросов.
Для использования расширенных возможностей поиска Яндекс позво-
ляет вводить запросы, используя собственный язык.
Таблица 1.1 – Использование расширенных возможностей поиска Яндекс
Пример
Значение
"слово"
Слова идут подряд в точной форме
" слово * слово "
Пропущено слово в цитате
слово & слово
Слова в пределах одного предложения
слово && слово
Слова в пределах одного документа
слово | слово | слово
Поиск любого из слов
слово « слово
Неранжирующее "и": выражение после операто-
ра нс влияет на позицию документа в выдаче
слово /2 слово
Расстояние в пределах двух слов в любую сто-
рону (то есть между заданными словами может
встречаться одно слово)
слово &&/3 слово
Расстояние в 3 предложения в любую сторону
–слово
Исключение слова из поиска
21
слово /+2 слово
Расстояние в пределах двух слов в прямом по-
рядке
слово1 –слово2
Поиск предложения, где слово « слово 1» встре-
чается без слова « слово2»
слово /(–1 +2) слово
Расстояние от одного слова в обратном порядке
до двух слов в прямом
! Слово ! слово ! слово
Слова в точной форме с заданным регистром
слово && (+ слово | !Cлово )
Скобки формируют группы в сложных запросах
!!слово
Словарная форма слова
Продолжение таблицы 1.1
title:(слово)
Поиск по заголовкам документов
url:www.site.net/pitca.htm
Поиск по URL
слово inurl:vojne
Поиск с учетом фрагмента URL
host:www.site.ru
Поиск по хосту
rhost:ru.site.*
Поиск по хосту в обратной записи
mime:pdf
Поиск по одному типу файлов
lang:en
Поиск с ограничением по языку
domain:ru
Поиск с ограничением по домену
date:200712*
Поиск с ограничением по дате
date:20071215..20080101,
date:>20091231
Поиск с ограничением по интервалу дат
cat: 11000051
Поиск по рубрике Яндекс.Каталога
Среди всех вышеперечисленных конструкций полезным будет поиск по
URL – он позволяет определить количество документов, проиндексирован-
ных Яндекс для каждого домена. Также полезен поиск точной фразы – он
позволяет найти дубликаты текстов в Интернет. Поиск точной словарной
формы в сочетании с поиском точной фразы дают возможность правильно
воспользоваться статистикой поисковых запросов Яндекс.

Смотрите также:

"Автоматизация обработки заявок ООО "Проектно-Строительная Компания"
"Автоматизация процесса аттестации персонала для ООО "Нэт Бай Нэт Холдинг"
"Анализ интернет-активности конкурентов ( на примере конкурентов "Газпром нефть")
"Бухгалтерский учёт и аудит расчётов с подотчётними лицами в организации на примере ООО "ЛОЦ 10""
«Психологическое сопровождение персонала в организации на примере ООО «Крокус»
Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR как средство продвижения организации (на примере ПАО "Тамбовский завод "Комсомолец им. Н.С. Артемова")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран