Диплом: Методы поисковой оптимизации ВЕБ-сайтов в Российском сегменте сети интернет (на примере ОАО "ЭЛТЕЗА")

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
22
Статистика поисковых запросов.
Для оценки частотности того или иного запроса в Яндекс необходимо
воспользоваться статистикой поисковых запросов (http://wordstat.yandex.ru.)
Рисунок 1 – Пример частотности запроса wordstat.yandex
Сервис позволяет проанализировать частотность запросов с учетом ре-
гионов и сезонности. В случае, когда запрос так или иначе связан с регионом
пользователя, его задавшего, необходимо выбрать регион из списка. Первая
цифра показывает суммарное количество запросов, учитывая как однослов-
ный запрос, так и его расширения в виде двух, трех, четырехсловных и более
длинных запросов. В случаи если необходимо узнать точное количество за-
просов нужно использовать язык поисковых запросов Яндекс. Вводим “слово
23
!слово !слово” – поиск точной фразы с учетом словоформ, 90% веб–мастеров
использующих статистику запросов Яндекс, совершают ошибку анализируя
статистику не применяя язык поисковых запросов.
В правой колонке показаны запросы, которые вводили пользователи
после того, как спросили у Яндекс основной запрос. Скорее всего пользова-
тели не нашли ответ на свой вопрос и пытались его переформулировать. Та-
ким образом, в правой колонке можно получить смежные, тематические за-
просы.
Поиск дубликатов текста.
Еще один из важных применений языка запросов в Яндекс является
поиск дубликатов текста. Для этого необходимо взять 5–6 слов в пределах
одного предложения и внести их в кавычках в поисковой строке Яндекс. Ес-
ли документ уникален, то в результатах поиска будет присутствовать ссылка
только на него.
Поиск с учетом региона.
От 15 до 30% всех запросов, которые пользователи задают Яндекс, –
геозависимые [58]. Это запросы, по которым, пользователи рассчитывают
получить локальную (региональную) информацию, к примеру, об услугах в
своем городе. На такие запросы Яндекс ответит по–разному, для каждого го-
рода/региона предложив пользователю различные результаты. Часть опреде-
ленных запросов, например, поиск книг или сериалов, не зависят от региона
нахождения пользователя. Такие запросы называются геонезависимыми, и
результаты поиска в данном случае не зависят от региона пользователя.
Существуют запросы, имеющие разное значение в зависимости от ре-
гиона. Набирая в поисковой системе слово «орбита», москвичи скорее всего
хотят получить информацию о кинотеатре, жители Ростова-на-Дону – об ав-
тосалоне, израильтяне – об интернет-портале.
24
Свойство, позволяющее различать запросы пользователя, повышает ка-
чество поиска и позволяет дать пользователю точный ответ без повторных
уточняющих запросов.
Принадлежность веб-сайта к какому-либо региону может быть распо-
знана по ряду характеристик, в их числе – его IP-адрес, контактная информа-
ция, указанная на веб-сайте, регион, которому посвящена информация на нем
Для веб-сайтов, зарегистрированных в Яндекс. Вебмастер
(http://webmaster.yandex.ru) можно указать регион самостоятельно. Также ре-
гион могут присвоить модераторы при добавлении веб-сайта в каталог Ян-
декс http://yaca.yandex.ru/).
Веб-сайты, на страницах которых указано множество адресов из раз-
личных регионов (например, почта России), могут признаваться общероссий-
скими, т.е. получить регион «Россия» и участвовать при поиске из любого
города. Список регионов/городов, для которых осуществляется поиск
http://search.yaca.yandex.ru/geo.c2n).
История алгоритмов.
Первая значительная смена формулы ранжирования с момента запуска
поисковой системы Яндекс произошла 20 декабря 2007 года. Именно тогда
Яндекс стал использовать переформулирование запросов и практически на
любой запрос стал выдавать сайты, подходящие под ключевые слова. До это-
го момента Яндекс соответствовал надписи на собственном логотипе при от-
сутствии найденных результатов: «Найдется все... со временем!», так как на
некоторые запросы ответов не находилось.
Практически сразу вслед за этой сменой формулы ранжирования по-
следовали еще две: алгоритм «8 sp 1» начал использоваться 17 января и 5
февраля 2008 года.
Примерно в это время началось массовое использование поискового
спама – попытки искусственно повышать позиции со стороны веб–мастеров.
Все последующие версии алгоритмов помимо новшеств для пользователей
25
поисковой системы включали также новые способы борьбы с поисковым
спамом.
Последующие версии алгоритмов Яндекс называл именами городов.
Формула ранжирования от 16 мая 2008 года была названа «Магадан». Поми-
мо текста на странице Яндекс стал учитывать переведенные и транслитеро-
ванные URL-адрсса, повысилась точность распознавания фамилий и геогра-
фических названий.
К лету специалисты Яндекс внесли корректировки в алгоритм, и 2
июля 2008 года был запущен «Магадан 2.0». Важнейшим нововведением ал-
горитма было определение первоисточника.
9 июля 2008 года был проведен запуск бета–версии алгоритма «Наход-
ка». Дорабатывали этот алгоритм долго, и итоговая версия «Находки» появи-
лась лишь 11 сентября 2008 года. В ней был реализован инновационный под-
ход к машинному обучению, изменен учет «стоп–слов», расширен тезаурус.
Следующим алгоритмом в Яндекс стал «Арзамас» (Анадырь), запу-
щенный в работу 10 апреля 2009 года. С этим алгоритмом Яндекс научился
лучше понимать русский язык. Теперь при запросе «реконструкция Маяков-
ской» показывается также страница со словами «станция Маяковская откры-
лась после реконструкции», и т.д. Также именно в этом алгоритме появилась
геозависимая выдача.
Алгоритм дорабатывался не один раз. Проводились изменения форму-
лы ранжирования, добавления новых регионов. В итоге к последней версии
Яндекс предоставлял локальные результаты поиска для 19 регионов.
17 ноября 2009 года был запущен алгоритм «Снежинск». Количество
учитываемых при ранжировании параметров увеличилось в разы, благодаря
чему повысилось качество поиска Яндекс. В этой версии впервые использо-
вался новый алгоритм машинного обучения «Матрикснет» [57].
26
22 декабря 2009 года Яндекс расширил количество городов, для кото-
рых производится локальное ранжирование. Обновленная версия получила
название «Конаково» (неофициальное название обновленного «Снежинска»).
10 марта 2010 года Яндекс анонсировал новую версию – Снежинск 1.1,
работа которого началась 17 марта. В ней была улучшена общая формула
ранжирования для геонезависимых.запросов.
Вслед за «Снежинск 1.1» 13 сентября 2010 появился «Обнинск» – новая
формула ранжирования для геонезависимых запросов. По словам разработ-
чиков Яндекс, формула ранжирования выросла почти в 2,5 раза (до 280 Мб).
Помимо постоянного развития алгоритмов ранжирования Яндекс пред-
лагает пользователям уникальные сервисы. Например, Яндекс первым пред-
ложил мониторинг автомобильных пробок в крупнейших городах. К тому же
Яндекс на сегодняшний день – это наш, «русский» поисковик, единственный
из большой тройки (Яндекс, Рамблер, Апорт), который успешно развивается.
Доверие пользователей к этой поисковой системе огромно, она по праву яв-
ляется самой популярной в России и будет оставаться такой еще долгие годы.
Даже если развитие интернет – проект приостанавливается, он будет еще по-
пулярен как минимум 3–5 лет. Поэтому исследование формулы ранжирова-
ния Яндекс – важная задача, которой уделена большая часть данной работы.
Для борьбы со ссылочным спамом 15 мая 2015 был запущен в работу
алгоритм Минусинск.
После этого сайты, которые в своей работе предполагают использова-
ние SEO-ссылок, могут занимать более низкую позицию в ранге. Яндекс со-
ветует пользователям не применять такие ссылки, поскольку такие негатив-
ные ограничения в виде понижения рейтинга могут заметно снизить трафик
из поисковой системы на срок до нескольких месяцев.
1.4 Google
27
Поисковая система Google (http://www.google.ru индексирует и осу-
ществляет поиск по следующим форматам документов: HTML, PDF, RTF,
DOC, XLS). Google в отличие от Яндекс использует для индексирования все-
го лишь одного робота, User–agent которого – «Googlebot». Он также осу-
ществляет поиск по картинкам и медиафайлам. Робот переходит по ссылкам,
находя в документах конструкции SRC и HREF формата HTML. Google не
имеет быстроробота, но скорость индексации Googlebot очень высока, и но-
вые документы с качественных веб-сайтов попадают в поисковую базу в те-
чение нескольких часов.
Google позволяет переводить запрос с русского языка на множество
других и осуществлять поиск Документам на различных языках. Веб-сайт
Google доступен в доменных зонах различных стран, алгоритмы которых
имеют свои отличия. В данной работе исследуется поисковый алгоритм, рас-
положенный в домене www.google.ru.
Выводы по главе 1
1. Показаны устройство и общая схема работы поисковых систем.
2. Приведены принципы определения текстовой релевантности, расчет по-
пулярности на основе гиперссылок, а также история поисковых систем
Рунет.
3. Сделан вывод об алгоритмах поисковой системы Яндекс.
4. Получено представление об алгоритмах работы поисковых систем как
важнейшей части исследования, так как именно оно даёт понимание для
построения стратегии продвижения сайтов.
28
Глава 2. Определение факторов, участвующих
в формуле ранжирования
2.1 Группы факторов, влияющих на релевантность
Важнейшей задачей в поисковой оптимизации является не столько зна-
ние существующих факторов, участвующих в формуле ранжирования, но и
умение анализировать изменения, происходящие при ее смене алгоритмов
поисковых систем.
Можно выделить 3 группы факторов, к которым прибегают поисковые
системы при расчете релевантности, среди них: внутренние, внешние факто-
ры и доверие к веб-сайту [54].
К внутренним факторам относятся те, которые характеризуют свойства
непосредственно самого документа и веб-сайта в целом. К примеру, наличие
слов «образование в России» в тексте документа делает его релевантным за-
просам «образование в России», «образование», «Россия», «российское обра-
зование» и т.д. Свойства веб-сайта в целом – его корректная с точки зрения
поисковых систем структура ссылок и HTML-кода страниц, уникальность
текстов документов, размещенных на нем, и т.д. Внутренние факторы обес-
печивают вклад в текстовое ранжирование, которое учитывается при опреде-
лении релевантности в любых поисковых системах как в Интернет, так и в
системах локального поиска.
К внешним факторам относится учет ссылок с других веб-сайтов.
Группа факторов называется внешней, поскольку вклад в определение реле-
вантности документа одного веб-сайта дает множество ссылок, расположен-
ных на других веб-сайтах. Такие ссылки называются внешними. Для опреде-
ления релевантности учитывается анкор (текст) ссылки, которая в простей-
шей конструкции языка HTML выглядит следующим образом:
29
<a href=http://site.ru>анкор</a>, где визуально анкор – это текст, кликая мы-
шью по которому пользователь совершает переход на другой веб-сайт.
Доверие поисковых систем к веб-сайту – один из важнейших факторов
при определении релевантности документа запросу. Доверие (авторитет-
ность, «траст» от англ, trust – доверять) [61]. Смысл его в том, что у веб-
сайта, признанного поисковой системой авторитетным, больше шансов за-
нять высокие места в результатах поиска при прочих равных, т.е. получить
большую релевантность [57]. Достаточно лишь упоминания слов запроса в
документе «трастового» сайта – и он уже на первых страницах результатов
поиска [51]. К тому выводу можно прийти, проанализировав, к примеру, веб-
сайт Википедии (http://ru.wikipedia.org) который по многим запросам нахо-
дится на первой странице результатов поиска.
2.2 Определение факторов, участвующих в формуле ранжирования,
методом экспертных оценок
Стоит упомянуть метод экспертных оценок, который может использо-
ваться для определения факторов и их важности [24]. Такой метод помогает
сконцентрировать знания более 100 экспертов в области поисковой оптими-
зации для выявления всех возможных факторов, влияющих на релевантность
документа запросу [1].
Первый этап позволяет каждому эксперту перечислить всевозможные
факторы, которые могут быть связаны с формулой ранжирования. Чаще все-
го прибегают к методу мозгового штурма, при котором можно высказывать
абсолютно любые собственные и смелые идеи – при этом важно, что ни одна
из идей не должна быть подвержена критике, благодаря чему накапливается
максимально возможное и разнообразное количество факторов.
На втором этапе продолжается анализ факторов, предложенных на пер-
вом этапе. Каждый из экспертов получает анкету, включающую полный
30
список факторов. Далее с помощью шкалы от 0 до 1 степени важности фак-
тора с шагом равным 0,1 каждый эксперт записывает свою оценку по каждо-
му из факторов, полученных на первом этапе. Итоговая оценка вычисляется
посредством среднего арифметического результатов анализа всех экспертов в
нормированной шкале с учетом коэффициента доверия к каждому эксперту.
Исключаются лишь факторы, важность которых в рамках установленной
шкалы менее 0.1.
Анкета содержит вопросы в виде двух блоков: первый вопросы, харак-
теризующие степень доверия к эксперту, его профессиональный уровень.
Второй вопросы, характеризующие важность факторов, участвующих в фор-
муле ранжирования.
Процесс обработки результатов и формирование экспертных оценок
происходит последовательно. Сначала эксперту задаются вопросы о возрасте,
сфере занятости, знаниях предметной области, и опыте поисковой оптимиза-
ции. В итоге каждый эксперт заполняет номера выбранного ответа, а из таб-
лицы пересчета выбирается коэффициент, характеризующий степень доверия
к этому эксперту, и определяется среднее значение коэффициента доверия по
всем вопросам первого блока для каждого эксперта. Далее все ответы экспер-
та умножаются на этот коэффициент.
Во втором блоке содержатся вопросы, которые нацелены на то, что бы
оценить важность факторов, участвующих в формуле расчета релевантности.
Ответы представляются посредством нормированной шкалы (от 0.0 до 1.0).
Исключению из списка подвержены те факторы, которые имеют окончатель-
ную оценку важности менее 0.1. Оценка важности фактора рассчитывается с
помощью усреднения результатов анкетирования, относящегося к этому фак-
тору, при этом во внимание берется уровень доверия к эксперту по всем за-
полненным анкетам.
Внутренние факторы поисковой оптимизации.
31
Важность факторов согласно методу экспертных оценок (в дальнейшем
«ключевое слово» – это слова (или одно слово) из запроса пользователей к
поисковой системе, относительно которых рассчитывается релевантность):
Таблица 2.1 – Оценка важности факторов по методу экспертных оценок
Фактор
Оценка
1 .Точное вхождение ключевого слово на странице в рамках пассажа
0.9
2. Точное вхождение ключевого слова в тег title
0.9
3. Точное вхождение ключевого слова в тег keywords
0.1
4. Точное вхождение ключевого слова в тег description
0.1
5. Точное вхождение ключевого слова в теги h1–h6
0.7
6. Плотность ключевого слова в тексте страницы – до 5%
0.8
7. Общий объем полезного текста на странице 1000–2000 знаков
0.5
8. Обновление веб-сайта
0.7
9. Выделение ключевого слова жирным шрифтом (теги <strong> или
<b>)
0.3
10. Точное вхождение ключевого слова в текстах гиперссылок в других
документах веб-сайта
0.5
11. Уникальность документа внутри веб-сайта
0.8
12. Уникальность документа и веб-сайта в целом в Интернет
1.0
13. Корректная работа скриптов
0.6
14. Запрет от индексации избыточных и служебных страниц и разделов
0.8
15. «Понятные» URL–адрсса веб–страниц
0.4
16. Вынос java–script и css в отдельные файлы
0.3
17. Главное зеркало для поисковых систем
0.5
1. Точное вхождение ключевого слова на странице в рамках пассажа.
Присутствие ключевого слова в пассаже документа существенно повышает
релевантность документа. Поисковые системы производят разделение доку-

Смотрите также:

"Автоматизация обработки заявок ООО "Проектно-Строительная Компания"
"Автоматизация процесса аттестации персонала для ООО "Нэт Бай Нэт Холдинг"
"Анализ интернет-активности конкурентов ( на примере конкурентов "Газпром нефть")
"Бухгалтерский учёт и аудит расчётов с подотчётними лицами в организации на примере ООО "ЛОЦ 10""
«Психологическое сопровождение персонала в организации на примере ООО «Крокус»
Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR как средство продвижения организации (на примере ПАО "Тамбовский завод "Комсомолец им. Н.С. Артемова")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран