35
11. Уникальность документа внутри веб-сайта. Многие веб-сайты
содержат большое количество документов, не имеющих полезной для поис-
ковой системы информации. К примеру, результаты поиска по сайту, версии
документов для печати (версии основных документов без графических эле-
ментов), метки (теги), списки документов, сортированные по датам, различ-
ные сортировки данных в таблицах по столбцам. Все эти данные уже проин-
дексированы поисковой системой. К примеру, текст новости проиндексиро-
ван по постоянному адресу, но выдержка из этой новости встречается в поис-
ке по датам опубликования, метках и т.д. Такой документ внутри веб-сайта
уже не уникален. Значительного понижения релевантности не будет, но же-
лательно избегать многочисленного повторения документа или его частей
внутри ресурса.
12. Уникальность документа и веб-сайта в целом в сети Интернет.
Один из важнейших факторов. Особенно важно для относительно новых (ме-
нее 3 лет) веб-сайтов. Веб-сайты, которые содержат большое число докумен-
тов, скопированных (но при этом разрешенных для индексации поисковыми
системами) с других веб-сайтов, могут быть убраны из результатов поиска
или стать нерелевантными ко всем запросам. Старые веб-сайты, имеющие
авторитет, могут размещать неуникальную информацию [41]. К таким мож-
но отнести подавляющее большинство новостных ресурсов, которые копи-
руют новости и пресс– релизы друг у друга и не получают никаких санкций
со стороны поисковых систем.
13. Корректная работа скриптов. Большинство современных веб-сайтов
работают на различных «движках» (скриптах), используют различные систе-
мы управления содержимым. «Чистых» (не берутся в расчет документы, со-
зданные с помощью подмены адресов через ModRewrite [61] или их аналога-
ми) статических документов HTML (т.е. с расширением .htm или .html) ста-
новится все меньше. При этом большинство готовых решений систем управ-
ления содержимым неправильно обрабатывают запросы к документам.