Диплом: Совершенствование интернет-сайта как коммуникационного ресурса компании на примере сайта компании "Аитэра"

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам
1
22
22
разработчики создают алгоритмы, которые позволяют поисковым системам
находить именно ту информацию, которую ищет пользователь. Поисковиков
много, и им необходимо «думать» похожим образом на то, как пользователь
ищет данные. Способы работы большинства поисковых систем
основываются на предварительном индексировании. Аналогичными
методами функционируют базы данных этих систем.
Существует также альтернативный метод структурирования
информации, который называют прямым поиском. Суть его в
последовательном просмотре книги с постраничным перелистыванием ради
нахождения ключевого слова или фразы. Однако стоит отметить, что такой
подход значительно менее продуктивен по сравнению с другими методами.
В случае использования инвертированного индекса поисковые системы
часто сталкиваются с проблемой большого объема файлов. Чаще всего эти
файлы имеют значительные размеры. Для решения этой задачи обычно
применяют два метода.
Основной момент состоит в том, что из файлов устраняются все
несущественные данные, сохраняя при этом только те, которые полезны для
проведения поиска.
Вторая методика работает следующим образом: вместо того чтобы
помнить каждую точную позицию, сохраняется их относительное положение,
то есть разница между нынешним и предыдущим адресами.
Итак, поисковая система в основном занимается двумя задачами -
индексированием веб-сайтов и страниц, а также непосредственным поиском.
Обычно процесс индексации не вызывает затруднений для поисковых систем.
Затруднения появляются при необходимости обрабатывать миллионы
запросов каждый день. Это связано с огромными объемами данных, которые
требуют обработки мощными компьютерными системами. Количество
задействованных серверов определяется уровнем поисковой нагрузки.
Именно этим можно объяснить некоторые неожиданности, возникающие при
поиске информации.
1
23
23
Поисковые системы состоят из пяти отдельных программных
компонентов:
Следующий пример объясняет, что представляет собой паук или spider,
это программа по типу браузера. Такие программы занимаются скачиванием
(передергиванием из сети) интернет-страниц и сохранением их на локальных
носителях [1].
Паук-кроулер, как будто бы «путешественник», это программа, которая
самостоятельно посещает все ссылки, которые обнаруживает на веб-странице.
Индексатор — это автоматическое программное обеспечение, которое
выполняет анализ скачанных пауками веб-страниц. Такой процесс часто
подразумевает извлечение, систематизацию и хранение информации для
дальнейшего использования в поисковых системах. Процедура «слепая», так
как индикация и управление выполняются непосредственно алгоритмом
программы, без необходимости вмешательства человека.
Хранилище для сохранённой и обработанной информации о веб-
страницах; это база данных, отвечающая за хранение страниц, которые были
скачаны и обработаны.
Система под названием Search engine results отвечает за то, чтобы
доставать данные поиска из имеющейся базы.
Паук представляет собой такую программу, предназначенную для
скачивания веб-страниц с сети. Он функционирует аналогично браузеру,
устанавливая соединение с веб-сайтом для последующей загрузки страницы.
При этом у паука отсутствуют любые графические компоненты, что отличает
его от стандартных интернет-обозревателей.
Ползун: И подобно пауку, он захватывает страницы, имея возможность
находить любые ссылки на странице. Его функция состоит в том, чтобы
решить, куда двигаться дальше, руководствуясь ссылками или заранее
установленным списком веб-адресов.
Индексатор выполняет разбиение страницы на отдельные компоненты
для последующего анализа. Это включает в себя различные элементы, такие
1
24
24
как заголовки страницы, подзаголовки, ссылки, текстовые блоки, а также
структурные элементы. Кроме того, он обрабатывает стилевые части
страницы, такие как элементы BOLD и ITALIC, и другие подобные
компоненты. Собранная информация подвергается тщательному анализу.
База данных представляет собой структуру для хранения всевозможной
информации, скачиваемой и анализируемой поисковой системой.
Управление ею может потребовать значительных вычислительных
мощностей и ресурсов.
Механизм выдачи результатов отвечает за сортировку страниц. Он
определяет, какие страницы соответствуют запросу пользователя, и
устанавливает порядок их отображения. Этот процесс основан на алгоритмах,
которые применяет поисковая система для ранжирования. Для оптимизатора
данная информация крайне важна - этот компонент поисковика
непосредственно влияет на улучшение позиций сайта. В дальнейшем мы
детально изучим все аспекты, которые влияют на ранжирование.
Процесс функционирования поискового указателя разделен на три
стадии, из которых первые две служат подготовительным целям и остаются
скрытыми от пользователя. Вначале указатель собирает данные из всемирной
паутины (World Wide Web). Для этого применяются специальные программы,
аналогичные обычным браузерам. Эти программы могут загрузить на сервер
поискового указателя нужную интернет-страницу, после чего анализируют ее
содержимое, отыскивая все представленные гиперссылки. Затем эти
гиперссылки приводят к следующим страницам и так далее, продолжается
сбор информации по аналогичной схеме. Каждая поисковая служба
использует для этих задач свою собственную программу, которая часто
создается в рамках компании-разработчика. Многие современные поисковые
системы возникли из исследовательских проектов, посвященных созданию и
улучшению таких автоматических программ для мониторинга интернета. В
теории, успешный обход может охватить весь интернет за одну сессию, но на
это потребуется значительное количество времени.
1
25
25
После загрузки найденных интернет-ресурсов на сервер поисковой
системы следует следующий важный этап—индексация. Этим процессом
управляет специальная программа, именуемая роботом. В любой поисковой
системе функционирует значительное количество таких роботов. Основная
их задача заключается в одновременном скачивании документов из разных
частей сети. Последовательное скачивание файлов нецелесообразно, потому
что оно не приносит ощутимых результатов.
Модуль для скачивания контента может быть двух видов:
мультимедийный, такой как AltavistaMerkator, или использующий
асинхронный ввод-вывод, например, GoogleBot. Когда применяется
мультитредовая схема, то треды, которые занимаются скачиванием,
именуются «червями» (worms). Управляет же этими тредами отдельный
менеджер, которого называют «погоняльщиком червей» (wormboy).
Основной задачей загрузки данных является снижение объема сетевого
трафика при сохранении полной информации. Практически каждый
поисковый бот следует инструкциям, указанным в файле robots.txt,
предоставляя веб-мастеру возможность ограничивать индексацию веб-
страниц.
У систем, занимающихся загрузкой данных, существуют
вспомогательные модули. Их основная задача заключается в поддержке
основных функций. Эти модули предназначены для оптимизации процесса
скачивания, управления трафиком, а также углубления поиска. Они
эффективно обрабатывают ресурсы, к которым часто вносят изменения, и
сохраняют URL-адреса и ссылки. Это позволяет исключить дублирующие
скачивания тех же данных. Также предусмотрены механизмы для выявления
дубликатов страниц. Они полезны тем, что таких страниц много с
дублирующейся информацией. Если робот обнаруживает повторяющийся
контент или минимально измененный, он его пропускает и избегает
дальнейшего анализа ссылок на этой странице. Немаловажным также
является существование модуля, который может определить кодировку и
1
26
26
язык документа. Такие модули позволяют повысить эффективность и
точность работы системы в целом.
После скачивания веб-страницы, происходит её обработка с помощью
html-парсера. Этот инструмент выбирает только ту информацию из
документа, которая имеет значение для поисковых операций: тексты,
шрифты, гиперссылки и так далее. Процесс индексирования создает
специализированные базы данных, что позволяет точно определить, где и
когда каждое конкретное слово появилось в сети. Эти индексированные базы
данных необходимы для того, чтобы поисковая система могла быстро и
эффективно отвечать на запросы пользователей. Сегодняшние технологии
позволяют получать ответы за доли секунды, но если индексы не
подготовлены заблаговременно, обработка одного запроса может занять
несколько часов.
На третьем этапе система обрабатывает запрос клиента и предоставляет
ему список найденных гиперссылок. Используя свои указатели, поисковая
система в минимальное время находит релевантные интернет-ресурсы и
оформляет страницу с результатами поиска, где представленные ссылки
расположены в форме гиперссылок. Клиент впоследствии может переходить
на нужные ему сайты через эти ссылки. Основная проблема современного
использования интернета связана с огромным количеством веб-страниц.
Достаточно ввести в поисковое поле простое слово, такое как «футбол», и
российская поисковая система покажет несколько тысяч результатов,
группируя их по 10-20 ссылок на странице. Это, можно сказать, не так много,
так как иностранная поисковая система может показать сотни тысяч ссылок в
аналогичном случае. Обычно пользователи смотрят не более 50 первых
ссылок. Однако качество первых ссылок — это вопрос, который беспокоит
клиентов. Пользователь ожидает, что наиболее полезные ресурсы будут в
начале списка. Здесь возникает проблема: как программе отличить полезный
ресурс от бесполезного? Именно поэтому лучшие поисковики используют
передовые технологии искусственного интеллекта, чтобы упорядочить
1
27
27
найденные ссылки по их полезности. Все поисковые системы черпают
информацию из одного и того же интернет-источника, поэтому их базы
данных могут быть сравнительно схожими. И только на третьем этапе, при
выдаче результатов поиска, каждая поисковая система показывает свои
сильные и слабые стороны. Эта операция по сортировке называется
ранжированием.
Для каждой обнаруженной веб-страницы система назначает показатель,
призванный характеризовать уровень качества представленного на ней
контента. Однако качество — это категория, зависящая от субъективной
оценки, в отличие от критериев, которые требуются программе. Эти
критерии должны быть объективными и выраженными в числовом формате,
чтобы возможно было проводить сравнение между различными страницами.
Популярные веб-страницы, как правило, достигают высоких рейтингов
в поисковых системах благодаря включению ключевых слов в заголовок.
Рейтинг увеличивается, если ключевое слово встречается на странице
несколько раз, но умеренно. Позитивно сказывается на рейтинге и то, что
ключевое слово находится в первых 5-6 абзацах текста, так как эти абзацы
считаются наиболее значимыми для индексации. Именно поэтому опытные
веб-мастера избегают использования таблиц в начале своих страниц. Для
алгоритмов поисковых систем каждая ячейка таблицы воспринимается как
отдельный абзац, что приводит к смещению содержательной части текста на
более поздние позиции.
Прекрасно, когда ключевые слова, упоминаемые в запросе,
присутствуют также в альтернативных описаниях изображений. Это служит
четким сигналом для поисковой системы о том, что конкретная страница
удовлетворяет запрос.
Также очень важным элементом качества интернет-страницы
выступает наличие ссылок на нее с различных других веб-ресурсов. В идеале,
чем больше этих ссылок, тем выше оценивается популярность страницы и
уровень ее цитирования. Крупные поисковые системы принимают во
1
28
28
внимание коэффициент цитируемости во время ранжирования страниц.
Разработчики веб-страниц всегда стремятся к росту числа посетителей,
поэтому они тщательно готовят контент для того, чтобы алгоритмы
поисковых системы ранжировали их как высококачественные ресурсы.
Грамотная работа веб-мастера может существенно увеличивать трафик на
интернет-страницу.
Одной из наиболее известных поисковых систем того времени является
AltaVista. Эта система обладала значительным аппаратным и программным
ресурсам, что позволяло осуществлять поиск по любому слову, указанному в
текстах интернет-страниц или статей в конференциях (данные на 1998 год).
AltaVista хранила данные о 30 миллионах интернет-страниц и информации из
14 тысяч конференций.
Эта система обладает сложным алгоритмом для формирования
запросов, который включает в себя различные элементы. В частности, это
могут быть отдельные слова, словосочетания и разнообразные знаки
пунктуации, такие как, например, кавычки, точки с запятой, двоеточие,
скобки, а также символы плюса и минуса. Кроме этого, могут использоваться
обычные логические операторы AND, OR, NOT и NEAR, применяемые в
контексте расширенного поиска (Advancedsearch). Комбинирование этих
составляющих позволяет наиболее точно создавать запросы для поиска
информации.
Символ «+» перед словом указывает на необходимость его присутствия
в документе, в то время как «-» исключает материалы с этим термином.
Кроме того, система поддерживает фразовый поиск, при котором вся фраза
заключена в кавычки, и поиск с обрезкой окончаний слов, где используется
знак «*». Также имеются опции установления временных рамок для
документов по дате создания или последнего обновления. В HotBot, который
считается одним из наиболее мощных инструментов для поиска в мировой
сети с базой данных о 54 миллионах документов, реализован поиск по всем
словам текста. Продвинутый поиск ExpertSearch в HotBot позволяет
1
29
29
детализировать запросы благодаря многоуровневому меню с различными
вариантами создания поискового запроса. Доступен поиск по комбинации
разных терминов, поиск конкретных фраз, лиц или электронных адресов.
При этом возможно проведение уточнения запроса с применением условий:
SHOULD для «может содержать», MUST для «должен содержать» и
MUSTNOT для «исключено содержать».
Значимым поисковым инструментом является система Excite,
обеспечивающая полнотекстовый поиск по более чем 50 миллионам веб-
страниц. Ключевая особенность взаимодействия с Excite состоит в том, что
запросы вводятся на естественном (английском) языке, аналогично живому
общению с человеком. Специально разработанная система на основе
технологии Intelligent Concept Extraction анализирует запрос и выдает ссылки
на документы, которые она считает релевантными. Практический опыт
показывает, что Excite корректно обрабатывает только простые запросы. Для
получения сведений по сложным темам рекомендуется использовать другие
поисковые системы.
Среди современных систем, предназначенных для выполнения поиска
по всему содержимому текста, можно выделить OpenText. Пользователь
имеет возможность выборочно сузить область поиска, чтобы это касалось
только ключевых и наиболее важных частей веб-страницы. Такие части
включают, например, заголовок, первый подзаголовок, резюме и веб-адрес
(URL). Эта функция особенно полезна в ситуациях, когда требуется найти
только основные работы в рамках широкой темы.
В сложных ситуациях, как и всегда, пользователи могут использовать
для запросов усложненный поиск под названием Power Search. Интерфейс
этой функции сделан таким образом, чтобы максимально упростить создание
поисковых запросов с помощью многоступенчатого меню. В этом меню есть
строки для ввода ключевых слов и указание, в каких полях необходимо
искать данные. Дополнительно можно применять стандартные логические
1
30
30
операторы: AND (и), OR (или), BUTNOT (но не), NEAR (близко) и
FOLLOWEDBY (следует за).
В последние годы наметилась тенденция к развитию коммерческого
рейтингования. В российском Интернете доминируют три основных
поисковых системы. Это «Рамблер» (www.rambler.ru), «Яндекс»
(www.yandex.ru) и «Апорт» (www.aport.ru).
Исторически поисковая система «Рамблер» занимает одно из первых
мест по популярности. Она начала работать раньше многих других и долго
оставалась лидером благодаря своему обширному поисковому указателю и
высокому качеству поиска. Однако эти достижения ныне остались в прошлом.
Хотя количество страниц в поисковом указателе «Рамблера» достигает
примерно [12] миллионов, он давно не обновлялся и предоставляет
устаревшие результаты. В нынешнее время «Рамблер» является известным
порталом в России, сочетающим классификационно-рейтинговую и
рекламную площадку. Традиционно эта система лидирует в России по числу
пользователей и имеет существенные рекламные доходы. В развитие
поисковых возможностей, однако, инвестиции не производятся.
На сегодняшний день, основа системы «Яндекс» включает самый
крупный индекс — около [27] миллионов веб-страниц, но это далеко не
единственный критерий. Важно не только количество, но и актуальность
информации. «Яндекс» на данный момент является лидером в вопросе
предоставления актуальных данных. В отличие от него, система «Апорт»
имеет преимущество на этапе подачи данных пользователю. Она не
стремится обзавестись самым масштабным индексом автоматически, а
активно использует информацию из каталога @Rus, которая проходит
ручную проверку. Из-за этого система предлагает меньше результатов по
сравнению с конкурентами, но эти результаты отличаются точностью и
хорошим представлением.
Чтобы успешно функционировать в современном мире быстрой
интернет-среды, важно при проектировании систем заранее учесть
1
31
31
значительный запас устойчивости. Нужно постоянно смотреть наперед и
учитывать будущую нагрузку, адаптируя сегодняшние технологии. Этот
метод не только помогает в борьбе с растущими объемами информации, но и
способствует внедрению инноваций, которые значительно увеличивают
эффективность поиска в сети.
Оценка посещаемости сайта
Данные, которые распространяются с помощью определённого
интернет-проекта, доступны не только пользователям, непосредственно
заходящим на сайт проекта. Через личные связи и контакты эту информацию
также могут получить и те люди, кто не посещает сайт, но относится к
целевой аудитории. Таким образом формируется зона влияния интернет-
проекта.
Максимальная аудитория показывает количество людей, посетивших
сайт. Эта аудитория, собранная в результате рекламной кампании, отражает
общий охват. Данный охват является важным индикатором кампании.
Основываясь на этих данных, рассчитываются различные финансовые
показатели, такие как CPM и ROI. Эти показатели являются критичными для
оценки эффективности вложений и возврата средств. Также учитываются и
другие ключевые метрики.
На основании собранной информации формируются стратегии
взаимодействия с целевой аудиторией и последующие маркетинговые
инициативы. Поскольку уровень осведомлённости потенциальных клиентов
о предлагаемом продукте значительно влияет на содержание рекламных
материалов, важно учитывать эту информацию при разработке рекламных
кампаний.
Деление на группы играет ключевую роль в изучении хода рекламной
кампании. К примеру, если заметны изменения в доле случайных
посетителей в сравнении с другими группами, то это указывает на
возможные ошибки в стратегии проведения рекламы.

Смотрите также:

Cовершенствование деловой оценки персонала в организации (на примере ООО "Даймонд кейтеринг развитие")
PR-коммуникации в сфере общественного питания (на примере кафе-кондитерской «Cream Cheese»)
SMM как средство повышения эффективности работы учреждений социокультурной сферы (на примере Малого театра)
Value-based education: ценности в системе образования и способы их реализации на уроке английского языка. Опыт Европейских стран
Work-life balance подход в управлении рабочим временем молодых сотрудников (на примере ООО «МГТ-сервис»)
Актуализация контента, отражающего концепцию «диалога культур», при освоении английского языка взрослыми обучающимися
Актуализация приемов инсценирования и драматизации в рамках интерактивной модели обучения английскому языку в старших классах
Актуальные подходы в построении внутреннего pr строительной компании (на примере ООО "Ренессанспроект")
Анализ деловой активности и экономической эффективности деятельности организации (на примере АО «СГ-Транс»)
Анализ деловой активности организации как инструмент повышения эффективности ее деятельности (на примере Косинского районного потребительского общества)