Работа в современном офисе

Поиск информации в Web

Разбить на страницы
Показывать лекцию целиком

Раз он в море закинул невод - Пришел невод с одною тиной Он в другой раз закинул невод - Пришел невод с травой морскою.

В Интернете размещены миллионы сайтов, причем с актуальной информацией соседствует много устаревших ресурсов, мусора и недобросовестной рекламы.

Интернет - это наиболее демократичный источник информации. Каждый может разместить в Сети собственный ресурс и высказать свое мнение. В этом одновременно сила и слабость Всемирной сети. Плюсы наличия столь демократической площадки очевидны.

Однако отсутствие единоначалия и единых требований по оформлению информации приводит к тому, что в Сети мало кто озабочен тем, чтобы избежать дублирования информации или следовать стандартам, принятым на сайте соседа. И здесь наблюдается резкий контраст с корпоративным документооборотом, описанным ранее.

Находить информацию в Интернете, вероятно, было бы очень трудно, если бы не были созданы мощные поисковые инструменты: поисковые машины (поисковики), каталоги (рубрикаторы), рейтинги, метапоисковые системы и тематические списки ссылок, онлайновые энциклопедии и справочники.

Как показывает практика, для поиска разного рода информации наиболее эффективными оказываются различные инструменты (рис. 4.19). Рассмотрим каждую категорию по отдельности.

(рис 4.19) Для каждого типа информации следует выбирать свой инструмент поиска

Индексированные каталоги

Каталог представляет собой данные, структурированные по темам в виде иерархических структур. Тематические разделы первого уровня определяют наиболее популярные, максимально широкие темы, такие как "спорт", "отдых", "наука", "магазины" и т.д. В каждом таком разделе есть подразделы. Таким образом, пользователь может уточнять интересующую его область, путешествуя по дереву каталога и постепенно сужая область поиска. Например, при поиске информации о ноутбуках цепочка поиска может выглядеть следующим образом:

Информационные технологии -> Компьютеры -> Ноутбуки.

Дойдя до нужного подкаталога, пользователь находит в нем набор ссылок.

Обычно в каталоге все ссылки являются профильными, поскольку составлением каталогов занимаются не программы, а люди. Очевидно, что если ведется поиск общей информации по некоторой широкой теме, то целесообразно обратиться к каталогу. Если же необходимо найти конкретный документ, то каталог окажется малоэффективным поисковым средством.

Существует огромное количество каталогов. Один из наиболее популярных каталогов в России находится по адресу http://list.mail.ru/.

Помимо каталогов общего профиля, в Сети достаточно много специализированных каталогов. Например, по адресу www.kinder.ru можно найти прекрасный каталог, посвященный детским ресурсам. В случае, если внутри отдельной темы каталога находится огромное количество ресурсов, возникает проблема выбора. В некоторых каталогах имеется сортировка по популярности, например, в каталоге Яндекса сортировка идет по индексу цитирования - числу ссылок на сайт с других сайтов.

Помимо каталогов в Сети существуют рейтинги. Одним из наиболее популярных рейтингов является Rambler's Top 100. (http://top100.rambler.ru/top100/). На рис. 4.20 показан рейтинг ресурсов. Популярность ресурса оценивается по ряду параметров, в том числе так называемым хостам (количество уникальных посетителей в единицу времени) и хитам (количество заходов на сайт за единицу времени).

(рис 4.20) Пример ранжирования ссылок в рейтинге Rambler Top 100

Тематические коллекции ссылок

Тематические коллекции ссылок - это списки, составленные группой профессионалов или даже коллекционерами-одиночками. Очень часто узкоспециализированная тема может быть раскрыта одним специалистом лучше, чем группой сотрудников крупного каталога. Тематических коллекций в Сети так много, что давать конкретные адреса не имеет смысла.

Подбор доменного имени

Каталог - удобная система поиска, однако для того, чтобы попасть на сервер компании Microsoft или IBM, вряд ли имеет смысл обращаться к каталогу. Угадать название соответствующего сайта нетрудно: www.microsoft.com, www.ibm.com или www.microsoft.ru, www.ibm.ru - сайты российских представительств этих компаний.

Аналогично, если пользователю необходим сайт, посвященный погоде в мире, его логично искать на сервере www.weather.com. В большинстве случаев поиск сайта с ключевым словом в названии эффективнее, чем поиск документа, в тексте которого это слово используется. Если западная коммерческая компания (или проект) имеет односложное название и реализует в Сети свой сервер, то его имя с высокой вероятностью укладывается в формат www.name.com, а для Рунета (российской части Сети) - www.name.ru, где name - имя компании или проекта. Подбор адреса может успешно конкурировать с другими приемами поиска, поскольку при подобной системе поиска можно установить соединение с сервером, который не зарегистрирован ни в одной поисковой системе. Однако, если подобрать искомое имя не удается, придется обратиться к поисковой машине.

Поисковые машины

Скажи мне, что ты ищешь в Интернете, и я скажу, кто ты

Если бы компьютер был высокоинтеллектуальной системой, которой можно было легко объяснить, что вы ищете, то он выдавал бы два-три документа - именно те, которые вам нужны. Но, к сожалению, это не так, и в ответ на запрос пользователь обычно получает длинный список документов, многие из которых не имеют никакого отношения к тому, о чем он спрашивал. Такие документы называются нерелевантными (от англ. relevant - подходящий, относящийся к делу). Таким образом, релевантный документ - это документ, содержащий искомую информацию. Очевидно, что от умения грамотно выдавать запрос зависит процент получаемых релевантных документов. Доля релевантных документов в списке всех найденных поисковой машиной документов называется точностью поиска. Нерелевантные документы называют шумовыми. Если все найденные документы релевантные (шумовых нет), то точность поиска составляет 100%. Если найдены все релевантные документы, то полнота поиска - 100%.

Таким образом, качество поиска определяется двумя взаимозависимыми параметрами: точностью и полнотой поиска. Увеличение полноты поиска снижает точность, и наоборот.

Как работает поисковая машина

Поисковые системы можно сравнить со справочной службой, агенты которой обходят предприятия, собирая информацию в базу данных (рис. 4.21). При обращении в службу информация выдается из этой базы. Данные в базе устаревают, поэтому агенты их периодически обновляют. Некоторые предприятия сами присылают данные о себе, и к ним агентам приезжать не приходится. Иными словами, справочная служба имеет две функции: создание и постоянное обновление данных в базе и поиск информации в базе по запросу клиента.

(рис 4.21) Поисковые системы можно сравнить со справочной службой, агенты которой обходят предприятия, собирая информацию в базу данных

Аналогично, поисковая машина состоит из двух частей: так называемого робота (или паука), который обходит серверы Сети и формирует базу данных поискового механизма.

База робота в основном формируется им самим (робот сам находит ссылки на новые ресурсы) и в гораздо меньшей степени - владельцами ресурсов, которые регистрируют свои сайты в поисковой машине. Помимо робота (сетевого агента, паука, червяка), формирующего базу данных, существует программа, определяющая рейтинг найденных ссылок.

Принцип работы поисковой машины сводится к тому, что она опрашивает свой внутренний каталог (базу данных) по ключевым словам, которые пользователь указывает в поле запроса, и выдает список ссылок, ранжированный по релевантности.

Следует отметить, что, отрабатывая конкретный запрос пользователя, поисковая система оперирует именно внутренними ресурсами (а не пускается в путешествие по Сети, как часто полагают неискушенные пользователи), а внутренние ресурсы, естественно, ограниченны. Несмотря на то что база данных поисковой машины постоянно обновляется, поисковая машина не может проиндексировать все Web-документы: их число слишком велико. Поэтому всегда существует вероятность, что искомый ресурс просто неизвестен конкретной поисковой системе.

Эту мысль наглядно иллюстрирует рис. 4.22. Эллипс 1 ограничивает множество всех Web-документов, существующих на некоторый момент времени, эллипс 2 - все документы, которые проиндексированы данной поисковой машиной, а эллипс 3 - искомые документы. Таким образом, найти с помощью данной поисковой машины можно лишь ту часть искомых документов, которые ею проиндексированы.

(рис 4.22) Схема, поясняющая возможности поиска

Проблема недостаточности полноты поиска состоит не только в ограниченности внутренних ресурсов поисковика, но и в том, что скорость робота ограниченна, а количество новых Web-документов постоянно растет. Увеличение внутренних ресурсов поисковой машины не может полностью решить проблему, поскольку скорость обхода ресурсов роботом конечна.

При этом считать, что поисковая машина содержит копию исходных ресурсов Интернета, было бы неправильно. Полная информация (исходные документы) хранится отнюдь не всегда, чаще хранится лишь ее часть - так называемый индексированный список, или индекс, который гораздо компактнее текста документов и позволяет быстрее отвечать на поисковые запросы.

Для построения индекса исходные данные преобразуются так, чтобы объем базы был минимальным, а поиск осуществлялся очень быстро и давал максимум полезной информации. Объясняя, что такое индексированный список, можно провести параллель с его бумажным аналогом - так называемым конкордансом, т.е. словарем, в котором в алфавитном порядке перечислены слова, употребляемые конкретным писателем, а также указаны ссылки на них и частота их употребления в его произведениях.

Очевидно, что конкорданс (словарь) гораздо компактнее исходных текстов произведений и найти в нем нужное слово намного проще, нежели перелистывать книгу в надежде наткнуться на нужное слово.

Построение индекса

Схема построения индекса показана на рис. 4.23. Сетевые агенты, или роботы-пауки, "ползают" по Сети, анализируют содержимое Web-страниц и собирают информацию о том, что и на какой странице было обнаружено.

(рис 4.23) Роботы-пауки просматривают информационное наполнение Web-страниц и создают базу, на основе которой производится поиск

При нахождении очередной HTML-страницы большинство поисковых систем фиксируют слова, картинки, ссылки и другие элементы (в разных поисковых системах по-разному), содержащиеся на ней. Причем при отслеживании слов на странице фиксируется не только их наличие, но и местоположение, т.е. где эти слова находятся: в заголовке (title), подзаголовках (subtitles), в метатэгахМетатэги - это служебные тэги, позволяющие разработчикам помещать на Web-страницы служебную информацию, в том числе для того, чтобы сориентировать поисковую машину. (meta tags) или в других местах. При этом обычно фиксируются значимые слова, а союзы и междометия типа "а", "но" и "или" игнорируются. Метатэги позволяют владельцам страниц определить ключевые слова и тематику, по которым индексируется страница. Это может быть актуально в случае, когда ключевые слова имеют несколько значений. Метатэги могут сориентировать поисковую систему при выборе из нескольких значений слова на единственно правильное. Однако метатэги работают надежно только в том случае, когда заполняются честными владельцами сайта. Недобросовестные владельцы Web-сайтов помещают в свои метатэги наиболее популярные в Сети слова, не имеющие ничего общего с темой сайта. В результате посетители попадают на незапрашиваемые сайты, повышая тем самым их рейтинг. Именно поэтому многие современные поисковики либо игнорируют метатэги, либо считают их дополнительными по отношению к тексту страницы. Каждый робот поддерживает свой список ресурсов, наказанных за недобросовестную рекламу.

Очевидно, что если вы ищете сайты по ключевому слову "собака", то поисковый механизм должен найти не просто все страницы, где упоминается слово "собака", а те, где это слово имеет отношение к теме сайта. Для того чтобы определить, в какой степени то или иное слово имеет отношение к профилю некоторой Web-страницы, необходимо оценить, насколько часто оно встречается на странице, есть ли по данному слову ссылки на другие страницы или нет. Короче говоря, необходимо ранжировать найденные на странице слова по степени важности. Словам присваиваются весовые коэффициенты в зависимости от того, сколько раз и где они встречаются (в заголовке страницы, в начале или в конце страницы, в ссылке, в метатэге и т.п.). Каждый поисковый механизм имеет свой алгоритм присваивания весовых коэффициентов - это одна из причин, по которой поисковые машины по одному и тому же ключевому слову выдают различные списки ресурсов. Поскольку страницы постоянно обновляются, процесс индексирования должен выполняться постоянно. Роботы-пауки путешествуют по ссылкам и формируют файл, содержащий индекс, который может быть довольно большим. Для уменьшения его размеров прибегают к минимизации объема информации и сжатию файла. Имея несколько роботов, поисковая система может обрабатывать сотни страниц в секунду. Сегодня мощные поисковые машины хранят сотни миллионов страниц и получают десятки миллионов запросов ежедневно.

При построении индекса решается также задача снижения количества дубликатов - задача нетривиальная, учитывая, что для корректного сравнения нужно сначала определить кодировку документа. Еще более сложной задачей является отделение очень похожих документов (их называют "почти дубликаты"), например таких, в которых отличается лишь заголовок, а текст дублируется. Подобных документов в Сети очень много - например, кто-то списал реферат и опубликовал его на сайте за своей подписью. Современные поисковые системы позволяют решать подобные проблемы.

Поиск по индексу

Поиск по индексу заключается в том, что пользователь формирует запрос и передает его поисковой машине. В случае когда у пользователя имеется несколько ключевых слов, весьма полезно использование булевых операторовЛогические операторы, получившие имя в честь знаменитого математика Джорджа Буля (Boole) (1815 - 1864). Буль первым показал, что существует аналогия между алгебраическими и логическими действиями, так как и те и другие предполагают лишь два варианта ответов - истина или ложь, нуль или единица. Он придумал систему обозначений и правил, пользуясь которыми можно было закодировать любые высказывания, а затем манипулировать ими как обычными числами. Булева алгебра располагала тремя основными операциями - И, ИЛИ, НЕ, которые позволяли производить сложение, вычитание, умножение, деление и сравнение символов и чисел..

Наиболее часто используемые булевы операторы:

  • AND - все термины, соединенные "AND", должны присутствовать в предлагаемом документе. Большинство поисковых систем используют значок "+" вместо "AND";
  • OR - как минимум одно из ключевых слов, соединенных "OR", должно присутствовать в искомом документе;
  • NOT - ключевое слово (слова), следующее за "NOT", не должно появляться в искомом документе. Некоторые поисковые системы используют значок "-" вместо "NOT";
  • FOLLOWED BY - одно из ключевых слов должно следовать непосредственно за другим;
  • NEAR - одно из слов должно отстоять на определенное количество слов от другого;
  • Кавычки - слова внутри кавычек - это фраза, которая целиком должна быть найдена в пределах документа или файла.
  • Текст, в пределах которого проверяется действие логических операторов, называется единицей поиска. Это может быть предложение, абзац или весь документ. В разных поисковых системах могут использоваться различные единицы поиска. Например, можно искать документы, в которых два слова - "электрический" и "счетчик" - находятся одновременно в пределах предложения или в пределах всего документа. Соответственно поиск в пределах предложения возможен для тех систем, которые имеют в индексе подробный адрес.

    Синтаксис языка запросов в разных поисковых системах может отличаться, обычно в справочных данных на поисковом сервере приводится информация о синтаксисе запросов. В качестве примера в табл. 4.2. приводится синтаксис языка запросов, принятый в поисковой машине Yandex.

    Синтаксис языка запросов при строгом поиске
    Синтаксис Что означает оператор Пример запроса
    Пробел или Логическое И (в пределах предложения) Лечебная физкультура
    Логическое И (в пределах документа) Рецепты (плавленый сыр)
    | Логическое ИЛИ Фото | фотография | снимок | фотоизображение
    + Обязательное наличие слова в найденном документе (работает также в применении к стоп- словамСтоп-слова - это распространенные слова, которые игнорируют поисковые машины во время поиска по ключевому слову. Поисковики не обращают на них внимания, чтобы сэкономить место на своих серверах и ускорить процесс поиска. ) +Быть или +не быть
    () Группирование слов (Технология | изготовление) (сыра | творога)
    ~ Оператор И НЕ (в пределах предложения) Банки ~ закон
    ~~или~ Оператор И НЕ (в пределах документа) Путеводитель по Парижу ~~ (агентство | тур)
    /(n m) Расстояние в словах (~ назад +вперед) Поставщики /2 кофе музыкальное /(-2 4) образование вакансии ~/+1 студентов
    << << Поиск фразы <<Красная шапочка>> (эквивалентно красная /+1 шапочка)
    /(n m) Расстояние в предложениях (-назад +вперед) Банк /1 налоги

    Многие поисковые системы имеют режим "расширенный поиск". Например, в наиболее популярной на сегодня поисковой системе Google (www.google.com) этот режим дает возможность искать документы на определенном языке, измененные в определенное время или представленные в определенном формате, например Word-документ или презентацию Power Point.

    После того как пользователь передал запрос поисковой системе, она обрабатывает синтаксис запроса и сравнивает ключевые слова со словами в индексе. После этого составляется список сайтов, отвечающих запросу, они ранжируются по релевантности и формируется результат поиска, который и выдается пользователю.

    Несмотря на то что человек человеку всегда лучше объяснит, что же он ищет, нельзя сказать, что современные поисковые машины - это примитивные системы, которые, кроме как найти некоторую последовательность символов, ничего не могут. Напротив, существуют, например, поисковые системы позволяющие решать проблему различных словоформ. А это далеко не тривиальная задача. Если мы ищем документ по ключевому слову "стол", то, вероятно, документ, содержащий фразу "столы для кухни" - это то, что нам нужно. Однако "стол" и "столы" для системы, осуществляющей формальное сравнение, - это разные слова. Поиск, учитывающий словоизменения, называется морфологическим поиском.

    Метапоисковые системы

    Интернет развивается стремительными темпами - каждый день появляются сотни тысяч новых Web-страниц. Рост количества документов происходит быстрее, чем поисковые системы успевают их проиндексировать. Отсюда следует неутешительный вывод, что, если даже в Сети и есть документ, который ищет пользователь, вовсе не обязательно, что о нем "знает" выбранная поисковая машина. Поисковых систем в мире сотни, и велика вероятность, что нужный пользователю документ не попал в данный поисковик, но проиндексирован другой поисковой системой. Поэтому существуют приложения, позволяющие передавать запрос пользователя сразу в несколько поисковых систем - так называемые метапоисковые системы.

    Метапоисковая система имеет те же преимущества перед поисковой системой, что и поиск в нескольких справочниках перед поиском в одном (рис. 4.24).

    (рис 4.24) Метапоисковая система имеет те же преимущества перед поисковой системой, что и поиск в нескольких справочниках перед поиском в одном

    Однако это не означает, что метапоиском следует пользоваться во всех случаях. Если документов по теме много, то метапоиск не нужен и, возможно, даже вреден, поскольку смешивает разные логики ранжирования. Но если документов по теме мало, то метапоиск может быть полезен именно благодаря тому, что объединяет большое число поисковиков.

    В качестве примера метапоисковой системы можно привести программу "ДИСКо Искатель" (Разработка фирмы "ДИСКо" www.disco.ru). Главной особенностью этой программы является возможность запоминать как параметры поиска, так и его результаты и впоследствии использовать их.

    Следует отметить, что существуют онлайновые сервисы метапоиска по отдельным товарам. Например, на сайте www.booksearch.ru можно осуществить метапоиск по 12 наиболее популярным книжным Интернет-магазинам. Это позволяет найти редкие книги, которые есть не во всех магазинах.

    Онлайновые энциклопедии и справочники

    В ряде случаев бывает нужно найти не просто документ, содержащий ключевое слово, а именно толкование некоторого слова. При поиске незнакомого термина с помощью поисковой машины вы рискуете получить целый ряд статей, в которых этот термин используется, и при этом так и не узнать, что же он все-таки обозначает.

    В ряде случаев можно воспользоваться поиском с ключевыми словами типа "что такое (неизвестный термин)", "(неизвестный термин) - это" или "(неизвестный термин) представляет собой" и т.д.

    Однако, если это не новый термин, предпочтительнее начать подобный поиск в онлайновой энциклопедии.

    Одной из крупнейших онлайновых энциклопедий является ресурс "Яндекс. Энциклопедии" (http://encycl.yandex.ru/) - этот проект содержит 14 энциклопедий, в том числе статьи из Большой Советской Энциклопедии и "Энциклопедию Брокгауза и Эфрона". К крупным относится и "Энциклопедия Кирилла и Мефодия", которую можно найти по адресу www.km.ru.

    Особенно актуальным является поиск толкований терминов по информационным технологиям, которые развиваются так быстро, что уследить за их появлением очень сложно. Увы, большинство словарей из данной категории - англоязычные. Весьма популярным и объемным является англоязычный FOLDOC (Free On-line Dictionary Of Computing - http://wombat.doc.ic.ac.uk/foldoc/index.html)- более 13 тыс. терминов. Следует рекомендовать еще как минимум два онлайновых словаря: Webopedia и WhatIs.com.

    Помимо традиционного словаря, ресурс Webopedia (www.pcwebopaedia.com) имеет массу специализированных сервисов, например: "Кто есть кто в компьютерных технологиях", "Сравнительная таблица микропроцессоров", "История развития компьютерных технологий" и др.

    Это интересно
    Степень достоверности содержания Web-документов

    Даже если документ содержит искомые ключевые слова, ценность его может быть различна. Следует помнить, что в отличие от печатных изданий, в которых есть редактор, литредактор, корректор и т.п., в Интернете текст может быть напечатан без должного контроля и корректуры. Поэтому важно оценить, в какой мере документ содержит рекламу и насколько можно доверять компетентности автора. Прежде всего, следует понять, на каких условиях работает ресурс, предоставляющий данную информацию, и здесь возможны разные варианты. Приведем некоторые примеры.

  • Информация находится на корпоративном сайте и представляет собой данные о продуктах этой компании. Очевидно, что фирма распространяет эти сведения потому, что ей выгодно информировать покупателей и клиентов о своем товаре. Именно поэтому информация для клиентов бесплатна.

    На таком сайте может быть точная и полезная информация о продуктах данной фирмы.

    Лучше, чем производитель, новости о своем продукте никто не расскажет, но если на том же сайте приведена аналитика и даны сравнения продукта с товарами конкурента, то, скорее всего, там будет присутствовать лишь та часть аналитики, которая представляет продукты фирмы в благоприятном свете.

  • Информация на сайте аналитического агентства.

    Сайт аналитического агентства обычно содержит более объективные данные о товарах конкурентов, здесь собрана и проанализирована информация о различных игроках рынка, однако чаще всего эта информация платная.

    Если на таком сайте информация выложена бесплатно, то, скорее всего, в ней приведены не все данные. А для того чтобы получить полную картину, информацию придется докупать.

    Аналогично поступают создатели сайтов, которые продают книги. Они выкладывают в Интернет главы из новинок, но если кого-то заинтересует эта информация, скорее всего, для получения полных текстов книгу придется покупать.

  • Информация на бесплатном сайте, предоставляющем различные информационные услуги (например, на новостном сайте). В этом случае информация обычно служит для привлечения массовых посетителей и окупается за счет рекламы. По такому принципу действует огромное количество ресурсов. На подобных сайтах встречается много баннерной рекламы, нередко материалы таких ресурсов содержат скрытую рекламу.
  • Информация на сайте научных изданий. Если документ размещен на сайте научного издания или университета, то, скорее всего, он прошел некоторое научное редактирование, и издание является гарантом его корректности.
  • Информация на частном сайте малоизвестного автора. Порой даже на домашней страничке можно найти уникальную информацию. Однако, если это частный сайт, важно установить авторство документа, авторство сайта и отдавать себе отчет, что доверять фактам, изложенным в документе, следует с определенной долей осторожности.

    Очень часто, проанализировав найденную информацию и отделив рекламную часть от содержательной, а также оценив степень компетентности автора, пользователь понимает, что потратил время впустую. Следует отметить, что, по мере того как коммерческие структуры борются за повышение рейтинга своих рекламных ресурсов в поисковых системах, технические материалы, доступные в Сети, "оттесняются на задний план" (рис. 4.25).

  • (рис 4.25) По мере роста рекламных материалов технические оттесняются на задний план

    WhatIs.com (http://whatis.com/index.htm) - толковый энциклопедический словарь по информационным технологиям и в первую очередь по терминам, связанным с ПК и интернетом. Ресурс содержит более 2 тыс. энциклопедических статей, а также дает несколько Интернет-ссылок на каждый термин. Все статьи взаимосвязаны и содержат около 12 тыс. гипертекстовых ссылок.

    Следует также обратить внимание на сетевую энциклопедию Wikipedia, (www.wikipedia.com), которую может редактировать любой желающий. Wikipedia предлагает каждому дописать в огромный справочник ту часть, в которой он считает себя специалистом. Казалось бы, неорганизованная в единый коллектив масса пользователей не может создать сложную упорядоченную структуру, однако рост объема и популярности Wikipedia говорит об обратном. В энциклопедии около 500 000 статей на английском языке.

    Практические рекомендации по поиску

  • Используйте различные инструменты для поиска информации разного профиля.

    Поиск в каталоге дает представление о структуре вопроса, поисковая система позволяет найти конкретный документ, подбор доменного имени помогает отыскать сервер фирмы, даже если она не индексирована ни одной поисковой системой.

  • Осуществляя поиск в поисковой машине, избегайте общих слов.

    Чем уникальнее ключевое слово, по которому осуществляется поиск, тем больше шансов найти именно то, что нужно. Логика рассуждений здесь очевидна: 400 наиболее часто употребляемых слов русского языка со всеми словоформами составляют одну треть всех слов в среднестатистическом тексте.

  • Ищите больше, чем по одному слову.
  • Сократить объем ссылок можно, определив несколько ключевых слов. Используйте синонимы.
  • Не пишите прописными (большими) буквами.

    Избегайте написания ключевого слова с прописной буквы. В ряде поисковых систем заглавные буквы позволяют искать имена собственные, например "телепередача Здоровье".

  • Используйте функцию "Найти похожие документы".

    Если один из найденных документов ближе к искомой теме, чем остальные, нажмите на ссылку "Найти похожие документы".

  • Пользуйтесь языком запросов.

    С помощью языка запросов можно сделать запрос более точным.

  • Пользуйтесь расширенным запросом.

    Во многих поисковых системах есть форма расширенного запроса, в которой можно использовать основные механизмы сужения поиска (не запоминая семантики языка запросов).

  • Пользуйтесь метапоисковыми системами, если по теме найдено мало документов.
  • Страницы:

    Раз он в море закинул невод - Пришел невод с одною тиной Он в другой раз закинул невод - Пришел невод с травой морскою.

    В Интернете размещены миллионы сайтов, причем с актуальной информацией соседствует много устаревших ресурсов, мусора и недобросовестной рекламы.

    Интернет - это наиболее демократичный источник информации. Каждый может разместить в Сети собственный ресурс и высказать свое мнение. В этом одновременно сила и слабость Всемирной сети. Плюсы наличия столь демократической площадки очевидны.

    Однако отсутствие единоначалия и единых требований по оформлению информации приводит к тому, что в Сети мало кто озабочен тем, чтобы избежать дублирования информации или следовать стандартам, принятым на сайте соседа. И здесь наблюдается резкий контраст с корпоративным документооборотом, описанным ранее.

    Находить информацию в Интернете, вероятно, было бы очень трудно, если бы не были созданы мощные поисковые инструменты: поисковые машины (поисковики), каталоги (рубрикаторы), рейтинги, метапоисковые системы и тематические списки ссылок, онлайновые энциклопедии и справочники.

    Как показывает практика, для поиска разного рода информации наиболее эффективными оказываются различные инструменты (рис. 4.19). Рассмотрим каждую категорию по отдельности.

    (рис 4.19) Для каждого типа информации следует выбирать свой инструмент поиска

    Индексированные каталоги

    Каталог представляет собой данные, структурированные по темам в виде иерархических структур. Тематические разделы первого уровня определяют наиболее популярные, максимально широкие темы, такие как "спорт", "отдых", "наука", "магазины" и т.д. В каждом таком разделе есть подразделы. Таким образом, пользователь может уточнять интересующую его область, путешествуя по дереву каталога и постепенно сужая область поиска. Например, при поиске информации о ноутбуках цепочка поиска может выглядеть следующим образом:

    Информационные технологии -> Компьютеры -> Ноутбуки.

    Дойдя до нужного подкаталога, пользователь находит в нем набор ссылок.

    Обычно в каталоге все ссылки являются профильными, поскольку составлением каталогов занимаются не программы, а люди. Очевидно, что если ведется поиск общей информации по некоторой широкой теме, то целесообразно обратиться к каталогу. Если же необходимо найти конкретный документ, то каталог окажется малоэффективным поисковым средством.

    Существует огромное количество каталогов. Один из наиболее популярных каталогов в России находится по адресу http://list.mail.ru/.

    Помимо каталогов общего профиля, в Сети достаточно много специализированных каталогов. Например, по адресу www.kinder.ru можно найти прекрасный каталог, посвященный детским ресурсам. В случае, если внутри отдельной темы каталога находится огромное количество ресурсов, возникает проблема выбора. В некоторых каталогах имеется сортировка по популярности, например, в каталоге Яндекса сортировка идет по индексу цитирования - числу ссылок на сайт с других сайтов.

    Помимо каталогов в Сети существуют рейтинги. Одним из наиболее популярных рейтингов является Rambler's Top 100. (http://top100.rambler.ru/top100/). На рис. 4.20 показан рейтинг ресурсов. Популярность ресурса оценивается по ряду параметров, в том числе так называемым хостам (количество уникальных посетителей в единицу времени) и хитам (количество заходов на сайт за единицу времени).

    (рис 4.20) Пример ранжирования ссылок в рейтинге Rambler Top 100

    Тематические коллекции ссылок

    Тематические коллекции ссылок - это списки, составленные группой профессионалов или даже коллекционерами-одиночками. Очень часто узкоспециализированная тема может быть раскрыта одним специалистом лучше, чем группой сотрудников крупного каталога. Тематических коллекций в Сети так много, что давать конкретные адреса не имеет смысла.

    Подбор доменного имени

    Каталог - удобная система поиска, однако для того, чтобы попасть на сервер компании Microsoft или IBM, вряд ли имеет смысл обращаться к каталогу. Угадать название соответствующего сайта нетрудно: www.microsoft.com, www.ibm.com или www.microsoft.ru, www.ibm.ru - сайты российских представительств этих компаний.

    Аналогично, если пользователю необходим сайт, посвященный погоде в мире, его логично искать на сервере www.weather.com. В большинстве случаев поиск сайта с ключевым словом в названии эффективнее, чем поиск документа, в тексте которого это слово используется. Если западная коммерческая компания (или проект) имеет односложное название и реализует в Сети свой сервер, то его имя с высокой вероятностью укладывается в формат www.name.com, а для Рунета (российской части Сети) - www.name.ru, где name - имя компании или проекта. Подбор адреса может успешно конкурировать с другими приемами поиска, поскольку при подобной системе поиска можно установить соединение с сервером, который не зарегистрирован ни в одной поисковой системе. Однако, если подобрать искомое имя не удается, придется обратиться к поисковой машине.

    Поисковые машины

    Скажи мне, что ты ищешь в Интернете, и я скажу, кто ты

    Если бы компьютер был высокоинтеллектуальной системой, которой можно было легко объяснить, что вы ищете, то он выдавал бы два-три документа - именно те, которые вам нужны. Но, к сожалению, это не так, и в ответ на запрос пользователь обычно получает длинный список документов, многие из которых не имеют никакого отношения к тому, о чем он спрашивал. Такие документы называются нерелевантными (от англ. relevant - подходящий, относящийся к делу). Таким образом, релевантный документ - это документ, содержащий искомую информацию. Очевидно, что от умения грамотно выдавать запрос зависит процент получаемых релевантных документов. Доля релевантных документов в списке всех найденных поисковой машиной документов называется точностью поиска. Нерелевантные документы называют шумовыми. Если все найденные документы релевантные (шумовых нет), то точность поиска составляет 100%. Если найдены все релевантные документы, то полнота поиска - 100%.

    Таким образом, качество поиска определяется двумя взаимозависимыми параметрами: точностью и полнотой поиска. Увеличение полноты поиска снижает точность, и наоборот.

    Как работает поисковая машина

    Поисковые системы можно сравнить со справочной службой, агенты которой обходят предприятия, собирая информацию в базу данных (рис. 4.21). При обращении в службу информация выдается из этой базы. Данные в базе устаревают, поэтому агенты их периодически обновляют. Некоторые предприятия сами присылают данные о себе, и к ним агентам приезжать не приходится. Иными словами, справочная служба имеет две функции: создание и постоянное обновление данных в базе и поиск информации в базе по запросу клиента.

    (рис 4.21) Поисковые системы можно сравнить со справочной службой, агенты которой обходят предприятия, собирая информацию в базу данных

    Аналогично, поисковая машина состоит из двух частей: так называемого робота (или паука), который обходит серверы Сети и формирует базу данных поискового механизма.

    База робота в основном формируется им самим (робот сам находит ссылки на новые ресурсы) и в гораздо меньшей степени - владельцами ресурсов, которые регистрируют свои сайты в поисковой машине. Помимо робота (сетевого агента, паука, червяка), формирующего базу данных, существует программа, определяющая рейтинг найденных ссылок.

    Принцип работы поисковой машины сводится к тому, что она опрашивает свой внутренний каталог (базу данных) по ключевым словам, которые пользователь указывает в поле запроса, и выдает список ссылок, ранжированный по релевантности.

    Следует отметить, что, отрабатывая конкретный запрос пользователя, поисковая система оперирует именно внутренними ресурсами (а не пускается в путешествие по Сети, как часто полагают неискушенные пользователи), а внутренние ресурсы, естественно, ограниченны. Несмотря на то что база данных поисковой машины постоянно обновляется, поисковая машина не может проиндексировать все Web-документы: их число слишком велико. Поэтому всегда существует вероятность, что искомый ресурс просто неизвестен конкретной поисковой системе.

    Эту мысль наглядно иллюстрирует рис. 4.22. Эллипс 1 ограничивает множество всех Web-документов, существующих на некоторый момент времени, эллипс 2 - все документы, которые проиндексированы данной поисковой машиной, а эллипс 3 - искомые документы. Таким образом, найти с помощью данной поисковой машины можно лишь ту часть искомых документов, которые ею проиндексированы.

    (рис 4.22) Схема, поясняющая возможности поиска

    Проблема недостаточности полноты поиска состоит не только в ограниченности внутренних ресурсов поисковика, но и в том, что скорость робота ограниченна, а количество новых Web-документов постоянно растет. Увеличение внутренних ресурсов поисковой машины не может полностью решить проблему, поскольку скорость обхода ресурсов роботом конечна.

    При этом считать, что поисковая машина содержит копию исходных ресурсов Интернета, было бы неправильно. Полная информация (исходные документы) хранится отнюдь не всегда, чаще хранится лишь ее часть - так называемый индексированный список, или индекс, который гораздо компактнее текста документов и позволяет быстрее отвечать на поисковые запросы.

    Для построения индекса исходные данные преобразуются так, чтобы объем базы был минимальным, а поиск осуществлялся очень быстро и давал максимум полезной информации. Объясняя, что такое индексированный список, можно провести параллель с его бумажным аналогом - так называемым конкордансом, т.е. словарем, в котором в алфавитном порядке перечислены слова, употребляемые конкретным писателем, а также указаны ссылки на них и частота их употребления в его произведениях.

    Очевидно, что конкорданс (словарь) гораздо компактнее исходных текстов произведений и найти в нем нужное слово намного проще, нежели перелистывать книгу в надежде наткнуться на нужное слово.

    Построение индекса

    Схема построения индекса показана на рис. 4.23. Сетевые агенты, или роботы-пауки, "ползают" по Сети, анализируют содержимое Web-страниц и собирают информацию о том, что и на какой странице было обнаружено.

    (рис 4.23) Роботы-пауки просматривают информационное наполнение Web-страниц и создают базу, на основе которой производится поиск

    При нахождении очередной HTML-страницы большинство поисковых систем фиксируют слова, картинки, ссылки и другие элементы (в разных поисковых системах по-разному), содержащиеся на ней. Причем при отслеживании слов на странице фиксируется не только их наличие, но и местоположение, т.е. где эти слова находятся: в заголовке (title), подзаголовках (subtitles), в метатэгахМетатэги - это служебные тэги, позволяющие разработчикам помещать на Web-страницы служебную информацию, в том числе для того, чтобы сориентировать поисковую машину. (meta tags) или в других местах. При этом обычно фиксируются значимые слова, а союзы и междометия типа "а", "но" и "или" игнорируются. Метатэги позволяют владельцам страниц определить ключевые слова и тематику, по которым индексируется страница. Это может быть актуально в случае, когда ключевые слова имеют несколько значений. Метатэги могут сориентировать поисковую систему при выборе из нескольких значений слова на единственно правильное. Однако метатэги работают надежно только в том случае, когда заполняются честными владельцами сайта. Недобросовестные владельцы Web-сайтов помещают в свои метатэги наиболее популярные в Сети слова, не имеющие ничего общего с темой сайта. В результате посетители попадают на незапрашиваемые сайты, повышая тем самым их рейтинг. Именно поэтому многие современные поисковики либо игнорируют метатэги, либо считают их дополнительными по отношению к тексту страницы. Каждый робот поддерживает свой список ресурсов, наказанных за недобросовестную рекламу.

    Очевидно, что если вы ищете сайты по ключевому слову "собака", то поисковый механизм должен найти не просто все страницы, где упоминается слово "собака", а те, где это слово имеет отношение к теме сайта. Для того чтобы определить, в какой степени то или иное слово имеет отношение к профилю некоторой Web-страницы, необходимо оценить, насколько часто оно встречается на странице, есть ли по данному слову ссылки на другие страницы или нет. Короче говоря, необходимо ранжировать найденные на странице слова по степени важности. Словам присваиваются весовые коэффициенты в зависимости от того, сколько раз и где они встречаются (в заголовке страницы, в начале или в конце страницы, в ссылке, в метатэге и т.п.). Каждый поисковый механизм имеет свой алгоритм присваивания весовых коэффициентов - это одна из причин, по которой поисковые машины по одному и тому же ключевому слову выдают различные списки ресурсов. Поскольку страницы постоянно обновляются, процесс индексирования должен выполняться постоянно. Роботы-пауки путешествуют по ссылкам и формируют файл, содержащий индекс, который может быть довольно большим. Для уменьшения его размеров прибегают к минимизации объема информации и сжатию файла. Имея несколько роботов, поисковая система может обрабатывать сотни страниц в секунду. Сегодня мощные поисковые машины хранят сотни миллионов страниц и получают десятки миллионов запросов ежедневно.

    При построении индекса решается также задача снижения количества дубликатов - задача нетривиальная, учитывая, что для корректного сравнения нужно сначала определить кодировку документа. Еще более сложной задачей является отделение очень похожих документов (их называют "почти дубликаты"), например таких, в которых отличается лишь заголовок, а текст дублируется. Подобных документов в Сети очень много - например, кто-то списал реферат и опубликовал его на сайте за своей подписью. Современные поисковые системы позволяют решать подобные проблемы.

    Поиск по индексу

    Поиск по индексу заключается в том, что пользователь формирует запрос и передает его поисковой машине. В случае когда у пользователя имеется несколько ключевых слов, весьма полезно использование булевых операторовЛогические операторы, получившие имя в честь знаменитого математика Джорджа Буля (Boole) (1815 - 1864). Буль первым показал, что существует аналогия между алгебраическими и логическими действиями, так как и те и другие предполагают лишь два варианта ответов - истина или ложь, нуль или единица. Он придумал систему обозначений и правил, пользуясь которыми можно было закодировать любые высказывания, а затем манипулировать ими как обычными числами. Булева алгебра располагала тремя основными операциями - И, ИЛИ, НЕ, которые позволяли производить сложение, вычитание, умножение, деление и сравнение символов и чисел..

    Наиболее часто используемые булевы операторы:

  • AND - все термины, соединенные "AND", должны присутствовать в предлагаемом документе. Большинство поисковых систем используют значок "+" вместо "AND";
  • OR - как минимум одно из ключевых слов, соединенных "OR", должно присутствовать в искомом документе;
  • NOT - ключевое слово (слова), следующее за "NOT", не должно появляться в искомом документе. Некоторые поисковые системы используют значок "-" вместо "NOT";
  • FOLLOWED BY - одно из ключевых слов должно следовать непосредственно за другим;
  • NEAR - одно из слов должно отстоять на определенное количество слов от другого;
  • Кавычки - слова внутри кавычек - это фраза, которая целиком должна быть найдена в пределах документа или файла.
  • Текст, в пределах которого проверяется действие логических операторов, называется единицей поиска. Это может быть предложение, абзац или весь документ. В разных поисковых системах могут использоваться различные единицы поиска. Например, можно искать документы, в которых два слова - "электрический" и "счетчик" - находятся одновременно в пределах предложения или в пределах всего документа. Соответственно поиск в пределах предложения возможен для тех систем, которые имеют в индексе подробный адрес.

    Синтаксис языка запросов в разных поисковых системах может отличаться, обычно в справочных данных на поисковом сервере приводится информация о синтаксисе запросов. В качестве примера в табл. 4.2. приводится синтаксис языка запросов, принятый в поисковой машине Yandex.

    Синтаксис языка запросов при строгом поиске
    Синтаксис Что означает оператор Пример запроса
    Пробел или Логическое И (в пределах предложения) Лечебная физкультура
    Логическое И (в пределах документа) Рецепты (плавленый сыр)
    | Логическое ИЛИ Фото | фотография | снимок | фотоизображение
    + Обязательное наличие слова в найденном документе (работает также в применении к стоп- словамСтоп-слова - это распространенные слова, которые игнорируют поисковые машины во время поиска по ключевому слову. Поисковики не обращают на них внимания, чтобы сэкономить место на своих серверах и ускорить процесс поиска. ) +Быть или +не быть
    () Группирование слов (Технология | изготовление) (сыра | творога)
    ~ Оператор И НЕ (в пределах предложения) Банки ~ закон
    ~~или~ Оператор И НЕ (в пределах документа) Путеводитель по Парижу ~~ (агентство | тур)
    /(n m) Расстояние в словах (~ назад +вперед) Поставщики /2 кофе музыкальное /(-2 4) образование вакансии ~/+1 студентов
    << << Поиск фразы <<Красная шапочка>> (эквивалентно красная /+1 шапочка)
    /(n m) Расстояние в предложениях (-назад +вперед) Банк /1 налоги

    Многие поисковые системы имеют режим "расширенный поиск". Например, в наиболее популярной на сегодня поисковой системе Google (www.google.com) этот режим дает возможность искать документы на определенном языке, измененные в определенное время или представленные в определенном формате, например Word-документ или презентацию Power Point.

    После того как пользователь передал запрос поисковой системе, она обрабатывает синтаксис запроса и сравнивает ключевые слова со словами в индексе. После этого составляется список сайтов, отвечающих запросу, они ранжируются по релевантности и формируется результат поиска, который и выдается пользователю.

    Несмотря на то что человек человеку всегда лучше объяснит, что же он ищет, нельзя сказать, что современные поисковые машины - это примитивные системы, которые, кроме как найти некоторую последовательность символов, ничего не могут. Напротив, существуют, например, поисковые системы позволяющие решать проблему различных словоформ. А это далеко не тривиальная задача. Если мы ищем документ по ключевому слову "стол", то, вероятно, документ, содержащий фразу "столы для кухни" - это то, что нам нужно. Однако "стол" и "столы" для системы, осуществляющей формальное сравнение, - это разные слова. Поиск, учитывающий словоизменения, называется морфологическим поиском.

    Метапоисковые системы

    Интернет развивается стремительными темпами - каждый день появляются сотни тысяч новых Web-страниц. Рост количества документов происходит быстрее, чем поисковые системы успевают их проиндексировать. Отсюда следует неутешительный вывод, что, если даже в Сети и есть документ, который ищет пользователь, вовсе не обязательно, что о нем "знает" выбранная поисковая машина. Поисковых систем в мире сотни, и велика вероятность, что нужный пользователю документ не попал в данный поисковик, но проиндексирован другой поисковой системой. Поэтому существуют приложения, позволяющие передавать запрос пользователя сразу в несколько поисковых систем - так называемые метапоисковые системы.

    Метапоисковая система имеет те же преимущества перед поисковой системой, что и поиск в нескольких справочниках перед поиском в одном (рис. 4.24).

    (рис 4.24) Метапоисковая система имеет те же преимущества перед поисковой системой, что и поиск в нескольких справочниках перед поиском в одном

    Однако это не означает, что метапоиском следует пользоваться во всех случаях. Если документов по теме много, то метапоиск не нужен и, возможно, даже вреден, поскольку смешивает разные логики ранжирования. Но если документов по теме мало, то метапоиск может быть полезен именно благодаря тому, что объединяет большое число поисковиков.

    В качестве примера метапоисковой системы можно привести программу "ДИСКо Искатель" (Разработка фирмы "ДИСКо" www.disco.ru). Главной особенностью этой программы является возможность запоминать как параметры поиска, так и его результаты и впоследствии использовать их.

    Следует отметить, что существуют онлайновые сервисы метапоиска по отдельным товарам. Например, на сайте www.booksearch.ru можно осуществить метапоиск по 12 наиболее популярным книжным Интернет-магазинам. Это позволяет найти редкие книги, которые есть не во всех магазинах.

    Онлайновые энциклопедии и справочники

    В ряде случаев бывает нужно найти не просто документ, содержащий ключевое слово, а именно толкование некоторого слова. При поиске незнакомого термина с помощью поисковой машины вы рискуете получить целый ряд статей, в которых этот термин используется, и при этом так и не узнать, что же он все-таки обозначает.

    В ряде случаев можно воспользоваться поиском с ключевыми словами типа "что такое (неизвестный термин)", "(неизвестный термин) - это" или "(неизвестный термин) представляет собой" и т.д.

    Однако, если это не новый термин, предпочтительнее начать подобный поиск в онлайновой энциклопедии.

    Одной из крупнейших онлайновых энциклопедий является ресурс "Яндекс. Энциклопедии" (http://encycl.yandex.ru/) - этот проект содержит 14 энциклопедий, в том числе статьи из Большой Советской Энциклопедии и "Энциклопедию Брокгауза и Эфрона". К крупным относится и "Энциклопедия Кирилла и Мефодия", которую можно найти по адресу www.km.ru.

    Особенно актуальным является поиск толкований терминов по информационным технологиям, которые развиваются так быстро, что уследить за их появлением очень сложно. Увы, большинство словарей из данной категории - англоязычные. Весьма популярным и объемным является англоязычный FOLDOC (Free On-line Dictionary Of Computing - http://wombat.doc.ic.ac.uk/foldoc/index.html)- более 13 тыс. терминов. Следует рекомендовать еще как минимум два онлайновых словаря: Webopedia и WhatIs.com.

    Помимо традиционного словаря, ресурс Webopedia (www.pcwebopaedia.com) имеет массу специализированных сервисов, например: "Кто есть кто в компьютерных технологиях", "Сравнительная таблица микропроцессоров", "История развития компьютерных технологий" и др.

    Это интересно
    Степень достоверности содержания Web-документов

    Даже если документ содержит искомые ключевые слова, ценность его может быть различна. Следует помнить, что в отличие от печатных изданий, в которых есть редактор, литредактор, корректор и т.п., в Интернете текст может быть напечатан без должного контроля и корректуры. Поэтому важно оценить, в какой мере документ содержит рекламу и насколько можно доверять компетентности автора. Прежде всего, следует понять, на каких условиях работает ресурс, предоставляющий данную информацию, и здесь возможны разные варианты. Приведем некоторые примеры.

  • Информация находится на корпоративном сайте и представляет собой данные о продуктах этой компании. Очевидно, что фирма распространяет эти сведения потому, что ей выгодно информировать покупателей и клиентов о своем товаре. Именно поэтому информация для клиентов бесплатна.

    На таком сайте может быть точная и полезная информация о продуктах данной фирмы.

    Лучше, чем производитель, новости о своем продукте никто не расскажет, но если на том же сайте приведена аналитика и даны сравнения продукта с товарами конкурента, то, скорее всего, там будет присутствовать лишь та часть аналитики, которая представляет продукты фирмы в благоприятном свете.

  • Информация на сайте аналитического агентства.

    Сайт аналитического агентства обычно содержит более объективные данные о товарах конкурентов, здесь собрана и проанализирована информация о различных игроках рынка, однако чаще всего эта информация платная.

    Если на таком сайте информация выложена бесплатно, то, скорее всего, в ней приведены не все данные. А для того чтобы получить полную картину, информацию придется докупать.

    Аналогично поступают создатели сайтов, которые продают книги. Они выкладывают в Интернет главы из новинок, но если кого-то заинтересует эта информация, скорее всего, для получения полных текстов книгу придется покупать.

  • Информация на бесплатном сайте, предоставляющем различные информационные услуги (например, на новостном сайте). В этом случае информация обычно служит для привлечения массовых посетителей и окупается за счет рекламы. По такому принципу действует огромное количество ресурсов. На подобных сайтах встречается много баннерной рекламы, нередко материалы таких ресурсов содержат скрытую рекламу.
  • Информация на сайте научных изданий. Если документ размещен на сайте научного издания или университета, то, скорее всего, он прошел некоторое научное редактирование, и издание является гарантом его корректности.
  • Информация на частном сайте малоизвестного автора. Порой даже на домашней страничке можно найти уникальную информацию. Однако, если это частный сайт, важно установить авторство документа, авторство сайта и отдавать себе отчет, что доверять фактам, изложенным в документе, следует с определенной долей осторожности.

    Очень часто, проанализировав найденную информацию и отделив рекламную часть от содержательной, а также оценив степень компетентности автора, пользователь понимает, что потратил время впустую. Следует отметить, что, по мере того как коммерческие структуры борются за повышение рейтинга своих рекламных ресурсов в поисковых системах, технические материалы, доступные в Сети, "оттесняются на задний план" (рис. 4.25).

  • (рис 4.25) По мере роста рекламных материалов технические оттесняются на задний план

    WhatIs.com (http://whatis.com/index.htm) - толковый энциклопедический словарь по информационным технологиям и в первую очередь по терминам, связанным с ПК и интернетом. Ресурс содержит более 2 тыс. энциклопедических статей, а также дает несколько Интернет-ссылок на каждый термин. Все статьи взаимосвязаны и содержат около 12 тыс. гипертекстовых ссылок.

    Следует также обратить внимание на сетевую энциклопедию Wikipedia, (www.wikipedia.com), которую может редактировать любой желающий. Wikipedia предлагает каждому дописать в огромный справочник ту часть, в которой он считает себя специалистом. Казалось бы, неорганизованная в единый коллектив масса пользователей не может создать сложную упорядоченную структуру, однако рост объема и популярности Wikipedia говорит об обратном. В энциклопедии около 500 000 статей на английском языке.

    Практические рекомендации по поиску

  • Используйте различные инструменты для поиска информации разного профиля.

    Поиск в каталоге дает представление о структуре вопроса, поисковая система позволяет найти конкретный документ, подбор доменного имени помогает отыскать сервер фирмы, даже если она не индексирована ни одной поисковой системой.

  • Осуществляя поиск в поисковой машине, избегайте общих слов.

    Чем уникальнее ключевое слово, по которому осуществляется поиск, тем больше шансов найти именно то, что нужно. Логика рассуждений здесь очевидна: 400 наиболее часто употребляемых слов русского языка со всеми словоформами составляют одну треть всех слов в среднестатистическом тексте.

  • Ищите больше, чем по одному слову.
  • Сократить объем ссылок можно, определив несколько ключевых слов. Используйте синонимы.
  • Не пишите прописными (большими) буквами.

    Избегайте написания ключевого слова с прописной буквы. В ряде поисковых систем заглавные буквы позволяют искать имена собственные, например "телепередача Здоровье".

  • Используйте функцию "Найти похожие документы".

    Если один из найденных документов ближе к искомой теме, чем остальные, нажмите на ссылку "Найти похожие документы".

  • Пользуйтесь языком запросов.

    С помощью языка запросов можно сделать запрос более точным.

  • Пользуйтесь расширенным запросом.

    Во многих поисковых системах есть форма расширенного запроса, в которой можно использовать основные механизмы сужения поиска (не запоминая семантики языка запросов).

  • Пользуйтесь метапоисковыми системами, если по теме найдено мало документов.
  • Вернуться к учебному плану