Язык поисковых запросов. Применение языка запросов.

Обновление 4_012_18

ПОИСК

информации в интернете

Введение

Интернет – это информационное пространство, в котором можно отыскать ответ практически на любой интересующий пользователя вопрос. Это огромная глобальная сеть, в которую как информационные ручейки стекаются потоки более мелких сетей. Любой пользователь, располагающий ПК и соответствующими программами, сможет подключиться к сети, используя её возможности для самых разных целей – проведения досуга, обучения, чтения научных работ, отправки электронной почты и т.д. По различным данным, в 2004 г. количество пользователей глобальной системы Интернет составило от 600 до 900 миллионов человек. Это число продолжает стремительно расти и уже в 2006 г. оно достигло миллиарда человек. Сегодня глобальная сеть превращается в важный социальный и политический фактор современного информационного общества. С развитием Интернет-технологий появился новый гигантский источник информационных ресурсов, доступ к которым является не только относительно дешевым, но и очень быстрым.

Поиск в компьютерных сетях становится искусством и требует вполне определённых знаний, которыми современному человеку необходимо овладеть. Я выбрала данную тему реферата, так как считаю что одной из составляющей грамотной работы в Интернет является умение работать в глобальной сети. И для того, чтобы не утонуть во всём изобилии информации необходимо научиться не только её искать, но и находить.

Задачи и стратегии поиска

Прежде чем начать поиск следует четко сформулировать задачу. До тех пор, пока задача не будет сформулирована об успешности, а тем более оптимизации поиска, не может быть и речи. Объем информации в Интернете слишком велик, и как нигде здесь верна поговорка «Время - деньги». Поэтому в здесь нельзя искать по принципу «Пойди туда, не знаю куда. Возьми то, не знаю что». Иначе результат будет плачевный.

Дать общий рецепт эффективной стратегии поиска информации в Интернет, пожалуй, невозможно. Есть лишь некоторые принципы, позволяющие тратить меньше времени. Вот некоторые из них. Например, вам необходимо узнать, где обитает трёхлапый ленивец, то вряд ли вы пойдете в алфавитный каталог библиотеки. Может быть, вы найдете нужную литературу с помощью систематического каталога. С несколько большей вероятностью - с помощью предметного. Но, скорее всего, ни один из библиотечных каталогов вам не поможет. Но, зайдя в информационно-библиографический отдел крупной библиотеки, дежурный библиограф достанет библиографический указатель по животным или какую-то похожую книжицу, из которой вы и найдете ответ на свой вопрос. Подобную стратегию можно с успехом применять и в Интернет. В ИПС(информационно-поисковых сетях) общего назначения можно утонуть в тысячах ссылок, выданных вам на простой запрос. Целью использования универсальной ИПС общего назначения может быть поиск специализированной ИПС, посвященной тематике вашего поиска. Такая ИПС может быть распознана по наличию слов "информация (information)", "документ (document)" и т.п. Но часто специализированная ИПС может скрываться на сервере общественной, профессиональной или специализированной организации, издательства.

 Этот пример иллюстрирует еще один элемент стратегии: читайте найденные документы в поисках наиболее точных терминов и связей между терминами. Возможно, вы мыслите в совершенно не тех терминах, которые используют авторы искомых документов (ведь большую роль играют культурные различия!).

Третий элемент стратегии: используйте несколько ИПС. Если вы регулярно занимаетесь поиском информации по какой-то тематике, отметьте те ИПС. которые для вас наиболее эффективны.

Средства поиска информации в глобальной сети

По принципу организации и использования средства поиска можно разделить на каталоги (справочники, директории) и поисковые машины.

Каталоги.

Каталоги являются справочниками, содержащими списки адресов Интернет, сгруппированные по определенным признакам. Как правило, они объединяются по тематике (наука, искусство, новости и т.д.), где каждая тема разветвляется на несколько подуровней. Особенность этих средств поиска информации состоит в том, что создание структуры, базы данных и их постоянное обновление осуществляется "вручную", коллективом редакторов и программистов, и сам процесс поиска требует непосредственного участия пользователя, самостоятельно переходящего от ссылки к ссылке. Основное достоинство поисковых каталогов ресурсов в том, что накапливаемая в них информация тщательно отбирается, сортируется, разбивается на отдельные категории.

Все каталоги построены по единому принципу. Страницы каталогов содержат тематические классификаторы. На стартовой странице располагается тематический каталог высшего уровня. Под каждой категорией каталога могут быть развёрнуты подкатегории. Посредством щелчка на одной из тематических ссылок открывается страница с тематическими категориями более низкого уровня, которые, в свою очередь, тоже разбиваются на подкатегории. Все категории и подкатегории соответствующим образом выделяются.

Каталоги организованы по иерархическому принципу и устроены в виде тематического дерева, корнем которого служит начальная страница каталога, содержащая определённое количество тематических ветвей. Перемещаться по тематическому дереву вверх или вниз можно посредством щелчков на именах страниц. Страницы большинства каталогов содержат специальные элементы – индексы, на которых расположены ссылки на узлы, относящиеся к данной тематике. Если щёлкнуть на одной из ссылок, то появится окно, в котором продемонстрирована организация данной ветви тематического дерева. Это ускоряет просмотр тематических категорий и подкатегорий.

Одним из наиболее известных каталогов является Yahoo! Страницы этого каталога содержат множество тематических категорий, организованных по иерархическому принципу. Категории на всех уровнях разветвляются на подкатегории. Корнем служит начальная страница каталога, содержащая 14 тематических ветвей. Перемещаться по тематическому дереву вверх или вниз можно посредством щелчков на именах страниц. На страницы Yahoo! встроены индексы всех Web-ресурсов, относящихся к данной теме. Все каталоги и подкатегории выделены полужирным шрифтом, а гиперссылки на существующие Web-сайты выделены подчёркиванием. На каждую страницу Yahoo! Вмонтированы специальные символы:

1. число, стоящее в круглых скобках около категории, указывает на количество ссылок в категории.;

2.          обозначение @ говорит о том, что подкатегория входит в состав нескольких категорий;

3.          слово new свидетельствует о том, что ссылка была добавлена недавно;

4.           значок с изображением очков указывает на интересную или полезную, по мнению администрации сайта, ссылку.

Механизм поиска Yahoo! Можно активизировать на любой из страниц каталога. Для поиска в пределах всего каталога или одной из страниц используются специальные переключатели и поисковое окно. Поиск в Yahoo! Производится в соответствии с типом адресов, выбираемых с помощью опций меню (размещённого под поисковым окном). Кроме системы адресации, используемой тематическим каталогом, существует возможность обращения по адресам информационной службы Usenet, а также электронной почты. При выборе опций меню Yahoo! Поиск ведётся среди Web-узлов, ключённых в каталог служб новостей, относящихся к данной тематике.

в Internet размещаются узлы и других каталогов, снабжённых поисковыми системами, подобными поисковым системам Yahoo!

Ниже перечислены некоторые поисковые каталоги:

  • Excite (www.excite.com);
  • Брама (www.brama.com);
  • Everyday (www.everyday.com.ua);
  • UP.RU (www.up.ru);
  • Elvisti (www.el.visti.net);
  • @Rus (www.atrus.ru);
  • List.ru (www.list.ru);
  • Weblist (www.weblist.ru);
  • Созвездие (www.stars.ru);
  • Улитка (www.ulitka.ru);
  • Иван Сусанин (www.susanin.ru);
  • MavicaNet (www.mavikanet.ru).

Главный недостаток поисковых каталогов Web-ресурсов в том, что их поисковые системы извлекают огромное число документов, не соответствующих вводимому запросу. Как правило, документы, которые находятся в конце списка, содержат мало полезной информации. Ключевые слова могут быть истолкованы системой поиска совершенно в ином контексте либо отвечают нескольким толкованием.

Поисковые машины.

 Для детального поиска документов используются специализированные поисковые системы – поисковые машины. Действие поисковых машин заключается в постоянном последовательном исследовании всех узлов Интернет, доступных данной системе поиска, со всеми их связями и ответвлениями. В связи с постоянным обновлением информации машина поиска регулярно возвращается через определенный срок (порядка месяца) к уже изученным узлам, чтобы обнаружить и зарегистрировать изменения. Вся прочитанная информация индексируется, то есть создается специализированная база данных, в которой закодированы все исследованные системой страницы Интернет.

 При поступлении запроса от пользователя машина поиска рассматривает всю индексированную информацию и выдает список документов, соответствующих задаче поиска. Найденные документы ранжируются в зависимости от местоположения ключевых слов (в заголовке, в начале текста, в первых параграфах) и частоты их появления в тексте. Несмотря на схожий принцип работы, машины поиска различаются по языкам запроса, зонам поиска, глубине поиска внутри документа, методам ранжирования и приоритетов, поэтому применение разных поисковых машин дает различные результаты

В настоящее время в отечественных ресурсах действует довольно много поисковых машин. Есть фирменные и даже индивидуальные сайты, которые включают те или иные поисковые машины. Поисковые элементы существуют практически на всех Интернет-газетах и учебных порталах.

 Наиболее распространённые из поисковых машин представлены ниже:

  • Яndex (www.yandex.ru);
  • Апорт (www.aport.ru);
  • МЕТА (www.meta-ukraine.com);
  • Rambler (www.rambler.ru);
  • UANET (www.uanet.com.ua);
  • EIVisti (www.el.visti.net);
  • SEARCH (www.search.kiev.ua);
  • Pathfinder (www.pups.kiev.ua);
  • Tela-поиск (www.tela.dux.ru);
  • Openweb (www.openweb.ru);
  • АУ (www.au.ru).

 Существует некоторые причины, по которым документ не может быть обнаружен. Прежде всего, требуемое не будет обнаружено поисковой машиной, если на ней данные ресурсы не прописаны. Необходимо запомнить, что недостаточно разместить что-либо в Интернете, необходимо прописать это на соответствующих поисковых машинах. Можно расположить материал в Интернете, знать его адрес. Однако, пока он не «прописан» на одной из поисковых машин, найти его будет очень сложно, конечно, если ему не дан адрес. Через некоторое время и этот сайт будет обнаружен так называемыми «поисковыми роботами» или «пауками-поисковиками» и, только тогда, возможно, он начнёт посещаться.

 Впрочем, есть возможность программно запретить регистрацию всего сайта, или отдельных элементов его, как всеми, так и определёнными поисковыми системами. Для подобных целей служат так называемые мета-теги или мета-определители. Однако это отдельный разговор, кем и с какой целью подобное запрещение делается.

Следующее - это специализация поисковых машин. Так, например, top100 относится к поисковым машинам специализированного типа и больше предназначена для поиска технических элементов компьютеров и справок по ним. Поисковые машины km.ru, yandex.ru, rambler.ru, относятся к группе общего назначения. Именно с них следует начинать поиск в Интернете. Причем, поисковая система «Кирилл и Мефодий» на km.ru все же чаще используется для розыска материалов в разного рода энциклопедиях и учебных пособиях, словарях, которые вышли после 1990 г. На AltaVista – пожалуй наиболее полно представлены материалы, связанные с коммерческой деятельностью, Google – более специализируется на оперативных новостях. На машинах Fast, Инфоарт, Русский интернет и Aпорт часто можно бывает найти информацию, связанную с куплей-продажей. Следует также учитывать, что полностью адрес поисковых машин обычно включает префикс и выглядит примерно так: http://www.dig.ru. Некоторые поисковые системы используют чужие поисковые системы. Так система поиска mail.ru на сегодняшний день использует поисковую машину rambler.ru, но выводит информацию в собственном интерфейсе.

Язык поисковых запросов. Применение языка запросов.

 Поисковый запрос может состоять из одного или нескольких слов, в нем могут присутствовать различные знаки препинания. Составлять самые простые запросы можно и не вдаваясь в тонкости языка запросов. Так, если ввести в поисковую строку несколько слов без знаков препинания и логических операторов, будут найдены документы, содержащие все эти слова, да ещё и если они находятся на строго ограниченном расстоянии друг от друга. Такой поиск с довольно большой вероятностью закончится отрицательным результатом. И здесь о понятии успешности не может быть и речи. Знание и правильное применение языка запросов поисковой машины поможет сделать поиск быстрым и эффективным.

 Что касается регистра, то в общем случае, регистр написания поисковых слов и операторов значения не имеет, то есть слова "реферат", "Реферат", рефеРАт, "РЕФЕРАТ" и "РеФерАт" - все будут восприниматься одинаково.               Это полностью касается и латиницы. Так, "Yas" и "yES", и даже "yeS", "yes" и "YES" все они для поиска однообразны. И лишь иногда, в целях повышения качества поиска, регистр поискового запроса принимается во внимание. Если в запросе задано слово с большой буквы, то будут найдены только слова в таком написании, а если с маленькой - оба варианта. Если запрос состоит из двух, трех или четырех слов, каждое из которых написано с большой буквы, то предполагается поиск по имени собственному, и автоматически производится изменение ограничения расстояния между словами запроса со значения по умолчанию на величину (n-1)*2, где n - количество слов запроса. Это позволяет находить группу слов запроса, внутри которой есть не более одного "лишнего" слова или знака препинания, например: "М. Лермонтов", "Баден-Баден", "Шарль де Голь", "Федор Михайлович Достоевский" и т.п.

 Современные поисковые машины используют операторы для поиска в компьютерных сетях. Под оператором здесь понимается инструкция поиска. По этой причине запрос, включающий несколько слов, может содержать операторы. Поиск указанных операторов в документе не производится. Они служат лишь инструкцией поисковой машине. По этой причине они имеют свою орфографию и синтаксис. Рассмотрим их подробнее.

Логические операторы.

Два запроса, соединенные оператором AND (логическое И) образуют сложный запрос, которому удовлетворяют только те документы, которые одновременно удовлетворяют обоим этим запросам, т.е. по запросу “телефон AND мобильный” найдутся только те документы, которые содержат и слово “телефон”, и слово “мобильный” одновременно. Если эти слова встретятся в текстах отдельно, поисковая машина эти тексты не покажет или покажет в конце списка найденных материалов, как только частично отвечающие запросу. Необходимо помнить, что если оператор в явном виде не указан, используется по умолчанию оператор AND. В результате будут выведены документы, содержащие все слова запроса.

 Сложному запросу, состоящему из двух запросов, соединенных оператором OR (логическое ИЛИ) соответствуют все документы, удовлетворяющие хотя бы одному из этих двух запросов. Например, “телефон OR мобильный” будут найдены документы, в которых присутствует хотя бы одно из этих двух слов, либо оба эти слова вместе.

 Оператор NOT (логическое И-НЕ) образует запрос, которому отвечают документы, удовлетворяющие левой части запроса и не удовлетворяющие правой. Так, результатом поиска по запросу “телефон NOT мобильный” будут показаны все документы, в которых есть слово “телефон” и при этом в данном документе на установленном расстоянии отсутствует слово “мобильный”.

Каждый из операторов имеет своё сокращенное обозначение, соответствие их приведено в таблице.

Оператор Полное обозначение Сокращённое обозначение
ИЛИ OR | , пробел
И AND & +
НЕ NOT ~

 

 В языке запросов обычно один значок оператора означает его действие в пределах абзаца, а два подряд - в пределах всего текста.

 Скобки. При построении запросов иногда возникает необходимость объединения слов запроса в группы, которые будут аргументами некоторого оператора. Такие группы заключаются в скобки. Как правило, в большинстве поисковых машин используют только скобки вида ( ). Часть запроса, заключенная в скобки, сама является запросом, и на нее распространяются все правила языка построения запросов. Использование скобок позволяет строить вложенные запросы и передавать их операторам в качестве аргументов, а также перекрывать приоритеты операторов, принятые по умолчанию.

Кавычки. Для поиска цитат можно использовать типовые (двойные) кавычки, вида « или “. Слова запроса, заключенного в двойные кавычки, ищутся в документах именно в том виде и в том порядке, как они были заданы в запросе. Это весьма эффективный способ поиска. Его применение обеспечивает успешность более 60%. Здесь важно учитывать только два момента. Во-первых, цитирование должно быть точным, т.е. без изменения по падежам, числам и лицам, во-вторых, материал, который вы ищите, как минимум должен быть в Интернете. Если при такой форме поиска будет допущена грамматическая ошибка, поиск даст отрицательный результат.

 Таким образом, двойные кавычки можно использовать и просто для поиска слова в заданной форме (по умолчанию слова находятся во всех формах). Например, запросу: <поезд "прибыл" посадка> удовлетворяет документ, содержащий текст '... поезд прибыл для осуществления посадки пассажиров ...', и не удовлетворяют документы: с '.. поезд подошел к платформе для посадки пассажиров ...', или '… поезд был подан для проведения посадки пассажиров…' и т.п.

 Метасимволы или маски. Далеко не всякая поисковая машина может поддерживать поиск строк с использованием метасимволов ('*', '?'), которые обычно используются в значении "любая подстрока" и "произвольный (любой) одиночный символ" соответственно. Тем не менее, эти операторы нередко бывают зарезервированы для подобного использования в будущем.

Рассмотрим конкретный пример. Откроем в браузере начальную страницу поискового сервера Яндекс. В поле поиска введём ключевые слова, например, «информатика учебники тесты CD-ROM», либо «информатика&учебники&тесты&CD-ROM». В результате проведённого поиска было найдено 202 страницы, содержащие данный запрос и не менее 81 сайта. В статистике поиска можно ознакомиться с количеством сайтов, содержащих каждое из ключевых слов: информатика – 55813, учебники – 189860, тесты – 498394, CD – 348167? ROM – 34315.

ПРИМЕР

         Теперь зададим в поле поиска следующую фразу: «информатика|учебники|тесты|CD-ROM», используя оператор OR. В результате по этому запросу будет найдено 48518876 страниц, не менее 22970 сайтов, в каталоге 962 сайта.

ПРИМЕР

          Используя оператор NOT, введём в поле поиска следующую фразу: «информатика ~учебники тесты CD-ROM»/ В результате будет найдено 3695907 страниц и не менее 4056 сайтов, которые будут содержать ключевое слово «информатика» с исключением слов, стоящих в запросе после значка «~».

ПРИМЕР

Яndex также позволяет использовать вместо слов целые логические выражения, при этом его необходимо заключить в скобки. Используя наш пример, введём в поле поиска следующее выражение: (информатика учебники) тесты CD-ROM. В результате поиска будет найдено 3564 страниц и не менее 701 сайта, содержащие в себе такую группу слов как (информатика учебники).

ПРИМЕР

      Теперь найдем фразу, для этого введём в поле поиска следующее выражение: «мороз и солнце, день чудесный». В результате этого поиска будет найдено 14195 страниц и не менее 756 сайтов.

ПРИМЕР

        При поиске информации в Интернет очень важно учитывать морфология языка запросов. По каждому слову запроса поиск ведется с учетом правил словоизменения соответствующего языка. Поисковая машина «понимает» и «различает» слова русского и английского языков - по умолчанию. Поиск ведется, с учетом изменения по склонению, спряжению, числу и лицу, т.е. по всем формам слова; включая даже совпадающие по смысловому значению. Например, при поиске по слову машина будут также найдены документы, содержащие слова 'о машине', ' промашину', 'машиной', и т.п., но и, что особенно важно, даже слова 'машины', 'машинам', 'машин' окажутся соответствующими запросу. Чтобы провести поиск только по одной строго определенной форме слова, нужно взять его в двойные кавычки или воспользоваться знаком "!".

Также существуют некоторые слова и символы, которые по умолчанию исключаются из запроса в связи с их малой информативностью. Это - самые частотные слова русского и английского языков, например, предлоги, частицы и артикли. Очень часто опускаются апострофы и тире. Большинство поисковых машин их знают и сами освобождают от них сформулированный Вами запрос. Это связано с тем, что факт присутствия этих слов может заметно замедлить поиск и отрицательно повлиять на его результат и полноту, а, в конечном итоге, и успешность. В тоже время есть возможность обозначить необходимость этих слов в запросе. Для этого, следует взять запрос в двойные кавычки или воспользовавшись поиском точной фразы в расширенном поиске.

Существует также поиск, с помощью ограничения расстояния. Например, если запрос составлен из нескольких слов без применения операторов и конструкций языка запросов, то машина будет пытаться найти документы, в которых встречаются все слова запроса. При этом для каждого запроса всегда вводится так называемое ограничение контекста - положительное число. По умолчанию принимается расстояние равное 40 словам. Документ, в котором встретились все слова запроса, будет выдан только в том случае, если расстояние между словами запроса будет меньше этого числа. В поисковых системах есть возможность задавать порядок следования и расстояние между словами. Расстояние между словами А и В равно: 1 ( В следует сразу за А ), 2 ( В следует за А через одно слово ) и т. д. Или -1 ( В стоит перед А ), -2 … Знак "/" между словами, за которым стоит число, означает, что расстояние между ними не должно превышать этого числа слов

Например, нам необходимо найти документы, в которых будут содержаться слова «информатика» и «учебники», и расстояние между ними не должно превышать 2 слов. Для этого введём в поле поиска следующее выражение: "информатика/2учебники". В результате по нашему запросу получим 9 страниц и не менее 5 сайтов

ПРИМЕР

         Если же мы немного изменим наш запрос - информатика/(+1+4)учебники – то мы получим документы, в которых данные ключевые слова будут идти друг за другом в таком порядке на расстоянии от 1 до 4 слов.

Очень часто приходиться также проводить поиск уже в найденной информации, т.е. можно осуществить поиск по документам, найденным по предыдущему запросу. Для этого в конце запроса нужно поставить "$$" или просто сделать отметку в окошке "поиск в найденном", расположенном на странице запроса. Эта функция очень удобна для последовательного сужения поиска.

Язык поисковой машины Яndex обладает наиболее полным набором возможностей в русскоязычном поиске, поэтому, освоив его, вы без труда сориентируетесь в языке запроса любого другого средства поиска.


Дата добавления: 2018-02-15; просмотров: 911; ЗАКАЗАТЬ РАБОТУ