Понятие и виды информационно-поисковых систем. Информационно - поисковые системы (ИПС)

Основой всех поисковых систем составляют базы данных - совокупность данных организованных по предельным правилам, предусматривающим общие принципы описания, хранения и манипулирования данными, независимо от прикладных программ.

Можно выделить следующие элементы функционирования информационных систем:

Сбор информации - организованный в специальном порядке процесс сбора и отображения информации:

Получение информации;

Оценка относимости информации;

Порядок отбора и фиксации информации.

Комплектование - процесс сложения информации из множества частей в единое целое и доведения её до пользователя.

Поиск и выдача информации - установление специального технологического порядка удовлетворения информационных потребностей абонентов информационной системы в управленческой деятельности и технологических процессах.

Поддержание целостности и сохранения информации - пересмотр, ревизия и отсеивание утратившей актуальность информации являются неотъемлемой функцией информационных подразделений. Сохранность информации осуществляется с помощью нормативно - инструктивных документов.

По характеру предоставления логической организации хранимой информации информационные системы разделяются на фактографические, документальные и геоинформационные.

Фактографические информационные системы накапливают и хранят данные в виде множества экземпляров одного или нескольких типов структурных элементов. Каждый из таких экземпляров структурных элементов или некоторая их совокупность отражают сведения, по какому - либо факту, событию. Структура каждого типа информационного объекта состоит из конечного набора реквизитов, отражающих основные аспекты и характеристики сведений для объектов данной предметной области.

В документальных информационных системах единичным элементом информации является нерасчлененный на более мелкие элементы документ и информация при вводе, как правило, не структурируется, или структурируются в ограниченном виде. Для вводимого документа могут устанавливаться некоторые формализованные позиции - дата изготовления, исполнитель, тематика. Некоторые виды документальных информационных систем обеспечивают установление логической взаимосвязи вводимых документов - соподчиненность по смысловому содержанию.

В геоинформационных системах данные организованы в виде отдельных информационных объектов, привязанных к общей электронной топографической основе. Геоинформационные системы применяются для информационного обеспечения в тех предметных областях, структура информационных объектов и процессов в которых имеется географический компонент.

Другим критерием классификации поисковых систем являются функции или решаемые задачи. По данному признаку различаются справочные, поисковые и расчётные системы.

Справочные являются наиболее распространенным типом функций информационных систем, и заключается в предоставлении абонентам системы возможностей получения установочных данных на определённые классы объектов.

Поисковые являются наиболее распространённым классом информационных систем. В общем, виде можно рассматривать как некое информационное пространство, задаваемое в терминах информационно - логического описания предметной области.

Расчетные заключается в обработке информации, находящейся в системе, по определённым расчётным алгоритмам для различных целей.

Технологические функции информационных систем заключаются в автоматизации всего технологического цикла или отдельных его компонентов, производственной или организационной структуры.

Таким образом, к основным функциям ИПС можно отнести:

Хранения больших объемов информации;

Быстрого поиска требуемой информации;

Добавления, удаления и изменения хранимой информации;

Вывода информации в удобном для человека виде.

Различают: - автоматизированные (coputerised);

Библиографические (reference);

Диалоговые (online);

Документальные и фактографические информационно-поисковые системы.

Информационно-поисковые системы в последнее время начали ускоренно развиваться, появляются новые системы, они широко рекламируются и продаются. Это обусловлено значительно возросшей потребностью общества в эффективной работе с правовой и нормативно-технической информацией и использованием при этом компьютерных информационно-поисковых систем. Широкое распространение поисковых систем явилось подлинным прорывом в области информатизации в России и дало возможность техническим специалистам предприятий получить свободный доступ к правовым и нормативно-техническим документам.

Качество принятых специалистом решений зависит от количества обработанной информации. В современных условиях обойтись без мощного и удобного инструмента, помогающего в поиске и обработке информации, невозможно. Эффективное использование поисковых систем зависит от того, насколько технический специалист знает специфику, возможности и область применения этих новых информационных систем.

Создание современных систем хранения информации осуществляется двумя основными способами: с использованием иерархической и гипертекстовой моделей. В иерархической модели используется многоуровневая рубрикация при классификации информации. Для поиска документа используется его краткое описание, составляемое при вводе информации в систему. Современная гипертекстовая модель позволяет в электронных документах использовать ссылки на другие документы.

Опыт эксплуатации различных систем обработки и поиска информации, основанных на таких моделях указывает на то, что они не лишены недостатков. Обе системы требуют значительных материальных затрат на разработку и формирование, а значит, ограничены в объемах хранимой информации. Формирование рубрикаторов и ссылок производится специалистами, а их представление об информации и представление пользователя могут различаться.

Санкт-Петербургский государственный университет

Филологический факультет

Кафедра математической лингвистики

В.П. Захаров

ИнформационнО-ПОИСКОВЫЕ
системы

Учебно-методическое пособие

Санкт-Петербург

Рецензенты:

докт. техн. наук В.Ш. Рубашкин (С.-Петерб. гос. ун-т)

канд. пед. наук О.А. Арбатская (С.-Петерб. гос. ун-т культ. и иск-в)

Печатается по постановлению
Редакционно-издательского совета
С.-Петербургского государственного университета

Захаров В.П.

З-38Информационно-поисковые системы: Учебно-метод. пособие. - СПб., 2005. - 48 с.

Предлагаемое пособие содержит описание основ документального информационного поиска, программу учебной дисциплины «Теория информационного поиска», которая изучается студентами 3-го курса отделения структурной и прикладной лингвистики Санкт-Петербургского государственного университета, и набор лабораторных (практических) работ по этой дисциплине. Отдельные лабораторные работы используются для обучения студентов других курсов и по другим дисциплинам. Пособие базируется на исследовательской и преподавательской деятельности автора.

Для студентов и аспирантов, специализирующихся в области прикладной лингвистики, информационных систем и автоматизированных систем обработки текста.

ã В.П. Захаров, 2005

ã Санкт-Петербургский
государственный
университет, 2005

1. Введение в теорию и практику
информационного поиска

1.1. Основные понятия информационного поиска

Информационно-поисковая система (ИПС) - это упорядоченная совокупность документов (массивов документов) и информационных технологий, предназначенных для хранения и поиска информации - текстов (документов) или данных (фактов). Информационно-поиско-выми системами являются любые определенным образом организованные хранилища информации. Причем информационно-поисковые системы могут быть и неавтоматизированными. Главное - это целевая функция: хранение и поиск информации.

В зависимости от объекта хранения и типа запроса различают два вида информационного поиска: документальный и фактографический - и, соответственно, два типа ИПС - документальные и фактографические. Последние также называют информационно-справочными ИПС.

Документальными называются ИПС, в которых реализуется поиск по тематическим запросам в массиве документов или текстов с последующим предоставлением пользователю подмножества этих документов или их копий. Понятие документа может меняться от системы к системе. В общем случае это некий информационный объект, зафиксированный (обычно посредством некоторой знаковой системы) на каком-то материальном носителе (бумага, фото- и кинопленка, магнитная память и т.п.) и предназначенный для передачи в пространстве и времени в системе социальных коммуникаций.

Фактографические ИПС реализуют хранение, поиск и выдачу непосредственно фактических данных (научных, технических, экономических характеристик и свойств объектов, процессов, явлений, адресов, наименований, количественных данных и т.п.).

Главное, сущностное, различие между документальным и фактографическим поиском заключается в подходе к семантике документов. В документальных системах описывается смысл документов в целом с точки зрения их тематического, предметного содержания. В этом случае важно выявить и назвать (перечислить) основные темы и объекты, которым посвящен документ. В фактографических системах описываются объекты, фиксируются их признаки и значения этих признаков. Отсюда различия в языках описания и способах хранения описаний в системе. Соответственно, для каждого вида поиска существуют свои поисковые средства.

Фактографические системы предполагают накопление и поиск в массиве документов со строго регламентированной структурой. Такая структура является или результатом предварительной интеллектуальной обработки документов при вводе информации в систему, или наличием таких документов в готовом виде в конкретных сферах человеческой деятельности, например, учетные формы, бланки, справочники, расписания и т.п. Существуют фактографические ИПС, которые обеспечивают накопление информации и поиск только по одному типу объектов и только по одному типу запросов. Существуют и более развитые фактографические системы, обеспечивающие хранение и поиск данных, разнообразных по содержанию и структуре, но это разнообразие всегда конечно.

В то же время между документальными и фактографическими системами нет непреодолимой разницы. Нередко реальные ИПС представляют собой пример смешанных систем, в которых фактографическая информация используется как дополнительное средство документального поиска, и наоборот. В документальных системах тексты (документы) также могут быть структурированы, разбиты на фрагменты или поля, и обработка и выдача документальной информации может вестись на уровне отдельных полей.

Выделяют еще и третий тип систем, которые называют информационно-логическими. Это системы, отвечающие на запросы, на которые в информационной базе в явном виде ответа нет. Получить ответ помогает экстралингвистическая база знаний и информация, порождаемая алгоритмически из уже имеющейся (документальной или фактографической). Эта новая информация или выдается как ответ на запрос, или дополнительно используется для поиска.

Информационно-поисковая система документального типа представляет собой упорядоченную совокупность документов, а также совокупность средств и методов, предназначенных для хранения, поиска и выдачи по запросам документальной информации. Документальная ИПС выдает документы, соответствующие запросу по теме, по предмету. Документ, центральный предмет или тема которого в целом соответ-ствует смысловому содержанию информационного запроса, называется релевантным , а свойство смысловой близости между двумя и более текстами (в данном случае - между документом и информационным запросом) - релевантностью . Релевантность - это фундаментальное понятие теории информационного поиска. Говорят о двух видах релевантности: смысловой и формальной. Соответствие документа содержа-нию информационного запроса называют смысловой релевантностью, а соответствие поискового образа этого документа формализованному поисковому предписанию, выражающему данный информационный запрос, - формальной релевантностью. Также формальную релевантность называют релевантностью документа, а смысловую релевантность - релевантностью информации (имеется в виду «информации, содержащейся в документе»).

Составные части ИПС называют подсистемами. Разделение на подсистемы необходимо и полезно как в целях разработки, так и для описания технологии функционирования систем. Оно может иметь разную основу. Обычно рассматривают два типа разбиения ИПС на подсистемы: по функциональному принципу (функциональные подсистемы) и по типу средств (обеспечивающие подсистемы).

Различные средства, реализующие функции ИПС, получили название обеспечивающих подсистем , или «обеспечений». Выделяют следующие подсистемы: лингвистическое обеспечение, информационное обеспечение, техническое обеспечение, программное обеспечение, технологическое обеспечение, кадровое обеспечение и др.

Информационное обеспечение - это информационные массивы (документы, запросы, метаданные), а также средства и способы их описания, построения и классификации.

Лингвистическое обеспечение - это логико-семантический аппарат, состоящий из информационно-поискового языка, правил применения (методик индексирования), критерия выдачи и других языковых средств.

Программное обеспечение - это алгоритмы и программные средства, реализующие все функции ИПС, выполняемые с помощью компьютера.

Техническое обеспечение - это технические средства (компьютеры, средства телекоммуникаций), обеспечивающие хранение, поиск и передачу информации.

Технологическое обеспечение - это набор и порядок выполнения автоматизированных и неавтоматизированных процессов и процедур обработки информации в ИПС, включая их описание, информационно-технологические схемы и инструктивно-методические материалы.

Кадровое (или штатное) обеспечение - это люди, взаимодействующие с системой и обеспечивающие ее эксплуатацию (обслуживающий персонал).

ИПС также делят на составные части (подсистемы) по функциональному признаку, когда каждая подсистема выполняет определенную функцию в технологическом процессе: ввод документов, индексирование документов, ввод и корректировка запросов, индексирование запросов, поиск, ведение словарей, ведение статистики, обработка результатов поиска, выдача документов и др. Такие части получили название функциональных подсистем .

Важные понятия в информационном поиске - документ и запрос. Документ определяется как средство закрепления любым способом на специальном материале любой информации о фактах, событиях, явлениях объективной действительности и мыслительной деятельности человека. Документы имеют различную форму представления. В автоматизированных документальных ИПС это прежде всего текстовая информация на естественных языках в машиночитаемой форме.

Запрос представляет собой информационную потребность, сформулированную на естественном языке. Результат «перевода» информационного запроса на информационно-поисковый язык называют поисковым образом запроса (ПОЗ) или поисковым предписанием (ПП). Под этим понимают выражение на языке запросов , который включает в себя как собственно ИПЯ, так и средства управления поиском. Синтаксис и семантика языков запросов определяется структурой и наполнением документов и общими задачами системы.

Третья часть информационного обеспечения - так называемая «выдача», результаты поиска. Выдача существует в двух видах: краткие описания документов и собственно документы.

Важнейшей компонентой информационно-поисковых систем является информационно-поисковый язык. Человек, чтобы отобрать из массива документов нужные, должен прочитать или просмотреть их содержимое. Для ускорения и упрощения этой процедуры появились различные формы сокращенной записи содержания документов - аннотации, рефераты, каталоги. Но во всех этих случаях при отборе документов по их сокращенным описаниям используется естественный язык. Хорошо известны такие «недостатки» языковых знаков, как омонимия, синонимия, многозначность. Точное значение многих слов можно понять только в контексте. Это препятствует использованию естественного языка для фиксации и отождествления понятийной информации. Поэтому формальные системы, предназначенные для хранения документальной информации с целью последующего поиска, потребовали создания специальных информационных языков. Информационно-поисковые языки представляют собой знаковые системы со своим алфавитом, лексикой, грамматикой и правилами пользования. Заметим лишь, что все искусственные языки так или иначе создавались и создаются на основе естественных языков.

При сопоставлении документов и запросов требуется определить релевантность документа по отношению к запросу и принять решение о выдаче или невыдаче документа на данный запрос. Правила, на основе которых формально определяется степень релевантности документа и запроса, т.е. соответствие ПОД и ПОЗ, называются критерием смыслового соответствия (КСС), или критерием выдачи .

Математические модели и формулы вычисления коэффициента релевантности могут быть самые разные. На практике повсеместное распространение получили ИПС с логическим критерием выдачи , когда ПП строятся с использованием логических (булевых) операторов конъюнкции (&), дизъюнкции (\/), отрицания (~). В этом случае логическое выражение запроса представляет собой набор поисковых элементов (обычно ключевых слов), объединенных логическими операторами и скобками, необходимыми для указания порядка выполнения операторов. Ключевые слова ПП играют роль булевых переменных, принимающих значение 1 («истина»), если данное слово содержится в документе, и 0 («ложь»), когда оно там отсутствует. Документ признается релевантным запросу, если логическая формула запроса в целом получает для данного документа значение «истина», и нерелевантным, если результат вычисления логической формулы дает «ложь».

Принятые в логике для обозначения конъюнкции, дизъюнкции и отрицания значки (&, \/, ~) в информационном поиске обычно заменяют на операторы AND, OR и NOT соответственно. В России чаще используются обозначения И, ИЛИ, НЕ. Однако в общем случае в каждой конкретной ИПС обозначения для булевых операторов выбираются свои, причем иногда для удобства пользователя вводится несколько значков для одного и того же оператора (например, в ИПС «Апорт» оператор конъюнкции может быть задан следующими знаками: &, пробел, AND, И, +).

Использование булевых операторов обеспечивает логику сравнения документов и запросов, понятную пользователю. Поиск (вычисление истинности для элементов ПП), как правило, проводится по специальным индексным (инвертированным) файлам, построенным на основе словника документального массива, и характеризуется высокой скоростью. Эти простота и понятность логического КСС и явились причиной его широкой распространенности.

Проблема оценки эффективности поиска является комплексной проблемой, включающей как теоретическую, так и практическую сторону. Главные из функциональных (технических) показателей ИПС, базирующихся на релевантности, - это полнота и точность, которые основываются на разделении документов на релевантные и нерелевантные, а также на выданные и невыданные.

Полнотой поиска (П) (англ. Recall - R) называется мера, вычисляемая как отношение количества выданных релевантных документов к общему числу релевантных документов, содержащихся в информационном массиве.

Точность поиска (Т) (англ. Precision - P) - это отношение количества выданных релевантных документов к общему числу документов в выдаче .

1.2. Информационный поиск в сети Интернет

Переход к информационному обществу XXI века породил беспрецедентный рост объемов и концентрации информации в глобальных компьютерных сетях. Это резко обострило проблему создания информационно-поисковых систем (ИПС) и их эффективного использования.

История автоматизированных информационно-поисковых систем исчисляется полувеком. Типичная ИПС первых лет - это человеко-машинная система, где анализ и описание содержания документов (индексирование) выполняется вручную, а поиски проводятся машиной. Первоначально основу ИПС составляли информационно-поисковые языки (ИПЯ), основным элементом которых являются дескрипторные словари и тезаурусы. Сегодня, однако, большинство работающих ИПС относится к классу вербальных систем бестезаурусного типа, когда индексационные термины выбираются непосредственно из текстов документов. Лавинообразный рост объемов электронной документальной информации, ее видовое, тематическое и языковое разнообразие являются как причиной кризиса современного информационного поиска, так и стимулом его совершенствования.

Проблема поиска ресурсов в сети Интернет была осознана достаточно скоро, и в ответ появились различные системы и програм-мные инструменты для поиска, среди которых следует назвать системы Gopher, Archie, Veronica, WAIS, WHOIS и др. В последнее время на смену этим инструментам пришли «клиенты» и «серверы» всемирной паутины WWW.

Если попытаться дать классификацию ИПС сети Интернет, то можно выделить следующие основные типы:

1. ИПС вербального типа (поисковые системы – search engines)

2. Классификационные ИПС (каталоги – directories)

3. Электронные справочники («желтые» страницы и т.п.)

4. Специализированные ИПС по отдельным видам ресурсов

5. Интеллектуальные агенты.

Глобальный учет всех ресурсов Интернета обеспечивается вербальными и отчасти классификационными системами.

Классификационные ИПС реализуют навигацию в веб-пространстве на основе специальных указателей, представляющих собой тематические «деревья», строящиеся на основе классификаций. Схемы классификации ресурсов в Интернете - это, как правило, древесные структуры, узлы которых названы словами естественного языка. Различные классификационные схемы отличаются друг от друга по объему и методологии их составления. Одним из недостатков универсальных иерархических классификаций является то, что они консервативны и отстают от развития науки, техники и жизни вообще. Главная проблема классификационных поисковых служб - это автоматизация классификации. До сих пор задача автоматической классификации удовлетворительного решения не нашла. Регистрация веб-сайтов и веб-страниц в каталогах, как правило, осуществляется людьми - индексаторами и модераторами данной системы. И поэтому объем базы данных систем классификационного типа сравнительно невелик по сравнению с информационной емкостью всего Интернета.

Для решения проблемы максимального охвата ресурсов Интернета создаются системы, называемые метапоисковыми (metasearch engines). Они не имеют собственных поисковых баз данных, не содержат никаких индексов и при поиске используют ресурсы других поисковых систем. За счет этого вероятность нахождения нужной информации возрастает. Для передачи запроса к поисковой системе используется специальный метапоисковый агент, который отвечает за процесс ретрансляции запроса в другие системы. После обработки полученного запроса каждая система возвращает метапоисковому агенту множество описаний и ссылок на документы, которые считает релевантными данному запросу. При всей привлекательности метапоисковых систем следует помнить и об их минусах и недостатках. Прежде всего, отсутствие единого стандарта языка запросов не позволяет метасистемам добиваться от поисковых систем, выполняющих запросы метапоисковых систем, такого же результата, какого может добиться опытный пользователь при работе с каждой машиной в отдельности.

Основным средством поиска информации в сети сегодня следует считать глобальные ИПС вербального типа (search engines), индексирующие (по крайней мере, претендующие на это) все Интернет-пространство. К числу главных поисковых систем этого типа (в первую очередь, по объему базы данных) можно отнести Google, Fast (AlltheWeb), AltaVista, HotBot, Inktomi, Teoma, WiseNut, MSN Search. Среди российских систем главными являются три: Яндекс (Yandex), Рамблер (Rambler) и Апорт! (Aport). Полнота поисковой базы и оперативность индексирования веб-сайтов является главной проблемой всех ИПС в Интернете. Как правило, системы с бóльшим объемом базы дают в результате поиска и большее количество документов. Большая, как лингвистическая, так и программная проблема - многоязычие информационного пространства Интернета и многообразие форматов представления данных. Тем не менее, основные глобальные системы с этими проблемами справляются.

Именно вербальным ИПС и уделено основное внимание в практической части пособия. Прежде всего, моделируется уровень пользователя, выражающийся в языках запросов и в запросно-ответных интерфейсах. Производится сравнительный анализ языков запросов различных ИПС сети Интернет.

Особенность современных систем - полнотекстовый поиск. Многие вербальные ИПС сети Интернет вычисляют релевантность документов запросам путем сопоставления элементов запроса с полными текстами документов, размещенных в сети. Что касается информационно-поискового языка, то, как правило, в качестве поисковых элементов выступают обычные слова естественных языков. Запросы формулируются через специальный интерфейс, реализуемый в виде экранных форм в программах-броузерах.

Полезно представлять, как эти системы устроены. В составе любой поисковой системы можно выделить три основные части.

Робот - подсистема, обеспечивающая просмотр (сканирование) Интернета и поддержание инвертированного файла (индексной базы данных) в актуальном состоянии. Этот программный комплекс является основным средством сбора информации о наличии и состоянии информационных ресурсов сети.

Поисковая база данных - так называемый индекс - специальным образом организованная база (англ. index database), включающая, прежде всего, инвертированный файл, который состоит из лексических единиц, взятых из проиндексированных веб-документов, и содержит разнообразную информацию о них (в частности, их позиции в документах), а также о самих документах и сайтах в целом.

Поисковая система - подсистема поиска, обеспечивающая обработку запроса (поискового предписания) пользователя, поиск в базе данных и выдачу результатов поиска пользователю. Поисковая система общается с пользователем через пользовательские интерфейсы - экранные формы программ-броузеров: интерфейс формирования запросов и интерфейс просмотра результатов поиска.

Индексный файл (или просто индекс) представляет собой набор связанных между собой файлов, ориентированных на быстрый поиск данных по запросу. В основе индекса всегда лежит инвертированный файл. Инвертированная (инверсная) схема организации поискового массива основана на принципе обеспечения доступа к документам через их идентификаторы содержания (поисковые признаки: дескрипторы, ключевые слова, термины, другие признаки). Такую схему получают путем обработки последовательного массива документов с целью создания специальных вспомогательных инвертированных файлов - точек доступа.

Каждая запись такого вспомогательного массива идентифицирована соответствующим идентификатором содержания (дескриптор, ключевое слово, просто термин, имя автора, название организации и т.п.) и содержит имена (адреса хранения) всех документов, в поисковых образах которых он содержится. Для каждого идентификатора содержания (поискового элемента данных) в инвертированном массиве вместе с адресом (номером, именем) документа может храниться (и обычно хранится) дополнительная информация, как-то: имя поля, номер предложения, в составе которых данный элемент встретился в данном документе, номер слова в предложении и т.д. Фиксация положения слова в тексте с точностью до номера предложения и номера этого слова в предложении позволяет построить гибкий язык запросов, позволяющий задавать расстояние между словами и предложениями в документе. Позиционные характеристики также используются при вычислении коэффициента релевантности и ранжировании документов в выдаче.

Нахождение необходимых документов через инвертированный файл осуществляется не сплошным просмотром всего массива, а просмотром лишь тех идентификаторов содержания в инвертированном файле, которые заданы в поисковом предписании, т.е. число операций сравнения слов при поиске пропорционально числу терминов поискового предписания. Такой способ работы систем снижает время на поиск и позволяет обслуживать потребителей информации в реальном масштабе времени.

Поиск в индексе - это операции над списками идентификаторов поисковых элементов в соответствии с моделью поиска и критерием соответствия. Результирующий список релевантных документов (в современной терминологии «отклик»), который преобразуется в ранжированный список кратких описаний документов, снабженных гипертекстовыми ссылками и другими характеристиками, возвращается пользователю в его клиентскую программу-броузер. Щелчок мышью по названию документа в его кратком описании (по гиперссылке) запрашивает этот документ либо непосредственно с того сервера, на котором он находится, либо через базу данных поисковой системы.

Важным компонентом современных ИПС являются так называемые интерфейсные веб-страницы, т.е. экранные формы, через которые пользователь общается с поисковой системой. Различают два основных типа интерфейсных страниц: страницы запросов и страницы результатов поиска.

    индексирование полных текстов возможно большего числа сайтов;

    «грамотная» работа со словоформами - способность ИПС отождествлять разные словоформы одной и той же лексемы, по-другому, порождать каноническую форму - лемму, и возможность выделять среди множества словоформ конкретную форму;

    поиск слов с заданным или произвольным усечением, как правым, так и левым;

    работа со словосочетаниями - учет расстояния между словами в словосочетаниях и порядка их следования;

    эффективные алгоритмы вычисления коэффициента смысловой релевантности и ранжирования результатов поиска.

Также важно, какую информацию и в каком виде можно извлечь из выходных интерфейсов ИПС. Интерфейс выдачи (форма представления результатов) у разных систем включает такие параметры: статистика слов из запроса, количество найденных документов, количество сайтов, средства управления сортировкой документов в выдаче, краткое описание документов и др. Описание каждого документа, в свою очередь, может содержать в своем составе: заглавие документа, URL (адрес в сети), объем документа, дату создания, название кодировки, аннотацию, шрифтовое выделение в аннотации слов из запроса, указание на другие релевантные веб-страницы того же сайта, ссылка на рубрику каталога, к которой относится найденный документ или сайт, коэффициент релевантности, другие возможности поиска (поиск похожих документов, поиск в найденном). Большой интерес представляют также частотные характеристики - сведения о количестве найденных документов и отождествленных языковых единиц. Некоторые системы ведут журнал запросов с возможностью повторных поисков и выдачей статистики по запросам. Полезной и интересной возможностью является также отнесение документов к тематическим классам.

Покажем особенности разных систем, наиболее популярных и обладающих наиболее развитым лингвистическим обеспечением (см. Табл., с. 14). В первую очередь, это российские ИПС Яндекс, Рамблер и Апорт. Возможно, наиболее мощный лингвистический аппарат имеет ИПС «Артефакт» (фирма «Интегрум-ТЕХНО», г. Москва), однако эта система является коммерческой и ее база данных по составу заметно отличается от других. Из западных систем, в большинстве своем не обладающих развитыми лингвистическими средствами анализа текстового материала, возьмем хорошо известные ИПС Google и AltaVista. Кратко охарактеризуем особенности этих систем (наличие или отсутствие соответствующих возможностей помечено знаками «+» и «-»).

«Поиск по лексемам» означает, что результат сравнения слов документов и запросов признается положительным при наличии в документе любой формы слова из запроса, что обеспечивается механизмом автоматической лемматизации.

«Поиск по словоформам» означает, что результат сравнения документов и запросов признается положительным при наличии в документе словоформы, точно совпадающей со словом из запроса, что происходит при отсутствии автоматической лемматизации или обеспечивается особым механизмом учета словоформ.

«Частота подокументная» означает, что в результате поиска выдается сообщение о количестве релевантных документов, т. е. документов, содержащих данное слово (словоформу) или словосочетание.

«Частота пословная» означает, что в результате поиска дополнительно выдаются сведения об общем количестве словоупотреблений данной лексемы или конкретной словоформы в поисковой базе данных (индексе).

Характеристика поисковых систем

Поиск по лексемам

+ (однословный запрос или логическая формула)

Поиск по словоформам

+ (в синтагмах: однословный запрос в кавычках или словосочетание в кавычках)

Учет синтагм (неразрывных словосоч.)

Учет больших и малых букв

+ (в синтагмах)

Частота послов- ная

Частота подокументная

1.3. Языки запросов ИПС Интернет

Обратившись в какую-либо службу, пользователь, не выходя из броузера, работает с «клиентом» этой службы, предоставляющим нам тот или иной язык запросов. Как правило, это языки без контроля лексики. Фактически, мы имеем дело с нормальным ИПЯ, реализованным в архитектуре «клиент-сервер», но видим только «надводную» часть этого ИПЯ - язык запросов. Язык запросов большинства систем включает в себя как традиционные булевы операторы, так и специальные контекстные операторы, учитывающие структурирование документа, порядок слов в тексте и расстояние между словами.

На языке запросов описывается сам запрос и иногда форма представления результатов. В языках запросов сетевых ИПС можно выделить следующие основные компоненты.

1) Собственно поисковые элементы (объекты поиска).

Это или ключевые слова, или другие идентификаторы содержания.

2) Поисковые операторы.

Почти во всех языках запросов используются булевские логические операторы И, ИЛИ, НЕ. Форма, в которой эти операторы задаются в запросе, самая разная, и разнится она как в отдельных службах, так и в разных типах запросов (простой, сложный).

3) Нормализация элементов запроса.

Одни и те же лексические единицы в документах и запросах могут быть представлены в разной форме. В поисковых службах имеются способы нормализации таких лексических единиц. Эта нормализация может задаваться самим пользователем (способ, известный под названием «усечения» (truncation) или «маскирования» (wildcards)) или выполняться автоматически (последнее предпочтительнее).

4) Линейная грамматика: порядок следования поисковых элементов и расстояние между ними.

Во-первых, это «фразы» (жесткие словосочетания).

Во-вторых, имеются специальные контекстные операторы (контекстное И), когда условие совместного вхождения элементов запроса в документ должно выполняться в контексте определенной длины.

5) Дополнительные условия поиска.

Для уменьшения объема выдачи и повышения точности используются различные дополнительные условия поиска, как-то:

– поиск в определенных полях (частях) документа;

– ограничение области поиска различными критериями (дата, тип данных, формат, и т.п.).

6) Требования к форме представления результатов поиска.

– требования на сортировку (ранжирование) выдаваемых результатов поиска;

– вид выдаваемых результатов;

– количество выдаваемых документов.

Для получения (просмотра) самих документов (веб-страниц) и их просмотра необходимо отправиться по http-адресу. Как правило, системы предоставляют возможность посмотреть контекст - фрагменты документов с выделенными ключевыми словами запроса.

В процессе поиска пользователю, как правило, дается возможность вернуться к старому запросу и либо просто уточнить, сузить его, либо перейти в другой режим поиска, предоставляющий более сложные поисковые средства. Довольно широко также распространен еще один способ поиска - поиск по образцу (search similar pages). При этом стратегия поиска выбирается самой системой.

2. Программа учебной дисциплины
«Теория информационного поиска»

2.1. Организационно-методический раздел

Программа дисциплины составлена в соответствии с государ-ственным образовательным стандартом высшего профессионального образования по направлению 021800 - Лингвистика.

Цель курса состоит в том, чтобы дать студентам теоретические основы информационного поиска, в первую очередь, документального, и навыки использования различных документальных ИПС, в том числе в сети Интернет.

Задачи курса:

    ознакомить студентов с основными понятиями и пробле-мами автоматизированного информационного поиска;

    ознакомить студентов с основными принципами организа-ции и функционирования информационно-поисковых систем (ИПС);

    изучить различные ИПС, в том числе ИПС сети Интернет;

    сформировать навыки исследовательской работы по анали-зу и сопоставлению различных систем.

Место курса в профессиональной подготовке выпускника: курс носит пропедевтический характер. Он рассчитан на широкий круг студентов-гуманитариев и призван дать им основополагающее пред-ставление о способах хранения и поиска информации.

Требования к уровню освоения содержания курса

В результате обучения студент:

    должен знать:

    основные понятия, относящиеся к информационным сис-темам;

    основные типы систем;

    понятие информационно-поискового языка;

    понятия релевантности и критерия смыслового соответ-ствия;

    основные поисковые системы сети Интернет;

    языки запросов и интерфейсы этих систем;

    должен уметь:

    осуществлять поиск в сети Интернет;

    сравнивать и анализировать различные системы.

Разделы курса:

      Основы информационного поиска

      Документальные ИПС

      Фактографические ИПС

      Информационный поиск в сети Интернет

Раздел 1. Основы информационного поиска

Предмет, цели и задачи курса. Связь курса с другими дисциплинами.

Информация, информационные процессы, информационные системы, информационные потоки, информационные технологии. Типы информационных систем (АИПС, АСНТИ, АСУ, АСНИ, АОС, САПР, ЭС, БЗ и др.).

Основные понятия информационного поиска: информация, информационная система, информационная потребность, релевантность.

Данные и документы. Виды информационных документов. Текстовые документы. Описание документов.

Запросы. Типы запросов. Предметный поиск. Основные проблемы автоматизации семантических процессов обработки информации.

Информационно-поисковые системы (ИПС). Типы ИПС. Краткий обзор основных типов: документальные, фактографические, интеллектуальные.

Библиографический поиск. Библиографические базы данных и электронные каталоги. Библиотечные системы.

Нетекстовые информационные системы (географические, картографические и др.). Поиск объектов по их описаниям (графические файлы, музыкальные файлы и т.п.). Поиск изображений и видеоинформации.

Раздел 2. Документальные ИПС

История развития автоматизированных документальных ИПС, этапы развития. Интегрированные системы. АСНТИ. Особенности современного этапа.

Составные части ИПС. ИПЯ. . Модели поиска. Абстрактная и конкретная ИПС.

Структура документальных и фактографических ИПС. Функциональные подсистемы. Структурная схема документальной ИПС.

Двухконтурные системы. Полнотекстовые ИПС. Гипертекстовые информационные системы.

Обеспечивающие подсистемы. Техническое обеспечение. Програм-мное обеспечение. Компьютерные сети. Особенности построения сетевых ИПС.

Математическая модель документальной ИПС.

Организация поисковых массивов в ИПС.

Классификация документальных ИПС по различным основаниям.

Раздел 3. Фактографические ИПС

Фактографическая информация. Хорошо структурированная и плохо структурированная фактографическая информация.

Объектно-характеристические таблицы.

Язык семантической эксп-ликации.

Эффективность фактографических ИПС.

Библиографический поиск как вид фактографического.

Раздел 4. Лингвистическое обеспечение информационного поиска

Лингвистические средства информационного поиска. Состав лингвистического обеспечения ИПС.

Понятие информационно-поискового языка (ИПЯ). ИПЯ как основной элемент логико-семантического аппарата ИПС.

Информационно-поисковые языки: классификация, типология. Объектно-признаковые языки. Классификации. Алфавитно-предметные и фасетные классификации.

Дескрипторные языки. Вербальные языки.

Семантические и синтагматические языки.

Способы описания языков. Составные части дескрипторных информационно-поисковых языков (алфавит, словарь, грамматика).

Нормирование лексики в ИПС. Дескрипторные словари. Тезаурусы. Создание словарей и тезаурусов. Авторитетный контроль как элемент лингвистического обеспечения автоматизированных библиотечных систем.

Грамматические средства ИПЯ. Парадигматические и синтагматические отношения.

Индексирование документов и запросов. Поисковые образы доку-ментов и запросов.

Языки запросов: понятие и состав. Средства и методы выражения информационной потребности. Поисковые предписания.

Модели поиска. Поисковые операторы.

Средства морфологической нормализации.

Языковые средства представления и структурирования электрон-ных документов (форматы, языки SGML, HTML, XML). Языки мета-данных (Dublin Core, GILS и др.).

Лингвистическое обеспечение фактографических ИПС. Основные единицы ИПЯ фактографических ИПС.

Раздел 5. Функционирование и эксплуатация ИПС

Информационное, технологическое и кадровое обеспечение.

Технология предмашинной обработки информации. Индексирование документов и запросов. Особенности поиска в зависимости от видов документов.

Режимы функционирования ИПС (ИРИ, ретроспективный поиск). Пакетный и диалоговый режимы.

Основные технические характеристики документальных ИПС (пол-нота, точность). Факторы, влияющие на эффективность поиска. Оценки эффективности ИПС.

Средства и методы решения лексико-семантических проблем в ИПС. Проблемы составления поисковых предписаний. Обратная связь по релевантности.

Обеспечение результатов поиска первичными документами. Электронная доставка документов.

Раздел 6. Информационный поиск в сети Интернет

Значение компьютерных сетей для организации информационного обслуживания. Способы и средства доступа к удаленным докумен-тальным массивам. Протокол Z39.50 (Search/Retrieval).

Сеть Интернет, ее краткая характеристика. Интернет как элек-тронная транспортная система. Интернет как глобальное информаци-онное пространство.

Информационные ресурсы сети Интернет. FTP-серверы. GOPHER. WAIS.

Понятие о гипертексте. Гипертекстовые системы до появления Интернета. WWW-серверы. Навигация в сети. Проблемы поиска инфор-мации.

Документальные источники информации. Электронные документы. Форматы представления текстовой информации в сети (html, pdf, ps, doc и др.). Электронные издания.

Нетекстовые информационные объекты. Понятие электронной библиотеки.

Типология поисковых систем в сети Интернет. Различные основания для классификации (по ширине охвата, по внутренним характеристикам, по видам документов).

Типология поисковых систем в Интернет. Классификационные информационно-поисковые системы (каталоги). Вербальные (текстовые, словарные) информационно-поисковые системы (поисковые машины).

Глобальные информационно-поисковые системы и службы Интернета.

Естественные языки в Интернете. Региональные ИПС. Региональные версии глобальных систем. Русскоязычный Интернет.

Методы создания поисковых баз данных в глобальных системах. Индексирование и регистрация. Роботы-индексаторы. Инструменты управления индексированием (файл robots.txt, META-элементы).

Особенности лингвистического и информационного обеспечения ИПС в Интернет. Вербальные ИПЯ. Грамматические средства ИПЯ: синтагматика. Контекстно-позиционные операторы («фразы», операторы расстояния и др.).

Проблемы ранжирования документов в выдаче. Способы управления ранжированием.

Входные интерфейсы. Языки запросов (простые, расширенные). Их состав, примеры. Сравнительный анализ языков запросов ИПС сети Интернет. Сохранение запросов (история сеанса).

Выходные интерфейсы. Представление результатов поиска. Описание документов (веб-страниц), описание сайтов. Группирование документов по сайтам. Идентификация и объединение дублей.

Управление поиском. Статистика поиска. Поиск в найденном. Поиск по подобию.

Примеры вербальных ИПС. Сравнительный анализ поисковых систем.

Практикум по отладке запросов и поиску в вербальных ИПС.

Классификационные ИПС. Способы формиро-вания базы данных в классификационных системах. Регистрация, специальные регистрационные сайты. Поиск по рубрикатору.

Практикум по поиску в классификационных ИПС.

Раздел 7. Настоящее и будущее информационного поиска

Коммерциализация Интернета в целом и поисковых служб в частности. Реклама. Плата за ускоренную регистрацию.

Развитие локальных ИПС.

Проблемы унификации и стандартизации.

Средства обратной связи. Неформальные «поисковые сообщества».

Развитие лингвистического обеспечения.

Системы с централизованной и децентрализованной распределенной архитектурой.

Интеллектуализация информационного поиска. Интеллектуальные информационные системы.

Элементы интеллектуальной обработки в глобальных ИПС сети Интернет. Интеллектуальные агенты.

Языки метаданных, языки XML, RDF, OWL и другие средства описания содержания.

2.3. Примерные вопросы для самоконтроля

Дать определения:

    Критерий выдачи

    Релевантность

    Тезаурус

    Составные части ИПС

    Состав лингвистического обеспечения

    Инверсный файл

Выбрать правильные варианты ответов

    Знак «&» в ИПС Рамблер означает операцию:

    дизъюнкции (ИЛИ)

    конъюнкции (И)

    расстояния

    Знак «|» в ИПС Яндекс означает операцию:

    следования

    конъюнкции (И)

    дизъюнкции (ИЛИ)

    Функциональные подсистемы ИПС - это:

    лингвистическое обеспечение

    программное обеспечение

    техническое обеспечение

    ввод документов

    ввод запросов

    критерий смыслового соответствия

    язык запросов

    выдача результатов поиска

    инвертированные файлы

    Типы ИПЯ - это:

    морфологические языки

    дескрипторные языки

    семантические языки

    классификационные языки

    вербальные языки

    вторичные языки

    объектно-признаковые языки

    Основные способы морфологической нормализации в ИПС:

    на основе автоматического морфоанализа

    усечение

    маскирование

    префиксация

    Критерий смыслового соответствия - это:

    правила индексирования

    правила нормализации

    правила вычисления полноты

    методы ранжирования

    методы классификации

    Индексирование - это:

    морфологическая нормализация

    составление поискового образа

    перевод на язык математической логики

    перевод на ИПЯ

    вычисление релевантности

    составление дескрипторного словаря

    Обеспечивающие подсистемы ИПС - это:

    лингвистическое обеспечение

    программное обеспечение

    техническое обеспечение

    ввод документов

    ввод запросов

    критерий смыслового соответствия

    поисковые предписания

    выдача результатов поиска

    инвертированные файлы

    Типы ИПЯ:

    объектно-признаковые языки

    классификационные языки

    морфологические языки

    семантические языки

    вербальные языки

    вторичные языки

    дескрипторные языки

    Критерий выдачи - это:

    правила индексирования

    правила нормализации

    правила вычисления релевантности

    правила вычисления полноты

    методы ранжирования

    методы классификации

2.4. Примерная тематика докладов, рефератов,
курсовых работ

    Анализ и описание ИПС сети Интернет (выбор сис-темы по согласованию с преподавателем)

    Создание терминологического банка данных по ин-форма-ционно-поисковым системам (выявление, клас-сификация терминов и толкований; результат - ги-пертекстовый словарь-указатель или поисковая база данных)

    Исследование способов использования онлайновых словарей и тезаурусов (например, WordNet) для индекси-рования запросов в информационно-поисковых системах

    Анализ и описание механизмов морфологической нормализации в информационно-поисковых системах

    Учет синтагматических связей как средство повы-шения эффективности поиска в полнотекстовых ИПС (экспериментальное исследование)

    Вычисления релевантности в информационно-поис-ковых системах (экспериментальное исследование)

    Анализ исследований сравнительной эффективности полнотекстовых информационно-поисковых систем

    Анализ лингвистического обеспечения полнотекс-товых информационно-поисковых систем

    Аналитический обзор публикаций электронного жур-нала по информационно-поисковым системам Search Engine Report

2.5. Примерный перечень вопросов к экзамену
(зачету) по всему курсу

    Абстрактная и конкретная (реальная) ИПС

    Вербальные информационно-поисковые системы (поисковые машины). Их архитектура. Примеры вербальных ИПС

    Глобальные и региональные ИПС в сети Интернет. Примеры

    Грамматические средства ИПЯ. Способы выражения грамматических отношений

    Дескрипторные словари. Тезаурусы

    Документальная информация в сети Интернет. Текстовые документы. Языковые средства представления и структурирования документов (под углом поиска)

    Индексирование документов и запросов. Автоматизация индексирования

    Интеллектуальные информационные системы

    Интернет как глобальная информационная среда. Информационные ресурсы сети. Проблемы поиска в сети Интернет

    Информационная потребность, информационный запрос, поисковое предписание

    Информационно-поисковые системы (ИПС). Типы ИПС. Краткий обзор основных типов

    Информационно-поисковые языки: классификация, типология

    ИПЯ. Дескрипторные языки. Вербальные языки

    ИПЯ. Классификационные языки

    История развития автоматизированных документальных ИПС, этапы развития. Особенности современного этапа

    Классификационные информационно-поисковые системы (каталоги). Примеры классификационных ИПС

    Классификация документальных ИПС по различным основаниям

    Критерий смыслового соответствия. Модели поиска

    Лингвистические средства информационного поиска. Состав лингвистического обеспечения ИПС

    Методы создания поисковых баз данных в глобальных системах (индексирование, регистрация)

    Морфологическая нормализация лексики в ИПС

    Обеспечивающие подсистемы

    Объектно-признаковые языки

    Организация поисковых массивов в ИПС

    Основные технические характеристики документальных ИПС (полнота, точность)

    Понятие информационно-поискового языка (ИПЯ). Классификация (типология) ИПЯ

    Понятия «информация» и «система». Информационные процессы и системы. Типы информационных систем

    Проблемы многоязычного поиска в Интернет. Способы решения в разных ИПС

    Проблемы поиска документов на русском языке. Русско-язычные ИПС

    Проблемы составления поисковых предписаний. Обратная связь по релевантности

    Смешанные (гибридные) системы. Метапоисковые системы. Примеры

    Составные части дескрипторных информационно-поисковых языков

    Составные части ИПС. Системные взаимосвязи между элементами ИПС

    Сущность документального информационного поиска. Понятие релевантности

    Семантические языки

    Технология и режимы функционирования ИПС. Двухконтурные ИПС

    Типология поисковых систем в Интернет

    Фактографические ИПС

    Функционально-структурная схема ИПС. Функциональные подсистемы

    Язык запросов ИПС «Altavista». Интерфейс представления результатов поиска

    Язык запросов ИПС «Google». Интерфейс представления результатов поиска

    Язык запросов ИПС «Апорт». Интерфейс представления результатов поиска

    Язык запросов ИПС «Рамблер». Интерфейс представления результатов поиска

    Язык запросов ИПС «Яндекс». Интерфейс представления результатов поиска

    Языки запросов современных информационно-поисковых систем. Сравнительный анализ

    Языки запросов. Поисковые предписания.

2.6. Распределение часов курса по темам
и видам работы

Наименование тем
и разделов

Аудиторные
занятия (ч)

В том числе

Самостоятельная работа

Семи-нары

Основы информационного поиска

Документальные ИПС

Фактографические ИПС

Лингвистическое обеспечение информационного поиска

Функционирование и эксплуатация ИПС

Информационный поиск
в Интернет

Настоящее и будущее информационного поиска

ИТОГО:

2.7. Форма текущего, промежуточного и итогового контроля

В течение семестра слушатели готовят письменные работы (рефераты) по одной из выбранных тем, которые «защищаются» в конце курса в виде докладов. В конце курса - зачет.

2.8. Учебно-методическое обеспечение курса

Основная литература

Захаров В.П. Информационные системы (документальный поиск). СПб., 2002.

Информатика / Под ред. К.В. Тараканова. М., 1986.

Лахути Д.Г . Автоматизированные документально-фактогра-фические информационно-поисковые системы // Итоги науки и техники. Информатика. Т. 12. М., 1988. С. 6–77.

Солтон Дж. Динамические библиотечно-информационные системы. М., 1979.

Сэлтон Г. Автоматическая обработка, хранение и поиск информации. М., 1973.

Черный А.И . Введение в теорию информационного поиска. М., 1975.

Дополнительная литература

Аветисян Д.О . Проблемы информационного поиска. М., 1991.

Армс У. Электронные библиотеки. М., 2001.

Белоозеров В.Н. Новые стандарты на терминологию инфор-мационного поиска // НТИ. Сер. 1. 1997. № 11. С. 14–21.

Войскунский В.Г. Документальный поиск и обратная связь // Предметный поиск в традиционных и нетрадиционных информационно-поисковых системах. СПб., 1993. Вып. 11. С. 129–141.

Войскунский В.Г., Захаров В.П. Диалоговый отладочный комплекс // Структурная и прикладная лингвистика: Межвузовский сборник. Вып. 4. СПб., СПбГУ, 1993. С. 197–211.

Декер С., Мельник С., Хермелен ван Ф . Semantic Web: роли XML и RDF // Открытые системы. 2001. № 9. С. 23–33.

Захаров В.П., Мордовченко П.Г., Сахарный Л.В. Совершенствование лингвистического обеспечения в ИПС «бестезаурусного» типа // НТИ. Сер. 2. 1980. № 6. С. 14–19.

Захаров В.П., Панков И.П. Информационно-поисковые системы // Прикладное языкознание: Учебник / Отв. ред. А.С. Герд. СПб., СПбГУ, 1996. С. 334–359.

Захаров В.П., Пименов Е.Н . Естественно-языковой подход к созданию лингвистического обеспечения информационно-по-исковых систем // НТИ. Сер. 2. 1997. № 12.

Змитрович А.И. Интеллектуальные информационные систе-мы. Минск, 1997.

Капустин В.А. Поиск информации в Интернет // Мир Internet. 1998. №9. С. 54–58.

Капустин В.А. Информационные ресурсы - как мы их будем искать? // Мир Internet. 1998. № 9. С. 58–61.

Капустин В.А. Основы поиска информации в Интернет: Методическое пособие. СПб., 1999.

Курник А. Поиск в Интернет. СПб., 2001.

Информационно -поисковые системы. М., 1972.

Лахути Д.Г. Интеллектуализация информационных систем: Научный доклад… М., 2002.

Любарский Ю.Я. Интеллектуальные информационные системы. М., 1990.

Масевич А.Ц . Два подхода к теории ИПС в свете современных лингвистических концепций // Предметный поиск в традиционных и нетрадиционных информационно-поисковых системах. Л., 1989. Вып. 9. С.25–49.

Москович В.А . Информационные языки. М., 1971.

Пархоменко В.Ф. Система автоматического индексирования документов СКОБКИ ОС ЕС // М., 1983

Прикладное языкознание: Учебник. СПб., 1996. С. 59–67, 92–99, 360–388.

Рубашкин В.Ш. Представление и анализ смысла в интеллектуальных информационных системах. М., 1989.

Соколов А.В. Автоматизация библиографического поиска. - М., 1981.

Соколов А.В . Введение в теорию социальной коммуникации. СПб., 1996.

Соколов А.В . Методические материалы по разработке информационно-поисковых тезаурусов. Л., 1976.

Степанов В . Библиографический поиск в Интернет // Библиография. 1998. № 1. С. 5–10.

Храмцов П.Б . Информационно-поисковые системы Internet // Открытые системы. 1996. № 3. С. 46–49.

Храмцов П.Б . Моделирование и анализ работы информационно-поисковых систем Internet // Открытые системы. 1996. № 6. С. 46–56.

Шемакин Ю.И., Романов А.А . Компьютерная семантика. М., 1995.

Шемакин Ю.И . Тезаурус в автоматизированных системах управления и обработки информации. М., 1974.

Стандарты

Типовые проектные решения для автоматизированных сис-тем научно-технической информации. М., 1983.

ГОСТ 34.601-90. Информационная технология. Комплекс стандартов на автоматизированные системы. Стадии создания автоматизированных систем.

ГОСТ 34.602-89. Информационная технология. Комплекс стандартов на автоматизированные системы. Техническое задание на создание автоматизированной системы.

ГОСТ 7.52-85. Коммуникативный формат для обмена биб-лиографическими данными на магнитной ленте. Поисковый образ документа.

ГОСТ 7.74-96. Информационно-поисковые языки. Термины и определения.

РД 34.003-90. Информационная технология. Термины и опреде-ления.

РД 34.201-89. Информационная технология. Виды, комплект-ность и обозначения документов при создании автоматизированных систем.

РД 34.680-88. Методические указания. Информационная технология. Основные положения.

РД 34.698-90. Методические указания. Информационная технология. Требования к содержанию документов.

3. Практикум (лабораторные работы)

Инструкция по выполнению лабораторных работ

Результаты лабораторных работ сохраняются на жестком диске в папке соответствующей лабораторной работы Lab#N, где N - номер работы. При этом все эти папки, в свою очередь, хранятся в папке студента, которая имеет следующий путь: ДИСК:\ ФамилияПреподавателя\nnn-Фам\ , где nnn - номер (идентификатор) группы, Фам - фамилия студента. Например, все файлы и папки, создаваемые и сохраняемые в ходе лабораторной работы № 2 размещаются в папке D:\Захаров\ML_3kurs-Иванова\Lab#2. В заданиях лабораторных работ эта текущая папка студента называется «своя папка ».

В ряде случаев перед началом работы по указанию преподавателя следует скопировать (с компьютера преподавателя через «Сетевое окружение» или с дискеты) в свою папку дополнительные файлы, необходимые для выполнения задания.

Текстовый отчет c результатами выполнения соответствующей работы создается в редакторе Word. В окне документа требуется ввести фамилию, имя, номер группы/подгруппы, номер лабораторной работы, дату выполнения работы. Далее в этот файл записывать требуемые результаты выполнения работы (под номером соответствующего пункта задания ). Сохранять эти данные как файл отчета с именем ReportN в своей папке, где N - номер работы. Во избежание потери данных при сбоях формируемые студентами во время работы файлы рекомендуется регулярно сохранять.

Для предъявления преподавателю результатов работы расположить их на экране в следующих окнах, расположив их каскадом слева направо: содержимое папки защищаемой лабораторной работы (в окне Проводника), файл отчета в окне редактора Word, окно броузера (если требуется).

Лабораторная работа № 1

(Классификационные ИПС)

    Открыть страницу поисковой системы Апорт (РОЛ, Russia On-Line). Ознакомиться с классификатором (рубрикатором) данной системы. Рубрики верхнего уровня переписать в тетрадь и перенумеровать. Переходя по рубрикам рубрикатора, найти два музея («Литературно-мемориальный музей Ф.М. Достоевского» и «Историко-мемориальный музей М.В. Ломоносова в селе Ломоносово Архангельской области»). Ознакомиться с формой представления информации о сайтах в каталоге.

    Для каждого музея:

    скопировать краткие описания указанных музеев в каталоге в файл отчета Report1;

    указать индекс цитируемости (в виде числа) и лигу (в виде словесного названия) для данных музейных сайтов;

    перейти на сайт музея и первую домашнюю страницу скопировать в своей папке в формате ;

    создать «закладку» на сайт музея в своей папке в Избранном.

    Открыть страницу поисковой системы Яндекс. Ознакомиться с классификатором (рубрикатором) данной системы. Рубрики верхнего уровня переписать в тетрадь и перенумеровать. Пометить (обвести) рубрики, совпадающие с рубриками Апорта (полностью или частично). Переходя по рубрикам рубрикатора, найти «Литературно-мемориальный музей Ф.М. Достоевского» и «Историко-мемориальный музей М.В. Ломоносова в селе Ломоносово Архангельской области». Их описания в рубрикаторе Яндекса скопировать в файл отчета.

    Посетить Рейтинговую систему ИПС Рамблер. Ознакомиться с классификатором (рубрикатором) данной системы. Рубрики, совпадающие с рубриками Апорта (полностью или частично), переписать в тетрадь. Посмотреть рейтинг сайтов по теме «Образование». Ознакомиться с формой представления информации в каталоге. Название сайта, занимающего пятое место, с его количественными показателями, скопировать в файл отчета Report1. Посмотреть подробную статистику и статтаблицу скопировать в файл отчета.

    То же самое повторить в системе Yahoo.

Лабораторная работа № 2

(Русскоязычные вербальные ИПС: сравнительный анализ)

    Работа заключается в сравнительном изучении систем Апорт, Яндекс, Рамблер. Результаты изучения студент должен отразить в виде таблицы (с. 34) в файле Report2 (ориентация таблицы - альбомная). В ячейках записать, как в каждой системе представляется тот или другой элемент языка запросов или входного/выходного интерфейса (все допустимые способы). В некоторых случаях можно отвечать знаками «+» или «–» (например, «Описание документа ») или свободным текстом своими словами (например, «Релевантные страницы того же сайта» или «Сортировка» ).

    Перейти на сайт поисковой системы Апорт (затем Яндекс и Рамблер). Найти в каждой системе ссылки на ее описание в целом, на описание языка запросов, интерфейсов («Справка», «Помощь», «Расширенный поиск» и т.п. ). Перейдя по ссылкам, внимательно изучить справочную информацию и в рабочей тетради кратко закон-спектировать основные пункты. После этого для каждой системы заполнить соответствующие ячейки таблицы (разделы 1, 2).

Примечание. Если текст ответа не помещается в ячейке таблицы, рекомендуется делать сноску и продолжать его под таблицей. Обратить внимание на то, что возможности систем в простом и в расширенном поиске различаются. Отразить это в отчете. Обратить внимание на наличие разделов «другое».

    Вернуться назад на начальную страницу поисковой системы Апорт (затем Яндекс и Рамблер). Ввести какой-либо запрос (например, «Статистические методы в лингвистике» ) в окне для текстового запроса и провести поиск. Страницу с результатами поиска сохранить в своей папке в формате «только html» .

    Изучить форму представления результатов. Кратко записать в тетради, что содержится на веб-странице с результатами поиска (структуру веб-страницы). Изучить форму представления отдельных веб-документов (их краткие описания с дополнительной информацией). На основе изучения полученных результатов и ранее изученной справочной информации заполнить соответствующие ячейки таблицы (раздел 3).

    Предъявить работу преподавателю.

Результаты сравнительного изучения систем Апорт, Яндекс, Рамблер


раздела

Параметры

Апорт

Яндекс

Рам-блер

Поиск по тексту

Логические операторы:

конъюнкция

дизъюнкция

отрицание

Синтагматические операторы:

фразы (словосочетания, слова рядом)

расстояние в словах

расстояние в предложениях

Морфологическая нормализация (автоматическая, используемые метасимволы)

Поиск по полям

по заглавию

по полю ключевых слов

по комментарию к картинкам (поле ALT)

по тексту гиперссылок

по адресам ссылок

по доменному имени сайта (сервера)

по формату

Интерфейс выдачи (форма представления результатов)

статистика слов из запроса

количество найденных документов

количество найденных сайтов

количество документов на странице результатов

сортировка документов на странице выдачи

поиск в найденном

описание документа включает следующие элементы:

URL (адрес в сети)

размер документа (объем)

дата создания

кодировка

аннотация (краткое содержание)

указание на другие релевантные веб-страницы того же сайта

поиск похожих документов

Лабораторная работа № 3

(Русскоязычные вербальные ИПС: поиск)

Составление и отладка тематического запроса

    Составить в тетради запрос по теме «Морские сражения во время Великой отечественной войны». При этом убрать из темы незначащие слова, расширить запрос синонимами, составить логическую формулу запроса с обязательным использованием операторов конъюнкции, дизъюнкции, расстояния и фразы (жесткое словосочетание).

    Показать запрос преподавателю.

    Затем записать его варианты на языках систем Апорт, Яндекс, Рамблер.

    Отладить запрос в режиме реального поиска, проводя последовательно сеансы во всех трех системах. Попытаться варьировать поисковые предписания, чтобы добиться оптимальных показателей поиска. Для этого фиксировать в тетради полученные результаты по каждому варианту: точность (по первым 20 документам) и условную полноту (абсолютный объем выдачи).

    Вернуться к наилучшему поисковому предписанию и текст запроса скопировать через буфер обмена из поисковой строки (окно для ввода запроса) в окно файла отчета Report3 (поочередно в каждой системе). Указать при этом в отчете показатели точности и полноты. Первую веб-страницу с результатами поиска в каждой системе сохранить в своей папке в формате «только html» .

Знакомство с поиском по полям («Расширенный поиск»)

    Найти с помощью системы Яндекс документы, посвященные Льву Гумилеву. Количество найденных документов и сайтов записать в файл отчета. Адрес (URL) первого документа из списка сохранить в Избранном в папке «Гумилев».

    Затем перейти в режим расширенного поиска и найти документы, посвященные Льву Гумилеву, с датой после 1 октября 2004 г. Новое количество найденных документов и сайтов снова записать в файл отчета. Первый документ из списка результатов поиска сохранить в своей папке в формате «веб-архив, один файл» (*.mht) .

    Найти через систему Рамблер документы по теме «Экономика города Москвы». При этом объём выдачи (количество описаний документов на странице результатов) установить равным 30. Результаты поиска отсортировать по дате (по убыванию) и первую веб-страницу с результатами поиска сохранить в своей папке в формате «только html»

    Перейти в режим расширенного поиска и найти документы по той же теме, но находящиеся лишь на сайте. Результаты поиска отсортировать по дате (по возрастанию) и первую веб-страницу с результатами поиска сохранить в своей папке в формате «только html» . Количество найденных документов и сайтов зафиксировать в файле отчета.

    Найти через систему Яндекс документы по теме «Образование», из которых есть ссылка на сайт. Первую веб-страницу с результатами поиска сохранить в своей папке в формате «только html» . Количество найденных документов и сайтов зафиксировать в файле отчета.

    Загрузить один из найденных документов, просмотреть его html-код, найти в нем ссылку на сайт и элемент гиперссылки (от начального до конечного тега А) через буфер обмена скопировать в файл отчета.

    Документ в формате mht, сохраненный в п. 7 (о Льве Гумилеве), прочитать в редакторе Word: вначале в формате веб-страницы, затем в формате «только текст». При втором чтении просмотреть содержимое окна ввода редактора Word (особенно начало и конец файла), скопировать первую страницу окна ввода в файл отчета и быть готовым объяснить, что такое формат mht.

Примечание. Формат mht кодируется в соответствии со стандартом MIME (RFC2046 и RFC2047) .

    Предъявить работу преподавателю.

Лабораторная работа № 4

(Глобальные вербальные ИПС: сравнительный анализ)

    Работа заключается в сравнительном изучении заданных глобальных ИПС сети Интернет вербального типа.

Примечание. Набор систем и их количество может меняться по усмотрению преподавателя.

    Перейти на сайт соответствующей поисковой системы (здесь и далее - доменное имя системы: www .название_системы. com ). Найти в каждой системе ссылки на ее описание в целом, на описание языка запросов, интерфейсов, режимов работы и других особенностей системы. Описание каждой ИПС кратко законспектировать в тетради.

    Проанализировать и сравнить возможности систем в режиме расширенного поиска. Страницы интерфейса расширенного поиска сохранить в своей папке.

    Результаты анализа в сжатом виде представить в форме сводной таблицы (с. 38) в файле отчета Report4 (ориентация таблицы - альбомная). Размеры таблицы можно увеличить. Если что-то не помещается в таблице, в ячейке делать сноску на текст под таблицей (таблица не столько форма представления результатов, сколько схема анализа).

    Предъявить работу преподавателю.

Результаты сравнительного изучения глобальных вербальных ИПС

Параметры

Логические операторы (какие и как задаются)

Синтагматические операторы
(какие и как задаются)

Поиск по полям (составить список полей, отмечать их наличие / отсутствие в конкретных системах)

поле 1

поле 2

………

поле k

Выбор поисковой базы данных
(в каких ресурсах можно искать)

ресурс 1

ресурс 2

………

ресурс k

Формат выдачи содержит следующие элементы (под таблицей привести пример из каждой системы)

элемент 1

элемент 2

………

элемент k

Специальные возможности или характерные особенности
(описать для каждой системы)

Лабораторная работа № 5

(Глобальные вербальные ИПС: изучение и поиск)

    Провести поиск по теме «Компьютерная лингвистика» в заданных глобальных ИПС (набор систем и их количество может меняться по усмотрению преподавателя). Поисковое предписание логически должно выглядеть следующим образом:

(comp utational V c omputi ng V c omput er ) & l inguistics .
Запрос задать по-английски дважды, как конъюнкцию и как устойчивое словосочетание (фраза), используя характерные для каждой системы способы выражения операторов (для незнакомых систем найти соответствующую справочную информацию). Первую веб-страницу с результатами каждого поиска сохранить в своей папке в виде «только html» . Количественные результаты отразить в таблице:

Название ИПС

Найдено документов/сайтов

Существующие в настоящие время средства информационного поиска могут рассматриваться как связь индивидуальных или коллективных потребителей (пользователей) информации. Средства поиска - это контакт конкретного потребителя с поставщиками инфор­мации, объединяемых общностью информации по отношению к поставленному вопросу (рис. 2).

Рис. 2 Схема взаимодействия средства информационного поиска с потребителями и поставщиками информации

На схеме поставщик информации вырабатывает информацию, которая аккумулируется (накапливается) средством информационного поиска. Потребитель информации формулирует запрос и после поиска в массиве получает от средства поиска необходимые сведения. Поставщики информации могут быть разобщены территориально и ведомственно, а средство поиска представляет способ преодоления этой разобщенности.

Средства информационного поиска решают проблемы отыскания конкретных сведений среди множества документов (информационных ресурсов). В их работе с документальной информацией можно выделить два основных этапа:

1-й этап - сбор и хранение информации;

2-й этап - поиск и выдача информационных ресурсов потребите­лям.

Процесс движения информации в Интернете происходит по замк­нутому кругу, состоящему из потребителей информации, поставщиков информации и средств информационного поиска. Поставщиками и потребителями информации могут быть как отдельные лица, так и целые организации. Источником информации является деятельность и общественная практика отдельных лиц и коллективов, в результате которых формируются документальные данные и сообщения.

Службы поиска (средства, предназначенные для поиска информа­ции) Интернета разделяются на каталоги (directories), поисковые системы (search engines) и метапоисковые системы (metasearch engines).

2. Информационно0поисковые каталоги

Каталоги

Каталог - это система, обеспечивающая классификацию информации . Его отличительная особенность - наличие иерархии (схемы упорядочения) ресурсов, в которой каждый из них (ресурсов)
относится к одному или более разделам. Каталоги (например, Yahoo!

www.yahoo.corn) и List.ru (http://list.ru )) работают не с индексами, а с описаниями ресурсов Интернета. Они наполняются Web-мастерами (людьми, создающими информационные ресурсы) или специальными редакторами, которые просматривают информационные ресурсы Сети. В ответ на запрос пользователя каталоги выполняют поиск по этим тесаниям. Каталоги автоматически не обнаруживают изменения ин­формационных ресурсов Сети. Однако результаты поиска в них могут

казаться более осмысленными, так как информационные ресурсы налогах подготовлены людьми.

Рассмотрим структуру типовой схемы каталога (рис. 3):

Рис. 3. Типовая схема каталога

Клиент - это программа просмотра конкретного информационного

ресурса. Наиболее популярными программами просмотра Интернет-

документов являются Microsoft Internet Explorer и Netscape Navigator. В

свою очередь, все эти информационные ресурсы являются объектами

поиска.

Пользовательский интерфейс - это группа Web-страниц (форм) средства поиска, при помощи которых пользователь взаимодействует с данным средством.

Поисковая машина - компонент системы, основное назначение ко­торого - поиск известных данной системе документов, соответствующих сформулированному запросу во внутреннем массиве данных системы, и формирование ответа (результата проведенного поиска) пользователю в виде набора ссылок на найденные документы.

Технический персонал - люди, в обязанности которых входит формирование перечня информационных ресурсов каталога, их описа­ний и иерархии этих ресурсов.

Запросы пользователя - массив данных системы, служащий для временного хранения сформулированных запросов пользователя.

Иерархия информационных ресурсов и их описания – внутренний массив данных каталога, в котором содержатся сведения об информационных ресурсах сети Интернет (адреса URL и краткое описание ресурсов). Данный массив организован таким образом, что каждый информационный ресурс соответствует какой-либо теме, а перечень тем упорядочен по признаку подчинения.

Информационные ресурсы - ресурсы, просмотр которых обеспе­чивается программами просмотра, такими как Microsoft Internet Explorer, Netscape Navigator и др., т.е. это Интернет-документы.

При решении стандартной поисковой задачи (при поиске обще­доступной информации) именно каталог, а не поисковая система оказывается наиболее лучшей точкой отсчета для начала поиска.

Типичным примером использования каталога является необходи­мость нахождения в сети Интернет группы информационных ресурсов на определенную недостаточно узкую тематику, например сайтов, предоставляющих контактную информацию организаций Москвы или сайтов электронных СМИ.

ИПС

Информационно-поисковые системы

Другая, принципиально отличная от каталога, служба поиска ин­формации - информационно-поисковая система (ИПС). ИПС - это система, обеспечивающая накопление и поиск информации

ИПС, решая задачи сбора, хранения, обработки и выдачи информации, выполняют следующие операции:

  • поиск документов;
  • анализ содержимого документов;
  • построение поисковых образов документов (извлечение из
    документов информации, используемой системой как знания
    о документе);
  • хранение поисковых образов документов (сведений о
    документах);
  • анализ запросов пользователей (потребителей информации);
  • поиск релевантных (соответствующих) запросу документов;
  • выдача ссылок на документы потребителям.

Это представляет возможным составить общую схему ИПС. Примером может служить типовая схема ИПС (рис. 4).

Рис. 4. Типовая схема информационно-поисковой системы

Индекс базы данных - это основной массив данных ИПС. Он служит для хранения сведений обо всех известных системе Интернет-документах. Данные сведения необходимы для того, чтобы поисковая система сумела найти документы на запрос пользователя.

Робот-индексировщик (crawler, spider или паук) - программный модуль поисковой системы, служащий для поиска (отбора) информаци­онных ресурсов в Сети и их индексирования (индексировать информацию означает приписать каждому документу ключевые слова, отражающие содержание документа и управляющие поиском, приводя к тем документам, слова которых оказываются более сходными со словами сделанного запроса), т.е. поддержания базы данных индекса в актуальном (по отношению к Интернету) состоянии. Эта программа является основным источником информации о состоянии информационных ресурсов. Просмотр документов Интернета данным модулем системы делается регулярно. Для крупных систем период просмотра документов, как правило, составляет 1-2 недели.

Общий алгоритм функционирования ИПС (принцип работы; со сюит в следующем. Робот-индексировщик автоматических просматривает (переходя от одного ресурса к другому, используя ссыл­ки, расположенные на нем) различные информационные ресурсы Интернета (Интернет-документы). Создает индекс базы данных, помещая туда информацию о ресурсах Сети. При этом он также периодически возвращается к информационным ресурсам и проверяет их на наличие изменений. Когда пользователь делает поисковой систе­ме; запрос, ее программное обеспечение (поисковая машина) просматривает созданный индекс базы данных в поиске ресурсов с заданными ключевыми словами и ранжирует (упорядочивает) эти ресур­сы по степени близости к предмету поиска.

Относительно алгоритма функционирования ИПС следует сделать ряд замечаний. В каждой конкретной поисковой системе хранятся (сведения не о всех документах Интернета, а только о тех документах которые известны данной системе (для различных систем процент проиндексированных документов различен, но, как правило, не превы­шает 30%). В поисковых системах хранятся не сами документы, а только сведения о них, достаточные для их нахождения пользователем и, как следствие этого, поисковая система в результатах поиска может и не выдавать некоторые соответствующие запросу документы. В результате поиска (отклике на запрос) системой сортируются документы по степени соответствия сделанному пользователем запросу с точки зрения алго­ритма поисковой системы, а не с точки зрения их фактического соответствия запросу. Данная особенность систем значительно эконо­мит время, затрачиваемое на поиск требуемой информации, особенно когда комбинация слов запроса встречается в нескольких тысячах или миллионах документов, однако нередки и случаи, когда наиболее соответствующие запросу документы не являются первыми в выданном списке. В данном случае следует соблюдать компромисс между количе­ством просматриваемых документов и общим числом найденных документов (как правило, требуемая информация содержится в первых нескольких десятках найденных документов), но наиболее типичным действием является уточнение запроса с помощью средств уточнения запроса, предоставляемых данной системой (т.е. обычно при помощи языка запросов и (или) средств расширенного интерфейса формулиров­ки запросов). К формированию более детального запроса также следует обратиться, если в результатах поиска много информационного шума (т.е. не соответствующей запросу информации), что, как правило, свиде­тельствует о неудачно подобранных терминах запроса (например, они подвержены полисемии (т.е. имеют несколько значений)). В промежут­ках между работой робота-индексировщика системы документы изменяются пользователями, но эти изменения часто учитываются поисковой системой не мгновенно, а спустя некоторый промежуток времени, определяемый периодом индексирования Интернета, поэтому некоторая информация может быть в системе потенциально недоступ­ной в конкретный момент времени.

Поисковые системы следует применять, если требуется найти информацию по специфичным вопросам или для обеспечения полноты охвата ресурсов.

Примером применения при поиске информационно-поисковых сис­тем могут являться требования найти сайт конкретной организации или дать ответ на вопрос «Причины введения единого экзамена в средних школах?».

К наиболее известным поисковым системам относятся такие служ­бы, как Google (http://www.qooqle.com ) и Яндех (http://www.yandex.ru).

Метапоисиовые системы

Отличия в стратегии и широте охвата материала различных поис­ковых систем часто приводят к тому, что разные средства поиска дают разноречивые ответы на один и тот же запрос. Этим воспользовались разработчики метапомсковых систем, которые в своей работе исполь­зуют потенциал других средств информационного поиска (рис. 5.). Метапоисковые системы - это надстройки над поисковыми системами и электронным каталогами, которые не имеют собственной базы данных (индекса) и при поиске по поисковому предписанию пользователя само­стоятельно формируют запросы для нескольких внешних средств

Рис. 5. Типовая схема метапоисковой системы

поиска, а затем анализируют полученные результаты и выдают список ссылок в порядке, определяемом соотношением рейтингов ответа сразу по нескольким средствам поиска. Иначе, такая система ведет опрос нескольких поисковых систем, а затем отбирает ссылки, следуя собст­венному алгоритму.

Метапоисковые системы позволяют сократить время, за­траченное на поиск информации, так как при обработке запроса пользователя эти системы одновременно обращаются к нескольким различным средствам поиска.

Наиболее значимые метапоисковые системы - MetaCrawler (http://www.metacrawler.com ) и MetaBot.ru (http://metabot.ru ). Их главное достоинство заключается в умении рассылать вводимые в них запросы по другим системам, а затем суммировать результаты. Таким образом, пользователь, вводя поисковое предписание, например в MetaBot.ru, фактически одновременно обращается к другим поисковым системам. Этим гарантируется «объективность» и «полнота» полученных ре­зультатов, однако, учитывая различия в подходах к обработке терминов разными системами, результат может оказаться не всегда релевантным запросу.

Метапоисковые системы наиболее эффективны на начальных чпапах поиска информации. Они помогают локализовать средства юиска, в которых присутствуют сведения об искомой пользователем информации.

Дополнительные средства и способы поиска

Существуют и дополнительные способы поиска в Интернете, кото­рые используют возможности, предоставляемые некоторыми другими службами Сети, ее персоналом, а также ее пользователями, которые способствуют поиску информации. К таким службам можно отнести телеконференции (форумы) (способ взаимодействия пользователей в Интернете, посредством которого один из пользователей оставляет сообщения на информационном ресурсе сети (сайте), а другие пользо­ватели могут читать в любое удобное для них время), электронные объявлений (строятся по принципу телеконференций), чаты (от (игл. chat - болтать) (способ взаимодействия пользователей в Интерне-ie, посредством которого происходит общение пользователей в режиме реального времени), серверы, ведущие поиск информации через элек­тронную почту (один из возможных способов обращения к средствам информационного поиска) и др. Данные способы являются дополни­тельными, поскольку они:

  • не предназначены для массового использования;
  • не являются универсальными (накапливают адреса в недос­таточном объеме или по узким направлениям);
  • не являются стандартными или обязательными для того, кто
    их предоставляет (т.е. нет гарантии получения ответа на
    запрос).

Cтраница 1


Информационно-поисковая система предназначена для хранения и корректировки информативных данных, которые неоднократно используются различными подсистемами технологической подготовки производства, а также для быстрого поиска и выдачи информации в соответствии с поисковым предписанием.  

Информационно-поисковая система (ИПС) - предназначена для хранения, поиска и выдачи необходимых специалистам сведений. ИПС - информационно-поисковый массив (ИПМ), к-рый в зависимости от характера представления хранимых сведений может быть документального или фактографич. ИПМ документального типа включают сведения о документах, напр.  

Информационно-поисковая система предусматривает возможность поиска нужных данных по базам практически по всем переменным полям хранящихся показателей.  

Информационно-поисковая система, ориентированная на поиск сведений определенного профиля, может быть построена также по принципу тематических сборников. В этом случае одной и той же информацией могут пользоваться группы лиц или организаций, в результате чего стоимость обслуживания уменьшается. Каждому пользователю разрешается разрабатывать и применять свой собственный метод поиска информации или использовать одну из нескольких стандартных процедур, предусмотренных в системе.  

Информационно-поисковая система, разработанная в Центральной геофизической экспедиции, написана в машинных кодах ЭВМ М-222, предназначена для автоматизированного хранения, обработки и выдачи информации для площадной интерпретации геологических, геофизических и промысловых данных с целью проектирования и анализа разработки месторождений.  

Информационно-поисковая система представляет собой комплекс методов и средств подготовки, хранения, поиска и выдачи информации, необходимой для технологической подготовки производства. В ИПС должны храниться: ГОСТы, нормали, нормативы, таблицы, классификаторы, стандартные программы, сведения об оборудовании, оснастке, типовых и унифицированных технологических процессах.  

Информационно-поисковые системы предназначены прежде-всего для помощи в проведении анализа и описания элементов, содержащихся в устройстве, запоминающем информацию, а также для поиска среди совокупности элементов и их выборки в ответ на запрос пользователя. В общем случае поисковая система осуществляет четыре основных типа деятельности: информационный анализ, организацию информации и ее поиск, формулирование запроса и выборку (или распространение) информации.  

Информационно-поисковые системы в АСУ обы / шо должны обеспечивать обработку чрезвычайно больших массивов информации, включающих сотни и тысячи документов. Поэтому создание таких систем часто требует очень больших трудовых затрат. Так, разработка только перечней используемых понятий (дескрипторов), их эквивалентности, подчинения и связи между ними, сводимых в специальные словари-тезаурусы объемом в десятки тысяч слов, требует 3 - 5 лет работы крупных коллективов специалистов.  

Информационно-поисковые системы, в частности на базе ЭВМ, служат для избирательного распространения информации (до 25 000 тем), выдачи библиографических подборок и фактографических справок (до 150 поисков по разовым запросам в сутки), тиражирования массивов информации на магнитной ленте, изготовления копий документов, выпуска информационных изданий. Поисковые машины (например, Поиск-5) автоматически находят кадр на микрофильмах, увеличивают с целью чтения на просветном экране и получают с него электрографическую копию. Поисковый комплекс Поиск ОК - l, кроме того, осуществляет съемку микрофильмов и хранит микрофильмированную информацию.  

Информационно-поисковые системы классифицируют по следующим основным признакам: виду выдаваемого результата и поиска, типу используемого информационно-поискового языка.  

Информационно-поисковая система Аргон представляет собой систему документального типа, предназначенную для обеспечения предприятий и учреждений ретроспективной и сигнальной информацией по вопросам технологии производства. В процессе поиска система выполняет следующие операции: запись поискового образа документа; запись поискового предписания запроса; установление соответствия поискового образа и поискового предписания запроса; принятие решения о выдаче или невыдачи документа на основе критерия смыслового соответствия; выдача документов, отвечающих на запрос.  

Информационно-поисковые системы предназначены для - сбора, обработки, ввода, хранения, поиска и выдачи информации.  

Информационно-поисковые системы должны быть обеспечены надежной защитой от случайной потери или искажения информации. В то же время в их организации необходимо предусмотреть возможность обновления информации, удаления устаревших, потерявших значение сведений и оперативной замены их новыми данными.  

Информационно-поисковые системы предназначены осуществлять поиск полных текстов документов, вторичных документов (например, рефератов), названий или адресов документов, которые могут храниться как в ЭВМ, так и вне ее. В ЭВМ хранятся в том и другом случае формализованные описания документов, которые носят название поисковых образов и содержат краткое описание их содержания. Потребители информации, желая найти документы по той или иной тематике, направляют в систему запрос, который является поисковым предписанием. По результатам поиска выдаются либо полный текст отобранных документов, либо ссылки на те документы, которые соответствуют запросу с той или иной степенью достоверности, избыточности или недостаточности.  

Тема 2. Информационно-поисковые и информационно-справочные системы

Содержание

2.4. Упражнение

2.5. Контрольные вопросы.

Ключевые слова

Классификационный индекс. Поисковое предписание. Поисковый образ документа. Поисковый образ запроса. Система метаданных. Сетевой доступ. Произвольный запрос. Работа по сценарию. Электронная библиотека. Машиночитаемый каталог.

2.1. Информационно-поисковые системы

Принципы формирования типовой информационной структуры:

Однократный ввод и многократное использование информации;

Полнота удовлетворения информационных потребностей основных групп пользователей;

Оперативное пополнение ресурсов обязательными документами;

Комфортный доступ к ресурсам в off - и on - line режимах;

Выполнение как конкретных узко тематических, так и широких по тематике запросов.

Запросы, которые формируют пользователи информационных систем, реализуются следующими способами:

Сообщения, являющиеся ответом на запрос, хранятся в явном виде в базе данных, и процесс получения ответа представляет собой выделение подмножества знаний из файлов базы данных, удовлетворяющих запросу;

Ответ не существует в явном виде в базе данных и формируется в процессе логического вывода на основании имеющихся данных.

Теория информационного поиска начиналась с исследования особенностей документальных информационно-поисковых систем (ИПС). Под информационным поиском в таких системах понимается некоторая последовательность операций, выполняемых с целью отыскания документов (статей, научно-технических отчетов, описаний к авторским свидетельствам и патентам, книг и т.д.), содержащих определенную информацию (с последующей выдачей самих документов или их копий), или с целью выдачи фактических данных, представляющих собой ответы на заданные вопросы.

Массив элементов информации, в котором производится информационный поиск, называется поисковым массивом. Существующие виды информационного обслуживания представлены в таблице:

Признак классификации

Вид обслуживания

По источнику инициативы

Принудительное;

По запросам потребителей

По типам документов

По направленности или адресности

Информационные издания (много адресов);

Избирательное распределение информации (один адрес)

По периодичности или срочности

Текущее оповещение;

Ретроспективный поиск

По способу доведения документов до потребителя

Непосредственная передача документов или их копий потребителям;

Двухступенчатое обслуживание (вначале информационное издание, а затем – копии заинтересовавших потребителя документов

По назначению, цели

Ознакомление;

Для практического использования

Способы реализации видов и форм обслуживания зависят от вида, назначения и способа реализации конкретной ИПС. Очевидно, что прочитать каждый документ библиотеки, чтобы найти необходимый, практически невозможно. Поэтому на протяжении истории развития информационного поиска разрабатывались и совершенствовались методы поиска.

Каждому документу, вводимому в поисковый массив, ставится в соответствии поисковый образ документа (ПОД), который представляет собой характеристику, отражающую основное смысловое содержание документа (этим ПОД отличается от кода, присваиваемого информационному элементу в фактографических ИС). В виде такой же краткой характеристики – поискового предписания или поискового образа запроса (ПОЗ) должны быть сформулирован и информационный запрос. Благодаря этому процедура поиска может быть сведена к простому сопоставлению поисковых образов документов с поисковым предписанием.

Для сопоставления ПОД и ПОЗ разрабатывают и применяют различные критерии поиска или критерии смыслового соответствия. Точность поиска определяется точностью отображения документов и запросов с помощью их поисковых образов и степенью совпадения ПОД и ПОЗ. Поэтому возможна неполнота выдачи документов, либо, напротив, «поисковый шум», которые представляют собой своеобразную плату за облегчение процедуры информационного поиска.

Процедура выражения основного смыслового содержания документа и информационных запросов на информационно-поисковом языке получила название индексирования и составляет существенную часть аналитико-синтетической обработки документов. Информационный поиск, таким образом, заключается в замене содержательного прочтения полного текста документов формальным «сличением» (сравнением на соответствие) их поисковых образов с запросами на языке индексов.

Информационный поиск реализуется при помощи информационно-поисковой системы , которая в абстрактном виде должна состоять из информационно-поискового языка, правил перехода на этот язык и критерия смыслового соответствия, определяющего объем выдачи документов или информации.

Модель организации данных в гипертекстовых справочных системах основана на сочетании ассоциативных гиперссылок и иерархического принципа организации фрагментов и документов. Концептуальная схема информационно-поисковой системы представлена на рисунке:

Модель организации данных в гипертекстовых справочных системах основана на сочетании ассоциативных гиперссылок и иерархического принципа организации фрагментов и документов.

Поисковые системы подразделяются на каталоги и указатели; они различаются технологией подготовки справочного материала: каталоги составляют люди, а указатели формируются автоматически. Самый крупный каталог Интернет – Yahoo ! (www . yahoo . com ); он содержит более миллион ресурсов и поддерживается 150 редакторами. Ведущий каталог России – List . Ru (www . list . ru ): 100 тысяч ссылок, классифицированных по 18 каталогам.

Язык поисковых слов служит для координатного индексирования документов и запросов посредством дескрипторов и ключевых слов. В его основе лежит алфавитный перечень лексических единиц, или словарь ключевых слов. Именно язык ключевых слов открыл возможность для автоматизации информационного поиска. Он позволяет достаточно детально и многоаспектно раскрывать содержание документов. Дескрипторы и ключевые слова легко дополняются и обновляются, поскольку в алфавитный перечень можно включать любую лексическую единицу, необходимую для индексирования.

Информационно-поисковые каталоги является традиционными технологиями организации информационного поиска в документальных фондах библиотек, архивов и представляют собой классификационную систему знаний по определенной предметной области. Смысловое содержание документа в информационно-поисковых каталогах отображается тем или иным классом каталога, а индексирование документов заключается в присвоении каждому документу специально кода (индекса), соответствующего по содержанию классу (классам) каталога, и создании на этой основе специального индексного указателя.

Система метаданных является центральным логическим компонентом любой электронной библиотеки (ЭБ). Подобно тому, как библиотечный каталог организует все множество единиц хранения в систему библиотечных фондов, вокруг которой строятся все библиотечные технологии, система метаданных организует совокупность электронных информационных ресурсов (или цифровых объектов) библиотеки.

На основе системы метаданных строятся основные технологические процессы ЭБ:

Навигация в информационном пространстве;

Поиск отдельных цифровых объектов (информационных ресурсов) или их совокупностей;

Ввод, обработка и организация хранения цифровых объектов, а также их исключение (изъятие);

Управление правами доступа к цифровым объектам, включая защиту авторских прав, организации платы за доступ и т.п.

Типы метаданных:

Описательные – библиографическая информация или другие сведения о содержании (семантике) цифровых объектов.

Структурные – сведения о форматах, структуре, объеме и других формальных свойствах цифровых объектов;

Административные – права, разрешения на доступ, на коррекцию данных, данные о пользователе, данные для систем оплаты, технологические данные.

Общим типом метаданных является идентификатор , задача которого – однозначное представление цифрового объекта для внешнего лица и различных приложений.

Системы метаданных определяют класс задач, которые реализуются в ЭБ и решающим образом влияют на интероперабельность (совместимость) коллекций, имеющихся в библиотеке. Тем самым принятие тех или иных принципов в отношении метаданных фактически определяет стоимость проектов по созданию ЭБ и эффективность затрат на эти проекты.

Известны следующие системы метаданных:

MARC – машиночитаемый каталог. CSDGM – стандарт цифровых геопространственных данных. GILS – глобальная (правительственная) служба поиска информации. EAD – кодировка архивных описаний, используемая для стандартизации и классификации уникальных архивов материалов, прежде всего рукописей. TEI – инициатива по кодированию текстов. Формат Государственного регистра баз и банков данных – содержит систему метаданных для баз данных и других электронных наборов данных.

Международная группа под руководством Stuart Weber & OCLC (штаб-квартира в Дублине, штат Огайо, США) разработала систему метаданных «Дублинское ядро».

Набор метаданных Дублинского ядра составляют 15 элементов:

Заголовок ( Title ) – название, присвоенное ресурсу создателем или издателем.

Автор ( Creator ) – человек или организация, изначально ответственная за интеллектуальное содержание ресурса (в случае рукописного документа это авторы; в случае визуальных ресурсов – исполнители, фотографы, иллюстраторы).

Предмет ( Subject ) – тема ресурса. Обычно предмет выражается в ключевых словах или фразе, описывающей предмет или содержание ресурса. приветствуется использование контролируемых словарей и формальных схем классификации.

Описание ( Description ) – текстовое описание содержания ресурса, включая реферат в случае документов или описания содержания в случае визуального ресурса.

Издатель ( Publisher ) – организация, ответственная за состояние ресурса в его представленной форме: издательский дом, университетский департамент, корпорация.

Участник создания материала ( Contributor ) – человек или организация, которые не являются авторами (не обозначены в элементе «автор»), но внесли значительный интеллектуальный вклад в ресурс; чей вклад вторичен по отношению к любому человеку или организации, указанной в числе авторов: редактор, переводчик, иллюстратор.

Дата ( Date ) – дата, указывающая на создание или появление ресурса (в доступном виде).

Тип ( Type ) – категория ресурса: домашняя страничка, роман, поэма, статья, препринт, технический отчет, эссе, словарь.

Формат ( Format ) – формат представления данных ресурса (обычно указывается тип программного обеспечении и, возможно, тип компьютера, которые могут быть необходимы для отображения ресурса и работы с ним).

Идентификатор ( Identifier ) – набор букв или цифр, который обычно используется для уникальной идентификации ресурса.

Источник ( Source ) – информация об источнике, из которого получен представленный ресурс.

Язык ( Language ) – язык, на котором изложено интеллектуальное содержание ресурса.

Связь ( Relation ) – идентификатор первичного ресурса и его связь с представленным ресурсом. Этот элемент позволяет связывать между собой близкие ресурсы, а также описание ресурса, которые необходимо показать. Например, издание книги и глава книги.

Охват ( Coverage ) – характеристика местонахождения и временной продолжительности ресурса.

Права ( Rights ) – утверждение об авторских правах и управление ими (идентификатор, связанный с такими утверждением; идентификатор, связанный с сервисом, представляющим информацию об управлении правами на данный ресурс).

2.2. Информационно-справочные системы. Библиотеки. Архивы

Доступ к данным осуществляется в соответствии с их структу­рой, заданной описанием данных, и представляет собой процедуру обхода вершин дерева данных. В процессе обхода в текущей вершине можно производить определенные действия с данными: читать и изме­нять данные, создавать новые вершины, удалять текущие вершины вместе с их поддеревьями и т.д. При этом все выполняемые в про­цессе обхода дерева данных движения представляют собой либо переходы, согласованные с иерархией дерева, либо прямые переходы по ссылкам. Совокупность таких переходов называется траекторией в де­реве данных или в базе данных.

В соответствии с траекторией дерева данных выполнение запро­са логически разбивается на части, относящиеся к обработке групп данных раз­личными процедурами. Последовательность доступа к данным по траектории дерева данных определяет последовательность выполнения процедур обработки, а наличие данных – сам факт выпол­нения процедур (фактически доступ к данным управляет выполнением процедур). Таким образом, запрос представляет собой сложную смесь считывания данных из базы и выполнения процедур.

Диалоговый интерфейс обеспечивает и различные формы взаимодействия:

Работа по сценарию;

Работа с произвольными запросами;

Работа по созданию сценария.

Работа по сценарию . Это – основной режим работы прикладных конеч­ных пользователей. Взаимодействие происходит на языке, состоящем из меню, команд и бланков, подлежащих заполнению и выдаваемых по заданному сценарию. Сценарий отражает профессиональные интересы пользователей и создается в понятных ему терминах. В состав сце­нария включаются средства подсказки и обучения. Пользователю не нужно знать структуру данных и изучать специальный язык манипули­рования данными. Сценарий создается администратором и оперативно­му изменению не подлежит.

Работа с произвольными запросами . Это – режим работы пользовате­лей-профессионалов в сфере обработки данных. Такая форма взаимо­действия доступна подготовленным пользователям, знающим структуру информационной базы и язык манипулирования данными. Пользователь может работать со схемой базы данных (определять, удалять, изме­нять отношения) в пределах предоставленных ему полномочий. Для манипулирования данными используется язык реляционного интерфей­са. Диалог состоит из запросов на языке реляционного интерфейса, команд управления и редактирования и ответов на них, передаваемых через диалоговый интерфейс.

Работа по созданию сценария . Это – режим работы администратора. Сценарий работы прикладных конечных пользователей создается адми­нистратором совместно с прикладными пользователями. Формирование сценария ведется в диалоговом режиме. В процессе работы админист­ратор имеет возможность проверить созданный им сценарий и опера­тивно откорректировать его. Администратор создает систему меню и связанных с меню запросов, а также описывает экранные формы в со­ответствии с требованиями конечных пользователей.

Диалог прикладного конечного пользователя задается иерархи­ческой системой меню, содержащих описание последовательности ра­боты в терминах определенной предметной области. Для формули­рования запросов пользователям предоставляется специализированный полноэкранный редактор. Стратегия диалога основана на концепции контекстной помощи, чередующейся с запросами. Фрагмент, состоящий из ключевого слова и свя­занного с ним текстового поля, становится самостоятельным объек­том. Укрупнение объектов редактирования позволяет ускорить обра­ботку запросов, а диалоговые средства работы с шаблонами снижают возможность случайного внесения ошибок в текст запросов.

Электронные библиотеки

Основными базовыми определениями являются:

Библиографическая БД – документальная база данных, запись в которой содержится только библиографическое описание.

Библиотечная система – совокупность взаимодействующих библиотек, объединенных на определенных договорных условиях в целях более полного удовлетворения запросов пользователей и эффективного использования библиотечных ресурсов.

Библиографирование – процесс подготовки библиографической информацию.

Библиографическая запись – совокупность библиографических сведений о документе, приведенных по определенным правилам, устанавливающим порядок следования областей и элементов, и предназначенных для идентификации общей характеристике документа.

Библиотечный каталог – совокупность расположенных по определенным правилам библиографических записей на документы, раскрывающая состав и содержание фонда библиотеки или информационного центра.

Индексирование – выражение содержания документа или смысла информационного запроса на ИПЯ.

Классификационный индекс – поисковый образ, построенный средствами классификационного ИПЯ.

Поисковое предписание – текст, включающий поисковый образ запроса и указания о логических операциях, подлежащих выполнению в процессе информационного поиска.

Осознание необходимости и преимуществ стандартизации в библиотечной среде пришло с началом использования машиночитаемых библиографических записей и обмена ими.

С этим периодом связано начало разработки отечественной системы стандартов по информатике, библиотечному издательскому делу – СИБИД (конец 70-х – начало 80-х годов). ГОСТы на библиографическое описание устанавливали общие принципы и правила составления описания для различных видов документов: набор элементов библиографического описания, последовательность их расположения, наполнение и способ представления каждого элемента, применение условных разделительных знаков.

Стандарты на библиографические описания появились как результат пересмотра национальных правил каталогизации в связи с созданием в 1977 году «Международного стандарта библиографического описания» ( ISBD ). Как известно, ISBD превратилось в международный стандарт ISO , который требовал пересмотра национальных правил в странах-членах ISO и создания соответствующих национальных стандартов.

Свойс­тва автоматизированной библиотечной системы:

Устранение значительной части примитивной или чисто канце­лярской работы;

Устранение ошибок, попадающих в систему;

Постоянство информации внутри системы;

Быстрота ответов на запросы.

Одной из важных функций библиотечных автоматизированных сис­тем является выдача ответов на запросы пользователей. В процессе формирования запроса пользователем должна быть идентифицирована та часть информационной базы, которая имеет отношение к выдаче справки, а также установлено предписание, задающее критерии отбора данных, и процедура извлечения нужных сведений из базы данных. Процедура поиска включает информацию, идентифицирующую часть базы данных, предикат, определяющий критерий отбора данных, и оператор извлечения.

Электронная библиотека – распределенная информационная система, позволяющая надежно сохранять и эффективно использовать разнородные коллекции электронных документов (текст, графика, аудио, видео) через глобальные сети передачи данных в удобном для конечного пользователя виде. Базовой единицей электронной библиотеки является электронный архив модульной структуры.

Электронная библиотека предназначена для выполнения следующих функций:

Автоматизированная регистрация поступающих материалов;

Перенос твердых копий на магнитные носители;

Индексирование поступающих материалов;

Библиографическое описание поступающих материалов;

Реферирование и аннотирование поступающих материалов;

Формирование ссылочных каталогов на внешние (сетевые) источники;

Автоматизированный поиск информации (индексирование информационных запросов);

Оборудование АРМ абонентов и их эксплуатация;

Связь с внешними источниками информации (сетевой сервис);

Вспомогательные работы: копирование документов на бумагу, магнитные носители, микроленту, фотобумагу, микрофиши;

Издание реферативных журналов и бюллетеней информации;

Организация справочной службы и служб сопровождения.

Средства, разрабатываемые для автоматизированных библиотечных систем по охвату поддерживаемых библиотечных процессов и услуг, классифицируют следующим образом:

Автоматизированные информационно-библиотечные системы (АИБС);

Автоматизированные рабочие места (АРМ), которые разрабатываются либо как программные модули библиотечной системы, либо как самостоятельные информационные системы;

Электронные справочные системы (включая полнотекстовые);

Автономные автоматизированные системы поддержки и эксплуатации информационных баз данных различного назначения.

Работа пользователя в электронной библиотеке осуществляется в режиме диалога с использованием иерархической системы меню. Предусмотрена возможность модификации имеющихся и создание новых меню в соответствии с конкретными потребностями пользователя.

Электронные архивы

При разработке управленческих документов часто возникает необходимость обращения к архивным документам, а при последующем хранении – процедура сдачи документов в Государственный архив и формирования собственных архивов.

Под архивным фондом понимается совокупность документов, отражающих материальную и духовную жизнь ее народов, имеющих историческое, научное, социальное, экономическое, политическое или культурное значение и являющихся неотъемлемой частью историко-культурного наследия народов РФ.

Под архивным документом понимается документ, сохраняемый или подлежащий сохранению в силу его значимости для общества, а равно имеющий ценность для собственника.

Под архивом понимается совокупность архивных документов, а также архивное учреждение или структурное подразделение учреждения, организации или предприятия, осуществляющее прием и хранение архивных документов в интересах пользователей.

Под тайным архивом понимается архив, о котором не заявлено публично.

Под архивным делом понимается деятельность по организации хранения, учета и использования архивных документов.

Электронный архив – универсальная система управления документами, основным назначением которой является централизованное хранение документов и их версий, обеспечение доступа сотрудников к документам для просмотра или редактирования, и быстрый поиск информации. Компоненты электронного архива представлены на рисунке:


Использование архива позволяет упорядочить хранение документов и организовать работу с ними, сократив при этом накладные расходы, связанные с доступом к документам.

В электронном архиве можно хранить документы любых типов – офисные документы, тексты, изображения, аудио и видео файлы, документы систем проектирования, архивы, приложения и т.д. Как показывает опыт, архивы чаще всего используют для управления внутренней, организационно-распорядительной документацией и договорами. В электронном архиве документы хранятся в папках-рубрикаторах, структуру которых можно организовать, например, в соответствии с иерархией отделов предприятия, назначая каждому разделу ответственного администратора. Основным преимуществом подобного архива является наличие достаточных возможностей при доступной цене. В сочетании с широкими возможностями масштабирования это позволяет эффективно использовать его как на малых, так и на крупных предприятиях.

Функции электронного архива:

Хранение документов. С помощью архива можно сформировать централизованное хранилище документов и обеспечить управляемый доступ сотрудников к документам, как по локальной сети, так и через Интернет. Документы хранятся в гибко настраиваемой структуре папок-рубрикаторов.

Создание документов. Документы в архиве можно создавать на основе заранее сформированных шаблонов, или путем переноса каталогов и файлов с локального или сетевого диска в нужные папки. Поддерживается ввод документов со сканера, в том числе и потоковый, с возможностью автоматического распознавания ( OCR версия). Служба распознавания работает на сервере архива в фоновом режиме.

Учет документов На каждый документ в архиве ведется учетно-регистрационная карточка, набор реквизитов которой соответствует ГОСТ Р 6.30-2003 и требованиям ГСДОУ. Состав и расположение реквизитов карточки являются жестко настроенными и не могут быть изменены.

Взаимодействие пользователей. В архиве пользователи могут обмениваться сообщениями, присоединяя к ним ссылки на документы системы. Предусмотрена отправка документов по электронной почте. С целью упорядочивания работ с документами предусмотрена возможность выдачи поручений и контроля их исполнения.

Работа с документами. Для просмотра и редактирования документов архив использует соответствующие приложения. Ряд распространенных форматов документов, например, тексты, изображения, RTF -документы, HTML -документы и документы Microsoft Office , можно просматривать непосредственно, не переключаясь в другое приложение.

Регистрация корреспонденции. В архив можно вести учет и регистрацию входящей и исходящей корреспонденции. При этом осуществляется автоматическая генерация сквозных регистрационных номеров.

Коллективный доступ. Архив обеспечивает коллективный доступ сотрудников к документам, как для просмотра, так и для редактирования. Конфликты при одновременном редактировании документов исключаются благодаря механизму блокировки документов.

Сетевой доступ. Входящие в комплект поставки компоненты позволяют организовать доступ к документов с помощью обычных web -браузеров. Это позволяет, например, подключить к системе клиентов или сотрудников, работающих вне офиса.

Поиск. Архив позволяет искать документы не только по реквизитам учетной карточки, но и по тексту, с учетом морфологии русского языка, т.е. находить любые формы слов, указанных в поисковом выражении.

Права доступа. Каждому объекту архива (документу или папке) можно назначить набор прав доступа. Поддерживаются группы пользователей и наследование прав. Права ранжируются на девять критериев: просмотр, открытие, редактирование, управление версиями, перемещение, право подписи, право изменения, создание и удаление. Все действия пользователей, связанные с изменениями объектов архива или доступом к ним, протоколируются и могут просматриваться администратором системы.

Интеграция с внешними приложениями. В состав архива входят механизмы интеграции системы с внешними приложениями, позволяющие:

Включать в существующий архив дополнительные функции;

Разрабатывать автоматизированные системы пакетной обработки;

Создавать узкоспециализированные приложения для работы с документами;

Разрабатывать Интернет-решения для доступа к документным базам данных.

2.3. Организационно-административная система вуза

Система предназначена для решения следующих функций:

1. Рациональное использование вычислительной техники.

2. Усиление интеллектуальных возможностей субъектов педагогичес­кого управления и научно-исследовательской деятельности.

3. Совершенствование контроля над качеством учебно-воспитательного процесса.

4. Дозировка загрузки преподавателей и учащихся.

5. Оптимизация расписания занятий при наилучшем использовании по­мещений и оборудования с учетом педагогических и медицинских требова­ний.

6. Создание сетевых графиков прохождения предметов и дисциплин.

7. Накопление, систематизация и оперативное представление необхо­димых сведений о результатах учебно-воспитательной деятельности.

8. Распределение затрат с учетом повышения эффективности учебного процесса.

9. Принятие оптимальных научно-обоснованных решений.

Компоненты системы:

1. Компьютерные классы общего профиля (информатика, программирование, самостоятельная работа).

2. Компьютерные классы специализированного профиля/лаборатория (начальная школа, мультимедиа, моделирование).

3. Административный комплекс (архивы, финансы, справочная служба).

4. Демонстрационный комплекс (учебное телевидение, аудио- и видеосредства, слайды).

5. Издательский комплекс (набор, сканирование, редактирование, тиражирование).

6. Библиотечный комплекс.

7. Коммуникационный комплекс.

Структура автоматизированной системы «Высшее учебное заведение» представлена на рисунке:


В качестве примера приведем функции базовой подсистемы Учебная часть, предназначенной для организа­ции учебного процесса:

Организация работы с учебными планами по всем специальностям;

Организация работы с тематическим планом;

Планирование объемов учебной работы кафедрам;

Распределение фонда почасовой оплаты по кафедрам;

Организация работы приемной комиссии;

Контроль выполнения учебных поручений кафедрами.

При работе с учебным планом выделены следующие функциональные операции: Просмотр плана, Формирование выписки, Просмотр выписки (вы­писку можно формировать по факультету, по предмету, по курсу).

Доступная информация хранится в базах:

Учебный план, Темати­ческий план, Объемы учебной работы, Карты заданий.

По каждой базе возможна реализация следующих информационных операций:

Просмотр запи­сей, Редактирование базы в целом, Добавление записей, Удаление записей, Модификация записей.

2.4. Упражнение

Ознакомиться с возможностями информационно-поисковых систем.

1. Использование тематических поисковых каталогов

Поисковые каталоги осуществляют поиск нужной информации путем использования многоуровневых списков, в которых возможная тематика поиска разбита на различные рубрики. Выбрав интересующую его рубрику, пользователь переходит на следующий, более подробный уровень, который представляет собой список подчиненных рубрик, и так далее. Конечным результатом поиска является один или список нескольких серверов, содержащих искомую информацию.

Использование англоязычного поискового каталога Yahoo!

Запустите Internet Explorer, если он еще не запущен. В поле Адрес введите http://www.yahoo.com и нажмите клавишу Enter . В появившейся странице поискового каталога выберите рубрику-ссылку Recreation&Sport и перейдите на следующий уровень. Аналогично, последовательно выбирая рубрики-ссылки Magazines, Bodybuilding, Master Trainer, войдите на сервер, содержащий выбранную информацию, и просмотрите ее.

Использование русскоязычного поискового каталога «Желтые страницы Интернет»

В поле Адрес введите http://www.piter-press.ru и нажмите клавишу Enter . Последовательно выбирая рубрики-ссылки Регионы и города, Санкт-Петербург, Живая камера на Мойке Вы увидите на выбранном сервере живые кадры одного из уголков нашего города.

Использование русскоязычного поискового каталога «АУ!»

В поле Адрес введите http://www.au.ru и нажмите клавишу Enter . Последовательно выберите рубрики-ссылки Семья-дом-досуг, Развлекательные серверы, Городской кот. Вы увидите страницу с указанной тематикой.

Использование русскоязычного поискового каталога «Созвездие Интернета»

В поле Адрес введите http://www.stars.ru и нажмите клавишу Enter . Выберите, например, рубрику-ссылку Отдых и развлечения и далее найдите ту развлекательную информацию, которая Вам по душе.

Использование поисковых систем

Поисковые системы (машины поиска) осуществляют автоматический поиск информации по ключевым словам или по группе ключевых слов, образующих с помощью специальных средств некоторый сложный запрос. Результатом такого поиска является список всех найденных в Интернете страниц, содержащих указанные ключевые слова в сочетании, определяемом условиями запроса. Далее можно просмотреть любую из найденных страниц в этом списке. В данном разделе рассматриваются возможности простого поиска: по одному или нескольким ключевым словам без использования специальных средств построения запросов.

Наиболее известны следующие поисковые системы:

AltaVista – http://www.altavista.digital.com

Я ndex – http://www.yandex.ru

Рэмблер – http://www.rambler.ru

Поиск по одному слову, заданному маленькими буквами

Результат поиска – все найденные страницы, содержащие заданное слово, записанное любыми буквами).

Введите в поле Адрес http://www.altavista.digital.com и нажмите клавишу Enter. После открытия начальной страницы этой поисковой системы введите в поле поискового запроса ключевое слово для поиска, например, Москва и нажмите кнопку начала поиска. Отметьте количество найденных страниц и просмотрите несколько из них.

Введите в поле Адрес окна Internet Explorer адрес системы http://www.yandex.ru и нажмите клавишу Enter . После открытия начальной страницы этой поисковой системы введите в поле поискового запроса ключевое слово для поиска Москва и нажмите кнопку начала поиска. Отметьте количество найденных страниц и просмотрите несколько из них. Повторите эти же операции для системы http://www.rambler.ru

Поиск по одному слову, заданному с большой буквы

Результат поиска – все страницы, содержащие заданное слово, записанное с большой буквы (для некоторых поисковых систем могут быть и другие результаты).

Повторите поиск во всех трех системах, задав ключевое слово для поиска Москва Адрес . Сравните результаты поиска с предыдущим пунктом.

Поиск по нескольким словам

Результат поиска – все найденные страницы, содержащие хотя бы одно из заданных слов (для некоторых поисковых систем могут быть и другие результаты).

Продажа автомобилей . При выборе поисковой системы используйте раскрывающийся список для поля Адрес

Поиск по нескольким словам, заключенным в кавычки

Результат поиска – все страницы, содержащие заданное словосочетание как единое целое.

Осуществите поиск во всех трех системах, задав сочетание слов для поиска – Продажа автомобилей . При выборе поисковой системы используйте раскрывающийся список для поля Адрес . Проанализируйте результаты поиска.

Использование поисковых систем: расширенные возможности

В поисковых системах существуют средства, позволяющие формировать сложные поисковые запросы. Полный набор этих средств может существенно отличаться от системы к системе. Однако можно выделить несколько операций для построения запросов, которые можно использовать в большинстве поисковых систем. Эти операции применяются к ключевым словам для задания сложных условий отбора при поиске.
Операция AND или & означает, что в искомых страницах должны присутствовать оба ключевых слова, например, выражение процессор AND сканер требует найти страницы, в которых присутствуют оба слова: процессор и сканер.

Операция OR или | означает, что в искомых страницах должно присутствовать хотя бы одно из ключевых слов, например, выражение процессор OR сканер требует найти страницы, в которых присутствуют или слово процессор, или слово сканер, или оба этих слова.

Операция NOT , или!, или ~ означает, что в искомых страницах должно отсутствовать ключевое слово, к которому она применена. Например, выражение NOT сканер требует найти страницы, в которых отсутствует слово сканер.

Группировка, обозначаемая скобками, означает, что операция применяется не к одному слову, а ко всему выражению, стоящему в скобках. Например, выражение (процессор AND сканер) OR (дисковод AND разъем) требует найти страницы, в которых вместе присутствуют слова процессор и сканер , или вместе присутствуют слова дисковод и разъем, или все эти четыре слова.

Применение рассмотренных операций часто требует предварительной установки режима (или перехода в режим) расширенного поиска (Advanced Search).

2.5. Контрольные вопросы

1. На каких принципах формируются типовые информационные структуры?

2. Что понимается под информационным поиском ?

3. Дайте определение информационно-поисковому языку.

4. Назовите типы метаданных, используемых в системе «Дублинское ядро».

5. Какие формы взаимодействия обеспечивает диалоговый интерфейс?

6. Охарактеризуйте свойс­тва автоматизированной библиотечной системы.

7. Какие функции выполняет электронная библиотека?

Приложение

Использованы материалы Академии управления, С.-Петербург (автор – Тишкин А.И.).