Начало разработки
Значимость разработки и использования
Потенциально использование тезаурусов в качестве средств для описания основного содержания текста позволяет преодолевать многие проблемы пословного поиска, упомянутые в лекции 3, а также проблему, связанную с избытком приписанных тексту слов, которых оказывается так много, что возникает отдельная задача по определению их значимости для данного текста.
Однако многочисленные исследования по определению эффективности различных методов представления документов при информационном поиске показали, что эффективность пословного индексирования сравнима с эффективностью поиска, использующего ручное индексирование по тезаурусу.
Действительно, применение хорошо разработанного тезауруса при ручном индексировании должно снимать проблемы синонимии, близких понятий, многозначности. Однако при этом могут возникнуть существенные различия между понятиями, используемыми в тезаурусе, и информационной потребностью пользователя, когда пользователю трудно сформулировать описание нужных ему текстов посредством понятий тезауруса или тезаурус действительно не содержит адекватных понятий. В этих случаях пословное индексирование имеет преимущество из-за больших выразительных возможностей.
Кроме того, при ручном индексировании серьезную проблему составляет фактор субъективности, когда приписывание тексту терминов тезауруса зависит от умения и опыта индексаторов, от количества текстов, которые необходимо проиндексировать, и т.п.
Тем не менее и в настоящее время существуют информационные службы, имеющие и разрабатывающие информационно-поисковые тезаурусы, а также имеющие штат профессиональных индексаторов, индексирующих документы на основе тезаурусов. Примерами таких организаций являются Исследовательская служба Конгресса США, индексирующая по тезаурусу LIV (Legislative Indexing
За прошедшие годы были разработаны и использовались информационными и терминологическими службами сотни тезаурусов, каждый из которых содержит ценную информацию о своей предметной области. Поэтому многие разработчики автоматических информационных систем исследовали вопросы о применении существующих
Более того, международный стандарт по разработке одноязычных тезаурусов (ISO 2788) четко указывает, что стандарт должен применяться в организациях, имеющих людей-индексаторов, которые анализируют содержание документов и описывают основные темы документов с помощью терминов тезауруса. "Применение стандарта не предполагает его применение в тех организациях, которые используют полностью автоматические методы индексирования".
Возникает вопрос: почему существующая парадигма разработки
В дальнейшем тексте информационно-поисковые тезаурусы, создаваемые в соответствии с существующими международными и национальными стандартами, будем называть традиционными
В различных стандартах и пособиях приводятся разные определения
Основными целями разработки традиционных ИПТ являются следующие:
Основной единицей тезаурусов являются
Большинство версий стандартов по ИПТ указывают на связь терминов с
При этом понятие рассматривается как единица мысли, которая формируется мысленно для отражения всех или некоторых свойств конкретного или абстрактного, реально существующего или мысленного объекта. Понятия существуют как абстрактные сущности, независимо от терминов, которые их выражают.
Российский ГОСТ рассматривает понятие как форму мышления, отражающую существенные свойства, связи и отношения предметов и явлений, а термином в определении ГОСТа является слово или словосочетание, являющееся точным обозначением определенного понятия какой-либо области знания.
ГОСТ 7.74-96 определяет единицы тезауруса как лексические единицы информационно-поискового языка - то есть обозначения отдельного понятия, принятые в информационно-поисковом языке и неделимые в этой функции.
Стоит отметить, что не все разработчики тезаурусов четко разделяли понятия и термины. Так, разработчики тезауруса AGROVOC определили его как термино-ориентированный (term-oriented), что находит свое проявление в том, что к термину невозможно добавить синонимы. Эта особенность тезауруса рассматривается авторами как недостаток, который необходимо исправить.
Таким образом, разработчики тезаурусов предполагают, что понятие предметной области обычно имеет несколько возможных вариантов лексического представления в тексте, которые рассматриваются как синонимы. Среди таких синонимов выбирается
Дескрипторы тезауруса должны соответствовать выбранной предметной области тезауруса. Каждый дескриптор, внесенный в тезаурус, должен представлять отдельное понятие данной области. Дескриптор может быть однословным или многословным. Поскольку часто бывает достаточно трудно понять, представляет ли отдельное понятие многословное словосочетание, многие тезаурусы и руководства уделяют особое внимание основным принципам включения в тезаурус в качестве дескрипторов многословных терминов.
Набор дескрипторов должен удовлетворять следующим требованиям:
ГОСТ 7.25 указывает, что основными типами отношений, обычно отражаемых в ИПТ, являются следующие:
Такие содержательные типы связей между дескрипторами чаще всего не отражаются в подробном перечне отношений тезауруса, а записываются с помощью небольшого набора отношений, которые обычно разделяются на два типа:
По ГОСТУ 7.25-2001
Основным иерархическим отношением, используемым в ИПТ, является родо-видовое отношение (оно же - отношение НИЖЕ-ВЫШЕ ). По ГОСТУ 7.25-2001 родо-видовая связь устанавливается между двумя дескрипторами, если объем понятия нижестоящего дескриптора входит в объем понятия вышестоящего дескриптора.
Также в качестве иерархического отношения в ИПТ может устанавливаться отношение ЧАСТЬ-ЦЕЛОЕ.
Многие руководства и стандарты подчеркивают, что
Так, для мышей можно указать, что они грызуны, поскольку это внутренняя характеристика мышей. В то же время неправильно указывать, что мыши - вредители, поскольку имеются лабораторные мыши и домашние мыши, которые вредителями не являются.
Рекомендуется использовать тест "все-некоторые". Например, "все мыши являются грызунами, но некоторые мыши являются вредителями".
Основное назначение установления ассоциативных отношений между дескрипторами ИПТ - указание на дополнительные дескрипторы, полезные при индексировании или поиске.
Отношение ассоциации является неиерархическим и ассоциативным. Ассоциативное отношение наиболее трудно определить. Российский стандарт на создание ИПТ указывает, что "ассоциативное отношение является объединением отношений, не входящих в РОД-ВИД ".
Другие источники стараются изложить более подробные принципы установления ассоциативных отношений, поскольку в противном случае отношение будет проставляться непоследовательно.
Американский стандарт описывает наиболее общее правило установления ассоциативного отношения между дескрипторами таким образом: это отношение стоит устанавливать между двумя дескрипторами, если при употреблении одного термина другой термин как бы подразумевается. Один термин может быть необходимым элементом определения другого термина, например, термин клетка составляет необходимую часть определения термина цитология.
Поскольку основными элементами ИПТ являются термины, описанные как дескрипторы и аскрипторы, может показаться, что достаточно просто осуществить автоматическое индексирование по ИПТ путем простого сопоставления дескрипторов и аскрипторов с документами.
Однако для большинства документов такое автоматическое сопоставление не сможет отразить основное содержание документа:
Поэтому исследуются более сложные методы автоматизации индексирования по ИПТ.
Одним из подходов для автоматизации индексирования по традиционным ИПТ является подход, основанный на правилах. Такой подход к автоматическому индексированию был реализован по тезаурусу EUROVOC.
Правила могут быть простыми и сложными. Простые правила не содержат условий. Сложные правила содержат такие условия, как Близость (на расстоянии трех слов по тексту, в одном предложении, в том же самом поле, например, в поле реферата), Местонахождение (в заголовке, в тексте реферата или документа, в начале предложения, в конце предложения), Формат (с большой буквы, все большими буквами). Всего было создано около 40 тысяч правил.
В качестве других подходов автоматизации индексирования используются статистические методы.
При таких подходах процесс автоматического приписывания дескрипторов тезауруса EUROVOC полнотекстовым документам включает две стадии.
Например, дескриптору тезауруса FISHERY MANAGEMENT соответствуют следующие слова (в порядке убывания веса): fishery, fish, stock, fishing, conservation, management, vessel и т.д.
На второй стадии (собственно индексирование) для каждого слова документа проверяется, каким дескрипторам тезауруса оно соответствует. Если такие дескрипторы имеются, то слово добавляет к весу дескриптора для данного текста натуральный логарифм веса, полученного на первом этапе. После обработки всех слов текущего текста получается суммированный вес дескрипторов тезауруса.
Например, для Резолюции по правам языковых и культурных меньшинств в Европейском союзе были получены следующие дескрипторы (в порядке убывания веса): Community programme, Young person, Cultural policy, CEEC, European Union и т.д.Индексаторы Европейского Парламента присваивают документу обычно от 3 до 10 дескрипторов.
Выдачу системы можно ограничить по количеству выдаваемых дескрипторов или по весу. Для текста примера присвоенные индексаторами дескрипторы находились в первой тридцатке дескрипторов, присвоенных автоматически (на позициях 3, 8, 9, 16 и 30).
При этом большинство автоматически присвоенных дескрипторов выглядят весьма релевантными тексту документа и только 3 из 40 присвоенных автоматически явно неправильны (например, Кипр).
В настоящее время в мире существует достаточно много информационных систем, предоставляющих пользователям возможности поиска информации как по свободному запросу на естественном языке, так и с помощью дескрипторов
Первым шагом на этом пути может быть нахождение корреляций между словами документов и дескрипторами тезауруса или рубриками рубрикатора.
Эксперименты по автоматическому расширению свободного запроса пользователя дескрипторами тезауруса проводились на двуязычной коллекции немецких и английских документов по общественным наукам. База включает в себя более 150 тысяч немецких документов и 26 тысяч английских. Документы реферативного характера содержат заголовок публикации, реферат и дескрипторы Тезауруса по общественным наукам, приписанных индексаторами. Эксперименты выполнялись в рамках предметно-ориентированного задания форума по многоязыковым информационным системам CLEF (Cross Language Evaluation Forum).
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.