Онтологии и тезаурусы: модели, инструменты, приложения

Информационно-поисковые тезаурусы и автоматическая обработка текстов

Разбить на страницы
Показывать лекцию целиком

10.1. Тезаурус для автоматического концептуального индексирования как особый вид тезауруса

Отличительные особенности тезауруса для автоматического концептуального индексирования

Основной целью разработки традиционных информационно-поисковых тезаурусов является использование их единиц (дескрипторов) для описания основных тем документов в процессе ручного индексирования. По своей сути тезаурус для ручного индексирования является искусственным языком описания, построенным на основе естественного языка. При этом сам процесс индексирования по такому тезаурусу базируется на лингвистических, грамматических знаниях, а также знаниях о предметной области, которые имеются у профессиональных индексаторов текстов. Индексатор сначала должен прочитать текст, понять его и затем изложить содержание текста, пользуясь дескрипторами информационно-поискового тезауруса. Индексатор должен хорошо понимать всю терминологию, использованную в тексте, - для описания основной темы текста ему понадобится значительно меньшее количество терминов.

При автоматической обработке текстов человека - посредника между текстом и описанием его содержания в виде дескрипторов нет. Есть только автоматический процесс и Тезаурус, который должен содержать и те знания, которые содержатся в традиционных информационно-поисковых тезаурусах, и те знания (насколько это возможно), которые использует индексатор для определения основной темы текста.

Именно поэтому традиционные тезаурусы, разработанные для ручного индексирования, трудно использовать при автоматическом индексировании.

Разработка тезауруса для автоматического индексирования (далее - АИ тезауруса) характеризуется прежде всего необходимостью описания значительно большего количества слов и словосочетаний, встречающихся в текстах данной предметной области. АИ тезаурус должен не только включать термины, которые представляют важные понятия в текстах данной предметной области, но также охватывать широкий круг более специфических терминов, обнаружение которых в конкретном тексте сделает этот текст релевантным запросу по понятиям более высокого уровня. Например, должны быть описаны не только дескриптор РЫБА и его основные подразделения, такие как МОРСКИЕ РЫБЫ, АНАДРОМНЫЕ РЫБЫ и т.п., но и значительное количество конкретных видов рыб, с тем чтобы текст, обсуждающий проблемы вылова минтая, мог бы быть получен при поиске по термину рыба.

Синонимические ряды понятий должны быть значительно богаче, чем совокупности вариантов дескриптора в тезаурусе для ручного индексирования, поскольку синонимы должны описывать различные способы выражения данного понятия в тексте для автоматического процесса, а не для человека. Ряды синонимов включают в себя не только существительные и именные группы, а также прилагательные, глаголы и глагольные группы. Расширение терминологической базы АИ-тезауруса ведет к необходимости описания многозначных терминов.

Расширение понятийной базы тезауруса ведет к увеличению и усложнению функций отношений между понятиями тезауруса (концептуальными отношениями): возникает необходимость логического вывода отношений, поскольку описать отношения всех дескрипторов со всеми близкими дескрипторами АИ-тезауруса становится трудоемким занятием и затрудняет проверку таких описаний.

Общественно-политический тезаурус как ресурс для автоматического концептуального индексирования текстов

С 1994 года в АНО ЦИИ (Автономная некоммерческая организация Центр информационных исследований) началась разработка Общественно-политического информационно-поискового тезауруса (русскоязычного) как ресурса для автоматического индексирования. Общественно-политический тезаурус включает в себя терминологию экономической, политической, военной, финансовой, законодательной, социальной, культурной и других сфер деятельности - терминологию, которая встречается в таких общезначимых документах, как официальные и законодательные документы, международные договоры, сообщения информационных агентств и газетные публикации.

Общественно-политический тезаурус представляет собой иерархическую сеть понятий, каждое из которых имеет ряд текстовых вариантов (способов языкового выражения) и совокупность отношений с другими понятиями тезауруса.

Предметная область тезауруса - это широкая политематическая область современных общественных отношений, проблем современного общества. Поэтому набор понятий Тезауруса соответствует понятийному содержанию и нормативных документов, и газетных публикаций, и в значительной степени - научных публикаций по общественным наукам.

С 1995 года Общественно-политический тезаурус активно и успешно применяется для различных приложений автоматической обработки текстов, таких как автоматическое концептуальное индексирование, автоматическое рубрицирование с использованием нескольких рубрикаторов, автоматическое аннотирование текстов.

В настоящее время Общественно-политический тезаурус включает 33 тысячи понятий, 87 тысяч русскоязычных слов, терминов, выражений, 130 тысяч отношений между понятиями.

Сравнение Тезауруса Исследовательской службы Конгресса США (LIV) с Общественно-политическим тезаурусом
ХарактеристикаОбщественно-политический ТезаурусLIV
Число понятий 33 тысяч 6,8 тысяч
Число терминов 87 тысяч 9,8 тысяч
Термины, описанные как многозначные 4,5 тысяч Нет
Общее количество описанных отношений между понятиями 130 тысяч 15 тысяч
Количество отношений, полученных по логическим свойствам 700 тысяч Не определено

Отношения в информационно-поисковых ресурсах: альтернативы

В связи с обсуждением направлений развития информационно-поисковых тезаурусов и возможностей их эффективного использования в современных технологиях информационного поиска возникает вопрос: как должен измениться набор отношений традиционного информационно-поискового тезауруса, который в подавляющем большинстве случаев включает два отношения - ВЫШЕ-НИЖЕ и АСЦ (ассоциация).

Часто исследователи обсуждают возможность применения в информационно-поисковых тезаурусах и других ресурсах, предназначенных для информационного поиска, подходов, предлагаемых в рамках онтологических исследований.

Современные подходы к описанию отношений при разработке онтологий

Рассмотрим онтологию, предназначенную для работы в информационно-поисковых задачах и содержащую описания понятий предметной области (отношения между понятиями задаются в виде предикатов). Пусть свойства отношений (аксиомы вывода) описываются как правила вида if P(x1,:,xn) then Q(y1,:,ym).

Чтобы инициализировать эти правила, необходимо быть уверенным, что P(x1,:,xn) определяется с высокой точностью. При современном уровне развития систем автоматической обработки текстов в большой разнородной коллекции не для любых типов предикатов P(x1,:,xn) можно гарантировать приемлемый уровень точности и полноты их нахождения.

Например, различные аргументы предиката P(x1,:,xn) могут оказаться в разных частях длинного предложения, что значительно усложнит сборку предиката, или в разных предложениях текста, например, из-за использования эллиптической конструкции или местоимения и т.п. Проблемы с правильной идентификацией аргументов предикатов в текстах могут свести к нулю возможные преимущества применения знаний, описанных в онтологиях, по сравнению с пословным поиском.

Среди потенциального множества отношений понятия наиболее стабильно можно опираться на те отношения, которые не исчезают, не меняются в течение всего срока существования любого или подавляющего большинства экземпляров понятия. Например, любой лес всегда состоит из деревьев.

Наиболее известным типом отношения, которое выполняется для всех экземпляров, является таксономическое отношение. Так, если С1 упомянуто в тексте и С1 является видом С2, это означает, что в тексте упомянуто и С2. Если данный текст релевантен запросу о С1, то он будет релевантен и запросу о С2.

В условиях невозможности использования сложных правил вывода для осуществления вывода по тексту желательно найти другие типы отношений, обладающие свойствами транзитивности и наследования, подобно таксономическим отношениям. Проблема рассмотрения взаимного сосуществования понятий является центральной в теории зависимости философской дисциплины "формальная онтология".

Отношения онтологической зависимости

Теория зависимости является одним из основных инструментов анализа сущностей в рамках философской дисциплины - онтологии. Главный вопрос теории зависимости: может ли сущность ( С1 ) существовать сама по себе или подразумевает существование чего-либо еще ( С2 ).

  • Строгая зависимость: существование одной сущности С1 подразумевает ли существование какой-либо конкретной сущности С2?

    Например, кипение ( С1 ) невозможно без существования конкретного объема жидкости ( С2 ), которая кипит.

  • Зависимость от класса: существование сущности С1 предполагает ли существование примеров (экземпляров) некоторого класса сущностей С2?

    Например, возникновение понятия гараж ( С1 ) невозможно без существования понятия автомобиль ( С2 ) как класса, хотя конкретный гараж может строиться безотносительно к конкретному автомобилю.

  • Историческая зависимость: существование сущности С1 в некоторый момент времени T1 предполагает ли существование сущности C2 в некоторый другой момент времени T2?

    Например, понятие солома ( С1 ) исторически зависит от понятия молотьба ( С2 ), поскольку солома не может возникнуть без предварительного процесса молотьбы; вместе с тем эти работы заканчиваются, а солома длительное время продолжает существовать.

  • Перечисленные выше типы отношений онтологической зависимости упорядочены по мере снижения объема пересечения сфер существования зависящего понятия и главного понятия.

    При строгой зависимости зависимое понятие не может быть оторвано от конкретного экземпляра главного понятия, поэтому если возникает, существует, обсуждается конкретный пример такого жестко зависимого понятия, то существует и обсуждается пример главного понятия.

    В случае зависимости от класса конкретный пример зависимого понятия может быть оторван от главного понятия, с ним может происходить что-то, не связанное с главным понятием, но обычно недолго и в относительно небольшой доле примеров зависимого понятия - например, в гараже может быть совершено преступление и оно может не иметь никакого отношения к автомобилям.

    При исторической зависимости пример зависимого понятия может достаточно долго существовать без главного понятия и участвовать в самых разных ситуациях, - например, сельскохозяйственная продукция создается в процессе сельскохозяйственного производства, затем продукция значимое время живет "своей жизнью": перевозится, продается, хранится.

    Подход к описанию отношений в Общественно-политическом тезаурусе

    Набор отношений в Общественно-политическом тезаурусе специально подобран для эффективной работы в информационно-поисковых приложениях. Имеется четыре основных типа отношения.

  • Первый тип отношений - родо-видовое отношение НИЖЕ-ВЫШЕ, оно обладает свойствами транзитивности и наследования.
  • Второе тип отношений - отношение ЧАСТЬ-ЦЕЛОЕ. Используется не только для описания физических частей, но и для других внутренних сущностей понятия, таких как свойства или роли для ситуаций. Важным условием при установлении этого отношения является то, что понятия-части должны быть жестко связаны со своим целым, то есть каждый пример понятия-части должен в течение всего времени своего существования являться частью для понятия-целого и не относиться к чему-либо другому. В этих условиях удается выполнить свойство транзитивности введенного таким образом отношения ЧАСТЬ-ЦЕЛОЕ, что очень важно для автоматического вывода в процессе автоматической обработки текстов.
  • Еще один тип отношения, называемый несимметричной ассоциацией ( АСЦ2-АСЦ1 ), связывает два понятия, которые не могут быть связаны вышерассмотренными отношениями, но одно из них не существовало бы без другого. Например, понятие САММИТ требует существования понятия ГЛАВА ГОСУДАРСТВА.
  • Последний тип отношений - симметричная ассоциация - связывает, например, понятия, очень близкие по смыслу, но такие, которые разработчики не решились склеить в одно понятие.
  • Отношения ВЫШЕ-НИЖЕ, ЧАСТЬ-ЦЕЛОЕ и несимметричная ассоциация являются иерархическими отношениями. Таким образом, на основе свойств иерархичности, транзитивности и наследования для каждого понятия может быть определена совокупность понятий, которые являются для него нижестоящими понятиями по иерархии.

    Таким образом, два отношения в тезаурусе из четырех существенно связаны с понятием онтологической зависимости. В количественном отношении эти два отношения занимают приблизительно половину из всех отношений тезауруса.

    Нарушение условий надежности

    Если условия надежности выполняются почти всегда, по умолчанию, то применяются специальные пометки - модификаторы отношений, что означает, что отношение более слабое. В связи с этим вводятся ограничения по транзитивности.

    Используются два модификатора:

  • модификатор В ("возможно") - отношение выполняется не для всех примеров;
  • модификатор А ("аспект", точка зрения) - отношение существует не все время.
  • Например,

    ПЕНСИОНЕР
    	ВЫШЕ_В		СТАРЫЙ ЧЕЛОВЕК
    	ЦЕЛОЕ_А		ПЕНСИОННАЯ СИСТЕМА

    Сравнение используемого отношения ЧАСТЬ-ЦЕЛОЕ с другими подходами

    Наиболее близким по такой трактовке отношений ЧАСТЬ-ЦЕЛОЕ является онтология Дж. Совы (John Sowa). Описывая классификацию ролей и отношений в своей онтологии верхнего уровня, автор рассматривает случаи зависимости (prehension) понятий друг от друга. Зависимость может быть внешняя (extrinsic) и внутренняя (intrinsic). Если одна сущность в отношении зависимости может исчезнуть, не меняя форму или существование другой сущности, это означает, что это отношение внешнее. Если исчезновение одной из сущностей меняет структуру или существование другой сущности, то это отношение внутреннее.

    Основным видом внутренне зависимых сущностей являются компоненты. Среди компонентов выделяются части и свойства. Части делятся на физические части, участников и стадии, а свойства - на атрибуты и способы.

    Таким образом, Sowa также объединяет в один куст отношений такие отношения, как физические части, участники, стадии, свойства, по свойству внутренней зависимости.

    Разработка Общественно-политического тезауруса как ресурса для автоматической обработки текстов. Соединение трех существующих традиций. Общественно-политический тезаурус как лингвистическая онтология

    Мы видим, что Общественно-политический тезаурус представляет собой лингвистическую онтологию, которая строится на сочетании трех различных традиций и методологий:

  • методологии разработки традиционных информационно-поисковых тезаурусов;
  • методологии разработки лингвистических ресурсов типа WordNet;
  • методологии созданий формальных онтологий.
  • Поскольку предполагается работать с терминологией, большими предметными областями и свободными текстами, то важно использовать опыт разработки информационно-поисковых тезаурусов, а именно:

  • информационно-поисковый контекст;
  • единицы онтологии создаются на основе значений терминов;
  • описание большого числа многословных выражений, принципы включения/невключения многословных единиц;
  • небольшой набор отношений между понятийными единицами.
  • Так как предполагается применять онтологию в автоматическом режиме обработки текстов, то необходимо использовать методологию разработки лексических ресурсов типа WordNet, в которой важны следующие положения:

  • понятия онтологии создаются на основе значений реально существующих языковых выражений - терминов ;
  • многоступенчатое иерархическое построение лексико-терминологической системы понятий;
  • принципы описания значений многозначных слов и выражений.
  • Из методологии разработки формальных онтологий важны следующие положения:

  • разработка лингвистической онтологии как иерархической системы понятий;
  • включение в состав отношений тезауруса отношений онтологической зависимости, которые описывают зависимость существования понятия или примеров понятия от существования других понятий (примеров понятия). Показано, что применение таких отношений в лингвистическом ресурсе эффективно для решения задач информационного поиска;
  • в качестве аксиом (правил вывода) - использование свойств транзитивности и наследования таксономических отношений и транзитивности отношений онтологической зависимости.
  • Контрольные вопросы

  • В чем состоят отличительные особенности Тезауруса для автоматического концептуального индексирования?
  • Каковы возможные способы установление отношений в тезаурусах?
  • Что такое отношения онтологической зависимости?
  • 10.2. Тезаурус для автоматического концептуального индексирования как ресурс для решения информационно-поисковых задач

    С 1995 года Общественно-политический тезаурус используется в таких областях автоматической обработки текстов, как автоматическое концептуальное индексирование, автоматическая рубрикация текстов, автоматическое аннотирование текстов. Все эти применения тезауруса базируются на тематическом представлении текста, моделирующем тематическую структуру документа на базе узлов близких по смыслу терминов.

    Совокупность этапов, преобразующих исходный текст в тематическое представление, называется Автоматической Лингвистической Обработкой Текста (АЛОТ).

    (рис 10.1) Обработка документов в УИС РОССИЯ

    Тезаурус и технология автоматического построения тематического представления содержания документа позволили развить в рамках УИС РОССИЯ (Университетской информационной системе РОССИЯ, uisrussia.msu.ru) гибкую технологию эффективной автоматической рубрикации текстов. Созданные системы автоматической рубрикации работают с такими рубрикаторами, как рубрикатор исследовательской службы конгресса США, общеправовым тематическим классификатором Центральной избирательной комиссии РФ, классификатором правовых актов РФ. Всего было внедрено шесть различных систем автоматической рубрикации с разными рубрикаторами размером от 35 до 1200 рубрик.

    Знания, описанные в Тезаурусе, а также технология построения тематического представления позволили создать систему автоматического аннотирования текстов. В 1998 году программа автоматического аннотирования англоязычных текстов участвовала в соревнованиях в рамках конференции SUMMAC, где эта программа получила лучшие результаты в номинации "Индикативная аннотация наилучшей длины".

    Тезаурус используется как инструмент для автоматического концептуального индексирования и ранжированного информационного поиска в УИС РОССИЯ.

    АЛОТ: основные этапы

    На первом этапе работы алгоритма происходит сравнение единиц текста с единицами Тезауруса. Сравнение текста и Тезауруса происходит на основе морфологического представления единиц текста и единиц Тезауруса. Из множества найденных в тексте единиц Тезауруса выбирается единица, имеющая максимальную длину. Если один и тот же фрагмент текста соответствует разным единицам Тезауруса, то фиксируется многозначность термина.

    В результате сопоставления с Тезаурусом текст отражается в последовательность дескрипторов Тезауруса. Все синонимы (варианты) одного и того же дескриптора отображаются в соответствующий дескриптор и далее не различаются. Для каждого дескриптора фиксируется частота его встречаемости в тексте.

    (рис 10.2) Покрытие терминологией Тезауруса лексики НА РФ. На примере документа "Постановление Правительства РФ от 26 июня 1995 г. № 604"

    Чтобы определить тезаурусные связи между дескрипторами текста, необходимо найти те пары дескрипторов, которые описаны в тезаурусных статьях друг друга. Но этого недостаточно. Необходимо также найти и такие пары дескрипторов текста, связи между которыми выводятся по свойствам транзитивности и наследования. Совокупность связанных между собой дескрипторов текста, полученных в результате применения процедуры вывода, называется проекцией Тезауруса на текст - тезаурусной проекцией .

    Таким образом, два дескриптора текста D1 и D2 оказываются непосредственно связанными в тезаурусной проекции, если:

  • эти дескрипторы D1 и D2 находятся в одной тезаурусной статье;
  • и между дескрипторами D1 и D2 существует путь в Тезаурусе, который состоит:
  • либо только из связей ВЫШЕ и ЦЕЛОЕ (в этому случае говорят, что дескрипторы D1 и D2 связаны по транзитивности связей ВЫШЕ и ЦЕЛОЕ );
  • либо из связей ВЫШЕ и ЦЕЛОЕ и одной связи АССОЦИАЦИЯ (в этому случае говорят, что дескрипторы D1 и D2 связаны по свойству наследования связи АССОЦИАЦИЯ связями ВЫШЕ и ЦЕЛОЕ ).
  • В построении тезаурусной проекции равным образом участвуют все дескрипторы, соответствующие неоднозначному термину. На основе тезаурусной проекции производится выбор дескриптора, соответствующего определенному значению термина. Для каждого значения неоднозначного термина проверяется:

  • употреблялись ли в данном тексте наряду с неоднозначным термином однозначные термины, соответствующие дескриптору, который выражает это значение неоднозначного термина;
  • имеет ли дескриптор, соответствующий этому значению неоднозначного термина, тезаурусные связи с другими дескрипторами проекции.
  • Если выполняется одно из вышеперечисленных условий, то считается, что "текст поддерживает" данное значение неоднозначного термина. Если текст "поддерживает" только одно значение неоднозначного термина, то выбирается соответствующий ему дескриптор.

    Если текст "поддерживает" дескрипторы, соответствующие разным значениям термина, то для каждого вхождения неоднозначного термина рассматриваются ближайшие по тексту дескрипторы, для них проверяются вышеуказанные условия и выбирается тот дескриптор неоднозначного термина, который "поддерживается" первым из ближайших по тексту дескрипторов.

    Теоретические основы построения тематического представления

    Популярной теорией в области автоматической обработки текстов является теория Т.А. ван Дейка - В.Кинча, которая указывает, что основная тема текста может быть описана некоторой пропозицией. Такая пропозиция называется макропропозицией. Основное содержание текста может быть представлено как иерархическая структура в том смысле, что тема всего текста может быть обычно описана посредством более конкретных тем текста, которые, в свою очередь, могут быть охарактеризованы посредством еще более конкретных подтем и т.п. Каждое предложение связного текста посвящено раскрытию той или иной подтемы основной темы текста.

    Второе направление исследований базируется на автоматическом выявлении лексической связности текста. Какими бы отношениями не были связаны между собой предложения текста, часть слов, входящих в состав этих предложений, должны быть лексически связаны между собой, причем эти отношения между словами заранее известны автору и читателю текста.

    Действительно, формулировка основной темы текста содержит некоторую совокупность слов, наиболее значимых для передачи содержания текста. Если рассмотреть текст, то можно видеть, что слова, близкие по смыслу к словам основной темы, образуют лексические цепочки, которые пронизывают весь текст. Естественно предположить, что если имеется лингвистический ресурс, в котором описаны разнообразные смысловые связи между словами, то можно двигаться по тексту, находить связанные по смыслу слова, формировать лексические цепочки. Самые частотные (или выделенные по другим критериям) цепочки могли бы показать, чему именно посвящен конкретный текст.

    Предположим, что мы сформулировали основную тему некоторого текста. В ней упомянуты некоторые понятия и/или конкретные объекты текста. Подтемы текста раскрывают взаимоотношения между этими основными понятиями/объектами и поэтому должны тем или иным образом ссылаться на них, используя повторы слов, синонимы или другие слова, семантически связанные с понятиями основной темы (далее основные понятия текста). Таким образом, основным понятиям текста соответствуют некоторые совокупности слов текста (и совокупность понятий, стоящих за этими словами), которые используются в данном тексте для ссылки на эти основные понятия. Такие совокупности слов обычно пронизывают весь текст "красной нитью".

    Если подтема текста раскрывается в более специфических подтемах, то для ссылки на основные понятия этой подтемы, в свою очередь, возникают более короткие "нити" слов. Таким образом, начало лексической цепочки нужно связывать не с началом текста, а с наиболее важным для содержания текста понятием, которое должно стать центром этой цепочки, а все элементы лексической цепочки должны быть прежде всего связаны лексическим отношением именно с этим центром (последователями подхода на основе WordNet также обсуждается необходимость нахождения центра лексической цепочки, правда, уже после ее формирования).

    Предполагается, что более важные для текста понятия чаще всего так или иначе выделены в тексте относительно других близких им по смыслу понятий (например, частотностью, упоминанием в заголовке текста). Структура, в которой все понятия связаны по тезаурусу с одним и тем же понятием, называется тематическим узлом , а главное понятие тематического узла - тематическим центром. Собственно расположение в тексте слов, соответствующих этим тематическим узлам, и создает эффект лексических цепочек.

    (рис 10.3) Сеть тематических узлов документа "Постановление Правительства РФ от 26 июня 1995 г. № 604"

    Построение тематических узлов

    Каждая тема, обсуждаемая в тексте, выражается обычно не одним термином, а совокупностью тематически близких терминов. Например, тема науки может развиваться в тексте посредством следующих терминов: математика, физика, прикладное исследование, фундаментальное исследование, научный работник. Тот термин, который наиболее точно характеризует развиваемую в тексте тему, обычно некоторым образом выделен из всей совокупности тематически близких терминов: может быть употреблен в заголовке и/или в начале текста, иметь максимальную частотность среди других тематически близких терминов.

    Главным термином темы может стать любой термин Тезауруса, независимо от его уровня общности/специфичности. Так, главным термином темы текста может стать термин математика, если речь в тексте идет о развитии математики; или главным термином может стать термин научный работник, если речь в тексте идет об оплате труда научных работников или о выезде ученых за рубеж.

    Напомним, что совокупность тематически связанных между собой дескрипторов с выделенным среди них главным дескриптором называется тематическим узлом .

    Тематическая связанность терминов отображается в связях между соответствующими дескрипторами в тезаурусной проекции. Тезаурусная проекция обычно состоит из нескольких фрагментов связанных между собой дескрипторов. Каждый такой связный фрагмент может иметь достаточно сложную структуру, и в него могут входить далекие друг от друга дескрипторы. Таким образом, чтобы выделить тематические узлы, необходимо провести дополнительное разбиение тезаурусной проекции.

    Как показали эксперименты, наиболее эффективно проводить разбиение следующим образом.

    Создание тематического узла начинается с выбора главного дескриптора тематического узла. Сначала тематические узлы собираются вокруг дескрипторов заголовка и первого предложения текста. Затем тематические узлы собираются для остальных дескрипторов, начиная с самых частотных. Те дескрипторы, которые уже попали в тематический узел некоторого дескриптора, свой тематический узел не образуют.

    После того как выбран главный дескриптор очередного тематического узла, в тематический узел включаются дескрипторы, непосредственно связанные с главным дескриптором тематического узла в тезаурусной проекции, и дескрипторы, связанные с главным дескриптором посредством такой совокупности тезаурусных связей, которые можно свести к одной связи путем применения свойств транзитивности и наследования.

    Выделение основных тематических узлов

    Для выявления основных тематических узлов производятся следующие процедуры:

  • в процессе сопоставления текста с тезаурусом для каждого понятия тезауруса, найденного в тексте, запоминаются его соседи - понятия влево и вправо. В экспериментах было установлено, что фиксация трех соседей вправо и влево представляется оптимальной. Такие пары понятий текста мы называем текстовыми связями понятия. Знак абзаца прерывает набор текстовых связей;
  • текстовые связи разных вхождений понятия в тексте суммируются. В результате мы получаем частотность текстовых связей понятий между собой;
  • в процессе создания тематических узлов текстовые связи каждого понятия в узле суммируются и получаются текстовые связи тематических узлов;
  • выбираются три тематических узла, суммарная частотность попарных текстовых связей между которыми является максимальной среди других треугольников текста. Это и есть первая тройка основных тематических узлов в тексте - центры этих основных тематических узлов являются элементами основной темы документа;
  • далее необходимо проверить, нет ли еще элементов основной темы документа. Для этого среди оставшихся тематических узлов отыскиваются тематические узлы, которые имеют текстовые связи как с уже полученными основными тематическими узлами, так и между собой;
  • таким образом, совокупность основных тематических узлов получена. Их текстовые связи образуют между собой симплексы - фигуры, в которых каждая вершина имеет ребро с другой вершиной (треугольник, пирамида и т.п.). Важная особенность выявления основных тематических узлов на основе симплексов текстовых связей - независимость процесса от размера, жанра и языка обрабатываемых текстов.
  • Эксперименты показали, что тематическое представление может быть построено для текстов любого размера и разнообразных типов. Тематические представления были построены для более 100 Мб официальных документов Российской Федерации, международных договоров, для большинства российских законов 1990-1997 гг. Тематические представления были также построены для более 50 Мб сообщений информационных агентств и газетных статей. Размеры обрабатываемых документов варьировались от 500 байт до более 500 Кб (Гражданский Кодекс Российской Федерации, Таможенный кодекс Российской Федерации).

    (рис 10.4) Структура тематического представления

    Тезаурус как поисковый механизм УИС РОССИЯ

    Тезаурус существенно используется в интерфейсе УИС РОССИЯ для следующих задач терминологического поиска:

  • уточнения запроса, когда выбор более точного термина позволяет получать только требуемые документы, например, выбирая вместо всех типов СТРОИТЕЛЬСТВА именно ДОРОЖНОЕ СТРОИТЕЛЬСТВО (автодорожное строительство, дорожно-строительные работы, строительство дорог, строительно-дорожный и т.д.);
  • автоматического расширения запроса по синонимам ( НАЛОГОВАЯ СИСТЕМА - НАЛОГОВЫЙ РЕЖИМ ), а также по иерархии ( МИГРАЦИЯ - БЕЖЕНЦЫ, ВЫНУЖДЕННЫЕ ПЕРЕСЕЛЕНЦЫ и т.д.).
  • Структурная тематическая аннотация

    Структурная тематическая аннотация представляет содержание текста посредством описания его основных тем, которые моделируются совокупностью терминов, относящихся к этим темам. Структурная тематическая аннотация содержит наиболее информативные фрагменты тематического представления текста, которое включает все термины текста, разбитые на тематические узлы и отношения между различными темами и подтемами текста.

    Автоматическое построение связной аннотации

    Знания человека о тематической связности между терминами вытекают из знаний о предметной области, в рамках которой написан текст. Таким образом, то новое и важное, что несет в себе текст и что должна отразить в себе аннотация, - это именно то, каким образом взаимодействуют между собой разные основные темы текста.

    Отсюда следует первый принцип составления аннотаций: важными (информативными) и, следовательно, возможно включенными в аннотацию считаются те предложения текста, которые содержат по крайней мере два термина, входящих в состав разных основных тем текста.

    Предложений, содержащих термины одних и тех же двух основных тем, в тексте может оказаться достаточно много. Для аннотации необходимо выделить одно предложение, в котором взаимодействие этих двух тем характеризуется "наилучшим образом".

    Чтобы понять, что значит "наилучшим образом", рассмотрим, как та или иная тема развивается в тексте. Не все основные темы начинают обсуждаться в тексте сразу, с первого предложения, - часть из них возникает в последующих предложениях. Чтобы сохранить связность и последовательность изложения текста, автор именно в этом первом предложении новой темы должен наиболее точно указать связь новой темы со всем предшествующим текстом.

    Таким образом, второй принцип составления аннотаций - для каждой пары выявленных основных тем текста выбрать в аннотацию те предложения, в которых эта пара обсуждалась первый раз, следуя по порядку текста.

    Нужно отметить, что при хорошем покрытии предметной области Тезаурусом появление в очередном предложении новой темы выявляется весьма точно, а это означает, что связность получаемой аннотации в среднем весьма высока.

    Контрольные вопросы

  • Перечислите этапы автоматической обработки текстов на основе Тезауруса.
  • Как моделируется связность текста?
  • Каков принцип построения связной аннотации текста?
  • 10.3. Технология автоматической рубрикации текстов с использованием тезауруса для автоматического концептуального индексирования

    Задачей систем автоматического рубрицирования является разбиение поступающего потока текстов на тематические подпотоки в соответствии с заранее заданными рубриками.

    Дадим некоторые определения.

    Под рубрикатором понимается классификационная таблица иерархической классификации, содержащая полный перечень включенных в систему классов и предназначенная для систематизации информационных фондов, массивов и изданий, а также для поиска в них (ГОСТ 7.74-96).

    Предметная рубрика - элемент информационно-поискового языка, представляющий собой краткую формулировку темы на естественном языке.

    Адекватная предметная рубрика - предметная рубрика, формулировка которой выражает объем понятия, наиболее точно соответствующего объему понятия о предмете документа.

    При составлении рубрикатора:

  • каждый документ предметной области должен иметь соответствующую предметную рубрику;
  • не должно быть рубрик, которым соответствует относительно малое количество документов;
  • рубрики по возможности должны быть четко отделены друг от друга. Для близких по содержанию рубрик лучше иметь краткие комментарии и четко различать, в каких случаях проставлять одну из рубрик, в каких случаях - обе рубрики.
  • Критерии оценки качества рубрицирования

    Для оценки эффективности работы систем рубрицирования используются такие характеристики, как точность и полнота.

    Точность (precision) - это отношение $$p=R/L$$, где $$R$$ - количество текстов, правильно отнесенных системой к некоторой рубрике, а $$L$$ - общее количество текстов, отнесенных системой к этой рубрике.

    Полнота (recall) - это отношение $$r=R/Q$$, где $$R$$ - количество текстов, правильно отнесенных системой к некоторой рубрике, а $$Q$$ - общее количество текстов, которые должны быть отнесены к этой рубрике.

    Проблемы ручного рубрицирования

    Характерными особенностями ручного рубрицирования являются:

  • высокая точность рубрицирования.

    Обычно процент документов, в которых проставлена явно неправильная рубрика, чрезвычайно мал;

  • низкая полнота рубрицирования.

    Обычно специалисты по рубрикации проставляют одну-две основных рубрики, характеризующие основное содержание документа, хотя документ может быть отнесен и к ряду других рубрик. В результате получается, что при сравнении результатов рубрикации разными экспертами одних и тех же документов процент совпадения проставленных рубрик может оказаться весьма низким - 60%. Это приводит к тому, что похожие документы могут получить достаточно разные наборы рубрик. Такая ситуация усугубляется при увеличении величины и иерархической сложности рубрикатора. Непоследовательность ручного рубрицирования становится серьезной проблемой для настройки разного типа систем автоматического рубрицирования, поскольку затрудняется построение формальных правил отнесения документов к той или иной рубрике;

  • низкая скорость обработки документов.
  • Методы автоматической рубрикации

    Наиболее эффективными, но и наиболее трудозатратными являются методы автоматического рубрицирования, основанные на знаниях. При рубрицировании текстов на основе знаний используются заранее сформированные базы знаний, в которых описываются языковые выражения, соответствующие той или иной рубрике, правила выбора между рубриками и др.

    Другим классом методов для автоматической рубрикации текстов являются методы машинного обучения, которые в качестве обучающих примеров используют заранее отрубрицированные вручную тексты.

    Приводятся очень высокие оценки результатов работы методов машинного обучения, время обучения составляет доли секунд. Однако при ближайшем рассмотрении оказывается, что практически все такие методы тестируются на одной и той же текстовой коллекции - это коллекция финансовых сообщений информационного агентства Рейтер, которая была специально создана несколько лет назад для тестирования методов автоматической рубрикации текстов.

    Эта коллекция характеризуется следующими основными чертами:

  • рубрикатор, включающий 135 рубрик, относительно прост, без иерархии;
  • небольшие по величине тексты принадлежат достаточно узкой области финансовых известий;
  • для обучения представляется более 15 тысяч отрубрицированных документов;
  • подавляющее большинство документов относится к приблизительно 20 рубрикам рубрикатора.
  • Все эти особенности коллекции значительно упрощают решение задачи машинного обучения автоматической рубрикации текстов.

    Проблемы автоматического рубрицирования

    Проблемы автоматического рубрицирования связаны со следующими обстоятельствами:

  • для автоматической рубрикации нужно сначала так или иначе создать образ рубрики как некоторое выражение на основе слов и (или) терминов реальных текстов. Это может быть сделано на основе экспертного описания рубрики или методов машинного обучения по уже отрубрицированным коллекцям;
  • при автоматической обработке конкретных текстов могут возникнуть достаточно серьезные проблемы анализа языкового материала, контекста употребления того или иного слова, требующие привлечения обширных знаний о языке и предметной области, которые очень трудно описать в действующих программных системах автоматической рубрикации.
  • Типы ошибок автоматического рубрицирования

  • Появление "лишних рубрик" - то есть в процессе автоматического рубрицирования документ был отнесен к ошибочной рубрике, не соответствующей содержимому документа. Причины этого могут быть разные:
  • Содержание рубрики сложнее, чем это выглядит по формулировке.

    Например, если рубрика в рубрикаторе новостей называется "Выборы", то обычно не считается правильным, если к этой рубрике будет отнесен текст о выборах президента UEFA.

  • Лексическая многозначность.

    Текст отнесен не к той рубрике из-за того, что некоторые слова, сопоставленные рубрике, в конкретном тексте употреблены в другом значении - таком, которое не соответствует данной рубрике.

  • Ложная корреляция.

    Ложная корреляция может возникнуть в случаях, когда для отнесения текста к рубрике необходимо присутствие в тексте двух логических элементов. Например, для рубрицирования по рубрике "Экономические реформы" необходимо присутствие в тексте двух тематических элементов - темы экономики и темы реформы. Ложная корреляция и, соответственно, неправильное отнесение текста к данной рубрике возникает в тех случаях, когда такие тематические элементы присутствуют в тексте, но не имеют отношения друг к другу, например, такая ситуация может произойти, если в тексте речь шла о судебной реформе и были упомянуты некоторые экономические вопросы.

  • Рубрикация по несущественному элементу.

    Текст отнесен к рубрике по слову или словосочетанию, которое по сути соответствует содержанию рубрики, но в данном тексте это опорное слово или словосочетание употреблено случайно или в каком-то специфическом контексте, из-за чего текст становится нерелевантным рубрике.

    Например, текст может быть отнесен к рубрике "Средства массовой информации" на основе следующего фрагмента: Около 40 человек умерли во Франции в результате установившейся в стране жары: Правительство и средства массовой информации следят за ситуацией:"

  • Пропуск правильных рубрик - то есть в процессе автоматического рубрицирования документ не был отнесен к какой-либо из рубрик, которая на самом деле имеет отношение к содержимому документа. Причины тоже могут быть разные:
  • Нехватка базы описания рубрики.

    Правильная рубрика не определена, поскольку в тексте упомянуты слова, не описанные в словаре системы рубрицирования.

  • Лексическая многозначность.

    Может стать причиной потери правильной рубрики для рубрикации.

  • Слишком сложная структура документа.

    Может привести к пропуску правильной рубрики при автоматической рубрикации, например, если в состав документа входит заголовок и большая таблица, при этом все информация для правильного отнесения текста к рубрике содержится только в заголовке.

  • Методы машинного обучения в задачах рубрикации

    В задаче рубрикации текстов используются различные методы машинного обучения, иллюстрируемые следующими рисунками (рис. 10.5-10.8).

    (рис 10.6) Отсечение по центрам тяжести(рис 10.5) Отсечение по ближайшим соседям (kNN)(рис 10.8) Отсечение по ближайшим точкам (SVM)(рис 10.7) Оптимальный линейный сепаратор SVM (Support Vector Machines). Оптимизация по критерию максимизации расстояния между двумя параллельными поддерживающими плоскостями

    Сложные задачи автоматической рубрикации текстов

    Реальные задачи рубрикации текстов в значительной мере отличаются от задачи классификации сообщений на тестовой коллекции агентства Рейтер. На практике, если перед достаточно большой компанией встает задача автоматической рубрикации текстов, то обычно используются автоматизированные технологии, основанные на ручном подборе лексики под каждую рубрику рубрикатора с последующим контролем результатов рубрицирования.

    Факторами, усложняющими или делающими невозможным применение методов машинного обучения для автоматической рубрикации текстов, являются следующие:

  • множество примеров отсутствует и не может быть создано в короткое время;
  • множество примеров существует, но при их создании отсутствовали требования к качеству, например, документы отрубрицированы их авторами, то есть людьми, которые не имеют согласованного взляда на содержание каждой конкретной рубрики;
  • множество примеров противоречиво и (или) недостаточно для большинства рубрик (очень большие классификаторы) - такая ситуация может возникнуть и при едином руководстве ручной рубрикацией;
  • множество примеров для обучения взято из близкой, но другой коллекции.
  • Применение тезауруса для решения сложных задач рубрикации

    В информационной системе УИС РОССИЯ реализована система автоматического рубрицирования, способная рубрицировать тексты различных типов (официальные документы, сообщения информационных агентств, газетные статьи), ее легко можно настроить на новый рубрикатор и новые типы текстов, рубрицирование можно осуществлять сразу по нескольким рубрикаторам.

    Реализация такой гибкой технологии автоматического рубрицирования основывается на определенных способах представления знаний о предметной области и представления текстовой информации:

  • знания о предметной области хранятся в виде иерархической сети в так называемом Тезаурусе по общественно-политической жизни России;
  • рубрикаторы связываются с Тезаурусом посредством небольшого числа опорных терминов, рубрики остальных терминов выводятся по связям внутри Тезауруса, что стало возможным благодаря тщательной предварительной разработке тезаурусных связей, максимально полному отражению различных аспектов описываемых понятий;
  • возможность обрабатывать тексты разных типов и размеров базируется на тематическом представлении содержания текста, которое моделирует основную тему и подтемы документа наборами (тематическими узлами) близких по смыслу терминов документа.
  • Схема описания рубрики

    Каждая рубрика R описывается дизъюнкцией альтернатив, каждый дизъюнкт представляет собой конъюнкцию:

    $$R=\bigcup\limits_{i}D_i;\ \ D_i= \bigcap\limits_j K_{ij}$$

    Конъюнкты, в свою очередь, описываются экспертами с помощью так называемых "опорных" понятий тезауруса. Для каждого опорного понятия задается правило его расширения f(•), определяющее, каким образом вместе с опорным понятием учитывать подчиненные ему по иерархии понятия. Выделяются три случая - без расширения (обозначается символом N ), полное расширение по дереву иерархии тезауруса (символ E ) и расширение только по родо-видовым связям (символ L ).

    (рис 10.9) Схема описания рубрики

    Опорный концепт может быть как "положительным", который добавляет нижерасположенные понятия в описание конъюнкта, так и "отрицательным", который вырезает свои подчиненные понятия. Последовательность учета положительных и отрицательных опорных понятий регулируется заданием специального атрибута. Результатом применения расширения опорных понятий является совокупность понятий тезауруса, полностью описывающая конъюнкт:

    $$K_{ij}=\bigcup\limits_m f_m(c_{ijm})\setminus\bigcup\limits_n f_n(e_{ijn})=\bigcup\limits_k d_{ijk}$$

    Контрольные вопросы

  • Перечислите методы автоматической рубрикации.
  • По каким причинам возникают сложности в задачах автоматической рубрикации текстов?
  • Какие рубрикаторы вам известны? Опишите их характеристики.
  • Страницы:

    10.1. Тезаурус для автоматического концептуального индексирования как особый вид тезауруса

    Отличительные особенности тезауруса для автоматического концептуального индексирования

    Основной целью разработки традиционных информационно-поисковых тезаурусов является использование их единиц (дескрипторов) для описания основных тем документов в процессе ручного индексирования. По своей сути тезаурус для ручного индексирования является искусственным языком описания, построенным на основе естественного языка. При этом сам процесс индексирования по такому тезаурусу базируется на лингвистических, грамматических знаниях, а также знаниях о предметной области, которые имеются у профессиональных индексаторов текстов. Индексатор сначала должен прочитать текст, понять его и затем изложить содержание текста, пользуясь дескрипторами информационно-поискового тезауруса. Индексатор должен хорошо понимать всю терминологию, использованную в тексте, - для описания основной темы текста ему понадобится значительно меньшее количество терминов.

    При автоматической обработке текстов человека - посредника между текстом и описанием его содержания в виде дескрипторов нет. Есть только автоматический процесс и Тезаурус, который должен содержать и те знания, которые содержатся в традиционных информационно-поисковых тезаурусах, и те знания (насколько это возможно), которые использует индексатор для определения основной темы текста.

    Именно поэтому традиционные тезаурусы, разработанные для ручного индексирования, трудно использовать при автоматическом индексировании.

    Разработка тезауруса для автоматического индексирования (далее - АИ тезауруса) характеризуется прежде всего необходимостью описания значительно большего количества слов и словосочетаний, встречающихся в текстах данной предметной области. АИ тезаурус должен не только включать термины, которые представляют важные понятия в текстах данной предметной области, но также охватывать широкий круг более специфических терминов, обнаружение которых в конкретном тексте сделает этот текст релевантным запросу по понятиям более высокого уровня. Например, должны быть описаны не только дескриптор РЫБА и его основные подразделения, такие как МОРСКИЕ РЫБЫ, АНАДРОМНЫЕ РЫБЫ и т.п., но и значительное количество конкретных видов рыб, с тем чтобы текст, обсуждающий проблемы вылова минтая, мог бы быть получен при поиске по термину рыба.

    Синонимические ряды понятий должны быть значительно богаче, чем совокупности вариантов дескриптора в тезаурусе для ручного индексирования, поскольку синонимы должны описывать различные способы выражения данного понятия в тексте для автоматического процесса, а не для человека. Ряды синонимов включают в себя не только существительные и именные группы, а также прилагательные, глаголы и глагольные группы. Расширение терминологической базы АИ-тезауруса ведет к необходимости описания многозначных терминов.

    Расширение понятийной базы тезауруса ведет к увеличению и усложнению функций отношений между понятиями тезауруса (концептуальными отношениями): возникает необходимость логического вывода отношений, поскольку описать отношения всех дескрипторов со всеми близкими дескрипторами АИ-тезауруса становится трудоемким занятием и затрудняет проверку таких описаний.

    Общественно-политический тезаурус как ресурс для автоматического концептуального индексирования текстов

    С 1994 года в АНО ЦИИ (Автономная некоммерческая организация Центр информационных исследований) началась разработка Общественно-политического информационно-поискового тезауруса (русскоязычного) как ресурса для автоматического индексирования. Общественно-политический тезаурус включает в себя терминологию экономической, политической, военной, финансовой, законодательной, социальной, культурной и других сфер деятельности - терминологию, которая встречается в таких общезначимых документах, как официальные и законодательные документы, международные договоры, сообщения информационных агентств и газетные публикации.

    Общественно-политический тезаурус представляет собой иерархическую сеть понятий, каждое из которых имеет ряд текстовых вариантов (способов языкового выражения) и совокупность отношений с другими понятиями тезауруса.

    Предметная область тезауруса - это широкая политематическая область современных общественных отношений, проблем современного общества. Поэтому набор понятий Тезауруса соответствует понятийному содержанию и нормативных документов, и газетных публикаций, и в значительной степени - научных публикаций по общественным наукам.

    С 1995 года Общественно-политический тезаурус активно и успешно применяется для различных приложений автоматической обработки текстов, таких как автоматическое концептуальное индексирование, автоматическое рубрицирование с использованием нескольких рубрикаторов, автоматическое аннотирование текстов.

    В настоящее время Общественно-политический тезаурус включает 33 тысячи понятий, 87 тысяч русскоязычных слов, терминов, выражений, 130 тысяч отношений между понятиями.

    Сравнение Тезауруса Исследовательской службы Конгресса США (LIV) с Общественно-политическим тезаурусом
    ХарактеристикаОбщественно-политический ТезаурусLIV
    Число понятий 33 тысяч 6,8 тысяч
    Число терминов 87 тысяч 9,8 тысяч
    Термины, описанные как многозначные 4,5 тысяч Нет
    Общее количество описанных отношений между понятиями 130 тысяч 15 тысяч
    Количество отношений, полученных по логическим свойствам 700 тысяч Не определено

    Отношения в информационно-поисковых ресурсах: альтернативы

    В связи с обсуждением направлений развития информационно-поисковых тезаурусов и возможностей их эффективного использования в современных технологиях информационного поиска возникает вопрос: как должен измениться набор отношений традиционного информационно-поискового тезауруса, который в подавляющем большинстве случаев включает два отношения - ВЫШЕ-НИЖЕ и АСЦ (ассоциация).

    Часто исследователи обсуждают возможность применения в информационно-поисковых тезаурусах и других ресурсах, предназначенных для информационного поиска, подходов, предлагаемых в рамках онтологических исследований.

    Современные подходы к описанию отношений при разработке онтологий

    Рассмотрим онтологию, предназначенную для работы в информационно-поисковых задачах и содержащую описания понятий предметной области (отношения между понятиями задаются в виде предикатов). Пусть свойства отношений (аксиомы вывода) описываются как правила вида if P(x1,:,xn) then Q(y1,:,ym).

    Чтобы инициализировать эти правила, необходимо быть уверенным, что P(x1,:,xn) определяется с высокой точностью. При современном уровне развития систем автоматической обработки текстов в большой разнородной коллекции не для любых типов предикатов P(x1,:,xn) можно гарантировать приемлемый уровень точности и полноты их нахождения.

    Например, различные аргументы предиката P(x1,:,xn) могут оказаться в разных частях длинного предложения, что значительно усложнит сборку предиката, или в разных предложениях текста, например, из-за использования эллиптической конструкции или местоимения и т.п. Проблемы с правильной идентификацией аргументов предикатов в текстах могут свести к нулю возможные преимущества применения знаний, описанных в онтологиях, по сравнению с пословным поиском.

    Среди потенциального множества отношений понятия наиболее стабильно можно опираться на те отношения, которые не исчезают, не меняются в течение всего срока существования любого или подавляющего большинства экземпляров понятия. Например, любой лес всегда состоит из деревьев.

    Наиболее известным типом отношения, которое выполняется для всех экземпляров, является таксономическое отношение. Так, если С1 упомянуто в тексте и С1 является видом С2, это означает, что в тексте упомянуто и С2. Если данный текст релевантен запросу о С1, то он будет релевантен и запросу о С2.

    В условиях невозможности использования сложных правил вывода для осуществления вывода по тексту желательно найти другие типы отношений, обладающие свойствами транзитивности и наследования, подобно таксономическим отношениям. Проблема рассмотрения взаимного сосуществования понятий является центральной в теории зависимости философской дисциплины "формальная онтология".

    Отношения онтологической зависимости

    Теория зависимости является одним из основных инструментов анализа сущностей в рамках философской дисциплины - онтологии. Главный вопрос теории зависимости: может ли сущность ( С1 ) существовать сама по себе или подразумевает существование чего-либо еще ( С2 ).

  • Строгая зависимость: существование одной сущности С1 подразумевает ли существование какой-либо конкретной сущности С2?

    Например, кипение ( С1 ) невозможно без существования конкретного объема жидкости ( С2 ), которая кипит.

  • Зависимость от класса: существование сущности С1 предполагает ли существование примеров (экземпляров) некоторого класса сущностей С2?

    Например, возникновение понятия гараж ( С1 ) невозможно без существования понятия автомобиль ( С2 ) как класса, хотя конкретный гараж может строиться безотносительно к конкретному автомобилю.

  • Историческая зависимость: существование сущности С1 в некоторый момент времени T1 предполагает ли существование сущности C2 в некоторый другой момент времени T2?

    Например, понятие солома ( С1 ) исторически зависит от понятия молотьба ( С2 ), поскольку солома не может возникнуть без предварительного процесса молотьбы; вместе с тем эти работы заканчиваются, а солома длительное время продолжает существовать.

  • Перечисленные выше типы отношений онтологической зависимости упорядочены по мере снижения объема пересечения сфер существования зависящего понятия и главного понятия.

    При строгой зависимости зависимое понятие не может быть оторвано от конкретного экземпляра главного понятия, поэтому если возникает, существует, обсуждается конкретный пример такого жестко зависимого понятия, то существует и обсуждается пример главного понятия.

    В случае зависимости от класса конкретный пример зависимого понятия может быть оторван от главного понятия, с ним может происходить что-то, не связанное с главным понятием, но обычно недолго и в относительно небольшой доле примеров зависимого понятия - например, в гараже может быть совершено преступление и оно может не иметь никакого отношения к автомобилям.

    При исторической зависимости пример зависимого понятия может достаточно долго существовать без главного понятия и участвовать в самых разных ситуациях, - например, сельскохозяйственная продукция создается в процессе сельскохозяйственного производства, затем продукция значимое время живет "своей жизнью": перевозится, продается, хранится.

    Подход к описанию отношений в Общественно-политическом тезаурусе

    Набор отношений в Общественно-политическом тезаурусе специально подобран для эффективной работы в информационно-поисковых приложениях. Имеется четыре основных типа отношения.

  • Первый тип отношений - родо-видовое отношение НИЖЕ-ВЫШЕ, оно обладает свойствами транзитивности и наследования.
  • Второе тип отношений - отношение ЧАСТЬ-ЦЕЛОЕ. Используется не только для описания физических частей, но и для других внутренних сущностей понятия, таких как свойства или роли для ситуаций. Важным условием при установлении этого отношения является то, что понятия-части должны быть жестко связаны со своим целым, то есть каждый пример понятия-части должен в течение всего времени своего существования являться частью для понятия-целого и не относиться к чему-либо другому. В этих условиях удается выполнить свойство транзитивности введенного таким образом отношения ЧАСТЬ-ЦЕЛОЕ, что очень важно для автоматического вывода в процессе автоматической обработки текстов.
  • Еще один тип отношения, называемый несимметричной ассоциацией ( АСЦ2-АСЦ1 ), связывает два понятия, которые не могут быть связаны вышерассмотренными отношениями, но одно из них не существовало бы без другого. Например, понятие САММИТ требует существования понятия ГЛАВА ГОСУДАРСТВА.
  • Последний тип отношений - симметричная ассоциация - связывает, например, понятия, очень близкие по смыслу, но такие, которые разработчики не решились склеить в одно понятие.
  • Отношения ВЫШЕ-НИЖЕ, ЧАСТЬ-ЦЕЛОЕ и несимметричная ассоциация являются иерархическими отношениями. Таким образом, на основе свойств иерархичности, транзитивности и наследования для каждого понятия может быть определена совокупность понятий, которые являются для него нижестоящими понятиями по иерархии.

    Таким образом, два отношения в тезаурусе из четырех существенно связаны с понятием онтологической зависимости. В количественном отношении эти два отношения занимают приблизительно половину из всех отношений тезауруса.

    Нарушение условий надежности

    Если условия надежности выполняются почти всегда, по умолчанию, то применяются специальные пометки - модификаторы отношений, что означает, что отношение более слабое. В связи с этим вводятся ограничения по транзитивности.

    Используются два модификатора:

  • модификатор В ("возможно") - отношение выполняется не для всех примеров;
  • модификатор А ("аспект", точка зрения) - отношение существует не все время.
  • Например,

    ПЕНСИОНЕР
    	ВЫШЕ_В		СТАРЫЙ ЧЕЛОВЕК
    	ЦЕЛОЕ_А		ПЕНСИОННАЯ СИСТЕМА

    Сравнение используемого отношения ЧАСТЬ-ЦЕЛОЕ с другими подходами

    Наиболее близким по такой трактовке отношений ЧАСТЬ-ЦЕЛОЕ является онтология Дж. Совы (John Sowa). Описывая классификацию ролей и отношений в своей онтологии верхнего уровня, автор рассматривает случаи зависимости (prehension) понятий друг от друга. Зависимость может быть внешняя (extrinsic) и внутренняя (intrinsic). Если одна сущность в отношении зависимости может исчезнуть, не меняя форму или существование другой сущности, это означает, что это отношение внешнее. Если исчезновение одной из сущностей меняет структуру или существование другой сущности, то это отношение внутреннее.

    Основным видом внутренне зависимых сущностей являются компоненты. Среди компонентов выделяются части и свойства. Части делятся на физические части, участников и стадии, а свойства - на атрибуты и способы.

    Таким образом, Sowa также объединяет в один куст отношений такие отношения, как физические части, участники, стадии, свойства, по свойству внутренней зависимости.

    Разработка Общественно-политического тезауруса как ресурса для автоматической обработки текстов. Соединение трех существующих традиций. Общественно-политический тезаурус как лингвистическая онтология

    Мы видим, что Общественно-политический тезаурус представляет собой лингвистическую онтологию, которая строится на сочетании трех различных традиций и методологий:

  • методологии разработки традиционных информационно-поисковых тезаурусов;
  • методологии разработки лингвистических ресурсов типа WordNet;
  • методологии созданий формальных онтологий.
  • Поскольку предполагается работать с терминологией, большими предметными областями и свободными текстами, то важно использовать опыт разработки информационно-поисковых тезаурусов, а именно:

  • информационно-поисковый контекст;
  • единицы онтологии создаются на основе значений терминов;
  • описание большого числа многословных выражений, принципы включения/невключения многословных единиц;
  • небольшой набор отношений между понятийными единицами.
  • Так как предполагается применять онтологию в автоматическом режиме обработки текстов, то необходимо использовать методологию разработки лексических ресурсов типа WordNet, в которой важны следующие положения:

  • понятия онтологии создаются на основе значений реально существующих языковых выражений - терминов ;
  • многоступенчатое иерархическое построение лексико-терминологической системы понятий;
  • принципы описания значений многозначных слов и выражений.
  • Из методологии разработки формальных онтологий важны следующие положения:

  • разработка лингвистической онтологии как иерархической системы понятий;
  • включение в состав отношений тезауруса отношений онтологической зависимости, которые описывают зависимость существования понятия или примеров понятия от существования других понятий (примеров понятия). Показано, что применение таких отношений в лингвистическом ресурсе эффективно для решения задач информационного поиска;
  • в качестве аксиом (правил вывода) - использование свойств транзитивности и наследования таксономических отношений и транзитивности отношений онтологической зависимости.
  • Контрольные вопросы

  • В чем состоят отличительные особенности Тезауруса для автоматического концептуального индексирования?
  • Каковы возможные способы установление отношений в тезаурусах?
  • Что такое отношения онтологической зависимости?
  • 10.2. Тезаурус для автоматического концептуального индексирования как ресурс для решения информационно-поисковых задач

    С 1995 года Общественно-политический тезаурус используется в таких областях автоматической обработки текстов, как автоматическое концептуальное индексирование, автоматическая рубрикация текстов, автоматическое аннотирование текстов. Все эти применения тезауруса базируются на тематическом представлении текста, моделирующем тематическую структуру документа на базе узлов близких по смыслу терминов.

    Совокупность этапов, преобразующих исходный текст в тематическое представление, называется Автоматической Лингвистической Обработкой Текста (АЛОТ).

    (рис 10.1) Обработка документов в УИС РОССИЯ

    Тезаурус и технология автоматического построения тематического представления содержания документа позволили развить в рамках УИС РОССИЯ (Университетской информационной системе РОССИЯ, uisrussia.msu.ru) гибкую технологию эффективной автоматической рубрикации текстов. Созданные системы автоматической рубрикации работают с такими рубрикаторами, как рубрикатор исследовательской службы конгресса США, общеправовым тематическим классификатором Центральной избирательной комиссии РФ, классификатором правовых актов РФ. Всего было внедрено шесть различных систем автоматической рубрикации с разными рубрикаторами размером от 35 до 1200 рубрик.

    Знания, описанные в Тезаурусе, а также технология построения тематического представления позволили создать систему автоматического аннотирования текстов. В 1998 году программа автоматического аннотирования англоязычных текстов участвовала в соревнованиях в рамках конференции SUMMAC, где эта программа получила лучшие результаты в номинации "Индикативная аннотация наилучшей длины".

    Тезаурус используется как инструмент для автоматического концептуального индексирования и ранжированного информационного поиска в УИС РОССИЯ.

    АЛОТ: основные этапы

    На первом этапе работы алгоритма происходит сравнение единиц текста с единицами Тезауруса. Сравнение текста и Тезауруса происходит на основе морфологического представления единиц текста и единиц Тезауруса. Из множества найденных в тексте единиц Тезауруса выбирается единица, имеющая максимальную длину. Если один и тот же фрагмент текста соответствует разным единицам Тезауруса, то фиксируется многозначность термина.

    В результате сопоставления с Тезаурусом текст отражается в последовательность дескрипторов Тезауруса. Все синонимы (варианты) одного и того же дескриптора отображаются в соответствующий дескриптор и далее не различаются. Для каждого дескриптора фиксируется частота его встречаемости в тексте.

    (рис 10.2) Покрытие терминологией Тезауруса лексики НА РФ. На примере документа "Постановление Правительства РФ от 26 июня 1995 г. № 604"

    Чтобы определить тезаурусные связи между дескрипторами текста, необходимо найти те пары дескрипторов, которые описаны в тезаурусных статьях друг друга. Но этого недостаточно. Необходимо также найти и такие пары дескрипторов текста, связи между которыми выводятся по свойствам транзитивности и наследования. Совокупность связанных между собой дескрипторов текста, полученных в результате применения процедуры вывода, называется проекцией Тезауруса на текст - тезаурусной проекцией .

    Таким образом, два дескриптора текста D1 и D2 оказываются непосредственно связанными в тезаурусной проекции, если:

  • эти дескрипторы D1 и D2 находятся в одной тезаурусной статье;
  • и между дескрипторами D1 и D2 существует путь в Тезаурусе, который состоит:
  • либо только из связей ВЫШЕ и ЦЕЛОЕ (в этому случае говорят, что дескрипторы D1 и D2 связаны по транзитивности связей ВЫШЕ и ЦЕЛОЕ );
  • либо из связей ВЫШЕ и ЦЕЛОЕ и одной связи АССОЦИАЦИЯ (в этому случае говорят, что дескрипторы D1 и D2 связаны по свойству наследования связи АССОЦИАЦИЯ связями ВЫШЕ и ЦЕЛОЕ ).
  • В построении тезаурусной проекции равным образом участвуют все дескрипторы, соответствующие неоднозначному термину. На основе тезаурусной проекции производится выбор дескриптора, соответствующего определенному значению термина. Для каждого значения неоднозначного термина проверяется:

  • употреблялись ли в данном тексте наряду с неоднозначным термином однозначные термины, соответствующие дескриптору, который выражает это значение неоднозначного термина;
  • имеет ли дескриптор, соответствующий этому значению неоднозначного термина, тезаурусные связи с другими дескрипторами проекции.
  • Если выполняется одно из вышеперечисленных условий, то считается, что "текст поддерживает" данное значение неоднозначного термина. Если текст "поддерживает" только одно значение неоднозначного термина, то выбирается соответствующий ему дескриптор.

    Если текст "поддерживает" дескрипторы, соответствующие разным значениям термина, то для каждого вхождения неоднозначного термина рассматриваются ближайшие по тексту дескрипторы, для них проверяются вышеуказанные условия и выбирается тот дескриптор неоднозначного термина, который "поддерживается" первым из ближайших по тексту дескрипторов.

    Теоретические основы построения тематического представления

    Популярной теорией в области автоматической обработки текстов является теория Т.А. ван Дейка - В.Кинча, которая указывает, что основная тема текста может быть описана некоторой пропозицией. Такая пропозиция называется макропропозицией. Основное содержание текста может быть представлено как иерархическая структура в том смысле, что тема всего текста может быть обычно описана посредством более конкретных тем текста, которые, в свою очередь, могут быть охарактеризованы посредством еще более конкретных подтем и т.п. Каждое предложение связного текста посвящено раскрытию той или иной подтемы основной темы текста.

    Второе направление исследований базируется на автоматическом выявлении лексической связности текста. Какими бы отношениями не были связаны между собой предложения текста, часть слов, входящих в состав этих предложений, должны быть лексически связаны между собой, причем эти отношения между словами заранее известны автору и читателю текста.

    Действительно, формулировка основной темы текста содержит некоторую совокупность слов, наиболее значимых для передачи содержания текста. Если рассмотреть текст, то можно видеть, что слова, близкие по смыслу к словам основной темы, образуют лексические цепочки, которые пронизывают весь текст. Естественно предположить, что если имеется лингвистический ресурс, в котором описаны разнообразные смысловые связи между словами, то можно двигаться по тексту, находить связанные по смыслу слова, формировать лексические цепочки. Самые частотные (или выделенные по другим критериям) цепочки могли бы показать, чему именно посвящен конкретный текст.

    Предположим, что мы сформулировали основную тему некоторого текста. В ней упомянуты некоторые понятия и/или конкретные объекты текста. Подтемы текста раскрывают взаимоотношения между этими основными понятиями/объектами и поэтому должны тем или иным образом ссылаться на них, используя повторы слов, синонимы или другие слова, семантически связанные с понятиями основной темы (далее основные понятия текста). Таким образом, основным понятиям текста соответствуют некоторые совокупности слов текста (и совокупность понятий, стоящих за этими словами), которые используются в данном тексте для ссылки на эти основные понятия. Такие совокупности слов обычно пронизывают весь текст "красной нитью".

    Если подтема текста раскрывается в более специфических подтемах, то для ссылки на основные понятия этой подтемы, в свою очередь, возникают более короткие "нити" слов. Таким образом, начало лексической цепочки нужно связывать не с началом текста, а с наиболее важным для содержания текста понятием, которое должно стать центром этой цепочки, а все элементы лексической цепочки должны быть прежде всего связаны лексическим отношением именно с этим центром (последователями подхода на основе WordNet также обсуждается необходимость нахождения центра лексической цепочки, правда, уже после ее формирования).

    Предполагается, что более важные для текста понятия чаще всего так или иначе выделены в тексте относительно других близких им по смыслу понятий (например, частотностью, упоминанием в заголовке текста). Структура, в которой все понятия связаны по тезаурусу с одним и тем же понятием, называется тематическим узлом , а главное понятие тематического узла - тематическим центром. Собственно расположение в тексте слов, соответствующих этим тематическим узлам, и создает эффект лексических цепочек.

    (рис 10.3) Сеть тематических узлов документа "Постановление Правительства РФ от 26 июня 1995 г. № 604"

    Построение тематических узлов

    Каждая тема, обсуждаемая в тексте, выражается обычно не одним термином, а совокупностью тематически близких терминов. Например, тема науки может развиваться в тексте посредством следующих терминов: математика, физика, прикладное исследование, фундаментальное исследование, научный работник. Тот термин, который наиболее точно характеризует развиваемую в тексте тему, обычно некоторым образом выделен из всей совокупности тематически близких терминов: может быть употреблен в заголовке и/или в начале текста, иметь максимальную частотность среди других тематически близких терминов.

    Главным термином темы может стать любой термин Тезауруса, независимо от его уровня общности/специфичности. Так, главным термином темы текста может стать термин математика, если речь в тексте идет о развитии математики; или главным термином может стать термин научный работник, если речь в тексте идет об оплате труда научных работников или о выезде ученых за рубеж.

    Напомним, что совокупность тематически связанных между собой дескрипторов с выделенным среди них главным дескриптором называется тематическим узлом .

    Тематическая связанность терминов отображается в связях между соответствующими дескрипторами в тезаурусной проекции. Тезаурусная проекция обычно состоит из нескольких фрагментов связанных между собой дескрипторов. Каждый такой связный фрагмент может иметь достаточно сложную структуру, и в него могут входить далекие друг от друга дескрипторы. Таким образом, чтобы выделить тематические узлы, необходимо провести дополнительное разбиение тезаурусной проекции.

    Как показали эксперименты, наиболее эффективно проводить разбиение следующим образом.

    Создание тематического узла начинается с выбора главного дескриптора тематического узла. Сначала тематические узлы собираются вокруг дескрипторов заголовка и первого предложения текста. Затем тематические узлы собираются для остальных дескрипторов, начиная с самых частотных. Те дескрипторы, которые уже попали в тематический узел некоторого дескриптора, свой тематический узел не образуют.

    После того как выбран главный дескриптор очередного тематического узла, в тематический узел включаются дескрипторы, непосредственно связанные с главным дескриптором тематического узла в тезаурусной проекции, и дескрипторы, связанные с главным дескриптором посредством такой совокупности тезаурусных связей, которые можно свести к одной связи путем применения свойств транзитивности и наследования.

    Выделение основных тематических узлов

    Для выявления основных тематических узлов производятся следующие процедуры:

  • в процессе сопоставления текста с тезаурусом для каждого понятия тезауруса, найденного в тексте, запоминаются его соседи - понятия влево и вправо. В экспериментах было установлено, что фиксация трех соседей вправо и влево представляется оптимальной. Такие пары понятий текста мы называем текстовыми связями понятия. Знак абзаца прерывает набор текстовых связей;
  • текстовые связи разных вхождений понятия в тексте суммируются. В результате мы получаем частотность текстовых связей понятий между собой;
  • в процессе создания тематических узлов текстовые связи каждого понятия в узле суммируются и получаются текстовые связи тематических узлов;
  • выбираются три тематических узла, суммарная частотность попарных текстовых связей между которыми является максимальной среди других треугольников текста. Это и есть первая тройка основных тематических узлов в тексте - центры этих основных тематических узлов являются элементами основной темы документа;
  • далее необходимо проверить, нет ли еще элементов основной темы документа. Для этого среди оставшихся тематических узлов отыскиваются тематические узлы, которые имеют текстовые связи как с уже полученными основными тематическими узлами, так и между собой;
  • таким образом, совокупность основных тематических узлов получена. Их текстовые связи образуют между собой симплексы - фигуры, в которых каждая вершина имеет ребро с другой вершиной (треугольник, пирамида и т.п.). Важная особенность выявления основных тематических узлов на основе симплексов текстовых связей - независимость процесса от размера, жанра и языка обрабатываемых текстов.
  • Эксперименты показали, что тематическое представление может быть построено для текстов любого размера и разнообразных типов. Тематические представления были построены для более 100 Мб официальных документов Российской Федерации, международных договоров, для большинства российских законов 1990-1997 гг. Тематические представления были также построены для более 50 Мб сообщений информационных агентств и газетных статей. Размеры обрабатываемых документов варьировались от 500 байт до более 500 Кб (Гражданский Кодекс Российской Федерации, Таможенный кодекс Российской Федерации).

    (рис 10.4) Структура тематического представления

    Тезаурус как поисковый механизм УИС РОССИЯ

    Тезаурус существенно используется в интерфейсе УИС РОССИЯ для следующих задач терминологического поиска:

  • уточнения запроса, когда выбор более точного термина позволяет получать только требуемые документы, например, выбирая вместо всех типов СТРОИТЕЛЬСТВА именно ДОРОЖНОЕ СТРОИТЕЛЬСТВО (автодорожное строительство, дорожно-строительные работы, строительство дорог, строительно-дорожный и т.д.);
  • автоматического расширения запроса по синонимам ( НАЛОГОВАЯ СИСТЕМА - НАЛОГОВЫЙ РЕЖИМ ), а также по иерархии ( МИГРАЦИЯ - БЕЖЕНЦЫ, ВЫНУЖДЕННЫЕ ПЕРЕСЕЛЕНЦЫ и т.д.).
  • Структурная тематическая аннотация

    Структурная тематическая аннотация представляет содержание текста посредством описания его основных тем, которые моделируются совокупностью терминов, относящихся к этим темам. Структурная тематическая аннотация содержит наиболее информативные фрагменты тематического представления текста, которое включает все термины текста, разбитые на тематические узлы и отношения между различными темами и подтемами текста.

    Автоматическое построение связной аннотации

    Знания человека о тематической связности между терминами вытекают из знаний о предметной области, в рамках которой написан текст. Таким образом, то новое и важное, что несет в себе текст и что должна отразить в себе аннотация, - это именно то, каким образом взаимодействуют между собой разные основные темы текста.

    Отсюда следует первый принцип составления аннотаций: важными (информативными) и, следовательно, возможно включенными в аннотацию считаются те предложения текста, которые содержат по крайней мере два термина, входящих в состав разных основных тем текста.

    Предложений, содержащих термины одних и тех же двух основных тем, в тексте может оказаться достаточно много. Для аннотации необходимо выделить одно предложение, в котором взаимодействие этих двух тем характеризуется "наилучшим образом".

    Чтобы понять, что значит "наилучшим образом", рассмотрим, как та или иная тема развивается в тексте. Не все основные темы начинают обсуждаться в тексте сразу, с первого предложения, - часть из них возникает в последующих предложениях. Чтобы сохранить связность и последовательность изложения текста, автор именно в этом первом предложении новой темы должен наиболее точно указать связь новой темы со всем предшествующим текстом.

    Таким образом, второй принцип составления аннотаций - для каждой пары выявленных основных тем текста выбрать в аннотацию те предложения, в которых эта пара обсуждалась первый раз, следуя по порядку текста.

    Нужно отметить, что при хорошем покрытии предметной области Тезаурусом появление в очередном предложении новой темы выявляется весьма точно, а это означает, что связность получаемой аннотации в среднем весьма высока.

    Контрольные вопросы

  • Перечислите этапы автоматической обработки текстов на основе Тезауруса.
  • Как моделируется связность текста?
  • Каков принцип построения связной аннотации текста?
  • 10.3. Технология автоматической рубрикации текстов с использованием тезауруса для автоматического концептуального индексирования

    Задачей систем автоматического рубрицирования является разбиение поступающего потока текстов на тематические подпотоки в соответствии с заранее заданными рубриками.

    Дадим некоторые определения.

    Под рубрикатором понимается классификационная таблица иерархической классификации, содержащая полный перечень включенных в систему классов и предназначенная для систематизации информационных фондов, массивов и изданий, а также для поиска в них (ГОСТ 7.74-96).

    Предметная рубрика - элемент информационно-поискового языка, представляющий собой краткую формулировку темы на естественном языке.

    Адекватная предметная рубрика - предметная рубрика, формулировка которой выражает объем понятия, наиболее точно соответствующего объему понятия о предмете документа.

    При составлении рубрикатора:

  • каждый документ предметной области должен иметь соответствующую предметную рубрику;
  • не должно быть рубрик, которым соответствует относительно малое количество документов;
  • рубрики по возможности должны быть четко отделены друг от друга. Для близких по содержанию рубрик лучше иметь краткие комментарии и четко различать, в каких случаях проставлять одну из рубрик, в каких случаях - обе рубрики.
  • Критерии оценки качества рубрицирования

    Для оценки эффективности работы систем рубрицирования используются такие характеристики, как точность и полнота.

    Точность (precision) - это отношение $$p=R/L$$, где $$R$$ - количество текстов, правильно отнесенных системой к некоторой рубрике, а $$L$$ - общее количество текстов, отнесенных системой к этой рубрике.

    Полнота (recall) - это отношение $$r=R/Q$$, где $$R$$ - количество текстов, правильно отнесенных системой к некоторой рубрике, а $$Q$$ - общее количество текстов, которые должны быть отнесены к этой рубрике.

    Проблемы ручного рубрицирования

    Характерными особенностями ручного рубрицирования являются:

  • высокая точность рубрицирования.

    Обычно процент документов, в которых проставлена явно неправильная рубрика, чрезвычайно мал;

  • низкая полнота рубрицирования.

    Обычно специалисты по рубрикации проставляют одну-две основных рубрики, характеризующие основное содержание документа, хотя документ может быть отнесен и к ряду других рубрик. В результате получается, что при сравнении результатов рубрикации разными экспертами одних и тех же документов процент совпадения проставленных рубрик может оказаться весьма низким - 60%. Это приводит к тому, что похожие документы могут получить достаточно разные наборы рубрик. Такая ситуация усугубляется при увеличении величины и иерархической сложности рубрикатора. Непоследовательность ручного рубрицирования становится серьезной проблемой для настройки разного типа систем автоматического рубрицирования, поскольку затрудняется построение формальных правил отнесения документов к той или иной рубрике;

  • низкая скорость обработки документов.
  • Методы автоматической рубрикации

    Наиболее эффективными, но и наиболее трудозатратными являются методы автоматического рубрицирования, основанные на знаниях. При рубрицировании текстов на основе знаний используются заранее сформированные базы знаний, в которых описываются языковые выражения, соответствующие той или иной рубрике, правила выбора между рубриками и др.

    Другим классом методов для автоматической рубрикации текстов являются методы машинного обучения, которые в качестве обучающих примеров используют заранее отрубрицированные вручную тексты.

    Приводятся очень высокие оценки результатов работы методов машинного обучения, время обучения составляет доли секунд. Однако при ближайшем рассмотрении оказывается, что практически все такие методы тестируются на одной и той же текстовой коллекции - это коллекция финансовых сообщений информационного агентства Рейтер, которая была специально создана несколько лет назад для тестирования методов автоматической рубрикации текстов.

    Эта коллекция характеризуется следующими основными чертами:

  • рубрикатор, включающий 135 рубрик, относительно прост, без иерархии;
  • небольшие по величине тексты принадлежат достаточно узкой области финансовых известий;
  • для обучения представляется более 15 тысяч отрубрицированных документов;
  • подавляющее большинство документов относится к приблизительно 20 рубрикам рубрикатора.
  • Все эти особенности коллекции значительно упрощают решение задачи машинного обучения автоматической рубрикации текстов.

    Проблемы автоматического рубрицирования

    Проблемы автоматического рубрицирования связаны со следующими обстоятельствами:

  • для автоматической рубрикации нужно сначала так или иначе создать образ рубрики как некоторое выражение на основе слов и (или) терминов реальных текстов. Это может быть сделано на основе экспертного описания рубрики или методов машинного обучения по уже отрубрицированным коллекцям;
  • при автоматической обработке конкретных текстов могут возникнуть достаточно серьезные проблемы анализа языкового материала, контекста употребления того или иного слова, требующие привлечения обширных знаний о языке и предметной области, которые очень трудно описать в действующих программных системах автоматической рубрикации.
  • Типы ошибок автоматического рубрицирования

  • Появление "лишних рубрик" - то есть в процессе автоматического рубрицирования документ был отнесен к ошибочной рубрике, не соответствующей содержимому документа. Причины этого могут быть разные:
  • Содержание рубрики сложнее, чем это выглядит по формулировке.

    Например, если рубрика в рубрикаторе новостей называется "Выборы", то обычно не считается правильным, если к этой рубрике будет отнесен текст о выборах президента UEFA.

  • Лексическая многозначность.

    Текст отнесен не к той рубрике из-за того, что некоторые слова, сопоставленные рубрике, в конкретном тексте употреблены в другом значении - таком, которое не соответствует данной рубрике.

  • Ложная корреляция.

    Ложная корреляция может возникнуть в случаях, когда для отнесения текста к рубрике необходимо присутствие в тексте двух логических элементов. Например, для рубрицирования по рубрике "Экономические реформы" необходимо присутствие в тексте двух тематических элементов - темы экономики и темы реформы. Ложная корреляция и, соответственно, неправильное отнесение текста к данной рубрике возникает в тех случаях, когда такие тематические элементы присутствуют в тексте, но не имеют отношения друг к другу, например, такая ситуация может произойти, если в тексте речь шла о судебной реформе и были упомянуты некоторые экономические вопросы.

  • Рубрикация по несущественному элементу.

    Текст отнесен к рубрике по слову или словосочетанию, которое по сути соответствует содержанию рубрики, но в данном тексте это опорное слово или словосочетание употреблено случайно или в каком-то специфическом контексте, из-за чего текст становится нерелевантным рубрике.

    Например, текст может быть отнесен к рубрике "Средства массовой информации" на основе следующего фрагмента: Около 40 человек умерли во Франции в результате установившейся в стране жары: Правительство и средства массовой информации следят за ситуацией:"

  • Пропуск правильных рубрик - то есть в процессе автоматического рубрицирования документ не был отнесен к какой-либо из рубрик, которая на самом деле имеет отношение к содержимому документа. Причины тоже могут быть разные:
  • Нехватка базы описания рубрики.

    Правильная рубрика не определена, поскольку в тексте упомянуты слова, не описанные в словаре системы рубрицирования.

  • Лексическая многозначность.

    Может стать причиной потери правильной рубрики для рубрикации.

  • Слишком сложная структура документа.

    Может привести к пропуску правильной рубрики при автоматической рубрикации, например, если в состав документа входит заголовок и большая таблица, при этом все информация для правильного отнесения текста к рубрике содержится только в заголовке.

  • Методы машинного обучения в задачах рубрикации

    В задаче рубрикации текстов используются различные методы машинного обучения, иллюстрируемые следующими рисунками (рис. 10.5-10.8).

    (рис 10.6) Отсечение по центрам тяжести(рис 10.5) Отсечение по ближайшим соседям (kNN)(рис 10.8) Отсечение по ближайшим точкам (SVM)(рис 10.7) Оптимальный линейный сепаратор SVM (Support Vector Machines). Оптимизация по критерию максимизации расстояния между двумя параллельными поддерживающими плоскостями

    Сложные задачи автоматической рубрикации текстов

    Реальные задачи рубрикации текстов в значительной мере отличаются от задачи классификации сообщений на тестовой коллекции агентства Рейтер. На практике, если перед достаточно большой компанией встает задача автоматической рубрикации текстов, то обычно используются автоматизированные технологии, основанные на ручном подборе лексики под каждую рубрику рубрикатора с последующим контролем результатов рубрицирования.

    Факторами, усложняющими или делающими невозможным применение методов машинного обучения для автоматической рубрикации текстов, являются следующие:

  • множество примеров отсутствует и не может быть создано в короткое время;
  • множество примеров существует, но при их создании отсутствовали требования к качеству, например, документы отрубрицированы их авторами, то есть людьми, которые не имеют согласованного взляда на содержание каждой конкретной рубрики;
  • множество примеров противоречиво и (или) недостаточно для большинства рубрик (очень большие классификаторы) - такая ситуация может возникнуть и при едином руководстве ручной рубрикацией;
  • множество примеров для обучения взято из близкой, но другой коллекции.
  • Применение тезауруса для решения сложных задач рубрикации

    В информационной системе УИС РОССИЯ реализована система автоматического рубрицирования, способная рубрицировать тексты различных типов (официальные документы, сообщения информационных агентств, газетные статьи), ее легко можно настроить на новый рубрикатор и новые типы текстов, рубрицирование можно осуществлять сразу по нескольким рубрикаторам.

    Реализация такой гибкой технологии автоматического рубрицирования основывается на определенных способах представления знаний о предметной области и представления текстовой информации:

  • знания о предметной области хранятся в виде иерархической сети в так называемом Тезаурусе по общественно-политической жизни России;
  • рубрикаторы связываются с Тезаурусом посредством небольшого числа опорных терминов, рубрики остальных терминов выводятся по связям внутри Тезауруса, что стало возможным благодаря тщательной предварительной разработке тезаурусных связей, максимально полному отражению различных аспектов описываемых понятий;
  • возможность обрабатывать тексты разных типов и размеров базируется на тематическом представлении содержания текста, которое моделирует основную тему и подтемы документа наборами (тематическими узлами) близких по смыслу терминов документа.
  • Схема описания рубрики

    Каждая рубрика R описывается дизъюнкцией альтернатив, каждый дизъюнкт представляет собой конъюнкцию:

    $$R=\bigcup\limits_{i}D_i;\ \ D_i= \bigcap\limits_j K_{ij}$$

    Конъюнкты, в свою очередь, описываются экспертами с помощью так называемых "опорных" понятий тезауруса. Для каждого опорного понятия задается правило его расширения f(•), определяющее, каким образом вместе с опорным понятием учитывать подчиненные ему по иерархии понятия. Выделяются три случая - без расширения (обозначается символом N ), полное расширение по дереву иерархии тезауруса (символ E ) и расширение только по родо-видовым связям (символ L ).

    (рис 10.9) Схема описания рубрики

    Опорный концепт может быть как "положительным", который добавляет нижерасположенные понятия в описание конъюнкта, так и "отрицательным", который вырезает свои подчиненные понятия. Последовательность учета положительных и отрицательных опорных понятий регулируется заданием специального атрибута. Результатом применения расширения опорных понятий является совокупность понятий тезауруса, полностью описывающая конъюнкт:

    $$K_{ij}=\bigcup\limits_m f_m(c_{ijm})\setminus\bigcup\limits_n f_n(e_{ijn})=\bigcup\limits_k d_{ijk}$$

    Контрольные вопросы

  • Перечислите методы автоматической рубрикации.
  • По каким причинам возникают сложности в задачах автоматической рубрикации текстов?
  • Какие рубрикаторы вам известны? Опишите их характеристики.
  • Вернуться к учебному плану