Основной целью разработки традиционных
При автоматической обработке текстов человека - посредника между текстом и описанием его содержания в виде дескрипторов нет. Есть только автоматический процесс и Тезаурус, который должен содержать и те знания, которые содержатся в традиционных информационно-поисковых тезаурусах, и те знания (насколько это возможно), которые использует индексатор для определения основной темы текста.
Именно поэтому традиционные тезаурусы, разработанные для ручного индексирования, трудно использовать при автоматическом индексировании.
Разработка тезауруса для автоматического индексирования (далее - АИ тезауруса) характеризуется прежде всего необходимостью описания значительно большего количества слов и словосочетаний, встречающихся в текстах данной предметной области. АИ тезаурус должен не только включать термины, которые представляют важные понятия в текстах данной предметной области, но также охватывать широкий круг более специфических терминов, обнаружение которых в конкретном тексте сделает этот текст релевантным запросу по понятиям более высокого уровня. Например, должны быть описаны не только дескриптор РЫБА и его основные подразделения, такие как МОРСКИЕ РЫБЫ, АНАДРОМНЫЕ РЫБЫ и т.п., но и значительное количество конкретных видов рыб, с тем чтобы текст, обсуждающий проблемы вылова минтая, мог бы быть получен при поиске по термину рыба.
Синонимические ряды понятий должны быть значительно богаче, чем совокупности вариантов дескриптора в тезаурусе для ручного индексирования, поскольку синонимы должны описывать различные способы выражения данного понятия в тексте для автоматического процесса, а не для человека. Ряды синонимов включают в себя не только существительные и именные группы, а также прилагательные, глаголы и глагольные группы. Расширение терминологической базы АИ-тезауруса ведет к необходимости описания многозначных терминов.
Расширение понятийной базы тезауруса ведет к увеличению и усложнению функций отношений между понятиями тезауруса (концептуальными отношениями): возникает необходимость логического вывода отношений, поскольку описать отношения всех дескрипторов со всеми близкими дескрипторами АИ-тезауруса становится трудоемким занятием и затрудняет проверку таких описаний.
С 1994 года в АНО ЦИИ (Автономная некоммерческая организация Центр информационных исследований) началась разработка Общественно-политического информационно-поискового тезауруса (русскоязычного) как ресурса для автоматического индексирования. Общественно-политический тезаурус включает в себя терминологию экономической, политической, военной, финансовой, законодательной, социальной, культурной и других сфер деятельности - терминологию, которая встречается в таких общезначимых документах, как официальные и законодательные документы, международные договоры, сообщения информационных агентств и газетные публикации.
Общественно-политический тезаурус представляет собой иерархическую сеть понятий, каждое из которых имеет ряд текстовых вариантов (способов языкового выражения) и совокупность отношений с другими понятиями тезауруса.
Предметная область тезауруса - это широкая политематическая область современных общественных отношений, проблем современного общества. Поэтому набор понятий Тезауруса соответствует понятийному содержанию и нормативных документов, и газетных публикаций, и в значительной степени - научных публикаций по общественным наукам.
С 1995 года Общественно-политический тезаурус активно и успешно применяется для различных приложений автоматической обработки текстов, таких как автоматическое концептуальное индексирование, автоматическое рубрицирование с использованием нескольких
В настоящее время Общественно-политический тезаурус включает 33 тысячи понятий, 87 тысяч русскоязычных слов, терминов, выражений, 130 тысяч отношений между понятиями.
| Характеристика | Общественно-политический Тезаурус | LIV |
|---|---|---|
| Число понятий | 33 тысяч | 6,8 тысяч |
| Число терминов | 87 тысяч | 9,8 тысяч |
| Термины, описанные как многозначные | 4,5 тысяч | Нет |
| Общее количество описанных отношений между понятиями | 130 тысяч | 15 тысяч |
| Количество отношений, полученных по логическим свойствам | 700 тысяч | Не определено |
В связи с обсуждением направлений развития ВЫШЕ-НИЖЕ и АСЦ (ассоциация).
Часто исследователи обсуждают возможность применения в информационно-поисковых тезаурусах и других ресурсах, предназначенных для информационного поиска, подходов, предлагаемых в рамках онтологических исследований.
Рассмотрим онтологию, предназначенную для работы в информационно-поисковых задачах и содержащую описания понятий предметной области (отношения между понятиями задаются в виде предикатов). Пусть свойства отношений (аксиомы вывода) описываются как правила вида if P(x1,:,xn) then Q(y1,:,ym).
Чтобы инициализировать эти правила, необходимо быть уверенным, что P(x1,:,xn) определяется с высокой точностью. При современном уровне развития систем автоматической обработки текстов в большой разнородной коллекции не для любых типов предикатов P(x1,:,xn) можно гарантировать приемлемый уровень точности и полноты их нахождения.
Например, различные аргументы предиката P(x1,:,xn) могут оказаться в разных частях длинного предложения, что значительно усложнит сборку предиката, или в разных предложениях текста, например, из-за использования эллиптической конструкции или местоимения и т.п. Проблемы с правильной идентификацией аргументов предикатов в текстах могут свести к нулю возможные преимущества применения знаний, описанных в онтологиях, по сравнению с пословным поиском.
Среди потенциального множества отношений понятия наиболее стабильно можно опираться на те отношения, которые не исчезают, не меняются в течение всего срока существования любого или подавляющего большинства экземпляров понятия. Например, любой лес всегда состоит из деревьев.
Наиболее известным типом отношения, которое выполняется для всех экземпляров, является таксономическое отношение. Так, если С1 упомянуто в тексте и С1 является видом С2, это означает, что в тексте упомянуто и С2. Если данный текст релевантен запросу о С1, то он будет релевантен и запросу о С2.
В условиях невозможности использования сложных правил вывода для осуществления вывода по тексту желательно найти другие типы отношений, обладающие свойствами транзитивности и наследования, подобно таксономическим отношениям. Проблема рассмотрения взаимного сосуществования понятий является центральной в теории зависимости философской дисциплины "формальная онтология".
Теория зависимости является одним из основных инструментов анализа сущностей в рамках философской дисциплины - онтологии. Главный вопрос теории зависимости: может ли сущность ( С1 ) существовать сама по себе или подразумевает существование чего-либо еще ( С2 ).
С1 подразумевает ли существование какой-либо конкретной сущности С2?Например, кипение ( С1 ) невозможно без существования конкретного объема жидкости ( С2 ), которая кипит.
С1 предполагает ли существование примеров (экземпляров) некоторого С2?Например, возникновение понятия гараж ( С1 ) невозможно без существования понятия автомобиль ( С2 ) как класса, хотя конкретный гараж может строиться безотносительно к конкретному автомобилю.
С1 в некоторый момент времени T1 предполагает ли существование сущности C2 в некоторый другой момент времени T2?Например, понятие солома ( С1 ) исторически зависит от понятия молотьба ( С2 ), поскольку солома не может возникнуть без предварительного процесса молотьбы; вместе с тем эти работы заканчиваются, а солома длительное время продолжает существовать.
Перечисленные выше типы отношений онтологической зависимости упорядочены по мере снижения объема пересечения сфер существования зависящего понятия и главного понятия.
При
В случае зависимости от класса конкретный пример зависимого понятия может быть оторван от главного понятия, с ним может происходить что-то, не связанное с главным понятием, но обычно недолго и в относительно небольшой доле примеров зависимого понятия - например, в гараже может быть совершено преступление и оно может не иметь никакого отношения к автомобилям.
При исторической зависимости пример зависимого понятия может достаточно долго существовать без главного понятия и участвовать в самых разных ситуациях, - например, сельскохозяйственная продукция создается в процессе сельскохозяйственного производства, затем продукция значимое время живет "своей жизнью": перевозится, продается, хранится.
Набор отношений в Общественно-политическом тезаурусе специально подобран для эффективной работы в информационно-поисковых приложениях. Имеется четыре основных типа отношения.
НИЖЕ-ВЫШЕ, оно обладает свойствами ЧАСТЬ-ЦЕЛОЕ. Используется не только для описания физических частей, но и для других внутренних сущностей понятия, таких как свойства или роли для ситуаций. Важным условием при установлении этого отношения является то, что понятия-части должны быть ЧАСТЬ-ЦЕЛОЕ, что очень важно для автоматического вывода в процессе автоматической обработки текстов.АСЦ2-АСЦ1 ), связывает два понятия, которые не могут быть связаны вышерассмотренными отношениями, но одно из них не существовало бы без другого. Например, понятие САММИТ требует существования понятия ГЛАВА ГОСУДАРСТВА.Отношения ВЫШЕ-НИЖЕ, ЧАСТЬ-ЦЕЛОЕ и несимметричная ассоциация являются
Таким образом, два отношения в тезаурусе из четырех существенно связаны с понятием онтологической зависимости. В количественном отношении эти два отношения занимают приблизительно половину из всех отношений тезауруса.
Если условия надежности выполняются почти всегда, по умолчанию, то применяются специальные пометки - модификаторы отношений, что означает, что отношение более слабое. В связи с этим вводятся ограничения по транзитивности.
Используются два модификатора:
В ("возможно") - отношение выполняется не для всех примеров;А ("аспект", точка зрения) - отношение существует не все время.Например,
ПЕНСИОНЕР ВЫШЕ_В СТАРЫЙ ЧЕЛОВЕК ЦЕЛОЕ_А ПЕНСИОННАЯ СИСТЕМА
Наиболее близким по такой трактовке отношений ЧАСТЬ-ЦЕЛОЕ является онтология Дж. Совы (John Sowa). Описывая классификацию ролей и отношений в своей онтологии верхнего уровня, автор рассматривает случаи зависимости (prehension) понятий друг от друга. Зависимость может быть внешняя (
Основным видом внутренне зависимых сущностей являются компоненты. Среди компонентов выделяются части и свойства. Части делятся на физические части, участников и стадии, а свойства - на атрибуты и способы.
Таким образом, Sowa также объединяет в один куст отношений такие отношения, как физические части, участники, стадии, свойства, по свойству внутренней зависимости.
Мы видим, что Общественно-политический тезаурус представляет собой
Поскольку предполагается работать с терминологией, большими предметными областями и свободными текстами, то важно использовать опыт разработки
Так как предполагается применять онтологию в автоматическом режиме обработки текстов, то необходимо использовать методологию разработки лексических ресурсов типа WordNet, в которой важны следующие положения:
Из методологии разработки формальных онтологий важны следующие положения:
С 1995 года Общественно-политический тезаурус используется в таких областях автоматической обработки текстов, как автоматическое концептуальное индексирование, автоматическая рубрикация текстов, автоматическое аннотирование текстов. Все эти применения тезауруса базируются на тематическом представлении текста, моделирующем тематическую структуру документа на базе узлов близких по смыслу терминов.
Совокупность этапов, преобразующих исходный текст в тематическое представление, называется Автоматической Лингвистической Обработкой Текста (АЛОТ).
(рис 10.1) Обработка документов в УИС РОССИЯТезаурус и технология автоматического построения тематического представления содержания документа позволили развить в рамках УИС РОССИЯ (Университетской информационной системе РОССИЯ, uisrussia.msu.ru) гибкую технологию эффективной автоматической рубрикации текстов. Созданные системы автоматической рубрикации работают с такими
Знания, описанные в Тезаурусе, а также технология построения тематического представления позволили создать систему автоматического аннотирования текстов. В 1998 году программа автоматического аннотирования англоязычных текстов участвовала в соревнованиях в рамках конференции SUMMAC, где эта программа получила лучшие результаты в номинации "Индикативная аннотация наилучшей длины".
Тезаурус используется как инструмент для автоматического концептуального индексирования и ранжированного информационного поиска в УИС РОССИЯ.
На первом этапе работы алгоритма происходит сравнение единиц текста с единицами Тезауруса. Сравнение текста и Тезауруса происходит на основе морфологического представления единиц текста и единиц Тезауруса. Из множества найденных в тексте единиц Тезауруса выбирается единица, имеющая максимальную длину. Если один и тот же фрагмент текста соответствует разным единицам Тезауруса, то фиксируется многозначность термина.
В результате сопоставления с Тезаурусом текст отражается в последовательность дескрипторов Тезауруса. Все синонимы (варианты) одного и того же дескриптора отображаются в соответствующий дескриптор и далее не различаются. Для каждого дескриптора фиксируется частота его встречаемости в тексте.
(рис 10.2) Покрытие терминологией Тезауруса лексики НА РФ. На примере документа "Постановление Правительства РФ от 26 июня 1995 г. № 604"Чтобы определить тезаурусные связи между дескрипторами текста, необходимо найти те пары дескрипторов, которые описаны в тезаурусных статьях друг друга. Но этого недостаточно. Необходимо также найти и такие пары дескрипторов текста, связи между которыми выводятся по свойствам транзитивности и наследования.
Таким образом, два дескриптора текста D1 и D2 оказываются D1 и D2 находятся в одной тезаурусной статье;D1 и D2 существует путь в Тезаурусе, который состоит:ВЫШЕ и ЦЕЛОЕ (в этому случае говорят, что дескрипторы D1 и D2 связаны по ВЫШЕ и ЦЕЛОЕ );ВЫШЕ и ЦЕЛОЕ и одной связи АССОЦИАЦИЯ (в этому случае говорят, что дескрипторы D1 и D2 связаны по свойству наследования связи АССОЦИАЦИЯ связями ВЫШЕ и ЦЕЛОЕ ).
В построении
Если выполняется одно из вышеперечисленных условий, то считается, что "текст поддерживает" данное значение неоднозначного термина. Если текст "поддерживает" только одно значение неоднозначного термина, то выбирается соответствующий ему дескриптор.
Если текст "поддерживает" дескрипторы, соответствующие разным значениям термина, то для каждого вхождения неоднозначного термина рассматриваются ближайшие по тексту дескрипторы, для них проверяются вышеуказанные условия и выбирается тот дескриптор неоднозначного термина, который "поддерживается" первым из ближайших по тексту дескрипторов.
Популярной теорией в области автоматической обработки текстов является теория Т.А. ван Дейка - В.Кинча, которая указывает, что основная тема текста может быть описана некоторой пропозицией. Такая пропозиция называется
Второе направление исследований базируется на автоматическом выявлении лексической связности текста. Какими бы отношениями не были связаны между собой предложения текста, часть слов, входящих в состав этих предложений, должны быть лексически связаны между собой, причем эти отношения между словами заранее известны автору и читателю текста.
Действительно, формулировка основной темы текста содержит некоторую совокупность слов, наиболее значимых для передачи содержания текста. Если рассмотреть текст, то можно видеть, что слова, близкие по смыслу к словам основной темы, образуют лексические цепочки, которые пронизывают весь текст. Естественно предположить, что если имеется лингвистический ресурс, в котором описаны разнообразные смысловые связи между словами, то можно двигаться по тексту, находить связанные по смыслу слова, формировать лексические цепочки. Самые частотные (или выделенные по другим критериям) цепочки могли бы показать, чему именно посвящен конкретный текст.
Предположим, что мы сформулировали основную тему некоторого текста. В ней упомянуты некоторые понятия и/или конкретные объекты текста. Подтемы текста раскрывают взаимоотношения между этими основными понятиями/объектами и поэтому должны тем или иным образом ссылаться на них, используя повторы слов, синонимы или другие слова, семантически связанные с понятиями основной темы (далее основные понятия текста). Таким образом, основным понятиям текста соответствуют некоторые совокупности слов текста (и совокупность понятий, стоящих за этими словами), которые используются в данном тексте для ссылки на эти основные понятия. Такие совокупности слов обычно пронизывают весь текст "красной нитью".
Если подтема текста раскрывается в более специфических подтемах, то для ссылки на основные понятия этой подтемы, в свою очередь, возникают более короткие "нити" слов. Таким образом, начало лексической цепочки нужно связывать не с началом текста, а с наиболее важным для содержания текста понятием, которое должно стать центром этой цепочки, а все элементы лексической цепочки должны быть прежде всего связаны лексическим отношением именно с этим центром (последователями подхода на основе WordNet также обсуждается необходимость нахождения центра лексической цепочки, правда, уже после ее формирования).
Предполагается, что более важные для текста понятия чаще всего так или иначе выделены в тексте относительно других близких им по смыслу понятий (например, частотностью, упоминанием в заголовке текста).
(рис 10.3) Сеть тематических узлов документа "Постановление Правительства РФ от 26 июня 1995 г. № 604"
Каждая тема, обсуждаемая в тексте, выражается обычно не одним термином, а совокупностью тематически близких терминов. Например, тема науки может развиваться в тексте посредством следующих терминов: математика, физика, прикладное исследование, фундаментальное исследование, научный работник. Тот термин, который наиболее точно характеризует развиваемую в тексте тему, обычно некоторым образом выделен из всей совокупности тематически близких терминов: может быть употреблен в заголовке и/или в начале текста, иметь максимальную частотность среди других тематически близких терминов.
Главным термином темы может стать любой термин Тезауруса, независимо от его уровня общности/специфичности. Так, главным термином темы текста может стать термин математика, если речь в тексте идет о развитии математики; или главным термином может стать термин научный работник, если речь в тексте идет об оплате труда научных работников или о выезде ученых за рубеж.
Напомним, что
Тематическая связанность терминов отображается в связях между соответствующими дескрипторами в
Как показали эксперименты, наиболее эффективно проводить разбиение следующим образом.
Создание тематического узла начинается с выбора главного дескриптора тематического узла. Сначала тематические узлы собираются вокруг дескрипторов заголовка и первого предложения текста. Затем тематические узлы собираются для остальных дескрипторов, начиная с самых частотных. Те дескрипторы, которые уже попали в
После того как выбран главный дескриптор очередного тематического узла, в
Для выявления основных тематических узлов производятся следующие процедуры:
Эксперименты показали, что тематическое представление может быть построено для текстов любого размера и разнообразных типов. Тематические представления были построены для более 100 Мб официальных документов Российской Федерации, международных договоров, для большинства российских законов 1990-1997 гг. Тематические представления были также построены для более 50 Мб сообщений информационных агентств и газетных статей. Размеры обрабатываемых документов варьировались от 500 байт до более 500 Кб (Гражданский Кодекс Российской Федерации, Таможенный кодекс Российской Федерации).
(рис 10.4) Структура тематического представления
Тезаурус существенно используется в интерфейсе УИС РОССИЯ для следующих задач терминологического поиска:
СТРОИТЕЛЬСТВА именно ДОРОЖНОЕ СТРОИТЕЛЬСТВО (автодорожное строительство, дорожно-строительные работы, строительство дорог, строительно-дорожный и т.д.);НАЛОГОВАЯ СИСТЕМА - НАЛОГОВЫЙ РЕЖИМ ), а также по иерархии ( МИГРАЦИЯ - БЕЖЕНЦЫ, ВЫНУЖДЕННЫЕ ПЕРЕСЕЛЕНЦЫ и т.д.).Структурная тематическая аннотация представляет содержание текста посредством описания его основных тем, которые моделируются совокупностью терминов, относящихся к этим темам. Структурная тематическая аннотация содержит наиболее информативные фрагменты тематического представления текста, которое включает все термины текста, разбитые на тематические узлы и отношения между различными темами и подтемами текста.
Знания человека о тематической связности между терминами вытекают из знаний о предметной области, в рамках которой написан текст. Таким образом, то новое и важное, что несет в себе текст и что должна отразить в себе аннотация, - это именно то, каким образом взаимодействуют между собой разные основные темы текста.
Отсюда следует
Предложений, содержащих термины одних и тех же двух основных тем, в тексте может оказаться достаточно много. Для аннотации необходимо выделить одно предложение, в котором взаимодействие этих двух тем характеризуется "наилучшим образом".
Чтобы понять, что значит "наилучшим образом", рассмотрим, как та или иная тема развивается в тексте. Не все основные темы начинают обсуждаться в тексте сразу, с первого предложения, - часть из них возникает в последующих предложениях. Чтобы сохранить связность и последовательность изложения текста, автор именно в этом первом предложении новой темы должен наиболее точно указать связь новой темы со всем предшествующим текстом.
Таким образом,
Нужно отметить, что при хорошем покрытии предметной области Тезаурусом появление в очередном предложении новой темы выявляется весьма точно, а это означает, что связность получаемой аннотации в среднем весьма высока.
Задачей систем автоматического рубрицирования является разбиение поступающего потока текстов на тематические
Дадим некоторые определения.
При составлении
Для оценки эффективности работы систем рубрицирования используются такие характеристики, как точность и полнота.
Характерными особенностями ручного рубрицирования являются:
Обычно процент документов, в которых проставлена явно неправильная рубрика, чрезвычайно мал;
Обычно специалисты по рубрикации проставляют одну-две основных рубрики, характеризующие основное содержание документа, хотя документ может быть отнесен и к ряду других рубрик. В результате получается, что при сравнении результатов рубрикации разными экспертами одних и тех же документов процент совпадения проставленных рубрик может оказаться весьма низким - 60%. Это приводит к тому, что похожие документы могут получить достаточно разные наборы рубрик. Такая ситуация усугубляется при увеличении величины и иерархической сложности
Наиболее эффективными, но и наиболее трудозатратными являются методы автоматического рубрицирования, основанные на знаниях. При рубрицировании текстов на основе знаний используются заранее сформированные базы знаний, в которых описываются языковые выражения, соответствующие той или иной рубрике, правила выбора между рубриками и др.
Другим классом методов для автоматической рубрикации текстов являются методы машинного обучения, которые в качестве обучающих примеров используют заранее отрубрицированные вручную тексты.
Приводятся очень высокие оценки результатов работы методов машинного обучения, время обучения составляет доли секунд. Однако при ближайшем рассмотрении оказывается, что практически все такие методы тестируются на одной и той же текстовой коллекции - это коллекция финансовых сообщений информационного агентства Рейтер, которая была специально создана несколько лет назад для тестирования методов автоматической рубрикации текстов.
Эта коллекция характеризуется следующими основными чертами:
Все эти особенности коллекции значительно упрощают решение задачи машинного обучения автоматической рубрикации текстов.
Проблемы автоматического рубрицирования связаны со следующими обстоятельствами:
Например, если рубрика в рубрикаторе новостей называется "Выборы", то обычно не считается правильным, если к этой рубрике будет отнесен текст о выборах президента UEFA.
Текст отнесен не к той рубрике из-за того, что некоторые слова, сопоставленные рубрике, в конкретном тексте употреблены в другом значении - таком, которое не соответствует данной рубрике.
Ложная корреляция может возникнуть в случаях, когда для отнесения текста к рубрике необходимо присутствие в тексте двух логических элементов. Например, для рубрицирования по рубрике "Экономические реформы" необходимо присутствие в тексте двух тематических элементов - темы экономики и темы реформы. Ложная корреляция и, соответственно, неправильное отнесение текста к данной рубрике возникает в тех случаях, когда такие тематические элементы присутствуют в тексте, но не имеют отношения друг к другу, например, такая ситуация может произойти, если в тексте речь шла о судебной реформе и были упомянуты некоторые экономические вопросы.
Текст отнесен к рубрике по слову или словосочетанию, которое по сути соответствует содержанию рубрики, но в данном тексте это опорное слово или словосочетание употреблено случайно или в каком-то специфическом контексте, из-за чего текст становится нерелевантным рубрике.
Например, текст может быть отнесен к рубрике "Средства массовой информации" на основе следующего фрагмента: Около 40 человек умерли во Франции в результате установившейся в стране жары: Правительство и средства массовой информации следят за ситуацией:"
Правильная рубрика не определена, поскольку в тексте упомянуты слова, не описанные в словаре системы рубрицирования.
Может стать причиной потери правильной рубрики для рубрикации.
Может привести к пропуску правильной рубрики при автоматической рубрикации, например, если в состав документа входит заголовок и большая таблица, при этом все информация для правильного отнесения текста к рубрике содержится только в заголовке.
В задаче рубрикации текстов используются различные методы машинного обучения, иллюстрируемые следующими рисунками (рис. 10.5-10.8).

(рис 10.6) Отсечение по центрам тяжести(рис 10.5) Отсечение по ближайшим соседям (kNN)
(рис 10.8) Отсечение по ближайшим точкам (SVM)(рис 10.7) Оптимальный линейный сепаратор SVM (Support Vector Machines). Оптимизация по критерию максимизации расстояния между двумя параллельными поддерживающими плоскостями
Реальные задачи рубрикации текстов в значительной мере отличаются от задачи классификации сообщений на тестовой коллекции агентства Рейтер. На практике, если перед достаточно большой компанией встает задача автоматической рубрикации текстов, то обычно используются автоматизированные технологии, основанные на ручном подборе лексики под каждую рубрику
Факторами, усложняющими или делающими невозможным применение методов машинного обучения для автоматической рубрикации текстов, являются следующие:
В информационной системе УИС РОССИЯ реализована система автоматического рубрицирования, способная рубрицировать тексты различных типов (официальные документы, сообщения информационных агентств, газетные статьи), ее легко можно настроить на новый
Реализация такой гибкой технологии автоматического рубрицирования основывается на определенных способах представления знаний о предметной области и представления текстовой информации:
Каждая рубрика R описывается дизъюнкцией альтернатив, каждый дизъюнкт представляет собой конъюнкцию:
Конъюнкты, в свою очередь, описываются экспертами с помощью так называемых "опорных" понятий тезауруса. Для каждого опорного понятия задается правило его расширения f(•), определяющее, каким образом вместе с опорным понятием учитывать подчиненные ему по иерархии понятия. Выделяются три случая - без расширения (обозначается символом N ), полное расширение по дереву иерархии тезауруса (символ E ) и расширение только по родо-видовым связям (символ L ).
(рис 10.9) Схема описания рубрикиОпорный концепт может быть как "положительным", который добавляет нижерасположенные понятия в описание конъюнкта, так и "отрицательным", который вырезает свои подчиненные понятия. Последовательность учета положительных и отрицательных опорных понятий регулируется заданием специального атрибута. Результатом применения расширения опорных понятий является совокупность понятий тезауруса, полностью описывающая конъюнкт:
$$K_{ij}=\bigcup\limits_m f_m(c_{ijm})\setminus\bigcup\limits_n f_n(e_{ijn})=\bigcup\limits_k d_{ijk}$$Основной целью разработки традиционных
При автоматической обработке текстов человека - посредника между текстом и описанием его содержания в виде дескрипторов нет. Есть только автоматический процесс и Тезаурус, который должен содержать и те знания, которые содержатся в традиционных информационно-поисковых тезаурусах, и те знания (насколько это возможно), которые использует индексатор для определения основной темы текста.
Именно поэтому традиционные тезаурусы, разработанные для ручного индексирования, трудно использовать при автоматическом индексировании.
Разработка тезауруса для автоматического индексирования (далее - АИ тезауруса) характеризуется прежде всего необходимостью описания значительно большего количества слов и словосочетаний, встречающихся в текстах данной предметной области. АИ тезаурус должен не только включать термины, которые представляют важные понятия в текстах данной предметной области, но также охватывать широкий круг более специфических терминов, обнаружение которых в конкретном тексте сделает этот текст релевантным запросу по понятиям более высокого уровня. Например, должны быть описаны не только дескриптор РЫБА и его основные подразделения, такие как МОРСКИЕ РЫБЫ, АНАДРОМНЫЕ РЫБЫ и т.п., но и значительное количество конкретных видов рыб, с тем чтобы текст, обсуждающий проблемы вылова минтая, мог бы быть получен при поиске по термину рыба.
Синонимические ряды понятий должны быть значительно богаче, чем совокупности вариантов дескриптора в тезаурусе для ручного индексирования, поскольку синонимы должны описывать различные способы выражения данного понятия в тексте для автоматического процесса, а не для человека. Ряды синонимов включают в себя не только существительные и именные группы, а также прилагательные, глаголы и глагольные группы. Расширение терминологической базы АИ-тезауруса ведет к необходимости описания многозначных терминов.
Расширение понятийной базы тезауруса ведет к увеличению и усложнению функций отношений между понятиями тезауруса (концептуальными отношениями): возникает необходимость логического вывода отношений, поскольку описать отношения всех дескрипторов со всеми близкими дескрипторами АИ-тезауруса становится трудоемким занятием и затрудняет проверку таких описаний.
С 1994 года в АНО ЦИИ (Автономная некоммерческая организация Центр информационных исследований) началась разработка Общественно-политического информационно-поискового тезауруса (русскоязычного) как ресурса для автоматического индексирования. Общественно-политический тезаурус включает в себя терминологию экономической, политической, военной, финансовой, законодательной, социальной, культурной и других сфер деятельности - терминологию, которая встречается в таких общезначимых документах, как официальные и законодательные документы, международные договоры, сообщения информационных агентств и газетные публикации.
Общественно-политический тезаурус представляет собой иерархическую сеть понятий, каждое из которых имеет ряд текстовых вариантов (способов языкового выражения) и совокупность отношений с другими понятиями тезауруса.
Предметная область тезауруса - это широкая политематическая область современных общественных отношений, проблем современного общества. Поэтому набор понятий Тезауруса соответствует понятийному содержанию и нормативных документов, и газетных публикаций, и в значительной степени - научных публикаций по общественным наукам.
С 1995 года Общественно-политический тезаурус активно и успешно применяется для различных приложений автоматической обработки текстов, таких как автоматическое концептуальное индексирование, автоматическое рубрицирование с использованием нескольких
В настоящее время Общественно-политический тезаурус включает 33 тысячи понятий, 87 тысяч русскоязычных слов, терминов, выражений, 130 тысяч отношений между понятиями.
| Характеристика | Общественно-политический Тезаурус | LIV |
|---|---|---|
| Число понятий | 33 тысяч | 6,8 тысяч |
| Число терминов | 87 тысяч | 9,8 тысяч |
| Термины, описанные как многозначные | 4,5 тысяч | Нет |
| Общее количество описанных отношений между понятиями | 130 тысяч | 15 тысяч |
| Количество отношений, полученных по логическим свойствам | 700 тысяч | Не определено |
В связи с обсуждением направлений развития ВЫШЕ-НИЖЕ и АСЦ (ассоциация).
Часто исследователи обсуждают возможность применения в информационно-поисковых тезаурусах и других ресурсах, предназначенных для информационного поиска, подходов, предлагаемых в рамках онтологических исследований.
Рассмотрим онтологию, предназначенную для работы в информационно-поисковых задачах и содержащую описания понятий предметной области (отношения между понятиями задаются в виде предикатов). Пусть свойства отношений (аксиомы вывода) описываются как правила вида if P(x1,:,xn) then Q(y1,:,ym).
Чтобы инициализировать эти правила, необходимо быть уверенным, что P(x1,:,xn) определяется с высокой точностью. При современном уровне развития систем автоматической обработки текстов в большой разнородной коллекции не для любых типов предикатов P(x1,:,xn) можно гарантировать приемлемый уровень точности и полноты их нахождения.
Например, различные аргументы предиката P(x1,:,xn) могут оказаться в разных частях длинного предложения, что значительно усложнит сборку предиката, или в разных предложениях текста, например, из-за использования эллиптической конструкции или местоимения и т.п. Проблемы с правильной идентификацией аргументов предикатов в текстах могут свести к нулю возможные преимущества применения знаний, описанных в онтологиях, по сравнению с пословным поиском.
Среди потенциального множества отношений понятия наиболее стабильно можно опираться на те отношения, которые не исчезают, не меняются в течение всего срока существования любого или подавляющего большинства экземпляров понятия. Например, любой лес всегда состоит из деревьев.
Наиболее известным типом отношения, которое выполняется для всех экземпляров, является таксономическое отношение. Так, если С1 упомянуто в тексте и С1 является видом С2, это означает, что в тексте упомянуто и С2. Если данный текст релевантен запросу о С1, то он будет релевантен и запросу о С2.
В условиях невозможности использования сложных правил вывода для осуществления вывода по тексту желательно найти другие типы отношений, обладающие свойствами транзитивности и наследования, подобно таксономическим отношениям. Проблема рассмотрения взаимного сосуществования понятий является центральной в теории зависимости философской дисциплины "формальная онтология".
Теория зависимости является одним из основных инструментов анализа сущностей в рамках философской дисциплины - онтологии. Главный вопрос теории зависимости: может ли сущность ( С1 ) существовать сама по себе или подразумевает существование чего-либо еще ( С2 ).
С1 подразумевает ли существование какой-либо конкретной сущности С2?Например, кипение ( С1 ) невозможно без существования конкретного объема жидкости ( С2 ), которая кипит.
С1 предполагает ли существование примеров (экземпляров) некоторого С2?Например, возникновение понятия гараж ( С1 ) невозможно без существования понятия автомобиль ( С2 ) как класса, хотя конкретный гараж может строиться безотносительно к конкретному автомобилю.
С1 в некоторый момент времени T1 предполагает ли существование сущности C2 в некоторый другой момент времени T2?Например, понятие солома ( С1 ) исторически зависит от понятия молотьба ( С2 ), поскольку солома не может возникнуть без предварительного процесса молотьбы; вместе с тем эти работы заканчиваются, а солома длительное время продолжает существовать.
Перечисленные выше типы отношений онтологической зависимости упорядочены по мере снижения объема пересечения сфер существования зависящего понятия и главного понятия.
При
В случае зависимости от класса конкретный пример зависимого понятия может быть оторван от главного понятия, с ним может происходить что-то, не связанное с главным понятием, но обычно недолго и в относительно небольшой доле примеров зависимого понятия - например, в гараже может быть совершено преступление и оно может не иметь никакого отношения к автомобилям.
При исторической зависимости пример зависимого понятия может достаточно долго существовать без главного понятия и участвовать в самых разных ситуациях, - например, сельскохозяйственная продукция создается в процессе сельскохозяйственного производства, затем продукция значимое время живет "своей жизнью": перевозится, продается, хранится.
Набор отношений в Общественно-политическом тезаурусе специально подобран для эффективной работы в информационно-поисковых приложениях. Имеется четыре основных типа отношения.
НИЖЕ-ВЫШЕ, оно обладает свойствами ЧАСТЬ-ЦЕЛОЕ. Используется не только для описания физических частей, но и для других внутренних сущностей понятия, таких как свойства или роли для ситуаций. Важным условием при установлении этого отношения является то, что понятия-части должны быть ЧАСТЬ-ЦЕЛОЕ, что очень важно для автоматического вывода в процессе автоматической обработки текстов.АСЦ2-АСЦ1 ), связывает два понятия, которые не могут быть связаны вышерассмотренными отношениями, но одно из них не существовало бы без другого. Например, понятие САММИТ требует существования понятия ГЛАВА ГОСУДАРСТВА.Отношения ВЫШЕ-НИЖЕ, ЧАСТЬ-ЦЕЛОЕ и несимметричная ассоциация являются
Таким образом, два отношения в тезаурусе из четырех существенно связаны с понятием онтологической зависимости. В количественном отношении эти два отношения занимают приблизительно половину из всех отношений тезауруса.
Если условия надежности выполняются почти всегда, по умолчанию, то применяются специальные пометки - модификаторы отношений, что означает, что отношение более слабое. В связи с этим вводятся ограничения по транзитивности.
Используются два модификатора:
В ("возможно") - отношение выполняется не для всех примеров;А ("аспект", точка зрения) - отношение существует не все время.Например,
ПЕНСИОНЕР ВЫШЕ_В СТАРЫЙ ЧЕЛОВЕК ЦЕЛОЕ_А ПЕНСИОННАЯ СИСТЕМА
Наиболее близким по такой трактовке отношений ЧАСТЬ-ЦЕЛОЕ является онтология Дж. Совы (John Sowa). Описывая классификацию ролей и отношений в своей онтологии верхнего уровня, автор рассматривает случаи зависимости (prehension) понятий друг от друга. Зависимость может быть внешняя (
Основным видом внутренне зависимых сущностей являются компоненты. Среди компонентов выделяются части и свойства. Части делятся на физические части, участников и стадии, а свойства - на атрибуты и способы.
Таким образом, Sowa также объединяет в один куст отношений такие отношения, как физические части, участники, стадии, свойства, по свойству внутренней зависимости.
Мы видим, что Общественно-политический тезаурус представляет собой
Поскольку предполагается работать с терминологией, большими предметными областями и свободными текстами, то важно использовать опыт разработки
Так как предполагается применять онтологию в автоматическом режиме обработки текстов, то необходимо использовать методологию разработки лексических ресурсов типа WordNet, в которой важны следующие положения:
Из методологии разработки формальных онтологий важны следующие положения:
С 1995 года Общественно-политический тезаурус используется в таких областях автоматической обработки текстов, как автоматическое концептуальное индексирование, автоматическая рубрикация текстов, автоматическое аннотирование текстов. Все эти применения тезауруса базируются на тематическом представлении текста, моделирующем тематическую структуру документа на базе узлов близких по смыслу терминов.
Совокупность этапов, преобразующих исходный текст в тематическое представление, называется Автоматической Лингвистической Обработкой Текста (АЛОТ).
(рис 10.1) Обработка документов в УИС РОССИЯТезаурус и технология автоматического построения тематического представления содержания документа позволили развить в рамках УИС РОССИЯ (Университетской информационной системе РОССИЯ, uisrussia.msu.ru) гибкую технологию эффективной автоматической рубрикации текстов. Созданные системы автоматической рубрикации работают с такими
Знания, описанные в Тезаурусе, а также технология построения тематического представления позволили создать систему автоматического аннотирования текстов. В 1998 году программа автоматического аннотирования англоязычных текстов участвовала в соревнованиях в рамках конференции SUMMAC, где эта программа получила лучшие результаты в номинации "Индикативная аннотация наилучшей длины".
Тезаурус используется как инструмент для автоматического концептуального индексирования и ранжированного информационного поиска в УИС РОССИЯ.
На первом этапе работы алгоритма происходит сравнение единиц текста с единицами Тезауруса. Сравнение текста и Тезауруса происходит на основе морфологического представления единиц текста и единиц Тезауруса. Из множества найденных в тексте единиц Тезауруса выбирается единица, имеющая максимальную длину. Если один и тот же фрагмент текста соответствует разным единицам Тезауруса, то фиксируется многозначность термина.
В результате сопоставления с Тезаурусом текст отражается в последовательность дескрипторов Тезауруса. Все синонимы (варианты) одного и того же дескриптора отображаются в соответствующий дескриптор и далее не различаются. Для каждого дескриптора фиксируется частота его встречаемости в тексте.
(рис 10.2) Покрытие терминологией Тезауруса лексики НА РФ. На примере документа "Постановление Правительства РФ от 26 июня 1995 г. № 604"Чтобы определить тезаурусные связи между дескрипторами текста, необходимо найти те пары дескрипторов, которые описаны в тезаурусных статьях друг друга. Но этого недостаточно. Необходимо также найти и такие пары дескрипторов текста, связи между которыми выводятся по свойствам транзитивности и наследования.
Таким образом, два дескриптора текста D1 и D2 оказываются D1 и D2 находятся в одной тезаурусной статье;D1 и D2 существует путь в Тезаурусе, который состоит:ВЫШЕ и ЦЕЛОЕ (в этому случае говорят, что дескрипторы D1 и D2 связаны по ВЫШЕ и ЦЕЛОЕ );ВЫШЕ и ЦЕЛОЕ и одной связи АССОЦИАЦИЯ (в этому случае говорят, что дескрипторы D1 и D2 связаны по свойству наследования связи АССОЦИАЦИЯ связями ВЫШЕ и ЦЕЛОЕ ).
В построении
Если выполняется одно из вышеперечисленных условий, то считается, что "текст поддерживает" данное значение неоднозначного термина. Если текст "поддерживает" только одно значение неоднозначного термина, то выбирается соответствующий ему дескриптор.
Если текст "поддерживает" дескрипторы, соответствующие разным значениям термина, то для каждого вхождения неоднозначного термина рассматриваются ближайшие по тексту дескрипторы, для них проверяются вышеуказанные условия и выбирается тот дескриптор неоднозначного термина, который "поддерживается" первым из ближайших по тексту дескрипторов.
Популярной теорией в области автоматической обработки текстов является теория Т.А. ван Дейка - В.Кинча, которая указывает, что основная тема текста может быть описана некоторой пропозицией. Такая пропозиция называется
Второе направление исследований базируется на автоматическом выявлении лексической связности текста. Какими бы отношениями не были связаны между собой предложения текста, часть слов, входящих в состав этих предложений, должны быть лексически связаны между собой, причем эти отношения между словами заранее известны автору и читателю текста.
Действительно, формулировка основной темы текста содержит некоторую совокупность слов, наиболее значимых для передачи содержания текста. Если рассмотреть текст, то можно видеть, что слова, близкие по смыслу к словам основной темы, образуют лексические цепочки, которые пронизывают весь текст. Естественно предположить, что если имеется лингвистический ресурс, в котором описаны разнообразные смысловые связи между словами, то можно двигаться по тексту, находить связанные по смыслу слова, формировать лексические цепочки. Самые частотные (или выделенные по другим критериям) цепочки могли бы показать, чему именно посвящен конкретный текст.
Предположим, что мы сформулировали основную тему некоторого текста. В ней упомянуты некоторые понятия и/или конкретные объекты текста. Подтемы текста раскрывают взаимоотношения между этими основными понятиями/объектами и поэтому должны тем или иным образом ссылаться на них, используя повторы слов, синонимы или другие слова, семантически связанные с понятиями основной темы (далее основные понятия текста). Таким образом, основным понятиям текста соответствуют некоторые совокупности слов текста (и совокупность понятий, стоящих за этими словами), которые используются в данном тексте для ссылки на эти основные понятия. Такие совокупности слов обычно пронизывают весь текст "красной нитью".
Если подтема текста раскрывается в более специфических подтемах, то для ссылки на основные понятия этой подтемы, в свою очередь, возникают более короткие "нити" слов. Таким образом, начало лексической цепочки нужно связывать не с началом текста, а с наиболее важным для содержания текста понятием, которое должно стать центром этой цепочки, а все элементы лексической цепочки должны быть прежде всего связаны лексическим отношением именно с этим центром (последователями подхода на основе WordNet также обсуждается необходимость нахождения центра лексической цепочки, правда, уже после ее формирования).
Предполагается, что более важные для текста понятия чаще всего так или иначе выделены в тексте относительно других близких им по смыслу понятий (например, частотностью, упоминанием в заголовке текста).
(рис 10.3) Сеть тематических узлов документа "Постановление Правительства РФ от 26 июня 1995 г. № 604"
Каждая тема, обсуждаемая в тексте, выражается обычно не одним термином, а совокупностью тематически близких терминов. Например, тема науки может развиваться в тексте посредством следующих терминов: математика, физика, прикладное исследование, фундаментальное исследование, научный работник. Тот термин, который наиболее точно характеризует развиваемую в тексте тему, обычно некоторым образом выделен из всей совокупности тематически близких терминов: может быть употреблен в заголовке и/или в начале текста, иметь максимальную частотность среди других тематически близких терминов.
Главным термином темы может стать любой термин Тезауруса, независимо от его уровня общности/специфичности. Так, главным термином темы текста может стать термин математика, если речь в тексте идет о развитии математики; или главным термином может стать термин научный работник, если речь в тексте идет об оплате труда научных работников или о выезде ученых за рубеж.
Напомним, что
Тематическая связанность терминов отображается в связях между соответствующими дескрипторами в
Как показали эксперименты, наиболее эффективно проводить разбиение следующим образом.
Создание тематического узла начинается с выбора главного дескриптора тематического узла. Сначала тематические узлы собираются вокруг дескрипторов заголовка и первого предложения текста. Затем тематические узлы собираются для остальных дескрипторов, начиная с самых частотных. Те дескрипторы, которые уже попали в
После того как выбран главный дескриптор очередного тематического узла, в
Для выявления основных тематических узлов производятся следующие процедуры:
Эксперименты показали, что тематическое представление может быть построено для текстов любого размера и разнообразных типов. Тематические представления были построены для более 100 Мб официальных документов Российской Федерации, международных договоров, для большинства российских законов 1990-1997 гг. Тематические представления были также построены для более 50 Мб сообщений информационных агентств и газетных статей. Размеры обрабатываемых документов варьировались от 500 байт до более 500 Кб (Гражданский Кодекс Российской Федерации, Таможенный кодекс Российской Федерации).
(рис 10.4) Структура тематического представления
Тезаурус существенно используется в интерфейсе УИС РОССИЯ для следующих задач терминологического поиска:
СТРОИТЕЛЬСТВА именно ДОРОЖНОЕ СТРОИТЕЛЬСТВО (автодорожное строительство, дорожно-строительные работы, строительство дорог, строительно-дорожный и т.д.);НАЛОГОВАЯ СИСТЕМА - НАЛОГОВЫЙ РЕЖИМ ), а также по иерархии ( МИГРАЦИЯ - БЕЖЕНЦЫ, ВЫНУЖДЕННЫЕ ПЕРЕСЕЛЕНЦЫ и т.д.).Структурная тематическая аннотация представляет содержание текста посредством описания его основных тем, которые моделируются совокупностью терминов, относящихся к этим темам. Структурная тематическая аннотация содержит наиболее информативные фрагменты тематического представления текста, которое включает все термины текста, разбитые на тематические узлы и отношения между различными темами и подтемами текста.
Знания человека о тематической связности между терминами вытекают из знаний о предметной области, в рамках которой написан текст. Таким образом, то новое и важное, что несет в себе текст и что должна отразить в себе аннотация, - это именно то, каким образом взаимодействуют между собой разные основные темы текста.
Отсюда следует
Предложений, содержащих термины одних и тех же двух основных тем, в тексте может оказаться достаточно много. Для аннотации необходимо выделить одно предложение, в котором взаимодействие этих двух тем характеризуется "наилучшим образом".
Чтобы понять, что значит "наилучшим образом", рассмотрим, как та или иная тема развивается в тексте. Не все основные темы начинают обсуждаться в тексте сразу, с первого предложения, - часть из них возникает в последующих предложениях. Чтобы сохранить связность и последовательность изложения текста, автор именно в этом первом предложении новой темы должен наиболее точно указать связь новой темы со всем предшествующим текстом.
Таким образом,
Нужно отметить, что при хорошем покрытии предметной области Тезаурусом появление в очередном предложении новой темы выявляется весьма точно, а это означает, что связность получаемой аннотации в среднем весьма высока.
Задачей систем автоматического рубрицирования является разбиение поступающего потока текстов на тематические
Дадим некоторые определения.
При составлении
Для оценки эффективности работы систем рубрицирования используются такие характеристики, как точность и полнота.
Характерными особенностями ручного рубрицирования являются:
Обычно процент документов, в которых проставлена явно неправильная рубрика, чрезвычайно мал;
Обычно специалисты по рубрикации проставляют одну-две основных рубрики, характеризующие основное содержание документа, хотя документ может быть отнесен и к ряду других рубрик. В результате получается, что при сравнении результатов рубрикации разными экспертами одних и тех же документов процент совпадения проставленных рубрик может оказаться весьма низким - 60%. Это приводит к тому, что похожие документы могут получить достаточно разные наборы рубрик. Такая ситуация усугубляется при увеличении величины и иерархической сложности
Наиболее эффективными, но и наиболее трудозатратными являются методы автоматического рубрицирования, основанные на знаниях. При рубрицировании текстов на основе знаний используются заранее сформированные базы знаний, в которых описываются языковые выражения, соответствующие той или иной рубрике, правила выбора между рубриками и др.
Другим классом методов для автоматической рубрикации текстов являются методы машинного обучения, которые в качестве обучающих примеров используют заранее отрубрицированные вручную тексты.
Приводятся очень высокие оценки результатов работы методов машинного обучения, время обучения составляет доли секунд. Однако при ближайшем рассмотрении оказывается, что практически все такие методы тестируются на одной и той же текстовой коллекции - это коллекция финансовых сообщений информационного агентства Рейтер, которая была специально создана несколько лет назад для тестирования методов автоматической рубрикации текстов.
Эта коллекция характеризуется следующими основными чертами:
Все эти особенности коллекции значительно упрощают решение задачи машинного обучения автоматической рубрикации текстов.
Проблемы автоматического рубрицирования связаны со следующими обстоятельствами:
Например, если рубрика в рубрикаторе новостей называется "Выборы", то обычно не считается правильным, если к этой рубрике будет отнесен текст о выборах президента UEFA.
Текст отнесен не к той рубрике из-за того, что некоторые слова, сопоставленные рубрике, в конкретном тексте употреблены в другом значении - таком, которое не соответствует данной рубрике.
Ложная корреляция может возникнуть в случаях, когда для отнесения текста к рубрике необходимо присутствие в тексте двух логических элементов. Например, для рубрицирования по рубрике "Экономические реформы" необходимо присутствие в тексте двух тематических элементов - темы экономики и темы реформы. Ложная корреляция и, соответственно, неправильное отнесение текста к данной рубрике возникает в тех случаях, когда такие тематические элементы присутствуют в тексте, но не имеют отношения друг к другу, например, такая ситуация может произойти, если в тексте речь шла о судебной реформе и были упомянуты некоторые экономические вопросы.
Текст отнесен к рубрике по слову или словосочетанию, которое по сути соответствует содержанию рубрики, но в данном тексте это опорное слово или словосочетание употреблено случайно или в каком-то специфическом контексте, из-за чего текст становится нерелевантным рубрике.
Например, текст может быть отнесен к рубрике "Средства массовой информации" на основе следующего фрагмента: Около 40 человек умерли во Франции в результате установившейся в стране жары: Правительство и средства массовой информации следят за ситуацией:"
Правильная рубрика не определена, поскольку в тексте упомянуты слова, не описанные в словаре системы рубрицирования.
Может стать причиной потери правильной рубрики для рубрикации.
Может привести к пропуску правильной рубрики при автоматической рубрикации, например, если в состав документа входит заголовок и большая таблица, при этом все информация для правильного отнесения текста к рубрике содержится только в заголовке.
В задаче рубрикации текстов используются различные методы машинного обучения, иллюстрируемые следующими рисунками (рис. 10.5-10.8).

(рис 10.6) Отсечение по центрам тяжести(рис 10.5) Отсечение по ближайшим соседям (kNN)
(рис 10.8) Отсечение по ближайшим точкам (SVM)(рис 10.7) Оптимальный линейный сепаратор SVM (Support Vector Machines). Оптимизация по критерию максимизации расстояния между двумя параллельными поддерживающими плоскостями
Реальные задачи рубрикации текстов в значительной мере отличаются от задачи классификации сообщений на тестовой коллекции агентства Рейтер. На практике, если перед достаточно большой компанией встает задача автоматической рубрикации текстов, то обычно используются автоматизированные технологии, основанные на ручном подборе лексики под каждую рубрику
Факторами, усложняющими или делающими невозможным применение методов машинного обучения для автоматической рубрикации текстов, являются следующие:
В информационной системе УИС РОССИЯ реализована система автоматического рубрицирования, способная рубрицировать тексты различных типов (официальные документы, сообщения информационных агентств, газетные статьи), ее легко можно настроить на новый
Реализация такой гибкой технологии автоматического рубрицирования основывается на определенных способах представления знаний о предметной области и представления текстовой информации:
Каждая рубрика R описывается дизъюнкцией альтернатив, каждый дизъюнкт представляет собой конъюнкцию:
Конъюнкты, в свою очередь, описываются экспертами с помощью так называемых "опорных" понятий тезауруса. Для каждого опорного понятия задается правило его расширения f(•), определяющее, каким образом вместе с опорным понятием учитывать подчиненные ему по иерархии понятия. Выделяются три случая - без расширения (обозначается символом N ), полное расширение по дереву иерархии тезауруса (символ E ) и расширение только по родо-видовым связям (символ L ).
(рис 10.9) Схема описания рубрикиОпорный концепт может быть как "положительным", который добавляет нижерасположенные понятия в описание конъюнкта, так и "отрицательным", который вырезает свои подчиненные понятия. Последовательность учета положительных и отрицательных опорных понятий регулируется заданием специального атрибута. Результатом применения расширения опорных понятий является совокупность понятий тезауруса, полностью описывающая конъюнкт:
$$K_{ij}=\bigcup\limits_m f_m(c_{ijm})\setminus\bigcup\limits_n f_n(e_{ijn})=\bigcup\limits_k d_{ijk}$$Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.