Онтологии и тезаурусы: модели, инструменты, приложения

Лингвистическая онтология WordNet

Разбить на страницы
Показывать лекцию целиком

8.1. Описание ресурса. EuroWordNet

Лингвистический ресурс WordNet разработан в Принстонском университете США. WordNet относится к классу лексических онтологий, свободно доступен в Интернете, и на его основе были выполнены тысячи экспериментов в области информационного поиска.

WordNet версии 2.1 охватывает приблизительно 155 тысяч различных лексем и словосочетаний, организованных в 117 тысяч понятий, или совокупностей синонимов (synset); общее число пар "лексема-значение" насчитывает 200 тысяч.

Разработка тезауруса была начата в 1984 году. В 1995 году WordNet появился в Интернете в свободном доступе и вызвал всплеск исследований по его использованию в различных компьютерных приложениях автоматической обработки текстов. Результаты применения WordNet оказались не столь однозначно положительными, но WordNet открыл новую эпоху разработки сверхбольших структурированных лингвистических ресурсов, вызвал появление большого числа последователей в разных странах, создающих такие "ворднеты" для своих языков, а также стал базой для многоплановых дискуссий и исследований того, на основе каких принципов должны строиться большие лингвистические ресурсы, пригодные для разнообразных приложений в области компьютерной лингвистики.

Первоначально WordNet создавался как модель человеческой памяти. Многие решения представления описаний слов в WordNet мотивируются психолингвистическими экспериментами. Однако нужно отметить, что WordNet вызвал значительно больший интерес у компьютерных лингвистов, чем у психолингвистов.

WordNet: основные принципы

Основоположник WordNet Джордж Миллер формулирует основные гипотезы, лежащие в основе разработки WordNet, следующим образом:

  • гипотеза отделимости: описание лексического компонента естественного языка может быть отделено и может изучаться отдельно;
  • гипотеза "образца" (patterning hypothesis): существует такое формальное описание слов, которое может быть применено к большинству слов языка;
  • гипотеза о покрытии (comprehensiveness hypothesis): для эффективного использования компьютерного словаря в приложениях автоматической обработки текстов такие словари должны быть очень большой величины.
  • В то время была популярной теория семантического компонентного анализа, в которой предполагалось, что значение слова, как и значение предложения, может быть представлено на основе набора семантических примитивов. Однако годы исследований не выявили лучшего набора семантических примитивов, пригодного для использования в ресурсах для обработки естественного языка.

    В качестве альтернативы был выбран подход так называемой реляционной семантики, когда значения слов представляются некоторым выражением компонентов, а не на основе описания отношений между значениями разных слов.

    Основным отношением в WordNet является отношение синонимии. Наборы синонимов - синсеты - основные структурные элементы WordNet.

    Понятие синонимии базируется на критерии, что два выражения являются синонимичными, если замена одного из них на другое в предложении не меняет значения истинности этого высказывания.

    Понятие синонимии, используемое в WordNet, не требует заменяемости синонимов во всех контекстах - по такому критерию в естественном языке было бы слишком мало синонимов. Используется значительно более слабое утверждение, что синонимы WordNet должны быть взаимозаменимы хотя бы в некотором множестве контекстов. Например, замена plank для слова board редко меняет значение истинности в контексте плотницкого дела, но существуют контексты, где такая замена не может считаться приемлемой.

    Именно определение синонимии в терминах заменимости делает необходимым разделение WordNet на отдельные подструктуры по частям речи.

    В состав словаря входят лексемы, относящиеся к четырем частям речи: прилагательное, существительное, глагол и наречие. Лексемы различных частей речи хранятся отдельно, и описания, соответствующие каждой части речи, имеют различную структуру.

    Синсет может рассматриваться как представление лексикализованного понятия (концепта) английского языка.

    Авторы считают, что синсет существительных представляет понятия существительных, глаголы выражают глагольные концепты, прилагательные - концепты прилагательных и т.п.

    Кроме того, авторы считают, что такое разделение соответствует психолингвистическим экспериментам, что представление информации о прилагательных, существительных, глаголах и наречиях устроено в человеческой памяти по-разному.

    Большинство синсетов снабжены толкованием, подобным толкованиям в традиционных словарях, - это толкование рассматривается как одно для всех синонимов синсета. Если слово имеет несколько значений, то оно входит в несколько различных синсетов.

    Описание существительных

    Между существительными в словаре установлены следующие семантические отношения:

  • синонимия;
  • антонимия;
  • гипонимия/гиперонимия - отношение, которое иначе может быть названо ВЫШЕ-НИЖЕ, isA -отношение. Отношение транзитивно и несимметрично. Гипоним наследует все свойства гиперонима. Это отношение является центральным отношением для описания существительных;
  • меронимия (отношение ЧАСТЬ-ЦЕЛОЕ ). Внутри этого отношения выделяются отношения быть_элементом и быть_сделанным_из.
  • WordNet: гипонимы

    Основным отношением между синсетами существительных является родо-видовое отношение, при этом видовой синсет называется гипонимом, а родовой - гиперонимом. Это транзитивное иерархическое отношение, которое может быть также названо isA -отношением.

    Синсет X называется гипонимом синсета Y, если носители английского языка считают нормальными предложения типа " An X is a (kind of) Y ".

    Таким образом, отношения между синсетами образуют иерархическую структуру.

    При построении иерархических систем на базе родо-видовых отношений обычно предполагается, что свойства вышестоящих понятий наследуются нижестоящими - так называемое свойство наследования.

    Таким образом, существительные в WordNet организованы в виде иерархической системы с наследованием; были сделаны систематические усилия, чтобы для каждого синсета найти его родовое понятие, его гипероним.

    При этом предполагается, что есть возможность найти различия между синонимией и гиперонимией. На практике, однако, различие не всегда очевидно.

    Кроме того, если традиционные словари могут в качестве различных значений одного и того же слова включить и более широкое, и более специализированное значение, например, board (доска) в широком смысле и в более специализированном, как surfboard (доска для серфинга), при разработке WordNet предпочтение отдавалось решениям, в которых одно и то же слово не представлено и в синсете гипонима, и в синсете гиперонима.

    WordNet разделяет существительные на несколько иерархий, каждая со своим начальным понятием. Всего для существительных имеется 25 синсетов верхнего уровня, такие как {act, activity} (деятельность), {animal, fauna} (животное), {artifact} (продукт труда), {food} (пища), {process} (процесс), {quantity, amount} (количество) и др.

    Отношение ЧАСТЬ-ЦЕЛОЕ

    Меронимия представляет собой скорее совокупность несколько отличающихся отношений, чем четкое отделяемое отношение.

    В качестве первого определения меронимии, которое, однако, исключает некоторые очевидные случаи отношения ЧАСТЬ-ЦЕЛОЕ, может служить следующее положение:

    X является меронимом Y тогда и только тогда, если предложения вида " Y имеет X (или Xы) " и " X - это часть Y " являются нормальными для X и Y, интерпретируемых как родовые понятия.

    Сущности, такие как группы, классы и коллекции, состоят в отношении меронимии со своими элементами:

  • Примеры групп: племя, команда, комитет, семья, оркестр, суд, отряд и др.
  • Примеры классов: пролетариат, аристократия, буржуазия.
  • Примеры коллекций: куча, лес, библиотека (как коллекция книг).
  • Отношение ЧАСТЬ-ЦЕЛОЕ представляет собой семейство близких отношений. Наиболее центральным типом этого отношения являются физические объекты.

  • Если и ЧАСТЬ, и ЦЕЛОЕ являются неисчислимыми, то говорят об отношении ингредиентов, например: спирт - водка.
  • Если ЧАСТЬ - исчислимое, а ЦЕЛОЕ - неисчислимое, то говорят об отношении ЧАСТИЦА-ВЕЩЕСТВО: песчинка - песок, снежинка - снег, капля - дождь.
  • Если ЧАСТЬ - неисчислимое, а ЦЕЛОЕ - исчислимое, то это так называемое отношение МАТЕРИАЛ-ОБЪЕКТ: стекло - бокал.
  • В WordNet выделяются три подвида отношения ЧАСТЬ-ЦЕЛОЕ: собственно часть, быть_элементом и быть_сделанным_из, например:

  • собственно часть:
  • flower, bloom, blossom - (reproductive organ of angiosperm plants esp. one having showy or colorful parts)
  • PART OF: angiosperm, flowering plant - (plants having seeds in a closed ovary)
  • элемент:
  • homo, man, human being, human - (any living or extinct member of the family Hominidae)
  • MEMBER OF: genus Homo - (type genus of the family Hominidae)
  • вещество:
  • glass - (a brittle transparent solid with irregular atomic structure)
  • SUBSTANCE OF: glassware, glasswork - (articles made of glass)
  • SUBSTANCE OF: plate glass, sheet of glass - (glass formed into a thin sheet)
  • Для частей характерно, что у многих разных сущностей части могут называться одинаково, например, point (острие) может быть у стрелы, ножа, иголки, карандаша, булавки и т.п. В таких случаях описываются все такие холонимы, например,

  • собственно часть:
  • point - (sharp end; "he stuck the point of the knife into a tree"; "he broke the point of his pencil")
  • PART OF: awl - (a pointed tool for marking surfaces or for punching small holes)
  • PART OF: icepick, ice pick - (pick consisting of a steel rod with a sharp point; used for breaking up blocks of ice)
  • PART OF: knife - (edge tool used as a cutting instrument; has a pointed blade with a sharp edge and a handle)
  • PART OF: needle - (a sharp pointed implement (usually steel))
  • PART OF: pencil - (a thin cylindrical pointed writing implement; a rod of marking substance encased in wood)
  • PART OF: pin - (a small slender (often pointed) piece of wood or metal used to support or fasten or attach things)
  • Авторы подчеркивают, что одной из проблем описания отношений меронимии является то, что части описываются несколько выше, чем это необходимо. Например, часто утверждается, что колесо - это часть транспортного средства, но тогда сани не являются транспортным средством. Однако часто такая ситуация является следствием того, что понятие необходимого уровня не лексикализовано в языке. Для данного конкретного примера WordNet вводит специальное дополнительное понятие {wheeled vehicle} - колесное транспортное средство.

    Описание прилагательных

    Прилагательные делятся на качественные и относительные.

    Семантическое описание качественных прилагательных значительно отличается от описания других основных категорий слов и базируется не на отношении гипонимии, а на отношении антонимии.

    Важность этого отношения для качественных прилагательных проявляется в психолингвистических тестах: когда человека просят назвать ассоциацию на качественное прилагательное, он чаще всего называет его антоним. Например, самая частая ассоциация на слово good (хороший) - это слово bad (плохой), и наоборот.

    Важность антонимии для организации качественных прилагательных становится понятной, если учесть, что функцией этих прилагательных является выражение величин атрибутов, и эти атрибуты обычно являются биполярными. Антонимичные прилагательные обычно выражают противоположные полюса атрибута.

    Авторы WordNet подчеркивают, что не всегда слова, противоположные по смыслу, рассматриваются носителями языка как антонимы; так, например, два близких по смыслу слова heavy (тяжелый) и weighty (тяжеловесный) имеют два разных антонима - light (легкий) и weightless (невесомый) соответственно. Кроме того, некоторые слова не имеют непосредственных антонимов: например, каков антоним слова ponderous (громоздкий)? Возможный антоним - прилагательное light - является безусловным антонимом прилагательного heavy.

    Если отношение антонимии возникает между выделенными парами прилагательных, то возникает вопрос, куда отнести такое прилагательное, как ponderous. Было принято решение такие прилагательные описывать через отношение сходства с одним из тех прилагательных, которые имеют антонимы.

    Таким образом, качественные прилагательные в WordNet представлены как биполярный кластер: центральным является отношение антонимии, для каждого из двух антонимов определены близкие по смыслу прилагательные. Например, описание пары значений прилагательных slow (медленный, медленно двигающийся) и fast (быстрый, быстро двигающийся) выглядит следующим образом: указана пара антонимов slow - fast, для которых описываются так называемые головные синсеты, приводятся толкования и примеры. Для каждого головного синсета описываются так называемые сателлитные синсеты, которые представляют синсеты, семантически близкие соответствующему головному синсету (и частично являющиеся его специализациями), такие как lazy (ленивый, медленно двигающийся), slow-moving (медленно двигающийся) и др.

    Пример кластера прилагательных:

  • slow (vs. fast ) - (not moving quickly; taking a comparatively long time; "a slow walker"; "the slow lane of traffic"; "her steps were slow"; "he was slow in reacting to the news"; "slow but steady growth")
  • => bumper-to-bumper - (used of traffic; "bumper-to-bumper traffic")
  • => dilatory, laggard, poky, pokey - (wasting time)
  • => dragging - (passing painfully or tediously slowly; "the dragging minutes")
  • => drawn-out - ((used of speech) uttered slowly with prolonged vowels)
  • => lazy - (moving slowly and gently; "up a lazy river"; "lazy white clouds"; "at a lazy pace")
  • => long-play, long-playing - ((used of records) playing at a slower speed and for a longer time than earlier records)
  • => slow-moving - (moving slowly; "slow-moving cars")
  • => sluggish, sulky - (with little movement; very slow; "a sluggish stream")
  • Отдельную группу составляют прилагательные цвета. Все оттенки цветов представляются как синсеты-саттелиты к прилагательному colored (цветной), которому противопоставлено как антоним прилагательное uncolored (нецветной). Оттенки от белого к черному представлены как семантически близкие синсеты к прилагательному achromatic (бесцветный).

    Значение относительных прилагательных представлено как отсылка к соответствующему синсету существительных. Для некоторых прилагательных одно из значений представлено как качественное прилагательное через антонимическую пару, а второе - как относительное прилагательное. Например, для прилагательного agricultural (сельский, сельскохозяйственный) первое значение отсылает к синсету слова agriculture (сельское хозяйство), а второе представлено как элемент пары антонимов сельский - городской.

  • Sense 1
  • agricultural - (relating to or used in or promoting agriculture or farming; "agricultural engineering"; "modern agricultural (or farming) methods"; "agricultural (or farm) equipment"; "an agricultural college")
  • Pertains to noun agriculture (Sense 2)
  • => farming, agriculture, husbandry - (the practice of cultivating the land or raising stock)
  • => cultivation - ((agriculture) production of food by preparing the land to grow crops)
  • Sense 2
  • agrarian, agricultural, farming (prenominal) - (relating to rural matters; "an agrarian (or agricultural) society"; "farming communities")
  • => rural (vs. urban ) - (living in or characteristic of farming or country life; "rural people"; "large rural households"; "unpaved rural roads"; "an economy that is basically rural")
  • Описание глаголов

    Для описания глаголы были разделены на семантические поля. На первом этапе были отделены глаголы, обозначающие действия и события, от глаголов, обозначающих состояния. Первая группа глаголов была разделена на 14 семантических полей: глаголы движения, восприятия, контакта, коммуникации, соревнования, изменения, познания, потребления, создания, эмоций, обладания, ухода за телом и глаголы, относящиеся к социальному поведению.

    Границы между группами являются достаточно расплывчатыми. Например, многие глаголы не могут быть однозначно расклассифицированы как глаголы познания или коммуникации ( wonder, speculate, confirm, judge и др.). Также, например, глагол whistle в предложении "The bullet whistled past him" может классифицироваться и как глагол издания звука, и как глагол движения. Если такие глаголы представлять как однозначные, они должны относиться более чем к одному семантическому полю. В WordNet глаголы чаще описывались как полисемичные, если обнаруживалось, что они могут быть отнесены одновременно к разным семантическим полям.

    Основу описания иерархии глаголов составляют отношения тропонимии (см. ниже). Кроме того, описываются отношения ПРИЧИНА-СЛЕДСТВИЕ (каузальные отношения) и другие отношения лексического следствия.

    Отношения между синсетами глаголов

    Отношение логического следования

    Это отношение устанавливается между синсетами глаголов V1 и V2, если из предложения "Someone V1 " логически следует "Someone V2 ". Например, из того, что "Человек идет", следует, что "Человек делает шаг".

  • Sense 1
  • walk, go on foot, foot, leg it, hoof, hoof it - (use one's feet to advance; advance by steps)
  • => step, take a step
  • Другой пример: из "храпеть" следует "спать", так как из предложения "Он храпит" следует "Он спит".

    Отношение тропонимии

    Лингвистический тест, который использовался для определения гипонимии между существительными: "An x is an y " - не подходит для глаголов, поскольку требует, чтобы x и y были существительными. Поэтому понадобилось предложить другой лингвистический текст для установления иерархических отношений между глаголами, и также было введено специальное название отношения - тропонимия. Используемый лингвистический тест таков: "To V1 is to V2 in some particular manner". Например, " Mumbling is talking in some particular manner" (" Бормотать - значит говорить некоторым специальным образом").

    Отношение тропонимии представляет собой специальный вид отношения следования.

    Глагольные иерархии, образованные отношением тропонимии, создают более узкую, но более кустистую структуру, чем существительные. В подавляющем большинстве случаев число уровней иерархии не превышает четырех.

    Отношение причины

    Отношение причины связывает два глагольных синсета, один из которых может быть назван каузатив (например, давать ), а второй - результатив (например, иметь ). Английский язык имеет лексикализованные каузативные пары, такие как " показывать - видеть ".

    Кроме того, WordNet устанавливает отношение причины от каузативных транзитивных глаголов к соответствующим инхоативным нетранзитивным значениям тех же слов. В качестве примеров можно рассмотреть такие глаголы, как blacken, develop, break, shrink.

    Отношение причины систематически представлено среди глаголов перемещения, соединяя каузативное и некаузативное употребление, например: blow (выдуть - выдуться).

  • Sense 1
  • kill - (cause to die)
  • => die, pip out, decease, perish, go, exit, pass away, expire - (pass from physical life and lose all bodily attributes and functions necessary to sustain life; "She died from cancer"; "They children perished in the fire"; "The patient went peacefully")
  • Отношение причины также может быть рассмотрено как специальный случай следования. Если V1 необходимо вызывает V2, значит, из V1 также логически следует V2.

    EuroWordNet

    Ресурс WordNet, разработанный для английского языка, вызвал в мире огромный интерес к разработке такого рода ресурсов для десятков других языков.

    Создание ворднетов для разных языков в рамках проекта EuroWordNet включает два этапа. На первом этапе (1996-1999) ворднеты создавались для голландского, испанского и итальянского языков. На втором - для французского, чешского, немецкого и эстонского языков.

    В проекте стоял серьезный выбор: нужно ли стремиться к разработке языково-независимой структуры, с которой необходимо сопоставить единицы каждого языка, или, может быть, нужно иметь единую систему синсетов - новая единица в иерархической сети может быть включена, если хотя бы один язык из рассматриваемых имеет лексему или устойчивый оборот с таким значением.

    По принятому в проекте решению каждый ворднет должен сохранять специфику своего языка. При этом каждый ворднет должен содержать отсылки на значения английского ворднета, что позволяет сравнивать ворднеты, обнаруживать непоследовательности в их построении и видеть различия в устройстве языковых систем.

    Одновременно в рамках проекта была создана небольшая онтология верхнего уровня, к которой должен быть приписан каждый создаваемый ворднет.

    Авторы проекта EuroWordNet подчеркивают различие между ресурсом класса wordnet как лингвистическими онтологиями и формальными онтологиями. Лингвистическая онтология должна отражать отношения между лексикализованными словами и выражениями языка, например, описывать, какие слова могут использоваться, чтобы заменить в тексте слово spoon (ложка) - object, tableware, silverware, merchandise, cutlery.

    Таким образом, ворднеты - это сеть языково-специфичных лексикализованных единиц (в отличие от формальных онтологий, которые представляют собой структуру данных с формально определенными понятиями).

    Основные предполагаемые применения ворднетов - это предсказание той или иной возможной замены лексических единиц в тексте для целей информационного поиска, генерации текстов, машинного перевода, разрешения лексической многозначности.

    Учитывая сложности, которые возникали при применении ворднетов в приложениях, европейские разработчики предложили ряд существенных нововведений в структуре создаваемых ворднетов. Большой класс этих изменений касается описания отношений между синсетами, которые можно разделить на следующие группы:

  • приписывание дополнительных атрибутов к существующим отношениям;
  • введение отношений между различными частями речи;
  • введение дополнительных отношений между словами (синсетами) одной части речи.
  • Индекс ILI

    Для того чтобы установить связи между различными языками, в проекте EuroWordNet синсеты каждого ворднета имеют отсылку на так называемый межязыковой индекс (interlingual index), в качестве которого выбираются синсеты Принстонского WordNet.

    (рис 8.1) Архитектура базы данных EuroWordNet

    Онтология верхнего уровня в EuroWordNet

    Онтология верхнего уровня EuroWordNet состоит из 63 признаков, которые могут комбинироваться. Назначение онтологии - служить единым описанием понятий верхнего уровня для ворднетов.

    Все сущности делятся на три класса: сущности 1-го порядка, 2-го порядка и 3-го порядка.

  • Конкретные синсеты характеризуются как сущности 1-го порядка и могут описываться 4 ролями теории порождающего лексикона Дж. Пустейовского: происхождение, форма, состав и функция. Например, vehicle (транспортное средство) описывается следующими признаками: артефакт (происхождение) + объект (форма) + транспортное средство (функция).
  • События, действия, отношения принадлежат к сущностям 2-го порядка, которые характеризуются по типу ситуации: динамические или статические, а также могут определяться одним или более ситуационными компонентами: причина, ментальный, физический, расположение, цель и др. Каждая сущность 2-го порядка имеет один тип ситуации и один или более ситуационных компонентов. Например, change location характеризуется как динамический + расположение + агентивный (причина) + физический.
  • Сущности 3-го порядка представляют собой ненаблюдаемые сущности, которые существуют вне пространства и времени. Они могут скорее истинными или ложными, чем реальными. Они могут утверждаться, отрицаться, запомниться или забыться. Примеры: идея, мысль, теория, план.
  • Контрольные вопросы

  • Как называются элементарные структурные единицы WordNet?
  • Перечислите основные отношения в WordNet.
  • Какими средствами в WordNet представляются глаголы?
  • 8.2. WordNet: применение в информационном поиске

    Для того чтобы попытаться реализовать схему автоматического концептуального индексирования и концептуального поиска, необходимо иметь лингвистический ресурс, организованный на основе понятий или значений слов. Поэтому такие ресурсы, как WordNet, могут использоваться как база для организации приложений концептуального индексирования и поиска. В этой лекции рассматривается два нижеследующих эксперимента.

    Векторная модель информационного поиска с вектором по синсетам WordNet

    Целью экспериментов была попытка выполнить поиск документов на основе не отдельных слов, а значений WordNet. Для каждого документа сначала выполняется процедура разрешения многозначности существительных, которая выбирает единственное значение и в результате которой каждому тексту ставится в соответствие вектор синсетов WordNet. После того как вектор создан, с ним могут выполняться такие же операции, как и с пословными векторами.

    Эффективность использования векторов синсетов сравнивалась с эффективностью информационного поиска на основе стандартной модели, использующей вектора слов. В стандартном прогоне и документы, и запросы представляются как вектора лемм всех значимых слов. В концептуальных прогонах и документы, и запросы представляются как вектора, состоящие из трех подвекторов:

  • вектор лемм слов, не найденных в WordNet, либо найденных, но многозначность которых не удалось разрешить (например, не являющихся существительными);
  • вектор синсетов существительных для слов с разрешенной многозначностью;
  • вектор лемм существительных для слов с разрешенной многозначностью.
  • Второй и третий подвектора представляют собой альтернативные представления документа, поскольку одни и те же слова этого документа порождают отдельные элементы каждого вектора.

    Для каждого запроса стандартный прогон векторной модели сравнивался со следующими комбинациями перечисленных выше подвекторов (цифры соответствуют весу, который дается 1-му, 2-му и 3-му подвектору, соответственно):

  • 110 - данная комбинация дает одинаковые веса словам, отличным от существительных, и синсетам существительных;
  • 211 - данная комбинация учитывает как синсеты существительных, так и леммы существительных, поэтому оставшиеся слова учитываются в двойном размере;
  • 101 - в данной комбинации подвектор синсетов существительных игнорируется, а леммы существительных и другие леммы документа получают одинаковые веса. Обратите внимание, что этот вектор отличается от стандартного прогона, поскольку результат сравнения для системы подвекторов вычисляется как сумма результатов сравнения каждого вектора.
  • Для экспериментов было использовано 5 разных коллекций документов (компьютерная область, медицинская область, газетные статьи и др.), и для каждой коллекции было выполнено более 30 различных запросов.

    Оценки эффективности информационного поиска на основе показателя средней точности показали серьезное ухудшение эффективности для векторов, включающих синсеты (от 6,2% до 42,3%).

    Основная причина такого ухудшения эффективности заключается в том, что процедура разрешения многозначности для слова в запросе может выбрать одно значение, а для того же слова в документе - другое значение. Например, при поиске по запросу "separation anxiety in infants and preschool children" из первых 15 документов стандартный прогон выдает 7 релевантных документов, в то время как прогон 110 - только один релевантный документ. Проблема вызвана выбором значения слова separation, для которого в WordNet описано 8 значений. Процедура разрешения многозначности выбирает такое значение этого слова в запросе, которое не было выбрано ни в одном из релевантных текстов.

    Эксперименты по расширению запросов на основе отношений WordNet

    Другая группа экспериментов по использованию WordNet в информационном поиске исследовала возможность расширения запросов синонимами или другими словами, связанными со словами запроса отношениями, которые описаны в WordNet. В таких экспериментах нет необходимости выбора единственного значения слова, что в случае ошибки привело бы к серьезному ухудшению результатов поиска.

    Для экспериментов были использованы следующие соображения.

    Во-первых, расширяться должны только важные для запроса понятия. Важность аппроксимируется количеством документов, в которых встречается конкретное слово запроса - слова, частотность которых в документах коллекции больше некоторого числа N, не участвуют в расширении запроса.

    Во-вторых, чтобы смоделировать разрешение многозначности, запрос расширяется только теми словами, которые оказались в окрестностях расширения по крайней мере двух слов запроса.

    Таким образом, сначала для каждого слова запроса, частотность которого меньше некоторого числа N, и каждого синсета для значений этого слова извлекается список близких по WordNet слов.

    Те слова, которые встретились по крайней мере в двух таких списках, добавляются к исходному запросу.

    Исследовались различные величины N - 10% коллекции и 5% коллекции.

    Для расширения запроса использовались синсеты, находящиеся на расстоянии одного или двух отношений от исходных синсетов - все виды связей трактовались одинаково.

    Добавленные слова могли учитываться с разными величинами весов: w = 0.3, 0.5, 0.8.

    Максимальное улучшение, которое удалось получить, - 0.7% средней точности, что не является статистически значимой величиной ( N = 5%, расстояние - 2, w = 0.3 ).

    Авторы подчеркивают, что идея аппроксимации разрешения многозначности путем поиска повторов в списках расширения оказалась неэффективной в виду того, что чаще всего это метод приводил к добавлению в запрос очень общих слов, таких как "система".

    Для того чтобы исключить из рассмотрения эффект лексической многозначности и исследовать возможности WordNet по расширению поискового запроса, были выполнены эксперименты с ручным выбором значения многозначных слов в запросе.

    Для каждого синсета, соответствующего слову запроса, в запрос могут быть добавлены разные слова на основе различных отношений данного синсета, например: синонимы; гипонимы (все слова из нижестоящих синсетов иерархии гипоним-гипероним ); все слова, отстоящие на один шаг от текущего синсета по любому типу отношений.

    Чтобы исследовать все такие возможности, был образован вектор, состоящий из 11 подвекторов: 10 - для слов исходного запроса, один - для синонимов, один - для каждого типа отношений существительных в WordNet. Сходство с документами вычислялось как взвешенная сумма результатов сравнений с каждым из подвекторов.

    Исследовались четыре варианта векторов:

  • расширение только по синонимам;
  • расширение "синонимы + полная иерархия вниз";
  • расширение "синонимы + родители + полная иерархия вниз";
  • расширение "синонимы + слова из любых синсетов на один шаг по любому типу отношений".
  • Тестирование проходило на двух типах вопросов: более длинной и более короткой версии. При поиске по полному запросу ни одной из комбинаций не удалось улучшить результаты поиска более чем на 2 процента. Короткие вопросы состояли из небольшого списка синсетов, например, {cancer}, {skin_cancer}, {phramaceutical}.

    Для укороченного запроса, используя 4-й тип расширения, при котором все добавления учитывались с коэффициентом 0,5, было получено 35% улучшение: средняя точность для укороченного запроса без расширения была 0,1634, с расширением - 0,2205. Средняя точность поиска по полному запросу - 0,3586.

    Выводы авторов эксперимента заключаются в том, что для успешного применения WordNet в информационном поиске необходимо значительно улучшить эффективность автоматического разрешения лексической многозначности, между тем парадигматических отношений в WordNet недостаточно для решения этой задачи.

    Проект Meaning

    Проект Meaning является продолжением проекта EuroWordNet. Авторы проекта мотивируют необходимость продолжения работ тем, что десятки человеко-лет были затрачены для создания ворднетов для разных языков, но этих усилий недостаточно, чтобы обеспечить качество многоязычных приложений компьютерной обработки текстов.

    Прогресс в этой области связан с решением двух промежуточных задач: автоматическое разрешение лексической многозначности и масштабное обогащение лексических баз знаний.

    Проблема, однако, заключается в том, что существуют взаимозависимые факторы:

  • для того чтобы достичь качественного разрешения лексической многозначности, необходимо значительно больше лингвистических и семантических знаний, чем имеется в текущих лексических базах знаний (к примеру, в ворднетах);
  • для того чтобы обогатить существующие лексические базы знаний, необходимо получать информацию из корпусов с качественной семантической разметкой.
  • В проекте планируется выполнить три последовательных цикла масштабного разрешения лексической многозначности и извлечения знаний для пяти европейских языков, включая баскский, испанский, итальянский, голландский и английский языки. Накопленные знания должны храниться в Многоязычном Центральном Репозитории.

    Эксперименты по семантическому индексированию в рамках проекта Meaning

    В рамках европейского проекта Meaning голландская компания Irion Technologies разработала технологию концептуального индексирования TwentyOne, комбинирующую лингвистический и статистический подходы. Авторы разработки считают, что неудачи с применением WordNet в информационно-поисковых приложениях связаны с трудностями встраивания такого рода лингвистических ресурсов в приложения, а также с проблемами оптимального использования содержащейся в ворднетах информации.

    Основой технологии является статистическая машина поиска, базирующаяся на стандартной векторной модели и обеспечивающая быстрый поиск документов.

    Лингвистические технологии используются для улучшения результатов, выданных статистической машиной, в двух направлениях:

  • максимизация полноты результатов за счет использования синонимии ворднетов;
  • максимизация точности результатов за счет сравнения запросов с конкретными фразами документов, а не с целыми документами.
  • Фраза представляет собой именную группу (noun phrase). Каждая фраза ассоциируется с отдельными словами, определенной комбинацией слов, а также комбинацией частей слов.

    Система TwentyOne использует совокупность факторов для сравнения запроса с фразами текста:

  • число совпадающих концептов между запросом и каждой фразой;
  • степень нечеткого сопоставления между запросом и каждой фразой;
  • степень деривационного несовпадения, слитного/раздельного написания и т.п.;
  • были ли использованы синонимы;
  • был ли использован тот же язык.
  • Суть технологии в том, что сначала выдаются документы, которые имеют наибольшее совпадение по концептам фраз с запросом. Среди документов, имеющих одинаковое количество сопоставленных понятий между собственными фразами и запросом, первыми выдаются наиболее схожие по конкретному набору слов.

    В проводимых экспериментах для сравнения были построены четыре индекса:

  • HTM - традиционный пословный индекс;
  • NP - индексы именных групп из запроса, с применением пословных методов, без использования ворднетов;
  • FULL - полные индексы с использованием ворднетов, но без процедуры разрешения многозначности, что приводит к полному расширению по синонимам и переводам для всех возможных значений слов запроса;
  • WSD - индексы, использующие ворднеты вместе с процедурой снижения многозначности на основе предметных областей ворднет.
  • В эксперименте индексы тестируются в системе автоматической рубрикации текстов на коллекции Reuter. Описывается, что максимальных значений F-меры система автоматической рубрикации достигает для индекса WSD: полнота - 80,7, точность - 72,2. Минимум система имеет на базе индекса HTM: полнота - 67,8, точность - 70,4.

    Нужно, однако, отметить, что описываемые результаты на основе пословного индекса значительно ниже, чем результаты других пословных систем на основе этой же коллекции. Иными словами, произведенные улучшения получаются по сравнению с заниженным недостаточно эффективным уровнем работы системы на основе пословного индекса, и значительные улучшения могли бы быть осуществлены еще в рамках такого индекса.

    Контрольные вопросы

  • Что такое концептуальное индексирование и концептуальный поиск?
  • Каковы проблемы использования онтологии в информационном поиске?
  • 8.3. WordNet: применение в вопросно-ответных системах

    Вопросно-ответная система представляет собой вид информационно-поисковых систем. Она должна предоставить не набор документов, которые наиболее релевантны поставленному вопросу, а выдать точный ответ на данный вопрос.

    Разработки вопросно-ответных систем были начаты в 1960-е годы. В то время предполагалась, что ответ на вопрос должен отыскиваться в специально подготовленных базах знаний.

    Второе рождение вопросно-ответные системы начали переживать с 90-х годов XX века. Тогда возникла необходимость искать ответы в больших текстовых коллекциях.

    С 1999 года проводится соревнование по вопросно-ответным системам в рамках конференции TREC, с 2003 года соревнования вопросно-ответных систем в многоязычном контексте начаты на конференции CLEF.

    Соревнование систем в рамках этих конференций проводится следующим образом.

    Участникам рассылается большой текстовый массив (более нескольких гигабайт) и порядка 200 вопросов. Нужно прислать текстовые фрагменты (50, 250 байт), содержащие ответы на вопрос. Ответы должны быть упорядочены, при этом засчитываются первые три ответа.

    Оценка производится следующим образом: за правильный ответ на первом месте система получает 1 балл, на втором месте - 0,5 балла, на третьем месте - 0,25 балла. Общая оценка системы получается путем вычисления среднего балла по всем вопросам.

    Основные этапы поиска ответа на вопрос в современных вопросно-ответных системах таковы.

  • Прежде всего, производится подробный анализ вопроса, в результате которого определяется тип вопроса (вопрос времени, места, количества и др.) и соответствующий тип ответа, а также формируется запрос к информационно-поисковый системе.
  • На втором этапе производится поиск релевантных документов или абзацев информационно-поисковой системой, формируется упорядоченный список наиболее релевантных документов (абзацев), из которого выбирается первых n (например, n=100 ) документов (абзацев) для дальнейшей обработки.
  • На третьем этапе производится подробный анализ полученных абзацев: содержит ли абзац требуемый тип ответа, близость слов ответа и вопроса и т.п.
  • Вопросы как особый тип запросов к информационно-поисковой системе

    Как известно, запросы в глобальных информационно-поисковых системах обычно очень короткие - 2-3 слова, и по ним находятся сотни и тысячи документов. Запросы в форме вопросов обычно значительно длиннее, поэтому если требовать присутствия в документе сразу всех слов запроса, то чаще всего не будет найдено ни одного документа.

    Классическая векторная модель на основе сравнения векторов запроса и документа позволяет найти наиболее релевантные документы и по части слов запроса. При этом во многих современных исследованиях по вопросно-ответным системам начали использовать не векторные модели поиска, а выполнять булевский поиск, поскольку считается, что при выполнении данной задачи необходимо осуществлять дополнительный контроль за тем, какие слова из формулировки вопроса обязательно должны присутствовать в тексте ответа, а какие могут пропасть в тексте ответа с минимальным ущербом для релевантности ответа.

    Булевское выражение обычно формируется как конъюнкция всех значимых слов формулировки вопроса. Если проводится морфологический анализ запроса или добавляются синонимы, то они объединяются в дизъюнкцию.

    Например, если задан вопрос " When did Shapour Bakhtiar die?", то может быть образовано следующее булевское выражение:

    Shapour AND Bakhtiar 
    AND (die OR dies OR died OR dying OR death OR deaths)

    Стандартной является ситуация, когда не находится документов, которые содержат все значимые слова вопроса, поэтому при обработке вопроса часто необходимо определить, какие именно слова формулировки вопроса можно отбросить, не включить в поисковый запрос без потери сути вопроса.

    Например, следующему вопросу " Кто из великих целителей прошлого написал трактат "О медицине"?" могут частично соответствовать два предложения:

  • ЦЕЛЬС (Celsus) Авл Корнелий (I в. до н. э.), древнеримский автор энциклопедических трудов "Artes" (сохранился трактат "О медицине", книги 1-8, с ценными сведениями по гигиене, хирургии, дерматологии);
  • А.Е. Ферсман приводит отрывок из трактата "Сокровищница лекарств", написанного арабским целителем около тысячи лет назад: "Ношение бирюзы:
  • Первое из предложений содержит правильный ответ ЦЕЛЬС, во втором предложении кандидатом на ответ является А.Е. Ферсман, что неверно.

    Таким образом, часто булевский вопрос к информационно-поисковой системе, составленный по формулировке вопроса, не находит ни одного документа. Поэтому обычно предлагается система модификаций, упрощающих исходное булевское выражение, после каждой из которых опять происходит обращение к поисковой системе для проверки, не появились ли релевантные документы.

    Используются обычно два основных способа упрощения булевского выражения.

    Во-первых, можно часть конъюнкций переводить в дизъюнкции.

    Вторым способом является поочередное исключение членов конъюнкции на основе некоторого множества эвристик, определяющих значимость членов конъюнкции.

    Значимость членов конъюнкции может определяться на основе их грамматических характеристик в формулировке вопроса. Так, наиболее значимыми обычно считаются имена, фразы в кавычках, а наименее значимыми - глаголы.

    Процесс исключения элементов из конъюнкции прекращается, когда количество документов (абзацев) в выдаче достигает заданного числа (например, 50) или когда остается заданный процент слов исходной формулировки вопроса.

    В связи с длинной формулировкой естественно-языкового вопроса и частым отсутствием в самых больших текстовых коллекциях ответов, содержащих все или большинство слов формулировки вопроса, значимой становится роль лексических ресурсов, позволяющих найти ответы в тех предложениях, в которых часть слов заменена на близкие по смыслу слова.

    Так, например, ответ на вопрос " Почему электрические батареи быстрее разряжаются на холоде?" может быть следующим: " Батарейки быстрее садятся на морозе, потому что...".

    В этом ответе практически каждое слово вопроса имеет соответствующее слово в данном ответе, при этом сделано 3 лексические замены. Пример не придуман, а реально найден в поисковой коллекции. Более лексически точного ответа в текстовой коллекции не нашлось.

    WordNet в вопросно-ответной системе Южного Методистского университета США

    Одной из самых эффективных систем в вопросно-ответной секции конференции TREC стала вопросно-ответная система Южного Методистского университета США, которая на нескольких этапах обработки вопроса и поиска ответа обращается к информации, хранимой в тезаурусе WordNet. В разработанной системе WordNet используется для:

  • распознавания типа вопроса;
  • классификации типов ответов;
  • реализации лексических и семантических замен.
  • Лексические и семантические замены осуществляются в момент сопоставления формальной структуры вопроса и ответа. Поиск в системе организован на основе обработки булевских запросов.

    Реальные вопросы

    Стоит отметить, что вопросы, на которые могла бы искать ответ вопросно-ответная система, очень востребованы в таких случаях, когда, например, люди обращаются в какие-либо компьютерные форумы с просьбой помочь им в решении некоей проблемы (например, при поломке компьютера или в какой-то юридической ситуации). В этих случаях часто оказывается, что такие ситуации уже обсуждались и достаточно просто было бы найти соответствующие ответы: однако имеющиеся ответы были сформулированы несколько иначе, поэтому в простом пословном поиске найти предшествующие аналогии очень трудно.

    Конечно, такие просьбы о помощи редко формулируются как простой, правильно построенный вопрос. Чаще они включают несколько предложений с описанием проблемы и, возможно, более одного вопроса. Например, вопрос может выглядеть таким образом:

    Ноутбук Compaq nx9010, месяц от роду, лицензионная русская XP Home SP1, каждые 3-4 дня загадочно исчезают точки восстановления: просто стираются соответствующие папки. Похоже, что при перезагрузке. Но не уверен. В календаре мастера восстановления - тоже исчезают. На диске свободно 27 Гб, движок стоит на все 12%. На десктопе со времен установки XP ничего подобного никогда не наблюдалось (там без сервиспака). Принятые меры: выключение и снова включение восстановления - ноль внимания. Снесение системы, установка заново - аналогично. Где копать? Машина хорошая, претензий нет. К виндам во всем остальном - тоже. Железо? Винды? Хитрые дрова? Что?

    Обработка таких вопросов значительно более сложна, чем обработка правильно сформированных вопросительных формулировок фактографического характера, которыми является, например, большинство вопросов конференции TREC:

  • фокус вопросов в форумах выражен неявно;
  • используется множество лишних для поиска слов, точный список которых достаточно трудно определить;
  • возможно, в вопросе имеются несколько подвопросов, на которые отвечают разные документы.
  • Контрольные вопросы

  • Назовите основные этапы работы вопросно-ответной системы.
  • Как можно использовать онтологию в вопросно-ответной системе?
  • Опишите механизм обработки булевского запроса в вопросно-ответной системе.
  • 8.4. WordNet: проблемы использования в автоматической обработке текстов

    Смешение типов и ролей

    Одной из серьезных проблем, приводящих к неправильным путям иерархии, является проблема установления таких отношений, когда вышестоящее понятие частично характеризует нижестоящее. Часто это связано с проблемой смешения понятий-типов и понятий-ролей.

    Так, например, Никола Гуарино критикует отношения в WordNet: "Человек всегда живое существо, но он (она) начинает играть роль каузального агента только в некоторых ситуациях. Та же проблема возникает для яблока, которое всегда плод растения, а в некоторых ситуациях может быть пищей. Проблема в том, что человек и яблоко - это типы сущностей, в то время как каузальный агент и пища - это роли".

    Один из аргументов в пользу различения типов и ролей в лингвистических онтологиях - это то, что они различаются в способах наследования свойств. WordNet не различает эти два типа понятий и помещает их в одни и те же иерархии.

    В соответствии с онтологическими подходами понятия-типы не должны находиться в иерархиях ниже понятий-ролей. Более радикальный подход заключается в том, чтобы разделить иерархии типов и ролей.

    Одна из авторов WordNet, Кристиан Фелбаум, отвечая на эту критику Н. Гуарино, заявляет, что в таких ресурсах, как WordNet, неоднородные классификации имеют право на существование, поскольку такие ресурсы рассматриваются в настоящее время прежде всего как инструменты для компьютерной обработки текстов, а не только как совершенные онтологии, которые должны соответствовать строгим онтологическим принципам.

    Вместе с тем важно подчеркнуть, что описание понятий-типов ниже понятий-ролей, то есть установление связей между понятиями, которые выполняются не в любых контекстах, а лишь при некоторых условиях, приводит к ложному срабатыванию этих связей, к неправильному выводу как раз при автоматической обработке текстов.

    Многозначность в WordNet

    Во многих работах признается, что различия значений в WordNet слишком тонки для таких компьютерных приложений, как машинный перевод, информационный поиск, классификация текстов, вопросно-ответные системы и др. Среднее количество значений в WordNet больше, чем в традиционных лексикографических словарях.

    Поэтому выполнен ряд исследований, чтобы разобраться, нельзя ли автоматически, на основе каких-либо разумных принципов собрать некоторые значения многозначных слов в кластеры и далее не различать эти значения.

    Проблема лексической многозначности и информационный поиск

    В частности, исследовался вопрос, какая группировка значений была бы полезной для задач информационного поиска. Предполагается, что некоторые значения могут быть кластеризованы для разных приложений; в то же время существуют примеры пар значений, кластеризация которых была бы полезна в информационно-поисковых приложениях, при этом в других приложениях было бы полезно их различать.

    Отмечается, что исследования регулярной многозначности не приводят к выделению полезных кластеров для информационно-поисковых задач, поскольку, как представляется авторам, некоторые образцы регулярной полисемии хорошо бы не различать для задач информационного поиска, в то время как другие хорошо бы сохранить отдельно. Так, например, полезно было бы кластеризовать такие пары регулярной полисемии, как container / quantity и music / dance. Однако такие образцы, как animal / food, plant / food, animal / skin, language / people хорошо бы различать, поскольку, как представляется, они употребляются в разных типах текстов.

    Поэтому нужны дополнительные исследования критериев кластеризации значений для информационно-поисковых задач.

    Далее сравниваются два дополнительных критерия группировки значений. Первый критерий заключается в том, чтобы группировать значения, которые встречаются в одних и тех же текстах. Для этого используется семантически размеченный корпус SemCor. Второй критерий группирует значения, которые получают одни и те же переводы в нескольких разных языках. Пересечение кластеров, построенных на основе этих двух критериев, составляет 55-60%, что показывает некоторую корреляцию между кластерами, но оставляет сомнения в полезности каждого из критериев.

    Проведенные эксперименты по кластеризации значений привели к выводу, что типология отношения между разными значениями многозначных слов является более полезной, чем формирование кластеров значений, поскольку близость значений зависит от приложения.

    Например, указание, что одно из значений является метафорой исходного значения, является важным для приложений информационного поиска и вопросно-ответных систем, поскольку относится к разным семантическим полям. Однако для приложений машинного перевода это различие может быть несущественно, поскольку метафорический перенос может быть сходным в разных языках. В ворднетах нужно в явном виде описать отношения между значениями для того, чтобы ворднеты стали стандартом лексических ресурсов для компьютерных приложений.

    Современные версии WordNet содержат для каждого многозначного слова указание на самое частотное значение по корпусу SemCor, что дает возможность, в случае проблем при процедуре автоматического разрешения многозначности, выбирать это самое частотное значение.

    Теннисная проблема

    Одной из серьезных проблем WordNet, препятствующей его использованию в приложениях, является так называемая "теннисная проблема": синсеты, принадлежащие одной предметной области, сфере деятельности или ситуации - оказываются очень далеко друг от друга в структуре WordNet.

    Предлагалось решать данную проблему введением в WordNet информации о принадлежности синсетов определенным доменам. Домены, такие как "теннис", "политика" или "образование", группируют синсеты в сценарии или схемы. Так, домен "теннис" включает такие синсеты, как "гейм", "теннисный мяч", "теннисная ракетка", "тайм-брейк" и т.д.

    Предполагается, что введение доменов должно быть особенно полезно для информационно-поисковых задач.

    Разработка иерархической системы доменов началась с 250 рубрик, собранных по различным словарям, и затем была дополнена и уточнена на базе Десятичной классификации Дьюи. Была получена иерархия из 115 доменов, организованных по 4 уровням иерархии, которая включала, например, такие домены, как "сельское хозяйство", "археология", "астрология", "биология", "ветеринария" и др.

    Авторы подчеркивают, что в WordNet имеются синсеты, которые не принадлежат никаким доменам, поскольку могут употребляться в текстах многих предметных областей. Для таких синсетов была введена специальная предметная область, называемая FACTOTUM.

    Для того чтобы разметить все множество синсетов WordNet, была реализована автоматизированная процедура, состоящая из следующих шагов:

  • вручную размечается относительно небольшое количество синсетов верхнего уровня;
  • автоматически по связям (гипонимия, тропонимия, меронимия, антонимия) пометки распространяются на другие синсеты;
  • можно задать исключения, например, для синсета " кресло парикмахера " (" barber_chair "), которое хотя и является частью парикмахерской (" barbershop "), не должно быть отнесено к домену КОММЕРЦИЯ ( COMMERCE ).
  • Эксперименты с доменами в ворднетах были продолжены и в следующем европейском проекте, связанном с ворднетами, - Meaning, в котором 165 иерархически организованных доменов были автоматизированно приписаны всем синсетам WordNet.

    Авторы также подчеркивают полезность разметки синсетов доменами для автоматического разрешения лексической многозначности.

    Вместе с тем остаются вопросы по отношению к введению в систему, построенную на основе одних единиц, набора других единиц с неопределенным относительно исходных единиц статусом, среди которых:

  • вариативность возможного набора областей;
  • небольшая наполненность некоторых доменов, и большое количество синсетов в других доменах:
  • необходимость разных систем доменов для разных задач;
  • отсутствие полностью выверенного набора доменов (выверять вручную очень трудоемко, а если выверять в процессе решения различных задач, то далеко не все проблемы (неточности, ошибки, приписки) удастся быстро обнаружить).
  • Представление толкований WordNet в виде логических выражений: проект eXtended WordNet

    Многие исследователи отмечают нехватку информации, описанной в WordNet, для различения значений, в нем перечисленных.

    В рамках проекта eXtended WordNet разработчики предполагают, что важным источником дополнительной информации могут стать толкования, приписанные к синсетам WordNet. Для того чтобы эти толкования можно было использовать в автоматических режимах компьютерных приложений, необходимо каждому знаменательному слову толкований сопоставить его значение-синсет и представить это толкование в виде формализованного выражения.

    Разрешение лексической многозначности

    Поскольку стало ясно, что применению таких ресурсов, как WordNet, препятствует такая проблема, как недостаточная эффективность разрешения лексической многозначности, эта проблема получила отдельную значимость.

    Была организована специальная конференция, посвященная проблеме разрешения лексической многозначности - Конференция SENSEVAL.

    Первая конференция по оценке методов разрешения лексической многозначности SENSEVAL состоялась в 1998 году, охватывала три языка, в ней приняли участие 25 исследовательских групп. Вторая состоялась в 2001 году, имела задания на 12 языках; в ней участвовали 35 исследовательских групп и более 90 систем.

    Контрольные вопросы

  • Каковы проблемы, возникающие при использовании WordNet для автоматической обработки текста?
  • Опишите проблему лексической многозначности.
  • Как в WordNet происходит разрешение многозначности?
  • Страницы:

    8.1. Описание ресурса. EuroWordNet

    Лингвистический ресурс WordNet разработан в Принстонском университете США. WordNet относится к классу лексических онтологий, свободно доступен в Интернете, и на его основе были выполнены тысячи экспериментов в области информационного поиска.

    WordNet версии 2.1 охватывает приблизительно 155 тысяч различных лексем и словосочетаний, организованных в 117 тысяч понятий, или совокупностей синонимов (synset); общее число пар "лексема-значение" насчитывает 200 тысяч.

    Разработка тезауруса была начата в 1984 году. В 1995 году WordNet появился в Интернете в свободном доступе и вызвал всплеск исследований по его использованию в различных компьютерных приложениях автоматической обработки текстов. Результаты применения WordNet оказались не столь однозначно положительными, но WordNet открыл новую эпоху разработки сверхбольших структурированных лингвистических ресурсов, вызвал появление большого числа последователей в разных странах, создающих такие "ворднеты" для своих языков, а также стал базой для многоплановых дискуссий и исследований того, на основе каких принципов должны строиться большие лингвистические ресурсы, пригодные для разнообразных приложений в области компьютерной лингвистики.

    Первоначально WordNet создавался как модель человеческой памяти. Многие решения представления описаний слов в WordNet мотивируются психолингвистическими экспериментами. Однако нужно отметить, что WordNet вызвал значительно больший интерес у компьютерных лингвистов, чем у психолингвистов.

    WordNet: основные принципы

    Основоположник WordNet Джордж Миллер формулирует основные гипотезы, лежащие в основе разработки WordNet, следующим образом:

  • гипотеза отделимости: описание лексического компонента естественного языка может быть отделено и может изучаться отдельно;
  • гипотеза "образца" (patterning hypothesis): существует такое формальное описание слов, которое может быть применено к большинству слов языка;
  • гипотеза о покрытии (comprehensiveness hypothesis): для эффективного использования компьютерного словаря в приложениях автоматической обработки текстов такие словари должны быть очень большой величины.
  • В то время была популярной теория семантического компонентного анализа, в которой предполагалось, что значение слова, как и значение предложения, может быть представлено на основе набора семантических примитивов. Однако годы исследований не выявили лучшего набора семантических примитивов, пригодного для использования в ресурсах для обработки естественного языка.

    В качестве альтернативы был выбран подход так называемой реляционной семантики, когда значения слов представляются некоторым выражением компонентов, а не на основе описания отношений между значениями разных слов.

    Основным отношением в WordNet является отношение синонимии. Наборы синонимов - синсеты - основные структурные элементы WordNet.

    Понятие синонимии базируется на критерии, что два выражения являются синонимичными, если замена одного из них на другое в предложении не меняет значения истинности этого высказывания.

    Понятие синонимии, используемое в WordNet, не требует заменяемости синонимов во всех контекстах - по такому критерию в естественном языке было бы слишком мало синонимов. Используется значительно более слабое утверждение, что синонимы WordNet должны быть взаимозаменимы хотя бы в некотором множестве контекстов. Например, замена plank для слова board редко меняет значение истинности в контексте плотницкого дела, но существуют контексты, где такая замена не может считаться приемлемой.

    Именно определение синонимии в терминах заменимости делает необходимым разделение WordNet на отдельные подструктуры по частям речи.

    В состав словаря входят лексемы, относящиеся к четырем частям речи: прилагательное, существительное, глагол и наречие. Лексемы различных частей речи хранятся отдельно, и описания, соответствующие каждой части речи, имеют различную структуру.

    Синсет может рассматриваться как представление лексикализованного понятия (концепта) английского языка.

    Авторы считают, что синсет существительных представляет понятия существительных, глаголы выражают глагольные концепты, прилагательные - концепты прилагательных и т.п.

    Кроме того, авторы считают, что такое разделение соответствует психолингвистическим экспериментам, что представление информации о прилагательных, существительных, глаголах и наречиях устроено в человеческой памяти по-разному.

    Большинство синсетов снабжены толкованием, подобным толкованиям в традиционных словарях, - это толкование рассматривается как одно для всех синонимов синсета. Если слово имеет несколько значений, то оно входит в несколько различных синсетов.

    Описание существительных

    Между существительными в словаре установлены следующие семантические отношения:

  • синонимия;
  • антонимия;
  • гипонимия/гиперонимия - отношение, которое иначе может быть названо ВЫШЕ-НИЖЕ, isA -отношение. Отношение транзитивно и несимметрично. Гипоним наследует все свойства гиперонима. Это отношение является центральным отношением для описания существительных;
  • меронимия (отношение ЧАСТЬ-ЦЕЛОЕ ). Внутри этого отношения выделяются отношения быть_элементом и быть_сделанным_из.
  • WordNet: гипонимы

    Основным отношением между синсетами существительных является родо-видовое отношение, при этом видовой синсет называется гипонимом, а родовой - гиперонимом. Это транзитивное иерархическое отношение, которое может быть также названо isA -отношением.

    Синсет X называется гипонимом синсета Y, если носители английского языка считают нормальными предложения типа " An X is a (kind of) Y ".

    Таким образом, отношения между синсетами образуют иерархическую структуру.

    При построении иерархических систем на базе родо-видовых отношений обычно предполагается, что свойства вышестоящих понятий наследуются нижестоящими - так называемое свойство наследования.

    Таким образом, существительные в WordNet организованы в виде иерархической системы с наследованием; были сделаны систематические усилия, чтобы для каждого синсета найти его родовое понятие, его гипероним.

    При этом предполагается, что есть возможность найти различия между синонимией и гиперонимией. На практике, однако, различие не всегда очевидно.

    Кроме того, если традиционные словари могут в качестве различных значений одного и того же слова включить и более широкое, и более специализированное значение, например, board (доска) в широком смысле и в более специализированном, как surfboard (доска для серфинга), при разработке WordNet предпочтение отдавалось решениям, в которых одно и то же слово не представлено и в синсете гипонима, и в синсете гиперонима.

    WordNet разделяет существительные на несколько иерархий, каждая со своим начальным понятием. Всего для существительных имеется 25 синсетов верхнего уровня, такие как {act, activity} (деятельность), {animal, fauna} (животное), {artifact} (продукт труда), {food} (пища), {process} (процесс), {quantity, amount} (количество) и др.

    Отношение ЧАСТЬ-ЦЕЛОЕ

    Меронимия представляет собой скорее совокупность несколько отличающихся отношений, чем четкое отделяемое отношение.

    В качестве первого определения меронимии, которое, однако, исключает некоторые очевидные случаи отношения ЧАСТЬ-ЦЕЛОЕ, может служить следующее положение:

    X является меронимом Y тогда и только тогда, если предложения вида " Y имеет X (или Xы) " и " X - это часть Y " являются нормальными для X и Y, интерпретируемых как родовые понятия.

    Сущности, такие как группы, классы и коллекции, состоят в отношении меронимии со своими элементами:

  • Примеры групп: племя, команда, комитет, семья, оркестр, суд, отряд и др.
  • Примеры классов: пролетариат, аристократия, буржуазия.
  • Примеры коллекций: куча, лес, библиотека (как коллекция книг).
  • Отношение ЧАСТЬ-ЦЕЛОЕ представляет собой семейство близких отношений. Наиболее центральным типом этого отношения являются физические объекты.

  • Если и ЧАСТЬ, и ЦЕЛОЕ являются неисчислимыми, то говорят об отношении ингредиентов, например: спирт - водка.
  • Если ЧАСТЬ - исчислимое, а ЦЕЛОЕ - неисчислимое, то говорят об отношении ЧАСТИЦА-ВЕЩЕСТВО: песчинка - песок, снежинка - снег, капля - дождь.
  • Если ЧАСТЬ - неисчислимое, а ЦЕЛОЕ - исчислимое, то это так называемое отношение МАТЕРИАЛ-ОБЪЕКТ: стекло - бокал.
  • В WordNet выделяются три подвида отношения ЧАСТЬ-ЦЕЛОЕ: собственно часть, быть_элементом и быть_сделанным_из, например:

  • собственно часть:
  • flower, bloom, blossom - (reproductive organ of angiosperm plants esp. one having showy or colorful parts)
  • PART OF: angiosperm, flowering plant - (plants having seeds in a closed ovary)
  • элемент:
  • homo, man, human being, human - (any living or extinct member of the family Hominidae)
  • MEMBER OF: genus Homo - (type genus of the family Hominidae)
  • вещество:
  • glass - (a brittle transparent solid with irregular atomic structure)
  • SUBSTANCE OF: glassware, glasswork - (articles made of glass)
  • SUBSTANCE OF: plate glass, sheet of glass - (glass formed into a thin sheet)
  • Для частей характерно, что у многих разных сущностей части могут называться одинаково, например, point (острие) может быть у стрелы, ножа, иголки, карандаша, булавки и т.п. В таких случаях описываются все такие холонимы, например,

  • собственно часть:
  • point - (sharp end; "he stuck the point of the knife into a tree"; "he broke the point of his pencil")
  • PART OF: awl - (a pointed tool for marking surfaces or for punching small holes)
  • PART OF: icepick, ice pick - (pick consisting of a steel rod with a sharp point; used for breaking up blocks of ice)
  • PART OF: knife - (edge tool used as a cutting instrument; has a pointed blade with a sharp edge and a handle)
  • PART OF: needle - (a sharp pointed implement (usually steel))
  • PART OF: pencil - (a thin cylindrical pointed writing implement; a rod of marking substance encased in wood)
  • PART OF: pin - (a small slender (often pointed) piece of wood or metal used to support or fasten or attach things)
  • Авторы подчеркивают, что одной из проблем описания отношений меронимии является то, что части описываются несколько выше, чем это необходимо. Например, часто утверждается, что колесо - это часть транспортного средства, но тогда сани не являются транспортным средством. Однако часто такая ситуация является следствием того, что понятие необходимого уровня не лексикализовано в языке. Для данного конкретного примера WordNet вводит специальное дополнительное понятие {wheeled vehicle} - колесное транспортное средство.

    Описание прилагательных

    Прилагательные делятся на качественные и относительные.

    Семантическое описание качественных прилагательных значительно отличается от описания других основных категорий слов и базируется не на отношении гипонимии, а на отношении антонимии.

    Важность этого отношения для качественных прилагательных проявляется в психолингвистических тестах: когда человека просят назвать ассоциацию на качественное прилагательное, он чаще всего называет его антоним. Например, самая частая ассоциация на слово good (хороший) - это слово bad (плохой), и наоборот.

    Важность антонимии для организации качественных прилагательных становится понятной, если учесть, что функцией этих прилагательных является выражение величин атрибутов, и эти атрибуты обычно являются биполярными. Антонимичные прилагательные обычно выражают противоположные полюса атрибута.

    Авторы WordNet подчеркивают, что не всегда слова, противоположные по смыслу, рассматриваются носителями языка как антонимы; так, например, два близких по смыслу слова heavy (тяжелый) и weighty (тяжеловесный) имеют два разных антонима - light (легкий) и weightless (невесомый) соответственно. Кроме того, некоторые слова не имеют непосредственных антонимов: например, каков антоним слова ponderous (громоздкий)? Возможный антоним - прилагательное light - является безусловным антонимом прилагательного heavy.

    Если отношение антонимии возникает между выделенными парами прилагательных, то возникает вопрос, куда отнести такое прилагательное, как ponderous. Было принято решение такие прилагательные описывать через отношение сходства с одним из тех прилагательных, которые имеют антонимы.

    Таким образом, качественные прилагательные в WordNet представлены как биполярный кластер: центральным является отношение антонимии, для каждого из двух антонимов определены близкие по смыслу прилагательные. Например, описание пары значений прилагательных slow (медленный, медленно двигающийся) и fast (быстрый, быстро двигающийся) выглядит следующим образом: указана пара антонимов slow - fast, для которых описываются так называемые головные синсеты, приводятся толкования и примеры. Для каждого головного синсета описываются так называемые сателлитные синсеты, которые представляют синсеты, семантически близкие соответствующему головному синсету (и частично являющиеся его специализациями), такие как lazy (ленивый, медленно двигающийся), slow-moving (медленно двигающийся) и др.

    Пример кластера прилагательных:

  • slow (vs. fast ) - (not moving quickly; taking a comparatively long time; "a slow walker"; "the slow lane of traffic"; "her steps were slow"; "he was slow in reacting to the news"; "slow but steady growth")
  • => bumper-to-bumper - (used of traffic; "bumper-to-bumper traffic")
  • => dilatory, laggard, poky, pokey - (wasting time)
  • => dragging - (passing painfully or tediously slowly; "the dragging minutes")
  • => drawn-out - ((used of speech) uttered slowly with prolonged vowels)
  • => lazy - (moving slowly and gently; "up a lazy river"; "lazy white clouds"; "at a lazy pace")
  • => long-play, long-playing - ((used of records) playing at a slower speed and for a longer time than earlier records)
  • => slow-moving - (moving slowly; "slow-moving cars")
  • => sluggish, sulky - (with little movement; very slow; "a sluggish stream")
  • Отдельную группу составляют прилагательные цвета. Все оттенки цветов представляются как синсеты-саттелиты к прилагательному colored (цветной), которому противопоставлено как антоним прилагательное uncolored (нецветной). Оттенки от белого к черному представлены как семантически близкие синсеты к прилагательному achromatic (бесцветный).

    Значение относительных прилагательных представлено как отсылка к соответствующему синсету существительных. Для некоторых прилагательных одно из значений представлено как качественное прилагательное через антонимическую пару, а второе - как относительное прилагательное. Например, для прилагательного agricultural (сельский, сельскохозяйственный) первое значение отсылает к синсету слова agriculture (сельское хозяйство), а второе представлено как элемент пары антонимов сельский - городской.

  • Sense 1
  • agricultural - (relating to or used in or promoting agriculture or farming; "agricultural engineering"; "modern agricultural (or farming) methods"; "agricultural (or farm) equipment"; "an agricultural college")
  • Pertains to noun agriculture (Sense 2)
  • => farming, agriculture, husbandry - (the practice of cultivating the land or raising stock)
  • => cultivation - ((agriculture) production of food by preparing the land to grow crops)
  • Sense 2
  • agrarian, agricultural, farming (prenominal) - (relating to rural matters; "an agrarian (or agricultural) society"; "farming communities")
  • => rural (vs. urban ) - (living in or characteristic of farming or country life; "rural people"; "large rural households"; "unpaved rural roads"; "an economy that is basically rural")
  • Описание глаголов

    Для описания глаголы были разделены на семантические поля. На первом этапе были отделены глаголы, обозначающие действия и события, от глаголов, обозначающих состояния. Первая группа глаголов была разделена на 14 семантических полей: глаголы движения, восприятия, контакта, коммуникации, соревнования, изменения, познания, потребления, создания, эмоций, обладания, ухода за телом и глаголы, относящиеся к социальному поведению.

    Границы между группами являются достаточно расплывчатыми. Например, многие глаголы не могут быть однозначно расклассифицированы как глаголы познания или коммуникации ( wonder, speculate, confirm, judge и др.). Также, например, глагол whistle в предложении "The bullet whistled past him" может классифицироваться и как глагол издания звука, и как глагол движения. Если такие глаголы представлять как однозначные, они должны относиться более чем к одному семантическому полю. В WordNet глаголы чаще описывались как полисемичные, если обнаруживалось, что они могут быть отнесены одновременно к разным семантическим полям.

    Основу описания иерархии глаголов составляют отношения тропонимии (см. ниже). Кроме того, описываются отношения ПРИЧИНА-СЛЕДСТВИЕ (каузальные отношения) и другие отношения лексического следствия.

    Отношения между синсетами глаголов

    Отношение логического следования

    Это отношение устанавливается между синсетами глаголов V1 и V2, если из предложения "Someone V1 " логически следует "Someone V2 ". Например, из того, что "Человек идет", следует, что "Человек делает шаг".

  • Sense 1
  • walk, go on foot, foot, leg it, hoof, hoof it - (use one's feet to advance; advance by steps)
  • => step, take a step
  • Другой пример: из "храпеть" следует "спать", так как из предложения "Он храпит" следует "Он спит".

    Отношение тропонимии

    Лингвистический тест, который использовался для определения гипонимии между существительными: "An x is an y " - не подходит для глаголов, поскольку требует, чтобы x и y были существительными. Поэтому понадобилось предложить другой лингвистический текст для установления иерархических отношений между глаголами, и также было введено специальное название отношения - тропонимия. Используемый лингвистический тест таков: "To V1 is to V2 in some particular manner". Например, " Mumbling is talking in some particular manner" (" Бормотать - значит говорить некоторым специальным образом").

    Отношение тропонимии представляет собой специальный вид отношения следования.

    Глагольные иерархии, образованные отношением тропонимии, создают более узкую, но более кустистую структуру, чем существительные. В подавляющем большинстве случаев число уровней иерархии не превышает четырех.

    Отношение причины

    Отношение причины связывает два глагольных синсета, один из которых может быть назван каузатив (например, давать ), а второй - результатив (например, иметь ). Английский язык имеет лексикализованные каузативные пары, такие как " показывать - видеть ".

    Кроме того, WordNet устанавливает отношение причины от каузативных транзитивных глаголов к соответствующим инхоативным нетранзитивным значениям тех же слов. В качестве примеров можно рассмотреть такие глаголы, как blacken, develop, break, shrink.

    Отношение причины систематически представлено среди глаголов перемещения, соединяя каузативное и некаузативное употребление, например: blow (выдуть - выдуться).

  • Sense 1
  • kill - (cause to die)
  • => die, pip out, decease, perish, go, exit, pass away, expire - (pass from physical life and lose all bodily attributes and functions necessary to sustain life; "She died from cancer"; "They children perished in the fire"; "The patient went peacefully")
  • Отношение причины также может быть рассмотрено как специальный случай следования. Если V1 необходимо вызывает V2, значит, из V1 также логически следует V2.

    EuroWordNet

    Ресурс WordNet, разработанный для английского языка, вызвал в мире огромный интерес к разработке такого рода ресурсов для десятков других языков.

    Создание ворднетов для разных языков в рамках проекта EuroWordNet включает два этапа. На первом этапе (1996-1999) ворднеты создавались для голландского, испанского и итальянского языков. На втором - для французского, чешского, немецкого и эстонского языков.

    В проекте стоял серьезный выбор: нужно ли стремиться к разработке языково-независимой структуры, с которой необходимо сопоставить единицы каждого языка, или, может быть, нужно иметь единую систему синсетов - новая единица в иерархической сети может быть включена, если хотя бы один язык из рассматриваемых имеет лексему или устойчивый оборот с таким значением.

    По принятому в проекте решению каждый ворднет должен сохранять специфику своего языка. При этом каждый ворднет должен содержать отсылки на значения английского ворднета, что позволяет сравнивать ворднеты, обнаруживать непоследовательности в их построении и видеть различия в устройстве языковых систем.

    Одновременно в рамках проекта была создана небольшая онтология верхнего уровня, к которой должен быть приписан каждый создаваемый ворднет.

    Авторы проекта EuroWordNet подчеркивают различие между ресурсом класса wordnet как лингвистическими онтологиями и формальными онтологиями. Лингвистическая онтология должна отражать отношения между лексикализованными словами и выражениями языка, например, описывать, какие слова могут использоваться, чтобы заменить в тексте слово spoon (ложка) - object, tableware, silverware, merchandise, cutlery.

    Таким образом, ворднеты - это сеть языково-специфичных лексикализованных единиц (в отличие от формальных онтологий, которые представляют собой структуру данных с формально определенными понятиями).

    Основные предполагаемые применения ворднетов - это предсказание той или иной возможной замены лексических единиц в тексте для целей информационного поиска, генерации текстов, машинного перевода, разрешения лексической многозначности.

    Учитывая сложности, которые возникали при применении ворднетов в приложениях, европейские разработчики предложили ряд существенных нововведений в структуре создаваемых ворднетов. Большой класс этих изменений касается описания отношений между синсетами, которые можно разделить на следующие группы:

  • приписывание дополнительных атрибутов к существующим отношениям;
  • введение отношений между различными частями речи;
  • введение дополнительных отношений между словами (синсетами) одной части речи.
  • Индекс ILI

    Для того чтобы установить связи между различными языками, в проекте EuroWordNet синсеты каждого ворднета имеют отсылку на так называемый межязыковой индекс (interlingual index), в качестве которого выбираются синсеты Принстонского WordNet.

    (рис 8.1) Архитектура базы данных EuroWordNet

    Онтология верхнего уровня в EuroWordNet

    Онтология верхнего уровня EuroWordNet состоит из 63 признаков, которые могут комбинироваться. Назначение онтологии - служить единым описанием понятий верхнего уровня для ворднетов.

    Все сущности делятся на три класса: сущности 1-го порядка, 2-го порядка и 3-го порядка.

  • Конкретные синсеты характеризуются как сущности 1-го порядка и могут описываться 4 ролями теории порождающего лексикона Дж. Пустейовского: происхождение, форма, состав и функция. Например, vehicle (транспортное средство) описывается следующими признаками: артефакт (происхождение) + объект (форма) + транспортное средство (функция).
  • События, действия, отношения принадлежат к сущностям 2-го порядка, которые характеризуются по типу ситуации: динамические или статические, а также могут определяться одним или более ситуационными компонентами: причина, ментальный, физический, расположение, цель и др. Каждая сущность 2-го порядка имеет один тип ситуации и один или более ситуационных компонентов. Например, change location характеризуется как динамический + расположение + агентивный (причина) + физический.
  • Сущности 3-го порядка представляют собой ненаблюдаемые сущности, которые существуют вне пространства и времени. Они могут скорее истинными или ложными, чем реальными. Они могут утверждаться, отрицаться, запомниться или забыться. Примеры: идея, мысль, теория, план.
  • Контрольные вопросы

  • Как называются элементарные структурные единицы WordNet?
  • Перечислите основные отношения в WordNet.
  • Какими средствами в WordNet представляются глаголы?
  • 8.2. WordNet: применение в информационном поиске

    Для того чтобы попытаться реализовать схему автоматического концептуального индексирования и концептуального поиска, необходимо иметь лингвистический ресурс, организованный на основе понятий или значений слов. Поэтому такие ресурсы, как WordNet, могут использоваться как база для организации приложений концептуального индексирования и поиска. В этой лекции рассматривается два нижеследующих эксперимента.

    Векторная модель информационного поиска с вектором по синсетам WordNet

    Целью экспериментов была попытка выполнить поиск документов на основе не отдельных слов, а значений WordNet. Для каждого документа сначала выполняется процедура разрешения многозначности существительных, которая выбирает единственное значение и в результате которой каждому тексту ставится в соответствие вектор синсетов WordNet. После того как вектор создан, с ним могут выполняться такие же операции, как и с пословными векторами.

    Эффективность использования векторов синсетов сравнивалась с эффективностью информационного поиска на основе стандартной модели, использующей вектора слов. В стандартном прогоне и документы, и запросы представляются как вектора лемм всех значимых слов. В концептуальных прогонах и документы, и запросы представляются как вектора, состоящие из трех подвекторов:

  • вектор лемм слов, не найденных в WordNet, либо найденных, но многозначность которых не удалось разрешить (например, не являющихся существительными);
  • вектор синсетов существительных для слов с разрешенной многозначностью;
  • вектор лемм существительных для слов с разрешенной многозначностью.
  • Второй и третий подвектора представляют собой альтернативные представления документа, поскольку одни и те же слова этого документа порождают отдельные элементы каждого вектора.

    Для каждого запроса стандартный прогон векторной модели сравнивался со следующими комбинациями перечисленных выше подвекторов (цифры соответствуют весу, который дается 1-му, 2-му и 3-му подвектору, соответственно):

  • 110 - данная комбинация дает одинаковые веса словам, отличным от существительных, и синсетам существительных;
  • 211 - данная комбинация учитывает как синсеты существительных, так и леммы существительных, поэтому оставшиеся слова учитываются в двойном размере;
  • 101 - в данной комбинации подвектор синсетов существительных игнорируется, а леммы существительных и другие леммы документа получают одинаковые веса. Обратите внимание, что этот вектор отличается от стандартного прогона, поскольку результат сравнения для системы подвекторов вычисляется как сумма результатов сравнения каждого вектора.
  • Для экспериментов было использовано 5 разных коллекций документов (компьютерная область, медицинская область, газетные статьи и др.), и для каждой коллекции было выполнено более 30 различных запросов.

    Оценки эффективности информационного поиска на основе показателя средней точности показали серьезное ухудшение эффективности для векторов, включающих синсеты (от 6,2% до 42,3%).

    Основная причина такого ухудшения эффективности заключается в том, что процедура разрешения многозначности для слова в запросе может выбрать одно значение, а для того же слова в документе - другое значение. Например, при поиске по запросу "separation anxiety in infants and preschool children" из первых 15 документов стандартный прогон выдает 7 релевантных документов, в то время как прогон 110 - только один релевантный документ. Проблема вызвана выбором значения слова separation, для которого в WordNet описано 8 значений. Процедура разрешения многозначности выбирает такое значение этого слова в запросе, которое не было выбрано ни в одном из релевантных текстов.

    Эксперименты по расширению запросов на основе отношений WordNet

    Другая группа экспериментов по использованию WordNet в информационном поиске исследовала возможность расширения запросов синонимами или другими словами, связанными со словами запроса отношениями, которые описаны в WordNet. В таких экспериментах нет необходимости выбора единственного значения слова, что в случае ошибки привело бы к серьезному ухудшению результатов поиска.

    Для экспериментов были использованы следующие соображения.

    Во-первых, расширяться должны только важные для запроса понятия. Важность аппроксимируется количеством документов, в которых встречается конкретное слово запроса - слова, частотность которых в документах коллекции больше некоторого числа N, не участвуют в расширении запроса.

    Во-вторых, чтобы смоделировать разрешение многозначности, запрос расширяется только теми словами, которые оказались в окрестностях расширения по крайней мере двух слов запроса.

    Таким образом, сначала для каждого слова запроса, частотность которого меньше некоторого числа N, и каждого синсета для значений этого слова извлекается список близких по WordNet слов.

    Те слова, которые встретились по крайней мере в двух таких списках, добавляются к исходному запросу.

    Исследовались различные величины N - 10% коллекции и 5% коллекции.

    Для расширения запроса использовались синсеты, находящиеся на расстоянии одного или двух отношений от исходных синсетов - все виды связей трактовались одинаково.

    Добавленные слова могли учитываться с разными величинами весов: w = 0.3, 0.5, 0.8.

    Максимальное улучшение, которое удалось получить, - 0.7% средней точности, что не является статистически значимой величиной ( N = 5%, расстояние - 2, w = 0.3 ).

    Авторы подчеркивают, что идея аппроксимации разрешения многозначности путем поиска повторов в списках расширения оказалась неэффективной в виду того, что чаще всего это метод приводил к добавлению в запрос очень общих слов, таких как "система".

    Для того чтобы исключить из рассмотрения эффект лексической многозначности и исследовать возможности WordNet по расширению поискового запроса, были выполнены эксперименты с ручным выбором значения многозначных слов в запросе.

    Для каждого синсета, соответствующего слову запроса, в запрос могут быть добавлены разные слова на основе различных отношений данного синсета, например: синонимы; гипонимы (все слова из нижестоящих синсетов иерархии гипоним-гипероним ); все слова, отстоящие на один шаг от текущего синсета по любому типу отношений.

    Чтобы исследовать все такие возможности, был образован вектор, состоящий из 11 подвекторов: 10 - для слов исходного запроса, один - для синонимов, один - для каждого типа отношений существительных в WordNet. Сходство с документами вычислялось как взвешенная сумма результатов сравнений с каждым из подвекторов.

    Исследовались четыре варианта векторов:

  • расширение только по синонимам;
  • расширение "синонимы + полная иерархия вниз";
  • расширение "синонимы + родители + полная иерархия вниз";
  • расширение "синонимы + слова из любых синсетов на один шаг по любому типу отношений".
  • Тестирование проходило на двух типах вопросов: более длинной и более короткой версии. При поиске по полному запросу ни одной из комбинаций не удалось улучшить результаты поиска более чем на 2 процента. Короткие вопросы состояли из небольшого списка синсетов, например, {cancer}, {skin_cancer}, {phramaceutical}.

    Для укороченного запроса, используя 4-й тип расширения, при котором все добавления учитывались с коэффициентом 0,5, было получено 35% улучшение: средняя точность для укороченного запроса без расширения была 0,1634, с расширением - 0,2205. Средняя точность поиска по полному запросу - 0,3586.

    Выводы авторов эксперимента заключаются в том, что для успешного применения WordNet в информационном поиске необходимо значительно улучшить эффективность автоматического разрешения лексической многозначности, между тем парадигматических отношений в WordNet недостаточно для решения этой задачи.

    Проект Meaning

    Проект Meaning является продолжением проекта EuroWordNet. Авторы проекта мотивируют необходимость продолжения работ тем, что десятки человеко-лет были затрачены для создания ворднетов для разных языков, но этих усилий недостаточно, чтобы обеспечить качество многоязычных приложений компьютерной обработки текстов.

    Прогресс в этой области связан с решением двух промежуточных задач: автоматическое разрешение лексической многозначности и масштабное обогащение лексических баз знаний.

    Проблема, однако, заключается в том, что существуют взаимозависимые факторы:

  • для того чтобы достичь качественного разрешения лексической многозначности, необходимо значительно больше лингвистических и семантических знаний, чем имеется в текущих лексических базах знаний (к примеру, в ворднетах);
  • для того чтобы обогатить существующие лексические базы знаний, необходимо получать информацию из корпусов с качественной семантической разметкой.
  • В проекте планируется выполнить три последовательных цикла масштабного разрешения лексической многозначности и извлечения знаний для пяти европейских языков, включая баскский, испанский, итальянский, голландский и английский языки. Накопленные знания должны храниться в Многоязычном Центральном Репозитории.

    Эксперименты по семантическому индексированию в рамках проекта Meaning

    В рамках европейского проекта Meaning голландская компания Irion Technologies разработала технологию концептуального индексирования TwentyOne, комбинирующую лингвистический и статистический подходы. Авторы разработки считают, что неудачи с применением WordNet в информационно-поисковых приложениях связаны с трудностями встраивания такого рода лингвистических ресурсов в приложения, а также с проблемами оптимального использования содержащейся в ворднетах информации.

    Основой технологии является статистическая машина поиска, базирующаяся на стандартной векторной модели и обеспечивающая быстрый поиск документов.

    Лингвистические технологии используются для улучшения результатов, выданных статистической машиной, в двух направлениях:

  • максимизация полноты результатов за счет использования синонимии ворднетов;
  • максимизация точности результатов за счет сравнения запросов с конкретными фразами документов, а не с целыми документами.
  • Фраза представляет собой именную группу (noun phrase). Каждая фраза ассоциируется с отдельными словами, определенной комбинацией слов, а также комбинацией частей слов.

    Система TwentyOne использует совокупность факторов для сравнения запроса с фразами текста:

  • число совпадающих концептов между запросом и каждой фразой;
  • степень нечеткого сопоставления между запросом и каждой фразой;
  • степень деривационного несовпадения, слитного/раздельного написания и т.п.;
  • были ли использованы синонимы;
  • был ли использован тот же язык.
  • Суть технологии в том, что сначала выдаются документы, которые имеют наибольшее совпадение по концептам фраз с запросом. Среди документов, имеющих одинаковое количество сопоставленных понятий между собственными фразами и запросом, первыми выдаются наиболее схожие по конкретному набору слов.

    В проводимых экспериментах для сравнения были построены четыре индекса:

  • HTM - традиционный пословный индекс;
  • NP - индексы именных групп из запроса, с применением пословных методов, без использования ворднетов;
  • FULL - полные индексы с использованием ворднетов, но без процедуры разрешения многозначности, что приводит к полному расширению по синонимам и переводам для всех возможных значений слов запроса;
  • WSD - индексы, использующие ворднеты вместе с процедурой снижения многозначности на основе предметных областей ворднет.
  • В эксперименте индексы тестируются в системе автоматической рубрикации текстов на коллекции Reuter. Описывается, что максимальных значений F-меры система автоматической рубрикации достигает для индекса WSD: полнота - 80,7, точность - 72,2. Минимум система имеет на базе индекса HTM: полнота - 67,8, точность - 70,4.

    Нужно, однако, отметить, что описываемые результаты на основе пословного индекса значительно ниже, чем результаты других пословных систем на основе этой же коллекции. Иными словами, произведенные улучшения получаются по сравнению с заниженным недостаточно эффективным уровнем работы системы на основе пословного индекса, и значительные улучшения могли бы быть осуществлены еще в рамках такого индекса.

    Контрольные вопросы

  • Что такое концептуальное индексирование и концептуальный поиск?
  • Каковы проблемы использования онтологии в информационном поиске?
  • 8.3. WordNet: применение в вопросно-ответных системах

    Вопросно-ответная система представляет собой вид информационно-поисковых систем. Она должна предоставить не набор документов, которые наиболее релевантны поставленному вопросу, а выдать точный ответ на данный вопрос.

    Разработки вопросно-ответных систем были начаты в 1960-е годы. В то время предполагалась, что ответ на вопрос должен отыскиваться в специально подготовленных базах знаний.

    Второе рождение вопросно-ответные системы начали переживать с 90-х годов XX века. Тогда возникла необходимость искать ответы в больших текстовых коллекциях.

    С 1999 года проводится соревнование по вопросно-ответным системам в рамках конференции TREC, с 2003 года соревнования вопросно-ответных систем в многоязычном контексте начаты на конференции CLEF.

    Соревнование систем в рамках этих конференций проводится следующим образом.

    Участникам рассылается большой текстовый массив (более нескольких гигабайт) и порядка 200 вопросов. Нужно прислать текстовые фрагменты (50, 250 байт), содержащие ответы на вопрос. Ответы должны быть упорядочены, при этом засчитываются первые три ответа.

    Оценка производится следующим образом: за правильный ответ на первом месте система получает 1 балл, на втором месте - 0,5 балла, на третьем месте - 0,25 балла. Общая оценка системы получается путем вычисления среднего балла по всем вопросам.

    Основные этапы поиска ответа на вопрос в современных вопросно-ответных системах таковы.

  • Прежде всего, производится подробный анализ вопроса, в результате которого определяется тип вопроса (вопрос времени, места, количества и др.) и соответствующий тип ответа, а также формируется запрос к информационно-поисковый системе.
  • На втором этапе производится поиск релевантных документов или абзацев информационно-поисковой системой, формируется упорядоченный список наиболее релевантных документов (абзацев), из которого выбирается первых n (например, n=100 ) документов (абзацев) для дальнейшей обработки.
  • На третьем этапе производится подробный анализ полученных абзацев: содержит ли абзац требуемый тип ответа, близость слов ответа и вопроса и т.п.
  • Вопросы как особый тип запросов к информационно-поисковой системе

    Как известно, запросы в глобальных информационно-поисковых системах обычно очень короткие - 2-3 слова, и по ним находятся сотни и тысячи документов. Запросы в форме вопросов обычно значительно длиннее, поэтому если требовать присутствия в документе сразу всех слов запроса, то чаще всего не будет найдено ни одного документа.

    Классическая векторная модель на основе сравнения векторов запроса и документа позволяет найти наиболее релевантные документы и по части слов запроса. При этом во многих современных исследованиях по вопросно-ответным системам начали использовать не векторные модели поиска, а выполнять булевский поиск, поскольку считается, что при выполнении данной задачи необходимо осуществлять дополнительный контроль за тем, какие слова из формулировки вопроса обязательно должны присутствовать в тексте ответа, а какие могут пропасть в тексте ответа с минимальным ущербом для релевантности ответа.

    Булевское выражение обычно формируется как конъюнкция всех значимых слов формулировки вопроса. Если проводится морфологический анализ запроса или добавляются синонимы, то они объединяются в дизъюнкцию.

    Например, если задан вопрос " When did Shapour Bakhtiar die?", то может быть образовано следующее булевское выражение:

    Shapour AND Bakhtiar 
    AND (die OR dies OR died OR dying OR death OR deaths)

    Стандартной является ситуация, когда не находится документов, которые содержат все значимые слова вопроса, поэтому при обработке вопроса часто необходимо определить, какие именно слова формулировки вопроса можно отбросить, не включить в поисковый запрос без потери сути вопроса.

    Например, следующему вопросу " Кто из великих целителей прошлого написал трактат "О медицине"?" могут частично соответствовать два предложения:

  • ЦЕЛЬС (Celsus) Авл Корнелий (I в. до н. э.), древнеримский автор энциклопедических трудов "Artes" (сохранился трактат "О медицине", книги 1-8, с ценными сведениями по гигиене, хирургии, дерматологии);
  • А.Е. Ферсман приводит отрывок из трактата "Сокровищница лекарств", написанного арабским целителем около тысячи лет назад: "Ношение бирюзы:
  • Первое из предложений содержит правильный ответ ЦЕЛЬС, во втором предложении кандидатом на ответ является А.Е. Ферсман, что неверно.

    Таким образом, часто булевский вопрос к информационно-поисковой системе, составленный по формулировке вопроса, не находит ни одного документа. Поэтому обычно предлагается система модификаций, упрощающих исходное булевское выражение, после каждой из которых опять происходит обращение к поисковой системе для проверки, не появились ли релевантные документы.

    Используются обычно два основных способа упрощения булевского выражения.

    Во-первых, можно часть конъюнкций переводить в дизъюнкции.

    Вторым способом является поочередное исключение членов конъюнкции на основе некоторого множества эвристик, определяющих значимость членов конъюнкции.

    Значимость членов конъюнкции может определяться на основе их грамматических характеристик в формулировке вопроса. Так, наиболее значимыми обычно считаются имена, фразы в кавычках, а наименее значимыми - глаголы.

    Процесс исключения элементов из конъюнкции прекращается, когда количество документов (абзацев) в выдаче достигает заданного числа (например, 50) или когда остается заданный процент слов исходной формулировки вопроса.

    В связи с длинной формулировкой естественно-языкового вопроса и частым отсутствием в самых больших текстовых коллекциях ответов, содержащих все или большинство слов формулировки вопроса, значимой становится роль лексических ресурсов, позволяющих найти ответы в тех предложениях, в которых часть слов заменена на близкие по смыслу слова.

    Так, например, ответ на вопрос " Почему электрические батареи быстрее разряжаются на холоде?" может быть следующим: " Батарейки быстрее садятся на морозе, потому что...".

    В этом ответе практически каждое слово вопроса имеет соответствующее слово в данном ответе, при этом сделано 3 лексические замены. Пример не придуман, а реально найден в поисковой коллекции. Более лексически точного ответа в текстовой коллекции не нашлось.

    WordNet в вопросно-ответной системе Южного Методистского университета США

    Одной из самых эффективных систем в вопросно-ответной секции конференции TREC стала вопросно-ответная система Южного Методистского университета США, которая на нескольких этапах обработки вопроса и поиска ответа обращается к информации, хранимой в тезаурусе WordNet. В разработанной системе WordNet используется для:

  • распознавания типа вопроса;
  • классификации типов ответов;
  • реализации лексических и семантических замен.
  • Лексические и семантические замены осуществляются в момент сопоставления формальной структуры вопроса и ответа. Поиск в системе организован на основе обработки булевских запросов.

    Реальные вопросы

    Стоит отметить, что вопросы, на которые могла бы искать ответ вопросно-ответная система, очень востребованы в таких случаях, когда, например, люди обращаются в какие-либо компьютерные форумы с просьбой помочь им в решении некоей проблемы (например, при поломке компьютера или в какой-то юридической ситуации). В этих случаях часто оказывается, что такие ситуации уже обсуждались и достаточно просто было бы найти соответствующие ответы: однако имеющиеся ответы были сформулированы несколько иначе, поэтому в простом пословном поиске найти предшествующие аналогии очень трудно.

    Конечно, такие просьбы о помощи редко формулируются как простой, правильно построенный вопрос. Чаще они включают несколько предложений с описанием проблемы и, возможно, более одного вопроса. Например, вопрос может выглядеть таким образом:

    Ноутбук Compaq nx9010, месяц от роду, лицензионная русская XP Home SP1, каждые 3-4 дня загадочно исчезают точки восстановления: просто стираются соответствующие папки. Похоже, что при перезагрузке. Но не уверен. В календаре мастера восстановления - тоже исчезают. На диске свободно 27 Гб, движок стоит на все 12%. На десктопе со времен установки XP ничего подобного никогда не наблюдалось (там без сервиспака). Принятые меры: выключение и снова включение восстановления - ноль внимания. Снесение системы, установка заново - аналогично. Где копать? Машина хорошая, претензий нет. К виндам во всем остальном - тоже. Железо? Винды? Хитрые дрова? Что?

    Обработка таких вопросов значительно более сложна, чем обработка правильно сформированных вопросительных формулировок фактографического характера, которыми является, например, большинство вопросов конференции TREC:

  • фокус вопросов в форумах выражен неявно;
  • используется множество лишних для поиска слов, точный список которых достаточно трудно определить;
  • возможно, в вопросе имеются несколько подвопросов, на которые отвечают разные документы.
  • Контрольные вопросы

  • Назовите основные этапы работы вопросно-ответной системы.
  • Как можно использовать онтологию в вопросно-ответной системе?
  • Опишите механизм обработки булевского запроса в вопросно-ответной системе.
  • 8.4. WordNet: проблемы использования в автоматической обработке текстов

    Смешение типов и ролей

    Одной из серьезных проблем, приводящих к неправильным путям иерархии, является проблема установления таких отношений, когда вышестоящее понятие частично характеризует нижестоящее. Часто это связано с проблемой смешения понятий-типов и понятий-ролей.

    Так, например, Никола Гуарино критикует отношения в WordNet: "Человек всегда живое существо, но он (она) начинает играть роль каузального агента только в некоторых ситуациях. Та же проблема возникает для яблока, которое всегда плод растения, а в некоторых ситуациях может быть пищей. Проблема в том, что человек и яблоко - это типы сущностей, в то время как каузальный агент и пища - это роли".

    Один из аргументов в пользу различения типов и ролей в лингвистических онтологиях - это то, что они различаются в способах наследования свойств. WordNet не различает эти два типа понятий и помещает их в одни и те же иерархии.

    В соответствии с онтологическими подходами понятия-типы не должны находиться в иерархиях ниже понятий-ролей. Более радикальный подход заключается в том, чтобы разделить иерархии типов и ролей.

    Одна из авторов WordNet, Кристиан Фелбаум, отвечая на эту критику Н. Гуарино, заявляет, что в таких ресурсах, как WordNet, неоднородные классификации имеют право на существование, поскольку такие ресурсы рассматриваются в настоящее время прежде всего как инструменты для компьютерной обработки текстов, а не только как совершенные онтологии, которые должны соответствовать строгим онтологическим принципам.

    Вместе с тем важно подчеркнуть, что описание понятий-типов ниже понятий-ролей, то есть установление связей между понятиями, которые выполняются не в любых контекстах, а лишь при некоторых условиях, приводит к ложному срабатыванию этих связей, к неправильному выводу как раз при автоматической обработке текстов.

    Многозначность в WordNet

    Во многих работах признается, что различия значений в WordNet слишком тонки для таких компьютерных приложений, как машинный перевод, информационный поиск, классификация текстов, вопросно-ответные системы и др. Среднее количество значений в WordNet больше, чем в традиционных лексикографических словарях.

    Поэтому выполнен ряд исследований, чтобы разобраться, нельзя ли автоматически, на основе каких-либо разумных принципов собрать некоторые значения многозначных слов в кластеры и далее не различать эти значения.

    Проблема лексической многозначности и информационный поиск

    В частности, исследовался вопрос, какая группировка значений была бы полезной для задач информационного поиска. Предполагается, что некоторые значения могут быть кластеризованы для разных приложений; в то же время существуют примеры пар значений, кластеризация которых была бы полезна в информационно-поисковых приложениях, при этом в других приложениях было бы полезно их различать.

    Отмечается, что исследования регулярной многозначности не приводят к выделению полезных кластеров для информационно-поисковых задач, поскольку, как представляется авторам, некоторые образцы регулярной полисемии хорошо бы не различать для задач информационного поиска, в то время как другие хорошо бы сохранить отдельно. Так, например, полезно было бы кластеризовать такие пары регулярной полисемии, как container / quantity и music / dance. Однако такие образцы, как animal / food, plant / food, animal / skin, language / people хорошо бы различать, поскольку, как представляется, они употребляются в разных типах текстов.

    Поэтому нужны дополнительные исследования критериев кластеризации значений для информационно-поисковых задач.

    Далее сравниваются два дополнительных критерия группировки значений. Первый критерий заключается в том, чтобы группировать значения, которые встречаются в одних и тех же текстах. Для этого используется семантически размеченный корпус SemCor. Второй критерий группирует значения, которые получают одни и те же переводы в нескольких разных языках. Пересечение кластеров, построенных на основе этих двух критериев, составляет 55-60%, что показывает некоторую корреляцию между кластерами, но оставляет сомнения в полезности каждого из критериев.

    Проведенные эксперименты по кластеризации значений привели к выводу, что типология отношения между разными значениями многозначных слов является более полезной, чем формирование кластеров значений, поскольку близость значений зависит от приложения.

    Например, указание, что одно из значений является метафорой исходного значения, является важным для приложений информационного поиска и вопросно-ответных систем, поскольку относится к разным семантическим полям. Однако для приложений машинного перевода это различие может быть несущественно, поскольку метафорический перенос может быть сходным в разных языках. В ворднетах нужно в явном виде описать отношения между значениями для того, чтобы ворднеты стали стандартом лексических ресурсов для компьютерных приложений.

    Современные версии WordNet содержат для каждого многозначного слова указание на самое частотное значение по корпусу SemCor, что дает возможность, в случае проблем при процедуре автоматического разрешения многозначности, выбирать это самое частотное значение.

    Теннисная проблема

    Одной из серьезных проблем WordNet, препятствующей его использованию в приложениях, является так называемая "теннисная проблема": синсеты, принадлежащие одной предметной области, сфере деятельности или ситуации - оказываются очень далеко друг от друга в структуре WordNet.

    Предлагалось решать данную проблему введением в WordNet информации о принадлежности синсетов определенным доменам. Домены, такие как "теннис", "политика" или "образование", группируют синсеты в сценарии или схемы. Так, домен "теннис" включает такие синсеты, как "гейм", "теннисный мяч", "теннисная ракетка", "тайм-брейк" и т.д.

    Предполагается, что введение доменов должно быть особенно полезно для информационно-поисковых задач.

    Разработка иерархической системы доменов началась с 250 рубрик, собранных по различным словарям, и затем была дополнена и уточнена на базе Десятичной классификации Дьюи. Была получена иерархия из 115 доменов, организованных по 4 уровням иерархии, которая включала, например, такие домены, как "сельское хозяйство", "археология", "астрология", "биология", "ветеринария" и др.

    Авторы подчеркивают, что в WordNet имеются синсеты, которые не принадлежат никаким доменам, поскольку могут употребляться в текстах многих предметных областей. Для таких синсетов была введена специальная предметная область, называемая FACTOTUM.

    Для того чтобы разметить все множество синсетов WordNet, была реализована автоматизированная процедура, состоящая из следующих шагов:

  • вручную размечается относительно небольшое количество синсетов верхнего уровня;
  • автоматически по связям (гипонимия, тропонимия, меронимия, антонимия) пометки распространяются на другие синсеты;
  • можно задать исключения, например, для синсета " кресло парикмахера " (" barber_chair "), которое хотя и является частью парикмахерской (" barbershop "), не должно быть отнесено к домену КОММЕРЦИЯ ( COMMERCE ).
  • Эксперименты с доменами в ворднетах были продолжены и в следующем европейском проекте, связанном с ворднетами, - Meaning, в котором 165 иерархически организованных доменов были автоматизированно приписаны всем синсетам WordNet.

    Авторы также подчеркивают полезность разметки синсетов доменами для автоматического разрешения лексической многозначности.

    Вместе с тем остаются вопросы по отношению к введению в систему, построенную на основе одних единиц, набора других единиц с неопределенным относительно исходных единиц статусом, среди которых:

  • вариативность возможного набора областей;
  • небольшая наполненность некоторых доменов, и большое количество синсетов в других доменах:
  • необходимость разных систем доменов для разных задач;
  • отсутствие полностью выверенного набора доменов (выверять вручную очень трудоемко, а если выверять в процессе решения различных задач, то далеко не все проблемы (неточности, ошибки, приписки) удастся быстро обнаружить).
  • Представление толкований WordNet в виде логических выражений: проект eXtended WordNet

    Многие исследователи отмечают нехватку информации, описанной в WordNet, для различения значений, в нем перечисленных.

    В рамках проекта eXtended WordNet разработчики предполагают, что важным источником дополнительной информации могут стать толкования, приписанные к синсетам WordNet. Для того чтобы эти толкования можно было использовать в автоматических режимах компьютерных приложений, необходимо каждому знаменательному слову толкований сопоставить его значение-синсет и представить это толкование в виде формализованного выражения.

    Разрешение лексической многозначности

    Поскольку стало ясно, что применению таких ресурсов, как WordNet, препятствует такая проблема, как недостаточная эффективность разрешения лексической многозначности, эта проблема получила отдельную значимость.

    Была организована специальная конференция, посвященная проблеме разрешения лексической многозначности - Конференция SENSEVAL.

    Первая конференция по оценке методов разрешения лексической многозначности SENSEVAL состоялась в 1998 году, охватывала три языка, в ней приняли участие 25 исследовательских групп. Вторая состоялась в 2001 году, имела задания на 12 языках; в ней участвовали 35 исследовательских групп и более 90 систем.

    Контрольные вопросы

  • Каковы проблемы, возникающие при использовании WordNet для автоматической обработки текста?
  • Опишите проблему лексической многозначности.
  • Как в WordNet происходит разрешение многозначности?
  • Вернуться к учебному плану