Лингвистический ресурс WordNet разработан в Принстонском университете США. WordNet относится к классу лексических онтологий, свободно доступен в Интернете, и на его основе были выполнены тысячи экспериментов в области информационного поиска.
WordNet версии 2.1 охватывает приблизительно 155 тысяч различных лексем и словосочетаний, организованных в 117 тысяч понятий, или совокупностей синонимов (synset); общее число пар "лексема-значение" насчитывает 200 тысяч.
Разработка тезауруса была начата в 1984 году. В 1995 году WordNet появился в Интернете в свободном доступе и вызвал всплеск исследований по его использованию в различных компьютерных приложениях автоматической обработки текстов. Результаты применения WordNet оказались не столь однозначно положительными, но WordNet открыл новую эпоху разработки сверхбольших структурированных лингвистических ресурсов, вызвал появление большого числа последователей в разных странах, создающих такие "ворднеты" для своих языков, а также стал базой для многоплановых дискуссий и исследований того, на основе каких принципов должны строиться большие лингвистические ресурсы, пригодные для разнообразных приложений в области компьютерной лингвистики.
Первоначально WordNet создавался как модель человеческой памяти. Многие решения представления описаний слов в WordNet мотивируются психолингвистическими экспериментами. Однако нужно отметить, что WordNet вызвал значительно больший интерес у компьютерных лингвистов, чем у психолингвистов.
Основоположник WordNet Джордж Миллер формулирует основные гипотезы, лежащие в основе разработки WordNet, следующим образом:
В то время была популярной теория семантического компонентного анализа, в которой предполагалось, что значение слова, как и значение предложения, может быть представлено на основе набора семантических примитивов. Однако годы исследований не выявили лучшего набора семантических примитивов, пригодного для использования в ресурсах для обработки естественного языка.
В качестве альтернативы был выбран подход так называемой реляционной семантики, когда значения слов представляются некоторым выражением компонентов, а не на основе описания отношений между значениями разных слов.
Основным отношением в WordNet является отношение синонимии. Наборы синонимов -
Понятие синонимии базируется на критерии, что два выражения являются синонимичными, если замена одного из них на другое в предложении не меняет значения истинности этого высказывания.
Понятие синонимии, используемое в WordNet, не требует заменяемости синонимов во всех контекстах - по такому критерию в естественном языке было бы слишком мало синонимов. Используется значительно более слабое утверждение, что синонимы WordNet должны быть взаимозаменимы хотя бы в некотором множестве контекстов. Например, замена plank для слова board редко меняет значение истинности в контексте плотницкого дела, но существуют контексты, где такая замена не может считаться приемлемой.
Именно определение синонимии в терминах заменимости делает необходимым разделение WordNet на отдельные подструктуры по частям речи.
В состав словаря входят лексемы, относящиеся к четырем частям речи: прилагательное, существительное, глагол и наречие. Лексемы различных частей речи хранятся отдельно, и описания, соответствующие каждой части речи, имеют различную структуру.
Синсет может рассматриваться как представление лексикализованного понятия (концепта) английского языка.
Авторы считают, что синсет существительных представляет понятия существительных, глаголы выражают глагольные концепты, прилагательные - концепты прилагательных и т.п.
Кроме того, авторы считают, что такое разделение соответствует психолингвистическим экспериментам, что представление информации о прилагательных, существительных, глаголах и наречиях устроено в человеческой памяти по-разному.
Большинство синсетов снабжены толкованием, подобным толкованиям в традиционных словарях, - это толкование рассматривается как одно для всех синонимов
Между существительными в словаре установлены следующие семантические отношения:
ВЫШЕ-НИЖЕ, isA -отношение. Отношение транзитивно и несимметрично. Гипоним наследует все свойства гиперонима. Это отношение является центральным отношением для описания существительных;ЧАСТЬ-ЦЕЛОЕ ). Внутри этого отношения выделяются отношения быть_элементом и быть_сделанным_из.Основным отношением между isA -отношением.
Синсет X называется гипонимом Y, если носители английского языка считают нормальными предложения типа " An X is a (kind of) Y ".
Таким образом, отношения между
При построении иерархических систем на базе родо-видовых отношений обычно предполагается, что свойства вышестоящих понятий наследуются нижестоящими - так называемое свойство наследования.
Таким образом, существительные в WordNet организованы в виде иерархической системы с наследованием; были сделаны систематические усилия, чтобы для каждого
При этом предполагается, что есть возможность найти различия между синонимией и гиперонимией. На практике, однако, различие не всегда очевидно.
Кроме того, если традиционные словари могут в качестве различных значений одного и того же слова включить и более широкое, и более специализированное значение, например, board (доска) в широком смысле и в более специализированном, как surfboard (доска для серфинга), при разработке WordNet предпочтение отдавалось решениям, в которых одно и то же слово не представлено и в
WordNet разделяет существительные на несколько иерархий, каждая со своим начальным понятием. Всего для существительных имеется 25 синсетов верхнего уровня, такие как {act, activity} (деятельность), {animal, fauna} (животное), { (продукт труда), {food} (пища), {process} (процесс), { (количество) и др.
Меронимия представляет собой скорее совокупность несколько отличающихся отношений, чем четкое отделяемое отношение.
В качестве первого определения ЧАСТЬ-ЦЕЛОЕ, может служить следующее положение:
X является меронимом Y тогда и только тогда, если предложения вида " Y имеет X (или Xы) " и " X - это часть Y " являются нормальными для X и Y, интерпретируемых как родовые понятия.
Сущности, такие как группы, классы и коллекции, состоят в отношении
Отношение ЧАСТЬ-ЦЕЛОЕ представляет собой семейство близких отношений. Наиболее центральным типом этого отношения являются физические объекты.
ЧАСТЬ, и ЦЕЛОЕ являются неисчислимыми, то говорят об отношении ингредиентов, например: спирт - водка.ЧАСТЬ - исчислимое, а ЦЕЛОЕ - неисчислимое, то говорят об отношении ЧАСТИЦА-ВЕЩЕСТВО: песчинка - песок, снежинка - снег, капля - дождь.ЧАСТЬ - неисчислимое, а ЦЕЛОЕ - исчислимое, то это так называемое отношение МАТЕРИАЛ-ОБЪЕКТ: стекло - бокал.В WordNet выделяются три подвида отношения ЧАСТЬ-ЦЕЛОЕ: собственно часть, быть_элементом и быть_сделанным_из, например:
flower, bloom , blossom - (reproductive organ of angiosperm plants esp. one having showy or colorful parts)PART OF: angiosperm, flowering plant - (plants having seeds in a closed ovary)homo, man, human being, human - (any living or extinct member of the family Hominidae)MEMBER OF: genus Homo - (type genus of the family Hominidae)glass - (a brittle transparent solid with SUBSTANCE OF: glassware, glasswork - (articles made of SUBSTANCE OF: plate glass , sheet of glass - (Для частей характерно, что у многих разных сущностей части могут называться одинаково, например, point (острие) может быть у стрелы, ножа, иголки, карандаша, булавки и т.п. В таких случаях описываются все такие холонимы, например,
point - (PART OF: awl - (a pointed tool for marking PART OF: icepick, ice pick - (pick consisting of a steel rod with a PART OF: knife - (edge tool used as a cutting instrument; has a pointed blade with a PART OF: needle - (a PART OF: pencil - (a thin cylindrical pointed writing implement; a rod of marking substance encased in wood)PART OF: pin - (a small slender (often pointed) piece of wood or Авторы подчеркивают, что одной из проблем описания отношений { - колесное транспортное средство.
Прилагательные делятся на качественные и относительные.
Семантическое описание
Важность этого отношения для качественных прилагательных проявляется в психолингвистических тестах: когда человека просят назвать ассоциацию на качественное прилагательное, он чаще всего называет его антоним. Например, самая частая ассоциация на слово good (хороший) - это слово bad (плохой), и наоборот.
Важность
Авторы WordNet подчеркивают, что не всегда слова, противоположные по смыслу, рассматриваются носителями языка как антонимы; так, например, два близких по смыслу слова heavy (тяжелый) и weighty (тяжеловесный) имеют два разных антонима - light (легкий) и weightless (невесомый) соответственно. Кроме того, некоторые слова не имеют непосредственных антонимов: например, каков антоним слова ponderous (громоздкий)? Возможный антоним - прилагательное light - является безусловным heavy.
Если отношение ponderous. Было принято решение такие прилагательные описывать через отношение
Таким образом, качественные прилагательные в WordNet представлены как биполярный кластер: центральным является отношение (медленный, медленно двигающийся) и fast (быстрый, быстро двигающийся) выглядит следующим образом: указана пара антонимов - fast, для которых описываются так называемые lazy (ленивый, медленно двигающийся), (медленно двигающийся) и др.
Пример кластера прилагательных:
slow (vs. fast ) - (not moving quickly; taking a comparatively long time; "a bumper-to-bumper - (used of traffic; "bumper-to-bumper traffic")dilatory, laggard, poky, pokey - (wasting time)dragging - (passing painfully or tediously slowly; "the dragging minutes")drawn-out - ((used of lazy - (moving slowly and gently; "up a lazy river"; "lazy white clouds"; "at a lazy pace")long-play, long-playing - ((used of records) playing at a slower speed and for a longer time than earlier records)slow -moving - (moving slowly; "sluggish, sulky - (with little movement; very Отдельную группу составляют прилагательные цвета. Все оттенки цветов представляются как colored (цветной), которому противопоставлено как антоним прилагательное uncolored (нецветной). Оттенки от белого к черному представлены как семантически близкие achromatic (бесцветный).
Значение agricultural (сельский, сельскохозяйственный) первое значение отсылает к agriculture (сельское хозяйство), а второе представлено как элемент пары антонимов сельский - городской.
agricultural - (relating to or used in or promoting agriculture or agriculture (Sense 2)farming , agriculture, husbandry - (the practice of cultivating the land or raising stock)cultivation - ((agriculture) production of food by preparing the land to grow crops)agrarian, agricultural, farming (prenominal) - (relating to rural matters; "an agrarian (or agricultural) society"; "rural (vs. urban ) - (living in or Для описания глаголы были разделены на семантические поля. На первом этапе были отделены глаголы, обозначающие действия и события, от глаголов, обозначающих состояния. Первая группа глаголов была разделена на 14 семантических полей: глаголы движения, восприятия, контакта, коммуникации, соревнования, изменения, познания, потребления, создания, эмоций, обладания, ухода за телом и глаголы, относящиеся к социальному поведению.
Границы между группами являются достаточно расплывчатыми. Например, многие глаголы не могут быть однозначно расклассифицированы как глаголы познания или коммуникации ( wonder, , confirm, judge и др.). Также, например, глагол whistle в предложении "The bullet whistled past him" может классифицироваться и как глагол издания звука, и как глагол движения. Если такие глаголы представлять как однозначные, они должны относиться более чем к одному семантическому полю. В WordNet глаголы чаще описывались как полисемичные, если обнаруживалось, что они могут быть отнесены одновременно к разным семантическим полям.
Основу описания иерархии глаголов составляют отношения ПРИЧИНА-СЛЕДСТВИЕ (каузальные отношения) и другие отношения лексического следствия.
Это отношение устанавливается между V1 и V2, если из предложения "Someone V1 " логически следует "Someone V2 ". Например, из того, что "Человек идет", следует, что "Человек делает шаг".
walk, go on foot , foot , leg it, hoof, hoof it - (use one's feet to advance; advance by steps)step, take a stepДругой пример: из "храпеть" следует "спать", так как из предложения "Он храпит" следует "Он спит".
Лингвистический тест, который использовался для определения x is an y " - не подходит для глаголов, поскольку требует, чтобы x и y были существительными. Поэтому понадобилось предложить другой лингвистический текст для установления V1 is to V2 in some particular manner". Например, " Mumbling is talking in some particular manner" (" Бормотать - значит говорить некоторым специальным образом").
Отношение
Глагольные иерархии, образованные отношением
Отношение причины связывает два глагольных давать ), а второй - иметь ). Английский язык имеет лексикализованные каузативные пары, такие как " показывать - видеть ".
Кроме того, WordNet устанавливает отношение причины от каузативных транзитивных глаголов к соответствующим инхоативным нетранзитивным значениям тех же слов. В качестве примеров можно рассмотреть такие глаголы, как blacken, develop, break, shrink.
Отношение причины систематически представлено среди глаголов перемещения, соединяя каузативное и некаузативное употребление, например: (выдуть - выдуться).
kill - (cause to die)die, pip out, decease, perish, go, exit, pass away, expire - (pass from physical life and lose all bodily attributes and functions necessary to sustain life; "She died from cancer"; "They children perished in the fire"; "The patient went peacefully")Отношение причины также может быть рассмотрено как специальный случай следования. Если V1 необходимо вызывает V2, значит, из V1 также логически следует V2.
Ресурс WordNet, разработанный для английского языка, вызвал в мире огромный интерес к разработке такого рода ресурсов для десятков других языков.
Создание ворднетов для разных языков в рамках проекта EuroWordNet включает два этапа. На первом этапе (1996-1999) ворднеты создавались для голландского, испанского и итальянского языков. На втором - для французского, чешского, немецкого и эстонского языков.
В проекте стоял серьезный выбор: нужно ли стремиться к разработке языково-независимой структуры, с которой необходимо сопоставить единицы каждого языка, или, может быть, нужно иметь единую систему синсетов - новая единица в иерархической сети может быть включена, если хотя бы один язык из рассматриваемых имеет лексему или устойчивый оборот с таким значением.
По принятому в проекте решению каждый ворднет должен сохранять специфику своего языка. При этом каждый ворднет должен содержать отсылки на значения английского ворднета, что позволяет сравнивать ворднеты, обнаруживать непоследовательности в их построении и видеть различия в устройстве языковых систем.
Одновременно в рамках проекта была создана небольшая онтология верхнего уровня, к которой должен быть приписан каждый создаваемый ворднет.
Авторы проекта EuroWordNet подчеркивают различие между ресурсом класса wordnet как spoon (ложка) - object, tableware, silverware, merchandise, cutlery.
Таким образом, ворднеты - это сеть языково-специфичных лексикализованных единиц (в отличие от формальных онтологий, которые представляют собой структуру данных с формально определенными понятиями).
Основные предполагаемые применения ворднетов - это предсказание той или иной возможной замены лексических единиц в тексте для целей информационного поиска, генерации текстов,
Учитывая сложности, которые возникали при применении ворднетов в приложениях, европейские разработчики предложили ряд существенных нововведений в структуре создаваемых ворднетов. Большой класс этих изменений касается описания отношений между
Для того чтобы установить связи между различными языками, в проекте EuroWordNet
(рис 8.1) Архитектура базы данных EuroWordNet
Онтология верхнего уровня EuroWordNet состоит из 63 признаков, которые могут комбинироваться. Назначение онтологии - служить единым описанием понятий верхнего уровня для ворднетов.
Все сущности делятся на три
vehicle (транспортное средство) описывается следующими признаками: артефакт (происхождение) + объект (форма) + транспортное средство (функция).change location характеризуется как динамический + расположение + агентивный (причина) + физический.идея, мысль, теория, план.Для того чтобы попытаться реализовать схему автоматического концептуального индексирования и концептуального поиска, необходимо иметь лингвистический ресурс, организованный на основе понятий или значений слов. Поэтому такие ресурсы, как WordNet, могут использоваться как база для организации приложений концептуального индексирования и поиска. В этой лекции рассматривается два нижеследующих эксперимента.
Целью экспериментов была попытка выполнить поиск документов на основе не отдельных слов, а значений WordNet. Для каждого документа сначала выполняется процедура разрешения многозначности существительных, которая выбирает единственное значение и в результате которой каждому тексту ставится в соответствие вектор синсетов WordNet. После того как вектор создан, с ним могут выполняться такие же операции, как и с пословными векторами.
Эффективность использования векторов синсетов сравнивалась с эффективностью информационного поиска на основе стандартной модели, использующей вектора слов. В
Второй и третий подвектора представляют собой альтернативные представления документа, поскольку одни и те же слова этого документа порождают отдельные элементы каждого вектора.
Для каждого запроса стандартный прогон векторной модели сравнивался со следующими комбинациями перечисленных выше подвекторов (цифры соответствуют весу, который дается 1-му, 2-му и 3-му подвектору, соответственно):
Для экспериментов было использовано 5 разных коллекций документов (компьютерная область, медицинская область, газетные статьи и др.), и для каждой коллекции было выполнено более 30 различных запросов.
Оценки эффективности информационного поиска на основе показателя средней точности показали серьезное ухудшение эффективности для векторов, включающих
Основная причина такого ухудшения эффективности заключается в том, что процедура разрешения многозначности для слова в запросе может выбрать одно значение, а для того же слова в документе - другое значение. Например, при поиске по запросу "separation anxiety in infants and preschool children" из первых 15 документов стандартный прогон выдает 7 релевантных документов, в то время как прогон 110 - только один релевантный документ. Проблема вызвана выбором значения слова separation, для которого в WordNet описано 8 значений. Процедура разрешения многозначности выбирает такое значение этого слова в запросе, которое не было выбрано ни в одном из релевантных текстов.
Другая группа экспериментов по использованию WordNet в информационном поиске исследовала возможность расширения запросов синонимами или другими словами, связанными со словами запроса отношениями, которые описаны в WordNet. В таких экспериментах нет необходимости выбора единственного значения слова, что в случае ошибки привело бы к серьезному ухудшению результатов поиска.
Для экспериментов были использованы следующие соображения.
Во-первых, расширяться должны только важные для запроса понятия. Важность аппроксимируется количеством документов, в которых встречается конкретное слово запроса - слова, частотность которых в документах коллекции больше некоторого числа N, не участвуют в расширении запроса.
Во-вторых, чтобы смоделировать разрешение многозначности, запрос расширяется только теми словами, которые оказались в окрестностях расширения по крайней мере двух слов запроса.
Таким образом, сначала для каждого слова запроса, частотность которого меньше некоторого числа N, и каждого
Те слова, которые встретились по крайней мере в двух таких списках, добавляются к исходному запросу.
Исследовались различные величины N - 10% коллекции и 5% коллекции.
Для расширения запроса использовались
Добавленные слова могли учитываться с разными величинами весов: w = 0.3, 0.5, 0.8.
Максимальное улучшение, которое удалось получить, - 0.7% средней точности, что не является статистически значимой величиной ( N = 5%, расстояние - 2, w = 0.3 ).
Авторы подчеркивают, что идея аппроксимации разрешения многозначности путем поиска повторов в списках расширения оказалась неэффективной в виду того, что чаще всего это метод приводил к добавлению в запрос очень общих слов, таких как "система".
Для того чтобы исключить из рассмотрения эффект лексической многозначности и исследовать возможности WordNet по расширению поискового запроса, были выполнены эксперименты с ручным выбором значения многозначных слов в запросе.
Для каждого гипоним-гипероним ); все слова, отстоящие на один шаг от текущего
Чтобы исследовать все такие возможности, был образован вектор, состоящий из 11 подвекторов: 10 - для слов исходного запроса, один - для синонимов, один - для каждого типа отношений существительных в WordNet. Сходство с документами вычислялось как взвешенная сумма результатов сравнений с каждым из подвекторов.
Исследовались четыре варианта векторов:
Тестирование проходило на двух типах вопросов: более длинной и более короткой версии. При поиске по {cancer}, {skin_cancer}, {phramaceutical}.
Для укороченного запроса, используя 4-й тип расширения, при котором все добавления учитывались с коэффициентом 0,5, было получено 35% улучшение: средняя точность для укороченного запроса без расширения была 0,1634, с расширением - 0,2205. Средняя точность поиска по
Выводы авторов эксперимента заключаются в том, что для успешного применения WordNet в информационном поиске необходимо значительно улучшить эффективность автоматического разрешения лексической многозначности, между тем парадигматических отношений в WordNet недостаточно для решения этой задачи.
Проект Meaning является продолжением проекта EuroWordNet. Авторы проекта мотивируют необходимость продолжения работ тем, что десятки человеко-лет были затрачены для создания ворднетов для разных языков, но этих усилий недостаточно, чтобы обеспечить качество многоязычных приложений компьютерной обработки текстов.
Прогресс в этой области связан с решением двух промежуточных задач: автоматическое разрешение лексической многозначности и масштабное обогащение лексических баз знаний.
Проблема, однако, заключается в том, что существуют взаимозависимые факторы:
В проекте планируется выполнить три последовательных цикла масштабного разрешения лексической многозначности и
В рамках европейского проекта Meaning голландская компания Irion Technologies разработала технологию концептуального индексирования TwentyOne, комбинирующую лингвистический и статистический подходы. Авторы разработки считают, что неудачи с применением WordNet в информационно-поисковых приложениях связаны с трудностями встраивания такого рода лингвистических ресурсов в приложения, а также с проблемами оптимального использования содержащейся в ворднетах информации.
Основой технологии является статистическая машина поиска, базирующаяся на стандартной векторной модели и обеспечивающая быстрый поиск документов.
Лингвистические технологии используются для улучшения результатов, выданных статистической машиной, в двух направлениях:
Фраза представляет собой именную группу (noun phrase). Каждая фраза ассоциируется с отдельными словами, определенной комбинацией слов, а также комбинацией частей слов.
Система TwentyOne использует совокупность факторов для сравнения запроса с фразами текста:
Суть технологии в том, что сначала выдаются документы, которые имеют наибольшее совпадение по концептам фраз с запросом. Среди документов, имеющих одинаковое количество сопоставленных понятий между собственными фразами и запросом, первыми выдаются наиболее схожие по конкретному набору слов.
В проводимых экспериментах для сравнения были построены четыре индекса:
В эксперименте индексы тестируются в системе автоматической рубрикации текстов на коллекции Reuter. Описывается, что максимальных значений F-меры система автоматической рубрикации достигает для индекса WSD: полнота - 80,7, точность - 72,2. Минимум система имеет на базе индекса HTM: полнота - 67,8, точность - 70,4.
Нужно, однако, отметить, что описываемые результаты на основе пословного индекса значительно ниже, чем результаты других пословных систем на основе этой же коллекции. Иными словами, произведенные улучшения получаются по сравнению с заниженным недостаточно эффективным уровнем работы системы на основе пословного индекса, и значительные улучшения могли бы быть осуществлены еще в рамках такого индекса.
Разработки вопросно-ответных систем были начаты в 1960-е годы. В то время предполагалась, что ответ на вопрос должен отыскиваться в специально подготовленных базах знаний.
Второе рождение вопросно-ответные системы начали переживать с 90-х годов XX века. Тогда возникла необходимость искать ответы в больших текстовых коллекциях.
С 1999 года проводится соревнование по вопросно-ответным системам в рамках конференции TREC, с 2003 года соревнования вопросно-ответных систем в
Соревнование систем в рамках этих конференций проводится следующим образом.
Участникам рассылается большой текстовый массив (более нескольких гигабайт) и порядка 200 вопросов. Нужно прислать текстовые фрагменты (50, 250 байт), содержащие ответы на вопрос. Ответы должны быть упорядочены, при этом засчитываются первые три ответа.
Оценка производится следующим образом: за правильный ответ на первом месте система получает 1 балл, на втором месте - 0,5 балла, на третьем месте - 0,25 балла. Общая оценка системы получается путем вычисления среднего балла по всем вопросам.
Основные этапы поиска ответа на вопрос в современных
n (например, n=100 ) документов (абзацев) для дальнейшей обработки.Как известно, запросы в глобальных информационно-поисковых системах обычно очень короткие - 2-3 слова, и по ним находятся сотни и тысячи документов. Запросы в форме вопросов обычно значительно длиннее, поэтому если требовать присутствия в документе сразу всех слов запроса, то чаще всего не будет найдено ни одного документа.
Классическая векторная модель на основе сравнения векторов запроса и документа позволяет найти наиболее релевантные документы и по части слов запроса. При этом во многих современных исследованиях по вопросно-ответным системам начали использовать не векторные модели поиска, а выполнять
Булевское выражение обычно формируется как конъюнкция всех значимых слов формулировки вопроса. Если проводится
Например, если задан вопрос " When did Shapour Bakhtiar die?", то может быть образовано следующее булевское выражение:
Shapour AND Bakhtiar AND (die OR dies OR died OR dying OR death OR deaths)
Стандартной является ситуация, когда не находится документов, которые содержат все значимые слова вопроса, поэтому при обработке вопроса часто необходимо определить, какие именно слова формулировки вопроса можно отбросить, не включить в поисковый запрос без потери сути вопроса.
Например, следующему вопросу " Кто из великих целителей прошлого написал трактат "О медицине"?" могут частично соответствовать два предложения:
Первое из предложений содержит правильный ответ ЦЕЛЬС, во втором предложении кандидатом на ответ является А.Е. Ферсман, что неверно.
Таким образом, часто булевский вопрос к информационно-поисковой системе, составленный по формулировке вопроса, не находит ни одного документа. Поэтому обычно предлагается система модификаций, упрощающих исходное булевское выражение, после каждой из которых опять происходит обращение к поисковой системе для проверки, не появились ли релевантные документы.
Используются обычно два основных способа упрощения булевского выражения.
Во-первых, можно часть конъюнкций переводить в дизъюнкции.
Вторым способом является поочередное исключение членов конъюнкции на основе некоторого множества эвристик, определяющих значимость членов конъюнкции.
Значимость членов конъюнкции может определяться на основе их грамматических характеристик в формулировке вопроса. Так, наиболее значимыми обычно считаются имена, фразы в кавычках, а наименее значимыми - глаголы.
Процесс исключения элементов из конъюнкции прекращается, когда количество документов (абзацев) в выдаче достигает заданного числа (например, 50) или когда остается заданный процент слов исходной формулировки вопроса.
В связи с длинной формулировкой естественно-языкового вопроса и частым отсутствием в самых больших текстовых коллекциях ответов, содержащих все или большинство слов формулировки вопроса, значимой становится роль лексических ресурсов, позволяющих найти ответы в тех предложениях, в которых часть слов заменена на близкие по смыслу слова.
Так, например, ответ на вопрос " Почему электрические батареи быстрее разряжаются на холоде?" может быть следующим: " Батарейки быстрее садятся на морозе, потому что...".
В этом ответе практически каждое слово вопроса имеет соответствующее слово в данном ответе, при этом сделано 3 лексические замены. Пример не придуман, а реально найден в поисковой коллекции. Более лексически точного ответа в текстовой коллекции не нашлось.
Одной из самых эффективных систем в вопросно-ответной секции конференции TREC стала
Лексические и семантические замены осуществляются в момент сопоставления формальной структуры вопроса и ответа. Поиск в системе организован на основе обработки булевских запросов.
Стоит отметить, что вопросы, на которые могла бы искать ответ
Конечно, такие просьбы о помощи редко формулируются как простой, правильно построенный вопрос. Чаще они включают несколько предложений с описанием проблемы и, возможно, более одного вопроса. Например, вопрос может выглядеть таким образом:
Ноутбук Compaq nx9010, месяц от роду, лицензионная русская XP Home SP1, каждые 3-4 дня загадочно исчезают точки восстановления: просто стираются соответствующие папки. Похоже, что при перезагрузке. Но не уверен. В календаре мастера восстановления - тоже исчезают. На диске свободно 27 Гб, движок стоит на все 12%. На десктопе со времен установки XP ничего подобного никогда не наблюдалось (там без сервиспака). Принятые меры: выключение и снова включение восстановления - ноль внимания. Снесение системы, установка заново - аналогично. Где копать? Машина хорошая, претензий нет. К виндам во всем остальном - тоже. Железо? Винды? Хитрые дрова? Что?
Обработка таких вопросов значительно более сложна, чем обработка правильно сформированных вопросительных формулировок фактографического характера, которыми является, например, большинство вопросов конференции TREC:
Одной из серьезных проблем, приводящих к неправильным путям иерархии, является проблема установления таких отношений, когда вышестоящее понятие частично характеризует нижестоящее. Часто это связано с проблемой смешения понятий-типов и понятий-ролей.
Так, например, Никола Гуарино критикует отношения в WordNet: "Человек всегда живое существо, но он (она) начинает играть роль каузального агента только в некоторых ситуациях. Та же проблема возникает для яблока, которое всегда плод растения, а в некоторых ситуациях может быть пищей. Проблема в том, что человек и яблоко - это типы сущностей, в то время как каузальный агент и пища - это роли".
Один из аргументов в пользу различения типов и ролей в
В соответствии с онтологическими подходами понятия-типы не должны находиться в иерархиях ниже понятий-ролей. Более радикальный подход заключается в том, чтобы разделить
Одна из авторов WordNet, Кристиан Фелбаум, отвечая на эту критику Н. Гуарино, заявляет, что в таких ресурсах, как WordNet, неоднородные классификации имеют право на существование, поскольку такие ресурсы рассматриваются в настоящее время прежде всего как инструменты для компьютерной обработки текстов, а не только как совершенные онтологии, которые должны соответствовать строгим онтологическим принципам.
Вместе с тем важно подчеркнуть, что описание понятий-типов ниже понятий-ролей, то есть установление связей между понятиями, которые выполняются не в любых контекстах, а лишь при некоторых условиях, приводит к ложному срабатыванию этих связей, к неправильному выводу как раз при автоматической обработке текстов.
Во многих работах признается, что различия значений в WordNet слишком тонки для таких компьютерных приложений, как
Поэтому выполнен ряд исследований, чтобы разобраться, нельзя ли автоматически, на основе каких-либо разумных принципов собрать некоторые значения многозначных слов в кластеры и далее не различать эти значения.
В частности, исследовался вопрос, какая группировка значений была бы полезной для задач информационного поиска. Предполагается, что некоторые значения могут быть кластеризованы для разных приложений; в то же время существуют примеры пар значений, кластеризация которых была бы полезна в информационно-поисковых приложениях, при этом в других приложениях было бы полезно их различать.
Отмечается, что исследования регулярной многозначности не приводят к выделению полезных кластеров для информационно-поисковых задач, поскольку, как представляется авторам, некоторые образцы регулярной полисемии хорошо бы не различать для задач информационного поиска, в то время как другие хорошо бы сохранить отдельно. Так, например, полезно было бы кластеризовать такие пары регулярной полисемии, как container / и music / dance. Однако такие образцы, как animal / food, plant / food, animal / skin, language / people хорошо бы различать, поскольку, как представляется, они употребляются в разных типах текстов.
Поэтому нужны дополнительные исследования критериев кластеризации значений для информационно-поисковых задач.
Далее сравниваются два дополнительных критерия группировки значений. Первый критерий заключается в том, чтобы группировать значения, которые встречаются в одних и тех же текстах. Для этого используется семантически размеченный корпус SemCor. Второй критерий группирует значения, которые получают одни и те же переводы в нескольких разных языках. Пересечение кластеров, построенных на основе этих двух критериев, составляет 55-60%, что показывает некоторую корреляцию между кластерами, но оставляет сомнения в полезности каждого из критериев.
Проведенные эксперименты по кластеризации значений привели к выводу, что типология отношения между разными значениями многозначных слов является более полезной, чем формирование кластеров значений, поскольку близость значений зависит от приложения.
Например, указание, что одно из значений является метафорой исходного значения, является важным для приложений информационного поиска и вопросно-ответных систем, поскольку относится к разным семантическим полям. Однако для приложений
Современные версии WordNet содержат для каждого многозначного слова указание на самое частотное значение по корпусу SemCor, что дает возможность, в случае проблем при процедуре автоматического разрешения многозначности, выбирать это самое частотное значение.
Одной из серьезных проблем WordNet, препятствующей его использованию в приложениях, является так называемая "теннисная проблема":
Предлагалось решать данную проблему введением в WordNet информации о принадлежности синсетов определенным доменам. Домены, такие как "теннис", "политика" или "образование", группируют
Предполагается, что введение доменов должно быть особенно полезно для информационно-поисковых задач.
Разработка иерархической системы доменов началась с 250 рубрик, собранных по различным словарям, и затем была дополнена и уточнена на базе Десятичной классификации Дьюи. Была получена иерархия из 115 доменов, организованных по 4 уровням иерархии, которая включала, например, такие домены, как "сельское хозяйство", "археология", "астрология", "биология", "ветеринария" и др.
Авторы подчеркивают, что в WordNet имеются
Для того чтобы разметить все множество синсетов WordNet, была реализована автоматизированная процедура, состоящая из следующих шагов:
кресло парикмахера " (" barber_chair "), которое хотя и является частью парикмахерской (" barbershop "), не должно быть отнесено к домену КОММЕРЦИЯ ( COMMERCE ).Эксперименты с доменами в ворднетах были продолжены и в следующем европейском проекте, связанном с ворднетами, - Meaning, в котором 165 иерархически организованных доменов были автоматизированно приписаны всем
Авторы также подчеркивают полезность разметки синсетов доменами для автоматического разрешения лексической многозначности.
Вместе с тем остаются вопросы по отношению к введению в систему, построенную на основе одних единиц, набора других единиц с неопределенным относительно исходных единиц статусом, среди которых:
Многие исследователи отмечают нехватку информации, описанной в WordNet, для различения значений, в нем перечисленных.
В рамках проекта eXtended WordNet разработчики предполагают, что важным источником дополнительной информации могут стать толкования, приписанные к
Поскольку стало ясно, что применению таких ресурсов, как WordNet, препятствует такая проблема, как недостаточная эффективность разрешения лексической многозначности, эта проблема получила отдельную значимость.
Была организована специальная конференция, посвященная проблеме разрешения лексической многозначности - Конференция SENSEVAL.
Первая конференция по оценке методов разрешения лексической многозначности SENSEVAL состоялась в 1998 году, охватывала три языка, в ней приняли участие 25 исследовательских групп. Вторая состоялась в 2001 году, имела задания на 12 языках; в ней участвовали 35 исследовательских групп и более 90 систем.
Лингвистический ресурс WordNet разработан в Принстонском университете США. WordNet относится к классу лексических онтологий, свободно доступен в Интернете, и на его основе были выполнены тысячи экспериментов в области информационного поиска.
WordNet версии 2.1 охватывает приблизительно 155 тысяч различных лексем и словосочетаний, организованных в 117 тысяч понятий, или совокупностей синонимов (synset); общее число пар "лексема-значение" насчитывает 200 тысяч.
Разработка тезауруса была начата в 1984 году. В 1995 году WordNet появился в Интернете в свободном доступе и вызвал всплеск исследований по его использованию в различных компьютерных приложениях автоматической обработки текстов. Результаты применения WordNet оказались не столь однозначно положительными, но WordNet открыл новую эпоху разработки сверхбольших структурированных лингвистических ресурсов, вызвал появление большого числа последователей в разных странах, создающих такие "ворднеты" для своих языков, а также стал базой для многоплановых дискуссий и исследований того, на основе каких принципов должны строиться большие лингвистические ресурсы, пригодные для разнообразных приложений в области компьютерной лингвистики.
Первоначально WordNet создавался как модель человеческой памяти. Многие решения представления описаний слов в WordNet мотивируются психолингвистическими экспериментами. Однако нужно отметить, что WordNet вызвал значительно больший интерес у компьютерных лингвистов, чем у психолингвистов.
Основоположник WordNet Джордж Миллер формулирует основные гипотезы, лежащие в основе разработки WordNet, следующим образом:
В то время была популярной теория семантического компонентного анализа, в которой предполагалось, что значение слова, как и значение предложения, может быть представлено на основе набора семантических примитивов. Однако годы исследований не выявили лучшего набора семантических примитивов, пригодного для использования в ресурсах для обработки естественного языка.
В качестве альтернативы был выбран подход так называемой реляционной семантики, когда значения слов представляются некоторым выражением компонентов, а не на основе описания отношений между значениями разных слов.
Основным отношением в WordNet является отношение синонимии. Наборы синонимов -
Понятие синонимии базируется на критерии, что два выражения являются синонимичными, если замена одного из них на другое в предложении не меняет значения истинности этого высказывания.
Понятие синонимии, используемое в WordNet, не требует заменяемости синонимов во всех контекстах - по такому критерию в естественном языке было бы слишком мало синонимов. Используется значительно более слабое утверждение, что синонимы WordNet должны быть взаимозаменимы хотя бы в некотором множестве контекстов. Например, замена plank для слова board редко меняет значение истинности в контексте плотницкого дела, но существуют контексты, где такая замена не может считаться приемлемой.
Именно определение синонимии в терминах заменимости делает необходимым разделение WordNet на отдельные подструктуры по частям речи.
В состав словаря входят лексемы, относящиеся к четырем частям речи: прилагательное, существительное, глагол и наречие. Лексемы различных частей речи хранятся отдельно, и описания, соответствующие каждой части речи, имеют различную структуру.
Синсет может рассматриваться как представление лексикализованного понятия (концепта) английского языка.
Авторы считают, что синсет существительных представляет понятия существительных, глаголы выражают глагольные концепты, прилагательные - концепты прилагательных и т.п.
Кроме того, авторы считают, что такое разделение соответствует психолингвистическим экспериментам, что представление информации о прилагательных, существительных, глаголах и наречиях устроено в человеческой памяти по-разному.
Большинство синсетов снабжены толкованием, подобным толкованиям в традиционных словарях, - это толкование рассматривается как одно для всех синонимов
Между существительными в словаре установлены следующие семантические отношения:
ВЫШЕ-НИЖЕ, isA -отношение. Отношение транзитивно и несимметрично. Гипоним наследует все свойства гиперонима. Это отношение является центральным отношением для описания существительных;ЧАСТЬ-ЦЕЛОЕ ). Внутри этого отношения выделяются отношения быть_элементом и быть_сделанным_из.Основным отношением между isA -отношением.
Синсет X называется гипонимом Y, если носители английского языка считают нормальными предложения типа " An X is a (kind of) Y ".
Таким образом, отношения между
При построении иерархических систем на базе родо-видовых отношений обычно предполагается, что свойства вышестоящих понятий наследуются нижестоящими - так называемое свойство наследования.
Таким образом, существительные в WordNet организованы в виде иерархической системы с наследованием; были сделаны систематические усилия, чтобы для каждого
При этом предполагается, что есть возможность найти различия между синонимией и гиперонимией. На практике, однако, различие не всегда очевидно.
Кроме того, если традиционные словари могут в качестве различных значений одного и того же слова включить и более широкое, и более специализированное значение, например, board (доска) в широком смысле и в более специализированном, как surfboard (доска для серфинга), при разработке WordNet предпочтение отдавалось решениям, в которых одно и то же слово не представлено и в
WordNet разделяет существительные на несколько иерархий, каждая со своим начальным понятием. Всего для существительных имеется 25 синсетов верхнего уровня, такие как {act, activity} (деятельность), {animal, fauna} (животное), { (продукт труда), {food} (пища), {process} (процесс), { (количество) и др.
Меронимия представляет собой скорее совокупность несколько отличающихся отношений, чем четкое отделяемое отношение.
В качестве первого определения ЧАСТЬ-ЦЕЛОЕ, может служить следующее положение:
X является меронимом Y тогда и только тогда, если предложения вида " Y имеет X (или Xы) " и " X - это часть Y " являются нормальными для X и Y, интерпретируемых как родовые понятия.
Сущности, такие как группы, классы и коллекции, состоят в отношении
Отношение ЧАСТЬ-ЦЕЛОЕ представляет собой семейство близких отношений. Наиболее центральным типом этого отношения являются физические объекты.
ЧАСТЬ, и ЦЕЛОЕ являются неисчислимыми, то говорят об отношении ингредиентов, например: спирт - водка.ЧАСТЬ - исчислимое, а ЦЕЛОЕ - неисчислимое, то говорят об отношении ЧАСТИЦА-ВЕЩЕСТВО: песчинка - песок, снежинка - снег, капля - дождь.ЧАСТЬ - неисчислимое, а ЦЕЛОЕ - исчислимое, то это так называемое отношение МАТЕРИАЛ-ОБЪЕКТ: стекло - бокал.В WordNet выделяются три подвида отношения ЧАСТЬ-ЦЕЛОЕ: собственно часть, быть_элементом и быть_сделанным_из, например:
flower, bloom , blossom - (reproductive organ of angiosperm plants esp. one having showy or colorful parts)PART OF: angiosperm, flowering plant - (plants having seeds in a closed ovary)homo, man, human being, human - (any living or extinct member of the family Hominidae)MEMBER OF: genus Homo - (type genus of the family Hominidae)glass - (a brittle transparent solid with SUBSTANCE OF: glassware, glasswork - (articles made of SUBSTANCE OF: plate glass , sheet of glass - (Для частей характерно, что у многих разных сущностей части могут называться одинаково, например, point (острие) может быть у стрелы, ножа, иголки, карандаша, булавки и т.п. В таких случаях описываются все такие холонимы, например,
point - (PART OF: awl - (a pointed tool for marking PART OF: icepick, ice pick - (pick consisting of a steel rod with a PART OF: knife - (edge tool used as a cutting instrument; has a pointed blade with a PART OF: needle - (a PART OF: pencil - (a thin cylindrical pointed writing implement; a rod of marking substance encased in wood)PART OF: pin - (a small slender (often pointed) piece of wood or Авторы подчеркивают, что одной из проблем описания отношений { - колесное транспортное средство.
Прилагательные делятся на качественные и относительные.
Семантическое описание
Важность этого отношения для качественных прилагательных проявляется в психолингвистических тестах: когда человека просят назвать ассоциацию на качественное прилагательное, он чаще всего называет его антоним. Например, самая частая ассоциация на слово good (хороший) - это слово bad (плохой), и наоборот.
Важность
Авторы WordNet подчеркивают, что не всегда слова, противоположные по смыслу, рассматриваются носителями языка как антонимы; так, например, два близких по смыслу слова heavy (тяжелый) и weighty (тяжеловесный) имеют два разных антонима - light (легкий) и weightless (невесомый) соответственно. Кроме того, некоторые слова не имеют непосредственных антонимов: например, каков антоним слова ponderous (громоздкий)? Возможный антоним - прилагательное light - является безусловным heavy.
Если отношение ponderous. Было принято решение такие прилагательные описывать через отношение
Таким образом, качественные прилагательные в WordNet представлены как биполярный кластер: центральным является отношение (медленный, медленно двигающийся) и fast (быстрый, быстро двигающийся) выглядит следующим образом: указана пара антонимов - fast, для которых описываются так называемые lazy (ленивый, медленно двигающийся), (медленно двигающийся) и др.
Пример кластера прилагательных:
slow (vs. fast ) - (not moving quickly; taking a comparatively long time; "a bumper-to-bumper - (used of traffic; "bumper-to-bumper traffic")dilatory, laggard, poky, pokey - (wasting time)dragging - (passing painfully or tediously slowly; "the dragging minutes")drawn-out - ((used of lazy - (moving slowly and gently; "up a lazy river"; "lazy white clouds"; "at a lazy pace")long-play, long-playing - ((used of records) playing at a slower speed and for a longer time than earlier records)slow -moving - (moving slowly; "sluggish, sulky - (with little movement; very Отдельную группу составляют прилагательные цвета. Все оттенки цветов представляются как colored (цветной), которому противопоставлено как антоним прилагательное uncolored (нецветной). Оттенки от белого к черному представлены как семантически близкие achromatic (бесцветный).
Значение agricultural (сельский, сельскохозяйственный) первое значение отсылает к agriculture (сельское хозяйство), а второе представлено как элемент пары антонимов сельский - городской.
agricultural - (relating to or used in or promoting agriculture or agriculture (Sense 2)farming , agriculture, husbandry - (the practice of cultivating the land or raising stock)cultivation - ((agriculture) production of food by preparing the land to grow crops)agrarian, agricultural, farming (prenominal) - (relating to rural matters; "an agrarian (or agricultural) society"; "rural (vs. urban ) - (living in or Для описания глаголы были разделены на семантические поля. На первом этапе были отделены глаголы, обозначающие действия и события, от глаголов, обозначающих состояния. Первая группа глаголов была разделена на 14 семантических полей: глаголы движения, восприятия, контакта, коммуникации, соревнования, изменения, познания, потребления, создания, эмоций, обладания, ухода за телом и глаголы, относящиеся к социальному поведению.
Границы между группами являются достаточно расплывчатыми. Например, многие глаголы не могут быть однозначно расклассифицированы как глаголы познания или коммуникации ( wonder, , confirm, judge и др.). Также, например, глагол whistle в предложении "The bullet whistled past him" может классифицироваться и как глагол издания звука, и как глагол движения. Если такие глаголы представлять как однозначные, они должны относиться более чем к одному семантическому полю. В WordNet глаголы чаще описывались как полисемичные, если обнаруживалось, что они могут быть отнесены одновременно к разным семантическим полям.
Основу описания иерархии глаголов составляют отношения ПРИЧИНА-СЛЕДСТВИЕ (каузальные отношения) и другие отношения лексического следствия.
Это отношение устанавливается между V1 и V2, если из предложения "Someone V1 " логически следует "Someone V2 ". Например, из того, что "Человек идет", следует, что "Человек делает шаг".
walk, go on foot , foot , leg it, hoof, hoof it - (use one's feet to advance; advance by steps)step, take a stepДругой пример: из "храпеть" следует "спать", так как из предложения "Он храпит" следует "Он спит".
Лингвистический тест, который использовался для определения x is an y " - не подходит для глаголов, поскольку требует, чтобы x и y были существительными. Поэтому понадобилось предложить другой лингвистический текст для установления V1 is to V2 in some particular manner". Например, " Mumbling is talking in some particular manner" (" Бормотать - значит говорить некоторым специальным образом").
Отношение
Глагольные иерархии, образованные отношением
Отношение причины связывает два глагольных давать ), а второй - иметь ). Английский язык имеет лексикализованные каузативные пары, такие как " показывать - видеть ".
Кроме того, WordNet устанавливает отношение причины от каузативных транзитивных глаголов к соответствующим инхоативным нетранзитивным значениям тех же слов. В качестве примеров можно рассмотреть такие глаголы, как blacken, develop, break, shrink.
Отношение причины систематически представлено среди глаголов перемещения, соединяя каузативное и некаузативное употребление, например: (выдуть - выдуться).
kill - (cause to die)die, pip out, decease, perish, go, exit, pass away, expire - (pass from physical life and lose all bodily attributes and functions necessary to sustain life; "She died from cancer"; "They children perished in the fire"; "The patient went peacefully")Отношение причины также может быть рассмотрено как специальный случай следования. Если V1 необходимо вызывает V2, значит, из V1 также логически следует V2.
Ресурс WordNet, разработанный для английского языка, вызвал в мире огромный интерес к разработке такого рода ресурсов для десятков других языков.
Создание ворднетов для разных языков в рамках проекта EuroWordNet включает два этапа. На первом этапе (1996-1999) ворднеты создавались для голландского, испанского и итальянского языков. На втором - для французского, чешского, немецкого и эстонского языков.
В проекте стоял серьезный выбор: нужно ли стремиться к разработке языково-независимой структуры, с которой необходимо сопоставить единицы каждого языка, или, может быть, нужно иметь единую систему синсетов - новая единица в иерархической сети может быть включена, если хотя бы один язык из рассматриваемых имеет лексему или устойчивый оборот с таким значением.
По принятому в проекте решению каждый ворднет должен сохранять специфику своего языка. При этом каждый ворднет должен содержать отсылки на значения английского ворднета, что позволяет сравнивать ворднеты, обнаруживать непоследовательности в их построении и видеть различия в устройстве языковых систем.
Одновременно в рамках проекта была создана небольшая онтология верхнего уровня, к которой должен быть приписан каждый создаваемый ворднет.
Авторы проекта EuroWordNet подчеркивают различие между ресурсом класса wordnet как spoon (ложка) - object, tableware, silverware, merchandise, cutlery.
Таким образом, ворднеты - это сеть языково-специфичных лексикализованных единиц (в отличие от формальных онтологий, которые представляют собой структуру данных с формально определенными понятиями).
Основные предполагаемые применения ворднетов - это предсказание той или иной возможной замены лексических единиц в тексте для целей информационного поиска, генерации текстов,
Учитывая сложности, которые возникали при применении ворднетов в приложениях, европейские разработчики предложили ряд существенных нововведений в структуре создаваемых ворднетов. Большой класс этих изменений касается описания отношений между
Для того чтобы установить связи между различными языками, в проекте EuroWordNet
(рис 8.1) Архитектура базы данных EuroWordNet
Онтология верхнего уровня EuroWordNet состоит из 63 признаков, которые могут комбинироваться. Назначение онтологии - служить единым описанием понятий верхнего уровня для ворднетов.
Все сущности делятся на три
vehicle (транспортное средство) описывается следующими признаками: артефакт (происхождение) + объект (форма) + транспортное средство (функция).change location характеризуется как динамический + расположение + агентивный (причина) + физический.идея, мысль, теория, план.Для того чтобы попытаться реализовать схему автоматического концептуального индексирования и концептуального поиска, необходимо иметь лингвистический ресурс, организованный на основе понятий или значений слов. Поэтому такие ресурсы, как WordNet, могут использоваться как база для организации приложений концептуального индексирования и поиска. В этой лекции рассматривается два нижеследующих эксперимента.
Целью экспериментов была попытка выполнить поиск документов на основе не отдельных слов, а значений WordNet. Для каждого документа сначала выполняется процедура разрешения многозначности существительных, которая выбирает единственное значение и в результате которой каждому тексту ставится в соответствие вектор синсетов WordNet. После того как вектор создан, с ним могут выполняться такие же операции, как и с пословными векторами.
Эффективность использования векторов синсетов сравнивалась с эффективностью информационного поиска на основе стандартной модели, использующей вектора слов. В
Второй и третий подвектора представляют собой альтернативные представления документа, поскольку одни и те же слова этого документа порождают отдельные элементы каждого вектора.
Для каждого запроса стандартный прогон векторной модели сравнивался со следующими комбинациями перечисленных выше подвекторов (цифры соответствуют весу, который дается 1-му, 2-му и 3-му подвектору, соответственно):
Для экспериментов было использовано 5 разных коллекций документов (компьютерная область, медицинская область, газетные статьи и др.), и для каждой коллекции было выполнено более 30 различных запросов.
Оценки эффективности информационного поиска на основе показателя средней точности показали серьезное ухудшение эффективности для векторов, включающих
Основная причина такого ухудшения эффективности заключается в том, что процедура разрешения многозначности для слова в запросе может выбрать одно значение, а для того же слова в документе - другое значение. Например, при поиске по запросу "separation anxiety in infants and preschool children" из первых 15 документов стандартный прогон выдает 7 релевантных документов, в то время как прогон 110 - только один релевантный документ. Проблема вызвана выбором значения слова separation, для которого в WordNet описано 8 значений. Процедура разрешения многозначности выбирает такое значение этого слова в запросе, которое не было выбрано ни в одном из релевантных текстов.
Другая группа экспериментов по использованию WordNet в информационном поиске исследовала возможность расширения запросов синонимами или другими словами, связанными со словами запроса отношениями, которые описаны в WordNet. В таких экспериментах нет необходимости выбора единственного значения слова, что в случае ошибки привело бы к серьезному ухудшению результатов поиска.
Для экспериментов были использованы следующие соображения.
Во-первых, расширяться должны только важные для запроса понятия. Важность аппроксимируется количеством документов, в которых встречается конкретное слово запроса - слова, частотность которых в документах коллекции больше некоторого числа N, не участвуют в расширении запроса.
Во-вторых, чтобы смоделировать разрешение многозначности, запрос расширяется только теми словами, которые оказались в окрестностях расширения по крайней мере двух слов запроса.
Таким образом, сначала для каждого слова запроса, частотность которого меньше некоторого числа N, и каждого
Те слова, которые встретились по крайней мере в двух таких списках, добавляются к исходному запросу.
Исследовались различные величины N - 10% коллекции и 5% коллекции.
Для расширения запроса использовались
Добавленные слова могли учитываться с разными величинами весов: w = 0.3, 0.5, 0.8.
Максимальное улучшение, которое удалось получить, - 0.7% средней точности, что не является статистически значимой величиной ( N = 5%, расстояние - 2, w = 0.3 ).
Авторы подчеркивают, что идея аппроксимации разрешения многозначности путем поиска повторов в списках расширения оказалась неэффективной в виду того, что чаще всего это метод приводил к добавлению в запрос очень общих слов, таких как "система".
Для того чтобы исключить из рассмотрения эффект лексической многозначности и исследовать возможности WordNet по расширению поискового запроса, были выполнены эксперименты с ручным выбором значения многозначных слов в запросе.
Для каждого гипоним-гипероним ); все слова, отстоящие на один шаг от текущего
Чтобы исследовать все такие возможности, был образован вектор, состоящий из 11 подвекторов: 10 - для слов исходного запроса, один - для синонимов, один - для каждого типа отношений существительных в WordNet. Сходство с документами вычислялось как взвешенная сумма результатов сравнений с каждым из подвекторов.
Исследовались четыре варианта векторов:
Тестирование проходило на двух типах вопросов: более длинной и более короткой версии. При поиске по {cancer}, {skin_cancer}, {phramaceutical}.
Для укороченного запроса, используя 4-й тип расширения, при котором все добавления учитывались с коэффициентом 0,5, было получено 35% улучшение: средняя точность для укороченного запроса без расширения была 0,1634, с расширением - 0,2205. Средняя точность поиска по
Выводы авторов эксперимента заключаются в том, что для успешного применения WordNet в информационном поиске необходимо значительно улучшить эффективность автоматического разрешения лексической многозначности, между тем парадигматических отношений в WordNet недостаточно для решения этой задачи.
Проект Meaning является продолжением проекта EuroWordNet. Авторы проекта мотивируют необходимость продолжения работ тем, что десятки человеко-лет были затрачены для создания ворднетов для разных языков, но этих усилий недостаточно, чтобы обеспечить качество многоязычных приложений компьютерной обработки текстов.
Прогресс в этой области связан с решением двух промежуточных задач: автоматическое разрешение лексической многозначности и масштабное обогащение лексических баз знаний.
Проблема, однако, заключается в том, что существуют взаимозависимые факторы:
В проекте планируется выполнить три последовательных цикла масштабного разрешения лексической многозначности и
В рамках европейского проекта Meaning голландская компания Irion Technologies разработала технологию концептуального индексирования TwentyOne, комбинирующую лингвистический и статистический подходы. Авторы разработки считают, что неудачи с применением WordNet в информационно-поисковых приложениях связаны с трудностями встраивания такого рода лингвистических ресурсов в приложения, а также с проблемами оптимального использования содержащейся в ворднетах информации.
Основой технологии является статистическая машина поиска, базирующаяся на стандартной векторной модели и обеспечивающая быстрый поиск документов.
Лингвистические технологии используются для улучшения результатов, выданных статистической машиной, в двух направлениях:
Фраза представляет собой именную группу (noun phrase). Каждая фраза ассоциируется с отдельными словами, определенной комбинацией слов, а также комбинацией частей слов.
Система TwentyOne использует совокупность факторов для сравнения запроса с фразами текста:
Суть технологии в том, что сначала выдаются документы, которые имеют наибольшее совпадение по концептам фраз с запросом. Среди документов, имеющих одинаковое количество сопоставленных понятий между собственными фразами и запросом, первыми выдаются наиболее схожие по конкретному набору слов.
В проводимых экспериментах для сравнения были построены четыре индекса:
В эксперименте индексы тестируются в системе автоматической рубрикации текстов на коллекции Reuter. Описывается, что максимальных значений F-меры система автоматической рубрикации достигает для индекса WSD: полнота - 80,7, точность - 72,2. Минимум система имеет на базе индекса HTM: полнота - 67,8, точность - 70,4.
Нужно, однако, отметить, что описываемые результаты на основе пословного индекса значительно ниже, чем результаты других пословных систем на основе этой же коллекции. Иными словами, произведенные улучшения получаются по сравнению с заниженным недостаточно эффективным уровнем работы системы на основе пословного индекса, и значительные улучшения могли бы быть осуществлены еще в рамках такого индекса.
Разработки вопросно-ответных систем были начаты в 1960-е годы. В то время предполагалась, что ответ на вопрос должен отыскиваться в специально подготовленных базах знаний.
Второе рождение вопросно-ответные системы начали переживать с 90-х годов XX века. Тогда возникла необходимость искать ответы в больших текстовых коллекциях.
С 1999 года проводится соревнование по вопросно-ответным системам в рамках конференции TREC, с 2003 года соревнования вопросно-ответных систем в
Соревнование систем в рамках этих конференций проводится следующим образом.
Участникам рассылается большой текстовый массив (более нескольких гигабайт) и порядка 200 вопросов. Нужно прислать текстовые фрагменты (50, 250 байт), содержащие ответы на вопрос. Ответы должны быть упорядочены, при этом засчитываются первые три ответа.
Оценка производится следующим образом: за правильный ответ на первом месте система получает 1 балл, на втором месте - 0,5 балла, на третьем месте - 0,25 балла. Общая оценка системы получается путем вычисления среднего балла по всем вопросам.
Основные этапы поиска ответа на вопрос в современных
n (например, n=100 ) документов (абзацев) для дальнейшей обработки.Как известно, запросы в глобальных информационно-поисковых системах обычно очень короткие - 2-3 слова, и по ним находятся сотни и тысячи документов. Запросы в форме вопросов обычно значительно длиннее, поэтому если требовать присутствия в документе сразу всех слов запроса, то чаще всего не будет найдено ни одного документа.
Классическая векторная модель на основе сравнения векторов запроса и документа позволяет найти наиболее релевантные документы и по части слов запроса. При этом во многих современных исследованиях по вопросно-ответным системам начали использовать не векторные модели поиска, а выполнять
Булевское выражение обычно формируется как конъюнкция всех значимых слов формулировки вопроса. Если проводится
Например, если задан вопрос " When did Shapour Bakhtiar die?", то может быть образовано следующее булевское выражение:
Shapour AND Bakhtiar AND (die OR dies OR died OR dying OR death OR deaths)
Стандартной является ситуация, когда не находится документов, которые содержат все значимые слова вопроса, поэтому при обработке вопроса часто необходимо определить, какие именно слова формулировки вопроса можно отбросить, не включить в поисковый запрос без потери сути вопроса.
Например, следующему вопросу " Кто из великих целителей прошлого написал трактат "О медицине"?" могут частично соответствовать два предложения:
Первое из предложений содержит правильный ответ ЦЕЛЬС, во втором предложении кандидатом на ответ является А.Е. Ферсман, что неверно.
Таким образом, часто булевский вопрос к информационно-поисковой системе, составленный по формулировке вопроса, не находит ни одного документа. Поэтому обычно предлагается система модификаций, упрощающих исходное булевское выражение, после каждой из которых опять происходит обращение к поисковой системе для проверки, не появились ли релевантные документы.
Используются обычно два основных способа упрощения булевского выражения.
Во-первых, можно часть конъюнкций переводить в дизъюнкции.
Вторым способом является поочередное исключение членов конъюнкции на основе некоторого множества эвристик, определяющих значимость членов конъюнкции.
Значимость членов конъюнкции может определяться на основе их грамматических характеристик в формулировке вопроса. Так, наиболее значимыми обычно считаются имена, фразы в кавычках, а наименее значимыми - глаголы.
Процесс исключения элементов из конъюнкции прекращается, когда количество документов (абзацев) в выдаче достигает заданного числа (например, 50) или когда остается заданный процент слов исходной формулировки вопроса.
В связи с длинной формулировкой естественно-языкового вопроса и частым отсутствием в самых больших текстовых коллекциях ответов, содержащих все или большинство слов формулировки вопроса, значимой становится роль лексических ресурсов, позволяющих найти ответы в тех предложениях, в которых часть слов заменена на близкие по смыслу слова.
Так, например, ответ на вопрос " Почему электрические батареи быстрее разряжаются на холоде?" может быть следующим: " Батарейки быстрее садятся на морозе, потому что...".
В этом ответе практически каждое слово вопроса имеет соответствующее слово в данном ответе, при этом сделано 3 лексические замены. Пример не придуман, а реально найден в поисковой коллекции. Более лексически точного ответа в текстовой коллекции не нашлось.
Одной из самых эффективных систем в вопросно-ответной секции конференции TREC стала
Лексические и семантические замены осуществляются в момент сопоставления формальной структуры вопроса и ответа. Поиск в системе организован на основе обработки булевских запросов.
Стоит отметить, что вопросы, на которые могла бы искать ответ
Конечно, такие просьбы о помощи редко формулируются как простой, правильно построенный вопрос. Чаще они включают несколько предложений с описанием проблемы и, возможно, более одного вопроса. Например, вопрос может выглядеть таким образом:
Ноутбук Compaq nx9010, месяц от роду, лицензионная русская XP Home SP1, каждые 3-4 дня загадочно исчезают точки восстановления: просто стираются соответствующие папки. Похоже, что при перезагрузке. Но не уверен. В календаре мастера восстановления - тоже исчезают. На диске свободно 27 Гб, движок стоит на все 12%. На десктопе со времен установки XP ничего подобного никогда не наблюдалось (там без сервиспака). Принятые меры: выключение и снова включение восстановления - ноль внимания. Снесение системы, установка заново - аналогично. Где копать? Машина хорошая, претензий нет. К виндам во всем остальном - тоже. Железо? Винды? Хитрые дрова? Что?
Обработка таких вопросов значительно более сложна, чем обработка правильно сформированных вопросительных формулировок фактографического характера, которыми является, например, большинство вопросов конференции TREC:
Одной из серьезных проблем, приводящих к неправильным путям иерархии, является проблема установления таких отношений, когда вышестоящее понятие частично характеризует нижестоящее. Часто это связано с проблемой смешения понятий-типов и понятий-ролей.
Так, например, Никола Гуарино критикует отношения в WordNet: "Человек всегда живое существо, но он (она) начинает играть роль каузального агента только в некоторых ситуациях. Та же проблема возникает для яблока, которое всегда плод растения, а в некоторых ситуациях может быть пищей. Проблема в том, что человек и яблоко - это типы сущностей, в то время как каузальный агент и пища - это роли".
Один из аргументов в пользу различения типов и ролей в
В соответствии с онтологическими подходами понятия-типы не должны находиться в иерархиях ниже понятий-ролей. Более радикальный подход заключается в том, чтобы разделить
Одна из авторов WordNet, Кристиан Фелбаум, отвечая на эту критику Н. Гуарино, заявляет, что в таких ресурсах, как WordNet, неоднородные классификации имеют право на существование, поскольку такие ресурсы рассматриваются в настоящее время прежде всего как инструменты для компьютерной обработки текстов, а не только как совершенные онтологии, которые должны соответствовать строгим онтологическим принципам.
Вместе с тем важно подчеркнуть, что описание понятий-типов ниже понятий-ролей, то есть установление связей между понятиями, которые выполняются не в любых контекстах, а лишь при некоторых условиях, приводит к ложному срабатыванию этих связей, к неправильному выводу как раз при автоматической обработке текстов.
Во многих работах признается, что различия значений в WordNet слишком тонки для таких компьютерных приложений, как
Поэтому выполнен ряд исследований, чтобы разобраться, нельзя ли автоматически, на основе каких-либо разумных принципов собрать некоторые значения многозначных слов в кластеры и далее не различать эти значения.
В частности, исследовался вопрос, какая группировка значений была бы полезной для задач информационного поиска. Предполагается, что некоторые значения могут быть кластеризованы для разных приложений; в то же время существуют примеры пар значений, кластеризация которых была бы полезна в информационно-поисковых приложениях, при этом в других приложениях было бы полезно их различать.
Отмечается, что исследования регулярной многозначности не приводят к выделению полезных кластеров для информационно-поисковых задач, поскольку, как представляется авторам, некоторые образцы регулярной полисемии хорошо бы не различать для задач информационного поиска, в то время как другие хорошо бы сохранить отдельно. Так, например, полезно было бы кластеризовать такие пары регулярной полисемии, как container / и music / dance. Однако такие образцы, как animal / food, plant / food, animal / skin, language / people хорошо бы различать, поскольку, как представляется, они употребляются в разных типах текстов.
Поэтому нужны дополнительные исследования критериев кластеризации значений для информационно-поисковых задач.
Далее сравниваются два дополнительных критерия группировки значений. Первый критерий заключается в том, чтобы группировать значения, которые встречаются в одних и тех же текстах. Для этого используется семантически размеченный корпус SemCor. Второй критерий группирует значения, которые получают одни и те же переводы в нескольких разных языках. Пересечение кластеров, построенных на основе этих двух критериев, составляет 55-60%, что показывает некоторую корреляцию между кластерами, но оставляет сомнения в полезности каждого из критериев.
Проведенные эксперименты по кластеризации значений привели к выводу, что типология отношения между разными значениями многозначных слов является более полезной, чем формирование кластеров значений, поскольку близость значений зависит от приложения.
Например, указание, что одно из значений является метафорой исходного значения, является важным для приложений информационного поиска и вопросно-ответных систем, поскольку относится к разным семантическим полям. Однако для приложений
Современные версии WordNet содержат для каждого многозначного слова указание на самое частотное значение по корпусу SemCor, что дает возможность, в случае проблем при процедуре автоматического разрешения многозначности, выбирать это самое частотное значение.
Одной из серьезных проблем WordNet, препятствующей его использованию в приложениях, является так называемая "теннисная проблема":
Предлагалось решать данную проблему введением в WordNet информации о принадлежности синсетов определенным доменам. Домены, такие как "теннис", "политика" или "образование", группируют
Предполагается, что введение доменов должно быть особенно полезно для информационно-поисковых задач.
Разработка иерархической системы доменов началась с 250 рубрик, собранных по различным словарям, и затем была дополнена и уточнена на базе Десятичной классификации Дьюи. Была получена иерархия из 115 доменов, организованных по 4 уровням иерархии, которая включала, например, такие домены, как "сельское хозяйство", "археология", "астрология", "биология", "ветеринария" и др.
Авторы подчеркивают, что в WordNet имеются
Для того чтобы разметить все множество синсетов WordNet, была реализована автоматизированная процедура, состоящая из следующих шагов:
кресло парикмахера " (" barber_chair "), которое хотя и является частью парикмахерской (" barbershop "), не должно быть отнесено к домену КОММЕРЦИЯ ( COMMERCE ).Эксперименты с доменами в ворднетах были продолжены и в следующем европейском проекте, связанном с ворднетами, - Meaning, в котором 165 иерархически организованных доменов были автоматизированно приписаны всем
Авторы также подчеркивают полезность разметки синсетов доменами для автоматического разрешения лексической многозначности.
Вместе с тем остаются вопросы по отношению к введению в систему, построенную на основе одних единиц, набора других единиц с неопределенным относительно исходных единиц статусом, среди которых:
Многие исследователи отмечают нехватку информации, описанной в WordNet, для различения значений, в нем перечисленных.
В рамках проекта eXtended WordNet разработчики предполагают, что важным источником дополнительной информации могут стать толкования, приписанные к
Поскольку стало ясно, что применению таких ресурсов, как WordNet, препятствует такая проблема, как недостаточная эффективность разрешения лексической многозначности, эта проблема получила отдельную значимость.
Была организована специальная конференция, посвященная проблеме разрешения лексической многозначности - Конференция SENSEVAL.
Первая конференция по оценке методов разрешения лексической многозначности SENSEVAL состоялась в 1998 году, охватывала три языка, в ней приняли участие 25 исследовательских групп. Вторая состоялась в 2001 году, имела задания на 12 языках; в ней участвовали 35 исследовательских групп и более 90 систем.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.