Исследование лексико-синтаксической сочетаемости в русском языке с помощью статистических методов: на базе корпусов текстов тема диссертации и автореферата по ВАК РФ 10.02.21, кандидат филологических наук Хохлова, Мария Владимировна

  • Хохлова, Мария Владимировна
  • кандидат филологических науккандидат филологических наук
  • 2010, Санкт-Петербург
  • Специальность ВАК РФ10.02.21
  • Количество страниц 218
Хохлова, Мария Владимировна. Исследование лексико-синтаксической сочетаемости в русском языке с помощью статистических методов: на базе корпусов текстов: дис. кандидат филологических наук: 10.02.21 - Прикладная и математическая лингвистика. Санкт-Петербург. 2010. 218 с.

Оглавление диссертации кандидат филологических наук Хохлова, Мария Владимировна

Введение.

Глава 1. Явление синтагматической сочетаемости.

1.1. Синтагматические отношения.

1.2. Понятие сочетаемости и ее виды.

1.3. Типы сочетаний.

1.4. Явление устойчивости.

1.5. Понятие коллокации.

1.5.1. Понятие коллокации в рамках британского контекстуализма.

1.5.2. Семантико-синтаксический подход к определению коллокации.

1.5.3: Заключительные замечания к понятию коллокации.

1.6. Синтаксический подход к описанию сочетаемости.

1.6.1. Описание сочетаемости с помощь шаблонов.

1.6.2. Валентность.

1.6.3. Синтаксические типы словосочетаний.

1.7. Выводы.

Глава 2. Статистико-комбинаторные методы и программный аппарат для исследования сочетаемости.

2.1. Основные понятия.

2.2. Меры ассоциации.

2.2.1. Мера Ml.

2.2.2. Мера T-score.

2.2.3. Мера Log-likelihood.

2.2.4. Мера Dice.

2.2.5. Мера Z-score.

2.2.6. Статистический аппарат в системе Sketch Engine.

2.2.7. Выводы: лингвистическая оценка мер ассоциации.

2.3. Программно-технологическое обеспечение для вычисления силы синтагматической связанности.

2.3.1. Программные средства с возможностью поиска идиоматических \ оборотов без статистического аппарата.

2.3.1.1. НКРЯ.

2.3.1.2. Alex/Alex +.

2.3.1.3. Кросслексика.

2.3.2. Программные средства со статистическим аппаратом для поиска словосочетаний.

2.3.2.1. АОТ.

2.3.2.2. Сервис для выявления коллокаций на базе корпусов Leeds.

2.4. Система Sketch Engine.

Глава 3. Эксперименты по выявлению устойчивых сочетаний статистическими методами.

3.1. Материал и инструменты исследования.96 >

3.2. Методика исследования.

3.3. Выявление коллокаций для слова «война».:.

3.4. Анализ выявления коллокаций с помощью мер LL, MI, t-score.

3.4.1. Результаты для меры LL.

3.4.2. Результаты для меры Ml.

3.4.3. Результаты для меры t-score.

3.5. Выводы.

Глава 4. Грамматика Word Sketch и выявление лексико-синтаксических сочетаний.

4.1. Word Sketches как часть системы Sketch Engine.

4.2. Язык регулярных выражений системы Sketch Engine.

4.3. Грамматика Word Sketch (описание лексико-синтаксических шаблонов)

4.3.1. Общие постулаты.

4.3.2. Описание лексико-синтаксических сочетаний для русского языка.

4.3.3. Другие варианты описания лексико-синтаксических шаблонов для русского языка.

4.4. Эксперименты по выявлению коллокаций на основе лексикосинтаксических шаблонов.

4.4.1. Материал для исследования.

4.4.2. Подготовка корпуса.

4.4.3. Результаты.

4.5. Выводы.

Рекомендованный список диссертаций по специальности «Прикладная и математическая лингвистика», 10.02.21 шифр ВАК

Введение диссертации (часть автореферата) на тему «Исследование лексико-синтаксической сочетаемости в русском языке с помощью статистических методов: на базе корпусов текстов»

Сочетаемость слов определяется различными факторами: лексическими, грамматическими и семантическими и представляет собой одно из проявлений языковой синтагматики. Существуют разные подходы к изучению синтагматических отношений. Значение слова зависит «от общественно осознанных и отстоявшихся контекстов его употребления, от конкретных лексических связей его с другими словами, обусловленных присущими данному языку законами сочетания словесных значений.» [Виноградов 19776: 163].

Широко распространен подход, при котором устойчивая сочетаемость определяется семантической совместимостью элементов данного словосочетания и/или конкретной синтаксической моделью. Еще один подход, получивший распространение в последние годы, заключается в выявлении статистических закономерностей при построении текста. Появилась возможность проверить применимость статистического метода на материале больших корпусов текстов, посмотреть, какие типы словосочетаний могут быть выделены. В российской лингвистике, вслед за западной, для обозначения устойчивых словосочетаний стал использоваться термин «коллокация».

В настоящей работе основной акцент делается на описании формальных механизмов лексико-синтаксической сочетаемости и выявления коллокаций. Внедрение данных методов в изучение сочетаемости имеет как теоретическое, так и практическое значение. Наше диссертационное исследование является своего рода объединением этих трех подходов к изучению сочетаемости: лексического (семантического), синтаксического и статистического.

Исследования, проводимые в этой области, базируются на использовании программного обеспечения, которое может представлять собой самостоятельный программный продукт или «надстройку» над корпусом текстов с использованием статистических методов. На данный момент для русского языка, к сожалению, доступно ограниченное количество подобных средств обработки текста. Их можно свести к следующим: 1) механизм выявления коллокаций на базе корпусов русских текстов на сервере университета г. Лидса 1 (разработчик — С.А. Шаров); 2) сервис поиска по биграммам на сайте «Автоматическая обработка текста» 2 (разработчики — А.Н. Аверин, А.В. Сокирко).

Актуальность темы. Проблема изучения синтагматической сочетаемости . важна в современной лингвистике. Существующая лингвистическая литература и словари не всегда полно и последовательно отражают информацию о сочетаемости лексем, об устойчивых словосочетаниях — таким образом, в них не отражается в достаточной степени положение того или иного слова в системе языка (которое определяется его связями, в- том числе текстовыми, с другими лексическими единицами.). Поэтому получение новых данных о сочетаемости, разработка новых методов ее изучения должны , способствовать развитию лексикографии, синтаксиса, семантики.

Исследование коллокаций на базе корпусов текстов тесно связано с применением статистических методов и является одним из новых и развивающихся подходов к исследованию языка, его грамматического и лексического описания. Тем не менее, на материале русского языка таких исследований крайне мало.

Применение статистических методов к анализу лексической сочетаемости на базе больших корпусов текстов уже сегодня служит основой при создании словарей и грамматик нового типа, в том числе, словарей устойчивых словосочетаний. Тем не менее, требуется дополнительное программное и лингвистическое обеспечение для дальнейшего усовершенствования работ, поскольку вручную невозможно обработать огромное количество языкового материала, предоставляемого корпусами, включая статистически устойчивые сочетания (коллокации). Также возникает необходимость создания дополнительных средств (своего рода фильтров)

Ьйр://согри51 .leeds.ac.uk/ruscorpora.html http://mvw.aot.ru/demo/bigrams.html между» корпусом и пользователем-лингвистом, которые будут обрабатывать выдаваемые результаты и помогать отбирать значимые факты языка, в нашем случае, относящиеся к теоретическим и прикладным аспектам лексической сочетаемости. Одним из примеров такого формального «фильтра» является разработанная английскими и чешскими исследователями система так называемых «лексических шаблонов». Задача такой системы — обеспечить лексикографов необходимым лексическим массивом и инструментарием, позволяющими получать объективную информацию о связях слова с другими, классифицировать контексты слова по синтаксическим типам и др. Механизм системы Sketch Engine для выделения словосочетаний в корпусе разработан в настоящее время для ряда европейских языков (английский, ирландский, испанский, итальянский, немецкий, португальский, словенский, французский, чешский), а также для китайского и японского языков. Он порождает на основе грамматически размеченного корпуса списки, в которых содержится информация о «поведении» слов — их сочетаемости с количественным указанием силы связи применительно к грамматическим моделям. Для русского языка данная система пока не была апробирована.

Другой подход к описанию типовых синтагматических отношений между словами представлен в модели «Смысл <=> Текст», разработанной отечественными лингвистами. Данная модель оперирует понятием лексических функций, которые можно рассматривать как аппарат для построения словосочетаний. Под сочетаемостью языковой единицы, как утверждает И.А. Мельчук, понимается «число других элементов, с каждым из которых данный элемент может вступать в определенное отношение (скажем, быть зависимым от него: например, сочетаемость прилагательного — это число существительных, к которым оно может быть определением, и т.д.)» [Мельчук 1960: 80].

Традиционные подходы к описанию понятия коллокации в целом можно свести к следующим:

1) подход, берущий начало в работах британских контекстуалистов [Firth 1957; Firth 1968 и др.];

2) семантико-синтаксический подход [Иорданская, Мельчук 2007; Мельчук 1974; Телия 1996; Cowie 1978; Hausmann 1979; Hausmann 1985 и др.].

Термин «коллокация» впервые был введен основоположником Лондонской школы структурной лингвистики, представителем британского контекстуализма Дж. Р. Фёрсом [Firth 1957: 94]. В рамках этого направления под коллокациями понимаются характерные, часто встречающиеся сочетания слов, «появление которых рядом друг с другом основывается на регулярном характере взаимного ожидания и задается не грамматическими, а чисто семантическими факторами» (цит. по: [Сусов 2006: 153]).

В рамках семантико-синтаксического подхода коллокации рассматриваются как комплексные семантико-синтаксические единицы. Они характеризуются семантической, синтаксической и дистрибутивной регулярностью. Одним из типов устойчивых сочетаний являются фразеологические единицы. Подобные речевые элементы в работах разных авторов называются по-разному: фразеологизмы, идиомы, фраземы, «устойчивые глаголъно-именные сочетания» [Дерибас 1983], «аналитические лексические коллокации» [Телия 1996] и др.

Термин «коллокация» в русскоязычной научной литературе впервые появился в Словаре лингвистических терминов О.С. Ахмановой [Ахманова 1966]. Первой работой в российской лингвистике, полностью посвященной исследованию понятия коллокации на материале русского языка, является монография Е.Г. Борисовой [Борисова 1995а].

В теории «Смысл О Текст» и в других работах И.А. Мельчука (см., например: [Иорданская, Мельчук 2007]) коллокации рассматриваются как подкласс более обширного класса несвободных словосочетаний, или фразем.

Коллокацией называется словосочетание, в котором одно из слов является семантической доминантой, а второе выбирается в зависимости от него для передачи смысла всего выражения. Этому типу фразем соответствуют: англ. land a job (букв, «приземлиться на должность») — «найти работу», stand а comparison [with N] (букв, «выстаивать сравнение с N») — «выдерживать сравнение с N». Большинство коллокаций в теории «Смысл <=> Текст» называется лексико-функциональными выражениями [Иорданская, Мельчук 2007: 239].

Таким образом, можно обобщенно сказать, что в традиционной лингвистике под коллокацией понимается определенный тип устойчивого словосочетания, где устойчивость базируется на семантических отношениях. В этих сочетаниях одно из слов является опорным1 — аргументом (node), а второе — коллокат (collocate) (или остальные, если рассматривается сочетание из нескольких слов) — является своего рода «функцией» от данного аргумента, причем лексическое значение этого элемента словосочетания отличается от основного значения (основных значений) этого слова в лексической системе языка (например, «бить баклуши», «выносить сор из избы»). Иными словами, традиционно, значение коллокации не равняется сумме значений ее составляющих.

В настоящее время термин «коллокация» нашел широкое применение в корпусной лингвистике, в рамках которой понятие коллокации переосмысливается или упрощается. Этот подход можно назвать статистическим. Во главу угла ставятся частотные характеристики, поэтому коллокации в корпусной лингвистике могут быть определены как статистические устойчивые словосочетания. При этом статистически устойчивое сочетание может быть как фразеологизированным, так и свободным. И именно появление больших репрезентативных корпусов текстов позволяет получить достоверные данные о частоте того или другого сочетания в языке в целом.

3 Ср.: семантическая доминанта в теории «Смысл о Текст».

Исследование коллокаций в настоящий момент играет одну из ведущих ролей в лексикографической практике [Беляева и др. 1996; Atkins, Rundell 2008; Hausmann 1979; Hausmann 1985; Kilgarriff 2006; Sinclair 1991]. В последнее время за рубежом и в России были созданы специальные словари коллокаций [Benson 1997; Crowther et al. 2002; Kjellmer 1994; Бирюк и др. 2008; Денисов, Морковкин 1983; Кустова и др. 2008; Шайкевич 2003].

Высокая величина частоты совместной встречаемости, казалось бы, говорит об устойчивости данного сочетания. Однако этой характеристики недостаточно, чтобы говорить о' предпочтительной сочетаемости данного аргумента именно с данным коллокатом. Вполне возможно, частота совместной встречаемости с другими коллокатами окажется еще выше. Поэтому был выработан целый ряд статистических мер (они получили название мер ассоциации, или мер ассоциативной связанности, англ. association measures), вычисляющих именно силу синтагматической связи элементов в составе коллокации. В общем случае, эти меры учитывают как частоту совместной встречаемости, так и другие параметры, прежде всего частоту в данном корпусе каждого отдельного элемента. Значения мер ассоциации можно считать показателями силы синтагматической связи между элементами словосочетаний. Общее количество этих мер исчисляется многими десятками. Описание наиболее распространенных мер см. [Evert 2004]. Чаще других используются MF-score, t-score и log-likelihood.

Однако остаются нерешенными многие проблемы, которые возникли внутри статистической методологии. Можно отметить, что существующий программный инструментарий автоматического выявления коллокаций на основе статистических методов весьма неудовлетворителен — как в части лингвистического обеспечения, так и с точки зрения выходных интерфейсов. Проблематично проводить поиск разрывных словосочетаний, варьировать размер контекстного окна относительно опорного слова. Особым образом нужно обрабатывать имена собственные, знаки препинания, служебные слова.

Особое значение имеет выдача коллокаций, построенных по определенной синтаксической модели, учет отношения зависимости между элементами коллокаций или сочетание грамматических признаков.

Целью настоящей диссертации является исследование и решение комплекса теоретических вопросов, связанных с троякой природой коллокаций (лексической, синтаксической и статистической), разработка общей модели лексико-синтаксических сочетаний в русском языке и изучение методов их выделения.

Для достижения поставленной цели в диссертационном исследовании был решен ряд теоретических и практических задач:

1. Проанализировано понятие «коллокация» в зарубежной и отечественной лингвистике.

2. Описаны статистические меры для вычисления силы синтагматической связанности.

3. Изучено и описано программное обеспечение, выявляющее коллокации в корпусах текстов.

4. Проведены экспериментальная проверка и сравнительный анализ эффективности различных мер ассоциации, используемых для выявления коллокаций, на материале русского языка.

5. Произведен анализ синтаксической типологии словосочетаний.

6. Разработано системное описание моделей коллокаций русского языка в рамках лексико-синтаксических шаблонов и базовой модели русского синтаксиса для системы типа Sketch Engine; разработанные правила описания лексико-синтаксических шаблонов апробированы на материале корпусов русского языка.

Объектом исследования выступает явление синтагматической сочетаемости в русском языке. Предмет исследования — статистически устойчивые сочетания (коллокации), соответствующие определенным лексико-синтаксическим моделям.

Методы исследования, использованные в работе, включают контекстный, сопоставительный и другие виды анализа. Применялся также статистический анализ по корпусам текстов русского языка с использованием следующих статистических мер: MI, t-score, log-likelihood и salience. Лингвистические корпусы позволяют рассматривать элементы текста одновременно в нескольких аспектах и получить разнообразные данные о них (например, морфологические, статистические характеристики, контексты словоупотреблений и др.).

Базой исследования послужили данные трех корпусов новостных текстов русского языка объемом 78 млн., 157 млн. и 174 млн. словоупотреблений соответственно.

Новизна исследования заключается в том, что в нем впервые в отечественной лингвистике сочетаемость рассматривается в аспекте своей троякой природы: лексической, синтаксической и статистической. Использованы статистический и лексико-синтаксический подходы к явлению сочетаемости. В настоящей работе впервые осуществлен последовательный, цикл разработки аппарата для выявления коллокаций на основе лексико-синтаксических шаблонов — от теоретического описания до практического внедрения в программу.

Теоретическая значимость исследования заключается в создании комплексной системы описания сочетаемости, базирующейся на грамматике лексико-синтаксических шаблонов для русского языка и статистических методах. Совмещение синтаксического подхода со статистическими методами, предлагаемое в диссертационном исследовании, является вкладом в создание 1 I единой теории словосочетаний, учитывающей синтаксический, семантический и узуальный аспекты сочетаемости. Теоретический интерес представляют также новые данные о сочетаемости лексических единиц, их контекстном окружении, полученные на основе корпусов текстов. Создана и апробирована новая методика исследования и лексикографического описания сочетаемостных предпочтений лексем.

Практическая значимость работы заключается в следующем:

1. созданное описание коллокаций может быть использовано в теоретических исследованиях по синтаксису словосочетаний, а также при написании грамматик;

2. результаты, полученные в диссертационном исследовании, и доработанный программный аппарат для русского языка могут служить базой для создания словарей русского языка;

3. программное обеспечение, адаптированное для русского языка, можно использовать при обучении;

4. разработанные методы и механизмы могут быть использованы в грамматических и стилистических программах-корректорах;

5. результаты исследования могут быть полезны при снятии семантической неоднозначности;

6. механизм выявления коллокаций и найденные сочетания могут быть использованы для автоматического расширения информационных запросов.

Апробация и внедрение результатов работы. Отдельные аспекты и основные положения диссертационного исследования обсуждались в докладах в рамках международных филологических конференций преподавателей и аспирантов в Санкт-Петербургском государственном университете (2008 г., 2010 г.), на международной конференции "Computer Treatment of Slavic and East European Languages" (Братислава, Словакия, 27 октября 2007), на заседании семинара «Автоматическая обработка естественного языка» (Санкт-Петербург, 10 октября 2009 года), на семинаре "Recent Advances in Slavonic Natural Language Processing" (Брно, Чехия, 5 декабря 2009), на международном семинаре Sketch Grammar (Любляна, Словения, 4 февраля 2010), на ХП1 и XTV международных лексикографических конгрессах "EURALEX" (Барселона, Испания, 18 июля 2008; Леэварден, Нидерланды, 6 июля 2010). По теме диссертации опубликовано 12 работ, в том числе две статьи в российских изданиях, рекомендованных ВАК РФ («Вестник Санкт-Петербургского государственного университета» №2, 2010г.; «Структурная и прикладная лингвистика» №8,2010г.).

На защиту выносятся следующие положения:

1. Количественные показатели устойчивой сочетаемости, вычисленные на основе мер ассоциации и статистических данных, получаемых на больших корпусах текстов, эффективно отражают реально существующие семантико-синтагматические связи разного типа и устойчивые словосочетания. Извлечение коллокаций с помощью статистических методов позволяет выявить устойчивые сочетания, отсутствующие в словарях и другой лингвистической литературе.

2. Комбинация статистического и синтаксического подходов к исследованию сочетаемости и к выявлению коллокаций является более эффективным методом, чем статистический подход. Синтаксический подход реализуется в разработанных лексико-синтаксических шаблонах, учитывающих возможные синтаксические отношения между словами в определенном контексте на основе морфологической разметки корпуса.

3. Описание лексико-синтаксических шаблонов, используемых в системе Sketch Engine, представляет собой формальную модель русского синтаксиса для словосочетаний разного типа. Это вариант грамматики, представленный в виде структурных образцов (лексико-синтаксических шаблонов) языковых конструкций, в которых указываются существенные грамматические характеристики лексем и синтаксические условия употребления языкового выражения, построенного в соответствии с шаблоном.

4. Сопряжение описанной грамматики со статистическими методами позволяет получать данные о сочетаемостных предпочтениях лексем в рамках конкретных моделей и о продуктивности различных синтаксических моделей.

Структура и объем работы. Диссертация состоит из Введения, четырех глав, Заключения, Списка литературы и трех Приложений. Основной текст диссертации занимает 211 страниц, содержит 14 таблиц, 18 рисунков. Список литературы состоит из 119 названий.

Похожие диссертационные работы по специальности «Прикладная и математическая лингвистика», 10.02.21 шифр ВАК

Заключение диссертации по теме «Прикладная и математическая лингвистика», Хохлова, Мария Владимировна

4.5. Выводы

Проведенные эксперименты доказали возможность поиска осмысленных словосочетшшй по заранее описанным лексико-синтаксическим шаблонам. При этом можно искать как контактные, так и дистантные словосочетания. Можно выбирать меру, согласно которой будет высчитываться сила синтагматической связанности, языковых элементов. Немаловажным представляется тот факт, что система выдает наиболее релевантные фрагменты результатов, что позволяет пользователю не. обращаться к полному объему выдачи, зачастую слишком большому.

Аппарат лексико-синтаксических шаблонов позволяет выявлять устойчивые словосочетания (например, «крепкий чай»), имена собственные, термины. Однако морфологическая разметка программы TreeTagger для русского языка выдает большой процент ошибок (в том числе плохо распознаются омоформы), что существенным образом затрудняет анализ и дальнейшую доработку правил.

На основе описанных лексико-синтаксических шаблонов можно получать данные о конструкциях, связанных с той или иной лексической единицей (например, конструкции, реализующие ту или иную модель управления, конструкции со вспомогательным глаголом, адъективным или наречным модификатором, идиоматические обороты), выделяя словосочетания по данным моделям для определенных типов словарей: например, словари глагольного управления, предложного управления.

Разработанная нами грамматика и базирующийся на ней программный аппарат (система Sketch Engine) позволяют получать наборы лексико-синтаксических сочетаний с количественными оценками их употребительности в русском языке и с указанием силы связей между элементами словосочетаний.

Инструменты Thesaurus, Clustering, Differences, работающие «поверх» нашей грамматики, позволяют исследовать семантические связи между словами.

Заключение

Применение описанных методов, а именно комбинирование статистического и лексико-синтаксического подходов к анализу лексической сочетаемости, которое ранее не применялось к русскому языку, открывает новые возможности в изучении данной проблематики.

Очевидно, что автоматический анализ текста (с помощью описанных в данном исследовании методов) — это только первоначальный этап для выявления коллокаций. Затем, как правило, требуется ручная обработка полученных результатов (под ручной мы понимаем дополнительный интеллектуальный анализ).

Как было показано в описании экспериментов в главах 3 и 4, статистические методы позволяют достаточно успешно автоматически выделять на базе корпусов текстов устойчивые словосочетания. Некоторая часть этих сочетаний зафиксирована в имеющихся словарях русского языка. Таким образом, результаты, демонстрируемые при использовании статистико-комбинаторных методов, являются лингвистически достоверными, зафиксированными в большом количестве источников.

При сравнении сочетаний, полученных с помощью статистических методов, со словарями наблюдается одинаковая тенденция: чем меньше значение меры, тем больше вероятность, что эти словосочетания не зафиксированы как устойчивые в словарях русского языка, и наоборот. Большинство коллокаций, зафиксированных в словарях, оказывается в верхней части списка, составленного на основе одной из мер ассоциации. В качестве общего вывода можно отметить, что ранг выделенного словосочетания обратно пропорционален вероятности того, что оно окажется устойчивым, т.е. чем выше ранг, тем больше вероятность найти это словосочетание в словарях. Таким образом, можно сказать, что данные об устойчивой сочетаемости, приведенные в словарях, совпадают с данными, полученными на основе мер ассоциации, или, по-другому, что статистические меры ассоциации достаточно хорошо выявляют реально существующие семантико-синтагматические связи.

Более того, среди коллокаций с высокими рангами далеко не все из них зафиксированы в словарях. Таким образом, встает вопрос о дальнейшей обработке данных, зафиксированных в списках и являющихся кандидатами на включение в словари.

Большую роль в объективизации «статистических» коллокаций играет объем корпуса. Например; на корпусах малых объемов не видны различия между результатами, которые выдаются разными статистическими мерами^ т.е. сочетаемость слова, выявленная подобным образом, будет примерно одинаковой. Это происходит из-за малой частоты самих слов и словосочетаний.

Вероятно, что для большинства исследований и задач стоит использовать сбалансированный корпус,, состоящий из текстов разных функциональных стилей. В то же время, интерес представляют также эксперименты на основе корпусов разных функциональных стилей. Можно даже предположить, что для корпуса определенного функционального стиля (например, научного) объем может быть меньшим, чем для упомянутого выше сбалансированного корпуса или использованного нами корпуса новостных текстов. Так как языковые конструкции, в том числе термины, научного стиля имеют тенденцию повторяться и, вероятно, окажутся в верхней части списка.

Также остро стоит вопрос о качестве корпусной разметки и самих текстов. Во-первых, в тестах зачастую содержатся ошибки сканирования, неудаленные структурные элементы (если тексты берутся из сети Интернет). Во-вторых, морфологическая разметка проводится автоматически, некоторым словоформам можно могут быть приписаны два или более морфологических показателя и несколько лемм. Вручную невозможно снять возникшую морфологическую неоднозначность или ошибки морфологического анализа на таких больших объемах текстов. Со всем этим тесным образом связано получение более «чистых» результатов.

Что касается самих использованных мер ассоциации, то наилучшие результаты выдает мера Ml. Также, возможно, стоит изучить вариант введения новой метрики, например, ввести величину, равную сумме рангов коллокаций по разным мерам.

Нами был рассмотрен статистический подход к изучению лексико-синтаксической сочетаемости, представленный «чисто» статистическим подходом, и подход, использующий лексико-синтаксические шаблоны.

В главе 3 было продемонстрировано, что списки сочетаемости, получаемые на основе только вероятностно-статистических методов, зачастую включают знаки препинания или служебные слова. В рамках нашего подхода, использующего лексико-синтаксические шаблоны, данная проблема была практически полностью решена, т.к. рассматривались слова, связанные синтаксическими отношениями в пределах одной синтагмы (полностью эту проблему можно было бы решить, наложив ограничение на «нежелаемые» языковые элементы, что вполне возможно в рамках разработанных нами лексико-синтаксических шаблонов).

В системах выдачи словосочетаний Leeds и АОТ отсутствовала возможность работы с разрывными словосочетаниями (строго говоря, можно было только задавать количество слов в контекстном окне, опять же, под словами понимались и знаки препинания). В рамках разработанной нами грамматики Word Sketch описываются все словосочетания, независимо от порядка слов и расстояния между ними.

Еще один недостаток, на который можно было обратить внимание в ходе экспериментов в главе 3, и, с нашей точки зрения, главный — слова выбираются статистическим методом на основе частот по всему корпусу вне зависимости от их распределения по грамматическим моделям. В верхней части единой таблицы оказываются, таким образом, высокочастотные словосочетания (выявленные согласно одной из мер) для всего корпуса, при этом высокая частота словосочетания внутри некоторой конкретной модели может оказаться намного ниже наивысшей частоты для всех словосочетаний. Т.е. характерные словосочетания, обладающие средней частотой, окажутся внутри общего списка. В рамках описанного в главе 4 подхода меры ассоциации рассчитываются отдельно для каждой конкретной модели, следовательно, устойчивые словосочетания, характерные для отдельных моделей, будут выданы согласно их частотным характеристикам для заданного отношения и не будут рассредоточены в общем списке.

Так, словосочетания! с высокочастотными словами, которые часто искажают картину, будут выданы в отдельной таблице (например, глагол + предлог, предлог + существительное, существительное/глагол + предлог + существительное).

Таким образом, описанная грамматика лексико-синтаксических шаблонов позволяет производить более точный расчет силы синтагматической связи, так как каждой модели соответствуют свои частотные характеристики.

Как было показано, синтагматические связи во многом обусловлены семантическими факторами, поэтому именно семантическая взаимообусловленность и предсказуемость коллокаций являются весьма важными. В свою очередь, разработанный нами инструмент позволяет выявлять и измерять семантические связи между словами (функции Thesaurus, Clustering, Differences).

Как было показано, с помощью существующей системы можно получить данные об отношениях разного типа в языке: атрибутивных, объектных и т.д.

Видимо, дальнейшим усовершенствованием данного аппарата может стать семантическая разметка, а именно использование корпусов с подобным видом разметки. На их базе можно классифицировать словосочетания в зависимости от значений слов (например, как в случае многозначных первообразных предлогов).

Практическое применение нашей работы, в первую очередь, может быть найдено в лексикографической практике. Коллокации, выдаваемые на основе использования статистических методов и особенно комбинации этих методов с синтаксисом (грамматика Word Sketch), не зафиксированные ни в одном из словарей, после тщательного анализа могут пополнить существующие словари и грамматики. Грамматика Word Sketch была нами внедрена в промышленно работающую систему Sketch Engine и используется для выдачи информации о лексико-синтаксической сочетаемости на базе корпуса русских текстов. С ее функционированием можно ознакомиться на сайте: http://sketchengine.co.uk. В настоящее время мы видим несколько важнейших прикладных задач, где есть потребность в автоматизированных методах извлечения коллокаций из больших корпусов текстов. В частности, это составление словарей и других лексикографических пособий, составление онтологий, обучение языку, отладка лингвопроцессоров, задачи информационного поиска.

Кроме того, существует обширный класс прикладных задач, использующих дистрибутивную информацию о словах (например, разрешение лексико-семантической неоднозначности, автоматическое исправление опечаток, классификация текстов, информационный поиск и др.), полученные нами результаты Moiyr использоваться при подготовке данных для работы в рамках этих задач.

Таким образом, обобщая, можно сказать, что исследованные нами методы извлечения коллокаций, а также разработанный аппарат лексико-синтаксических шаблонов имеют большую практическую значимость и могут быть использованы в различных областях прикладной лингвистики:

• при обучении языкам;

• при решении проблем, связанных с переводом текстов (в том числе с машинным переводом);

• при снятии неоднозначности при автоматическом анализе;

• в задачах создания автоматизированных систем семантического анализа и синтеза текстов;

• в исследованиях, посвященных социальным явлениям, например, в работах о языковой картине мира и др.

Список литературы диссертационного исследования кандидат филологических наук Хохлова, Мария Владимировна, 2010 год

1. Абрамов Н. Словарь русских синонимов и сходных по смыслу выражений. - М.: Русские словари, 2007. - 667 с.

2. Андреев Н.Д. Статистико-комбинаторные методы в теоретическом и прикладном языковедении. JL: Наука, 1967. - 403 с.

3. Апресян Ю.Д. Идеи и методы современной структурной лингвистики. -М.: Просвещение, 1966. 305 с.

4. Апресян Ю.Д. Значение и оттенок значения // Известия АН СССР. Отделение литературы и языка. Т. ХХХП. Вып. 4. -М., 1974. - С. 320330.

5. Апресян Ю.Д. Избранные труды. Том 1. Лексическая семантика: Синонимические средства языка. М.: Языки русской культуры, 1995. -472 с.

6. Апресян Ю.Д., Жолковский Ю.Д., Мельчук И.А. Об одном способе изучения сочетаемости слов // Русский язык в национальной школе. 1969. №6.-С. 61-71.

7. Архангельский B.JI. Устойчивые фразы в современном русском языке. Опыт теории устойчивых фраз и проблемы общей фразеологии. Ростов-на-Дону, 1964.-315 с.

8. Ахманова О.С. Словарь лингвистических терминов. — М.: Советская энциклопедия, 1966. 608 с.

9. Балли Ш. Общая лингвистика и вопросы французского языка / пер. с фр. М.: Изд-во иностранной литературы, 1955. — 416 с.

10. Беляева JI.H., Герд A.C., Убин И.И. Автоматизация в лексикографии // Прикладное языкознание: Учебник / JI.B. Бондарко, JI.A. Вербицкая, Г.Я. Мартыненко и др. Отв. Редактор A.C. Герд. СПб.: Изд-во С.Петербург. ун-та, 1996. С. 318-333.

11. Бирюк О.Л., Гусев В.Ю., Калинина Е.Ю. Словарь глагольной сочетаемости непредметных имен русского языка. М., 20086. Электронный ресурс. URL: http://dict.ruslang.ru/abstrnoun.php (дата обращения: 5.10.2010).

12. Богуславский И.М. Сфера действия лексических единиц. — М.: Языки русской культуры, 1996. 464 с.

13. Большой академический словарь русского языка (БАС) / Гл. ред. К.С. Горбачевич. Т. 1-12. М., СПб., 2004-2010.

14. Борисова Е.Г. Коллокации. Что это такое и как их изучать. М.: Филология, 1995а. - 49 с.

15. Борисова Е.Г. Слово в тексте. Словарь коллокаций (устойчивых словосочетаний) русского языка с англо-русским словарем ключевых слов. -М.: Филология, 19956. 149 с.

16. Валгина Н.С., Розенталь Д.Э., Фомина М.И. Современный русский язык: Учебник / Под редакцией Н.С. Валгиной. — М.: Логос, 2002. 528 с.

17. Виноградов В.В. Об основных типах фразеологических единиц в русском языке // Виноградов В.В. Избранные труды. Лексикология и лексикография. М., 1977а.-С. 140-161.26; Виноградов В.В. Основные типы лексических значений слова //

18. Виноградов В.В. Избранные труды. Лексикология и лексикография; М., 19776. -С. 162-189.

19. Витгенштейн Л; О достоверности // Вопросы философии. 1991. № 2.

20. Дементьева И., Танабакова В.Д. Коллокация как средство семантизации слова в английском словаре // Language and Literature. № 4 Электронный ресурс. URL: http://fi-gf.utmn.ru/last/No4/text6.htm^{дата обращения: 5.10.2010).

21. Денисов П.Н., Морковкин В.В. Словарь сочетаемости слов русского языка. -М.: Русский язык, 1983. — 688 с.

22. Дерибас В.М. Устойчивые глагольно-именные словосочетания русского языка. -М:, 1983.

23. Жуков В.П. Русская фразеология. — М.: Высшая школа, 1986. — 310 с.

24. Караулов Ю.Н., Черкасова Г.А., Уфимцева Н.В., Сорокин Ю.А., Тарасов Е.Ф. Русский ассоциативный словарь. В 2 т. Т. 1. От стимула к реакции. -М.: АСТ-Астрель, 2002. 784 с.

25. Кацнельсон С.Д. О грамматической категории // Вестник ЛГУ. 1948. №■2;

26. Кацнельсон С.Д. Общее и типологическое языкознание. Л.: Наука, 1986. -298 с.

27. Копотев М.В., Мустайоки А. Современная корпусная лингвистика // 81ауюа НеЫп^еп^а 34. Инструментарий русистики: Корпусные подходы. Хельсинки, 2008. - С. 7-24.

28. Копыленко М.М., Попова З.Д. Очерки по общей фразеологии. Воронеж: Изд-во Воронеж, ун-та, 1978. - 144 с.

29. Кустова Г.И. Словарь русской идиоматики. Сочетания слов со значением высокой степени. М., 2008. - Электронный ресурс. ХЖЬ: http://dict.ruslang.ru/magn.php (дата обращения: 5.10.2010).

30. Кутина Л.Л. Формирование норм словоупотребления при заимствовании и теория интерференции // Теория языка. Методы его исследования и преподавания. К 100-летию со дня рождения академика Л. В. Щербы Л.: Наука, 1981.-292 с.

31. Мельчук И.А. О терминах «устойчивость» и «идиоматичность» // Вопросы языкознания. 1960, № 4. С. 73-80.

32. Мельчук И. А. Опыт теории лингвистических моделей «Смысл*-»Текст». — М.: Наука, 1974.-314 с.

33. Молотков А.И. Основы фразеологии русского языка. JL: Наука, 1977. — 284 с.

34. Налимов В.В, Вероятностная модель языка. М.: Наука, 1979. - 303 с.

35. Перцов Н.В. О роли корпусов в лингвистических исследованиях // Труды международной конференции «Корпусная лингвистика-2006»; СПб;: Изд-во G.-Петерб. ун-та, 2006. - С. 318-331.

36. Пиотровский P. F. Текст, машина, человек. Л.: Наука, 1975; - 327 с.

37. С. 103-106. Электронный ресурс. URL:http://rcdl2008.jinr.ru/pdf/103l06рарег10.pdf (дата обращения: 5.10.2010).

38. Рогожникова Р.П. Толковый словарь сочетаний, эквивалентных слову, М.: Астрель, 2003. 416 с.

39. Русская грамматика. Т. I, II / Н. Ю. Шведова (гл. ред.). М.: Наука, 1980. (АГ-1980)

40. Сидорова Б.А. Подход к построению предметных словарей по корпусу текстов// Труды международной конференции «Корпусная лингвистика-2008». СПб., 20086.- С. 365-372.

41. Словарь русского языка: В 4 т. (MAG) / Под ред. А.П. Евгеньевой: 2-е изд., испр. и доп. - М;*. Русский язык, 1981-1984.

42. Словарь современного русского литературного языка: В 17 т. (БАС) / Под ред. А.М. Бабкина, С.F. Бархударова, Ф.П. Филина и др. -М.; Ли Изд-во АН СССР, 1948-1965.

43. Солодуб Ю.П., Альбрехт Ф.Б. Современный русский язык. Лексика и фразеология (сопоставительный аспект). М.: Наука, 2003. - 264 с.

44. Соссюр Ф. де. Курс общей лингвистики / Пер. А.М.Сухотина. М.: Соцэкгиз, 1933. — 272 с.

45. Сусов И.П. История языкознания: Учебное пособие для студентов старших курсов и аспирантов. М.: Восток-Запад, 2006. - 295 с.

46. Телия В.Н. Русская фразеология: семантический, прагматический и лингвокультурологический аспекты. — М.: Языки русской культуры, 1996. -288 с.

47. Теньер Л. Основы структурного синтаксиса. М., «Прогресс», 1988.653 с.

48. Тестелец Я.Г. Введение в общий синтаксис. — М.: РГГУ, 2001. 800 с.

49. Угланова И.А., Ерофеева Е.В. Частотная категория в языке и речевой деятельности II. Слово отзовется: Памяти Аллы Соломоновны Штерн и Леонида Вольковича Сахарного. — Пермь: Перм. госуд. ун-т, 2006. С. — 197-203.

50. Шайкевич А .Я., Андрющенко В.М., Ребецкая H.A. Статистический словарь языка Достоевского. М.: Языки славянских культур, 2003. -832 с.

51. Шанский Н.М. Русское языкознание и лингводидактика. М.: Русский язык, 1985. - 239 с.

52. Шанский Н.М. Фразеология современного русского языка. М.: Высшая школа, 1963. - 156 с.

53. Шаров С.А. Частотный словарь современного русского языка. 2002. -Электронный ресурс. URL: http^/bokrcorpora.narod.ru/frqlist/irqlist.html (дата обращения: 5.10.2010).

54. Ярцева В.Н, ред. Лингвистический энциклопедический словарь. — М.: Советская энциклопедия, 1990. 685 с.

55. Atkins S., Rundell М. The Oxford Guide to Practical Lexicography. Oxford: Oxford University Press, 2008. — 552 p.

56. Bartsch S. Structural and functional properties of collocations in English. A corpus study of lexical and pragmatic constraints on lexical cooccurrence. -Tübingen: Narr, 2004. 244 p.

57. Benson M. Collocations and idioms // Ilson, Robert (ed.), Dictionaries, lexicography and language learning. Oxford, 1985. P. 61-68.

58. Benson, Morton et al. (eds.): The BBI Dictionary of English Word Combinations. Revised edition. Amsterdam, Philadelphia, 1997.

59. Benson, M. Collocations and general-purpose dictionaries // International Journal of Lexicography. Oxford: Oxford University Press, 1990. - Vol. 3. -Issue l.-P. 23-34.

60. Berry-Rogghe G.L.M. The Computation of Collocations and Their Relevance in Lexical Studies // The Computer and Literary Studies. / A.J. Aitken, R.W. Bailey and N. Hamilton-Smith. Edinburgh: Edinburgh University Press, 1973.-P. 103-112.

61. Biber D., Conrad S., Reppen R. Corpus Linguistics: investigating language structure and use. Cambridge: Cambridge University Press, 1998. — 312 p.

62. Bolshakov I. CrossLexica: A Large Electronic Dictionary of Collocations and Semantic Links in Russian. — Электронный ресурс. Систем, требования: Microsoft Office PowerPoint. URL: http://vmw.gelbukh.com/xiex/XLexE.ppt (дата обращения: 5.10.2010).

63. Church К., Hanks P. Word association norms, mutual information, and lexicography // Computational Linguistics. 1990. - Vol. 16. - Issue 1. — P. 22-29.

64. Cowie A.P. The place of illustrative material and collocations in the design of a learner's dictionary // In Honour of A.S. Hornby / Strevens P. Oxford: Oxford University Press, 1978. - 207 p.

65. Cowie A.P. General introduction // Cowie, A. P. et al. (eds.), Oxford Dictionary of Current Idiomatic English, Volume 2. Oxford: Oxford University Press 1983.-P. 10-17.

66. Crowther J., Dignen S., Lea D. (Eds.). Oxford collocations dictionary for students of English. Oxford: Oxford University Press, 2002.83. Ôermâk F. (ed.) Kolokace. Praha: TJstav Ceského nârodniho korpusu, 2006.

67. Durco P. Collocations in Slovak (Based on Slovak National Corpus) // Computer treatment of Slavic and East European languages. Fourth International Seminar, Bratislava, Slovakia, 25-27 October 2007. Bratislava: Tribun, 2007. P. 43-50.

68. Evert S. STS: SigDiff the statistical significance of differences // The International Workshop on "Computational approaches to collocations". — Vienna, 2002 Электронный ресурс. Систем, требования: Adobe Acrobat

69. Reader. URL: http://www.ofai.at/~brigitte.krenn/colloc02/sigdiff.pdf (дата обращения: 5.10.2010).

70. Evert S., Krenn В. Using small random samples for the manual evaluation of statistical association measures // Computer Speech and Language. Vol. 19(4), 2005.-P. 450-466.

71. Fano R. Transmission of information. Massachusetts: MIT Press, 1961. —

72. Firth J.R. Papers in linguistics 1934-1951. London: Oxford University Press, 1957.-245 p.

73. Firth J.R. Selected papers of J.R. Firth, 1952-1959. London: Harlow, Longman, 1968. - 219 p.

74. Fontenelle T. Collocation acquisition from a corpus or from a dictionary: a comparison // Proceedings I-П. Papers submitted to the 5th EURALEX International Congress on Lexicography in Tampere, Finland. Tampere: Yliopisto, 1992. -P. 221-228.

75. Halliday M., ed. In memory of John Firth. London, 1966.

76. Halliday M. Current ideas in systemic practice and theory. London: Pinter, 1991.- 157 p.

77. Hausmann F J. Un dictionnaire de collocations est-il possible? // Travaux de Linguistique et de Littérature. — Strasbourg: Centre de philologie et de littérature romanes de l'université de Strasbourg, 1979. -Vol. 17. P. 187-195.

78. Hausmann FJ. Kollokationen im deutschen Wörterbuch: ein Beitrag zur Theorie des lexicographischen Beispiels // Lexicographie und Grammatik, 28. 30. 6. 1984. Bergenholtz, H. and Mugdon, J. eds. - Tübingen: Max Niemeyer, 1985.-P. 118-129.

79. Heid U., Gouws R. A model for a multifunctional electronic dictionary of collocations // Proceedings of the XIIthEuralex International Congress. -Torino: Université di Torino, 2006. P. 979-988.

80. Hunston S. Corpora in Applied Linguistics. Cambridge: Cambridge University Press, 2002. - 254 p.

81. Kahane S., Polguère A. Formal foundation of lexical functions // Proceedings of ACL/EACL 2001 Workshop on Collocation. Toulouse, 2001. - P. 8-15.

82. Kilgarriff A., Rychly P., Smrz P., Tugwell D. The Sketch Engine // Proceedings of the Xlth Euralex International Congress. Lorient: Universite de Bretagne-Sud, 2004. - P. 105-116.

83. Kilgarriff A. Collocationality (and how to measure it) // Proceedings of the Xllth Euralex International Congress. Torino: Universitä di Torino, 2006. -P. 997-1004.

84. Kjellmer G. A dictionary of English collocations based on the Brown Corpus. 3 volumes. Oxford: Clarendon Press, 1994.v v

85. Kren M. Kolokacni miry a cestina: srovnani na datech CNK // Cermâk F. (ed.) Kolokace. Praha: Ûstav Ceského nârodniho korpusu, 2006. - P. 223-248.

86. Manning Ch., Schütze H. Foundations of Statistical Natural Language Processing. Massachusetts: MIT Press, 1999. - 717 p.

87. Matthews P.H. The Concise Oxford dictionary of linguistics. Oxford: Oxford University Press, 1997. - 414 p.

88. Mel'cuk I.A. 1998: Collocations and lexical functions // Phraseology: Theory, Analysis, and Applications / Cowie A.P. Oxford: Clarendon Press, 1998. — P. 23-53.

89. Oakes M. Statistics for corpus linguistics. Edinburgh: Edinburgh University Press, 1998. - 303 p.

90. Palmer F.R. Semantics: A new outline. M.: Progress, 1992. — 109 p.

91. Porzig W. Wesenhafte Bedeutungsbeziehungen // Beiträge zur Geschichte der deutschen Sprache und Literatur. 1934. - № 58. - S. 70-97.

92. Rychly P., Smrz P. Manatee, Bonito and word sketches for Czech // Труды, международной конференции «Корпусная лингвистика-2004»: Сборник докладов. СПб.: Изд-во Санкт-Петербургского госуд. ун-та, 2004.1. С. 324-334.

93. Salton G. Automatic text processing. The transformation, analysis, and retrieval of information by computer. Massachusetts: Addison-Wesley, 1989. -543 p.

94. Sinclair J. Beginning the study of lexis // In memory of J.R. Firth / Bazell C., Catford J., Halliday M., Robins R. (eds) London: Longman, 1966. — P. 410430.

95. Sinclair J. Corpus, concordance, collocation. — Oxford: Oxford University Press, 1991.-196 p.

96. Sketch Engine Corpus Querying Электронный ресурс. URL: http://trac.sketchengine.co.uk/wiki/SkE/CorpusQuerying (дата обращения: 5.10.2010).

97. Stubbs М. Collocations and semantic profiles: On the cause of the trouble with quantitative studies // Functions of Language. 1995. -Vol. 1 — P. 23-55.

98. Trier J. Der Deutsche Wortschatz im Sinnbezirk des Verstandes. Die Geschichte eines Sprachlichen Feldes. Heidelberg: Carl Winters Universitatsbuchh, 1931. - 347 s.

99. Weeber M., Vos R., Baayen R. Extracting the lowest-frequency words: Pitfalls and possibilities // Computational Linguistics. 2000. - Vol. 26. - P. 301-317.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.