Методы автоматического вычисления мер близости в задаче кластеризации малых близкородственных идиомов (на материале славянских языков) тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Афанасьев Илья Андреевич
- Специальность ВАК РФ00.00.00
- Количество страниц 292
Оглавление диссертации кандидат наук Афанасьев Илья Андреевич
Введение
Глава 1. Измерение языкового расстояния: эволюция идеи
1.1. Эволюция понимания расстояния между языками в истории языкознания
1.2. Компьютерная лектометрия: формализация и квантификация
1.3. Развитие языка как эволюция: появление и расцвет компьютерной филогенетической лингвистики
1.4. Базы данных в современной компьютерной филогенетической лингвистике
1.5. Выводы по главе
Глава 2. Перекрёстная оценка в современной компаративистике
2.1. Перекрёстная оценка при помощи альтернативных методов
2.2. Перекрёстная оценка при помощи альтернативных данных
2.3. Важность взаимного сравнения в перекрёстной оценке
2.4. Выводы по главе
Глава 3. Методология исследования: от списков слов к малым необработанным корпусам
3.1. Общее описание применяемой методологии
3.1.1. Методы, применяемые для предварительной обработки данных
3.1.1.1. Предварительная обработка списков фонетических особенностей
3.1.1.2. Предварительная обработка списков когнатов
3.1.1.3. Предварительная обработка малых необработанных корпусов
3.1.2. Методы сравнения языковых единиц
3.1.2.1. Методы сравнения последовательностей фонетических признаков
3.1.2.2. Методы сравнения списков слов
3.1.2.2.1. Метод-«чёрный ящик»
3.1.2.2.2. Не учитывающие языковую информацию меры сходства строк
3.1.2.2.3. Учитывающие языковую информацию меры сходства строк
3.1.2.3. Методы измерения расстояния между лектами на основании корпусных данных
3.1.2.3.1. Этимологическая статистика
3.1.2.3.2. Методы, основанные на корпусных данных
3.1.3. Методы кластеризации
3.2. Способы оценки полученной кластеризации
3.2.1. Индивидуальная оценка полученных деревьев
3.2.2. Перекрёстная оценка полученных деревьев
3.3. Порядок проведения экспериментов
3.3.1. Таа: меры сходства строк и «чёрный ящик»
3.3.2. Малые территориальные восточнославянские лекты: от списков особенностей к корпусному сравнению
3.3.2.1. Списки особенностей: насколько велико влияние предварительной лингвистической обработки?
3.3.2.2. Корпусные данные: предварительная проверка качества
3.3.3. Современные славянские стандартные лекты: выявление погрешности
3.3.4. Древневосточнославянские лекты: предварительная оценка
3.4. Поиск дистрибуционных различий: итоговый статистический и квалитативный анализ
3.5. Ход исследования
3.6. Выводы по главе
Глава 4. Лингвистическая характеристика наборов данных
4.1. Основной набор данных
4.2. Дополнительные наборы данных
4.2.1. Современные малые восточнославянские лекты
4.2.1.1. Малые необработанные корпуса: Белогорное, Мегра, Зялёнка
4.2.1.2. Списки базисной лексики: Белогорное, Мегра, Хиславичи
4.2.1.3. Списки фонетических особенностей: Крицковщина, Мокшенская, Песчанка
4.2.2. Современные стандартные славянские лекты (хорватский, словенский, словацкий): малые необработанные корпуса
4.2.3. Таа («южнокойсанская» семья): списки базисной лексики
4.3. Выводы по главе
Глава 5. Результаты проведения экспериментов на отдельных наборах данных
5.1. Лекты таа: Cipher-RF, ЬОМО,
5.2. Современные малые территориальные восточнославянские лекты: результаты анализа
5.2.1. Списки слов говоров с. Белогорное, д. Мегра и Хиславичского
района Смоленской области
5.2.2. Списки фонетических особенностей говоров д. Крицковщина, д. Мокшенская и д. Песчанка
5.3. Малые необработанные корпусы стандартного хорватского, стандартного словенского и стандартного словацкого
5.4. Малые корпусы древневосточнославянских лектов
5.5. Выводы по главе
Глава 6. Интерпретация результатов
6.1. Проверка устойчивости метода
6.1.1. Таа
6.1.2. Малые территориальные восточнославянские лекты
6.1.2.1. Меры сходства строк и метод-«чёрный ящик»: дополнительное сравнение
6.1.2.2. Метод, использующий корпусные данные, в контексте современных малых территориальных восточнославянских лектов
6.1.3. Древневосточнославянские лекты
6.2. Статистический анализ
6.3. Квалитативный анализ
6.3.1. Классификация минимальных несовпадений между 3-шинглами анализируемых лектов
6.3.2. Консенсусное дерево
6.4. Выводы по главе
Заключение
Библиография
Список использованных источников
Список использованной литературы
Список сокращений, используемых в работе
1, 2, 3 - 1, 2, 3 лицо глагола
ACC - Accusative (винительный падеж)
DAT - Dative (дательный падеж)
DET - Determiner (указательное местоимение)
GEN - Genitive (родительный падеж)
F - Feminine (женский род)
FUT - Future (будущее время)
INS - Instrumental (творительный падеж)
IPFV - Imperfective (несовершенный вид)
LDN, LDND - Levenshtein distance normalised (нормализованное расстояние Левенштейна), Levenshtein distance normalised divided (среднее нормализованное расстояние Левенштейна)
LOC - Locative (местный/предложный падеж)
M - Masculine (мужской род)
NEG - Negation (отрицание)
N - Neutral (средний род)
NOM - Nominative (именительный падеж)
PADLDND - Phonetics-aware Damerau-Levenshtein distance normalised divided (среднее нормализованное расстояние Дамерау-Левенштейна, использующее фонетические векторы анализируемых символов)
PAHD - Phonetics-aware Hamming distance (разделённое расстояние Хэмминга, использующее фонетические признаки) PST - Past (прошедшее время)
PCA - Principal Component Analysis, анализ главных компонент
PFV - Perfective (совершенный вид)
PL - Plural (множественное число)
PRS - Present (настоящее время)
REFL - Reflexive (возвратность)
t-SNE - t-distributed Stochastic Neighbour Embedding (стохастическое вложение соседей с t-распределением) SG - Singular (единственное число)
VDN - Vector distance normalised (нормализованное векторное расстояние)
VWJDN - Vector-weighted Jaro distance normalised (нормализованное взвешенное векторное расстояние Джаро)
WJWDN, WJWDND - Weighted Jaro-Winkler distance normalised (нормализованное взвешенное расстояние Джаро-Винклера, Weighted Jaro-Winkler distance normalised divided (среднее нормализованное взвешенное расстояние Джаро-Винклера)
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Введение диссертации (часть автореферата) на тему «Методы автоматического вычисления мер близости в задаче кластеризации малых близкородственных идиомов (на материале славянских языков)»
Введение
Определение родственного соотношения лектов1 является одной из наиболее актуальных и сложных задач, с которыми сталкивается исследователь при составлении корпуса раннеславянских языков, от древнецерковнославянского до рутенского. Квантитативные (Lendvai et а1. 2023: 18-19) и квалитативные (Schaeken 1987: 90-91; Зализняк 2004: 7-8; Соболевский 1886: 17; Kamphuis 2020: 7-8) исследования демонстрируют, что ряд раннеславянских лектов значительно отличался от других по ряду лингвистических параметров, что обнаруживается в текстах, написанных на этих лектах (Соболевский 1886: 17; Schaeken 1987: 90-91; Крысько 1998: 82-84). В частности, в Киевских листках фиксируются рефлексы сочетаний и нехарактерные для иных старославянских памятников ^^аекеп 1987: 90-91); для писцов древненовгородских берестяных грамот характерно отсутствие второй палатализации (Крысько 1998: 82-84). Данные лекты представляют так называемые аутгруппы (лекты, которые удалены от всех остальных лектов данной группы больше, чем все остальные лекты друг от друга) Примерами аутгрупп могут выступать древненовгородский диалект для древневосточнославянских лектов (Зализняк 2004: 7-8), а также анатолийские языки для индо-европейской языковой семьи (01аМег 2022: 5). Выявление аутгрупп и структуры группы лектов в целом - задача внутренней классификации2.
Традиционно для внутренней классификации малых3 близкородственных лектов использовались методы, основанные либо на
1 Определение термина лект см. ниже.
2 Под термином внутренняя классификация (группы) лектов здесь и далее подразумевается такая группировка лектов, при которой они образуют подгруппы, лекты внутри которых по некоторому набору критериев более похожи между собой, чем на единицы других подгрупп.
3
Малый лект, как правило, ограничен количеством говорящих (и, как следствие, количеством доступного материала) по сравнению с, например, стандартными лектами. Так, малые территориальные лекты, диалекты, ограничены территориально рядом небольших населённых пунктов.
квалитативном исследовании (Moser 1998: 129-130; Баранникова 2005: 193-200), либо на исследовании списков слов методами вычислительной диалектометрии (Архангельский 2021: 10-11) или байесовской филогенетики (Auderset et al. 2023: 39-43). Однако исторические малые территориальные лекты зачастую не позволяют собрать достаточное количество материала для сравнительного анализа. Единственный доступный источник - малые (не более 5 000 токенов) необработанные (такие, в которых отсутствует любая лингвистическая разметка) корпусы -может значительно затруднить как квалитативное, так и для квантитативное сопоставление. Классификация на основании таких корпусов может быть только предварительной, поскольку с их помощью затруднительно собрать материал для группировки лектов как на основании совместных фонетических, морфологических и синтаксических инноваций, так и на основании лексики, а существующие корпусные методы не приспособлены для создания сравнительно-исторической классификации. Следовательно, классификация при помощи малых необработанных корпусов требует экстенсивной квалитативной интерпретации и перекрёстной оценки. Помимо этого, при использовании текстового материала необходимо отличать тематические особенности текста от лингвистических особенностей лекта, выявлять и устранять лексику, которая может вносить шум в итоговый результат: например, заимствования.
Все эти факторы обусловливают необходимость разработки метода автоматического измерения расстояния между лектами на материале малых необработанных корпусов. Такой метод должен быть основан на апостериорном (bottom-up) подходе к данным, который формализует системы оппозиций, обнаруженные моделью, а не применяет к ним заранее определённые лингвистом разграничения (Otheguy 2002: 378-381).
Диссертационное исследование посвящено квантитативным аспектам языковой вариативности и языкового изменения, обусловленным
исторически, которые в современной лингвистике традиционно изучаются посредством подсчёта языкового расстояния между лектами, для которых заранее установлен факт родства, т.е. происхождения от общего предка, на материале малых необработанных корпусов.
В работе используется термин лект, который обозначает любой вариант языковой системы вне зависимости от возможных ограничений распространения (идиолект, докулект, диалект, региолект, социолект, стандарт). Это нейтральный термин, выбранный для избежания построения предварительных иерархий вида «Х - это диалект языка Y», в которых подразумевается некоторая несамодостаточность Х по отношению к Y, вплоть до принадлежности X к Y. Последнее значительно затрудняет и сравнительно-историческую классификацию, и обсуждение существенных различий между исследуемыми вариантами языковой системы.
Данная работа выполнена в рамках научного подхода, объединяющего методы компьютерной филогенетической лингвистики и компьютерной диалектометрии.
Объектом исследования являются близкородственные лекты, представленные необработанными малыми корпусами:
1. Деловые древневосточнославянские грамоты конца XII - начала XIV вв. смоленской, полоцкой и новгородской частей древневосточнославянского континуума.
2. Фрагменты корпусов современных малых территориальных восточнославянских лектов.
3. Текст Евангелия от Иоанна, переведённый на современные стандартные славянские лекты.
Предмет исследования - квантифицируемые генетически значимые (фонетические соответствия, единицы базисной лексики) различия между текстами близкородственных лектов, используемые для их иерархической восходящей кластеризации.
Материал исследования - шесть наборов данных, собранных в рамках выполнения данной работы или взятых из открытых источников. Большое количество наборов данных обусловлено активным применением в исследовании перекрёстной оценки, проверки функционирования методов через их использование на дополнительных наборах данных, а также их сравнение с другими методами на одних и тех же наборах данных. В работе используется шесть наборов данных:
1. Малые корпусы древневосточнославянских лектов Смоленска, Полоцка и Новгорода (основной набор данных).
2. Малые корпусы современных малых территориальных восточнославянских лектов: говоров д. Мегра (Вологодская область, Россия), с. Белогорное (Саратовская область, Россия) (источник -Саратовский диалектологический корпус, собранный в Саратовском государственном университете им. Н. Г. Чернышевского; часть данных была расшифрована автором работы) и с. Зялёнка (Витебская область, Республика Беларусь) (источник - Полоцкий этнографический сборник, собранный в Полоцком государственном университете Республики Беларусь) (вспомогательный набор данных).
3. 40-словные списки базисной лексики современных малых территориальных восточнославянских лектов: говоров д. Мегра, с. Белогорное (собраны и опубликованы автором работы по материалам Саратовского диалектологического корпуса) и Хиславичского района Смоленской области (собраны и опубликованы автором работы по материалам корпуса говоров Хиславичского района Смоленской области, разрабатываемого в НИУ ВШЭ) (вспомогательный набор данных).
4. Списки фонетических особенностей современных малых территориальных восточнославянских лектов: говоров д. Мокшенская (Архангельская область, Россия), с. Песчанка (Саратовская область, Россия) и д. Крицковщина (ранее - Нагать; Смоленская область, Россия) (источник
- электронная версия Диалектологического атласа русского языка) (вспомогательный набор данных).
5. Малые необработанные корпусы современных стандартных славянских лектов (словацкого, хорватского и словенского), взятые из электронных источников (вспомогательный набор данных).
6. 40-словные списки базисной лексики лектов таа (семья туу, т.н. «южнокойсанские языки»), собранные в существующих исследованиях по лексикостатистическому анализу этой языковой группы (вспомогательный набор данных).
Выбор древневосточнославянских лектов в качестве основного набора данных обусловлен недостаточной изученностью их с точки зрения квантитативного анализа. Малые территориальные восточнославянские лекты выбраны как принадлежащие той же кладе (а именно, славянской группе) современные лекты с большим количеством доступного материала, а также более высокой степенью квантитативной изученности. Современные стандартные славянские лекты, также будучи родственными предыдущим наборам данных, позволяют провести эксперименты, ориентированные на влияние размера данных на предложенные метрики, и оценить поведение методов в пограничных для методов компьютерной диалектометрии случаях (Kassian 2023). Причина выбора лектов таа в качестве вспомогательного набора данных - наличие определённого консенсуса о структуре их дерева, а также сравнительно недавно собранные списки слов и проведённый по ним лексикостатический анализ (Starostin 2022b: 31-34). Помимо этого, таа максимально удалены от славянских языков как исторически (на данный момент не могут быть верифицированы ни языковой контакт, ни общий предок), так и типологически (во всяком случае, фонетически (Старостин 2013: 239-242)).
Актуальность работы обусловлена необходимостью разработки методов, позволяющих вычислить языковое расстояние между лектами,
представленными малыми необработанными корпусами. Активное обнаружение новых источников информации об исторических славянских лектах (таких как новгородские берестяные грамоты), продолжающееся с 1950-х гг. до сегодняшнего дня, делает такие методы всё более востребованными.
Новизна работы состоит во введении в научный оборот трёх новых корпусных наборов данных для исторических восточнославянских лектов (малый необработанный корпус смоленских, полоцких и новгородских грамот), современных малых территориальных восточнославянских лектов (малый необработанный корпус говоров с. Белогорное, д. Мегра и д. Зялёнка) и современных стандартных славянских лектов (малый необработанный корпус Евангелия от Иоанна для словацкого, словенского и хорватского языков), а также одного списка базисной лексики для современных малых территориальных восточнославянских лектов (говоров Хиславичского района Смоленской области, а также с. Белогорное и д. Мегра). Предлагаются новые методы для подсчёта языкового расстояния на основании списков слов, фонетических особенностей и малых необработанных корпусов. Впервые методы компьютерной диалектометрии применяются для исторических восточнославянских лектов.
Практическая ценность работы заключается в возможности применения полученной квантитативной (степень родства) и квалитативной (различия в дистрибуции конкретных субтокенов, выявленные регулярные соответствия) информации о различиях между лектами в задачах языковой нормализации, автоматической обработки естественного языка, в частности, частеречной разметки, лемматизации и языкового моделирования. Результаты измерения языкового расстояния могут быть применены в задачах языковой идентификации, стилометрии,
классификации рукописей, поиске наиболее девиантных текстов в корпусе и при оценке эффективности чат-ботов.
Теоретическая значимость работы состоит в разработке нового подхода для исследования малых исторических лектов, основанного на сочетании подходов компьютерной филогенетической лингвистики и компьютерной диалектометрии. Для оценки эффективности метода применяется перекрёстная оценка.
Цель исследования - разработка автоматического метода предварительной внутренней классификации близкородственных исторических лектов, представленных необработанными малыми корпусами, основанного на методе иерархической восходящей кластеризации на базе квантифицируемых генетически значимых (фонетические соответствия, единицы базисной лексики) различий между текстами, написанными на близкородственных исторических лектах (на материале деловых восточнославянских грамот конца XII - начала XIV вв.).
Для выполнения цели были поставлены следующие задачи:
1. Систематизация существующих подходов к классификации языковых вариантов в рамках современной лингвистики.
2. Разработка метода автоматической предварительной обработки данных для задач диалектометрии.
3. Создание метода автоматического вычисления расстояния между близкородственными лектами, представленными малыми необработанными корпусами.
4. Проведение и анализ иерархической восходящей кластеризации набора данных (деловые древневосточнославянские грамоты конца XII -начала XIV вв. смоленской, полоцкой и новгородской частей древневосточнославянского континуума) с целью создания предварительной внутренней классификации исследуемых лектов.
5. Дополнительная проверка метода при помощи вспомогательных наборов данных (корпуса и списки слов современных и исторических славянских лектов: говор с. Белогорное, говор д. Мегра, говоры Хиславичского района Смоленской области, говор с. Зялёнка, стандартный хорватский, стандартный словенский, стандартный словацкий; списки фонетических особенностей восточнославянских лектов: говор с. Мокшенская, говор с. Песчанка, говор д. Крицковщина (ныне - Нагать); списки слов лектов таа: къхонг, масарва, н|у||ен).
Разработанные автоматические методы были практически реализованы с помощью компьютерных программ, написанных на языках Python и R. Также был опубликован пакет на языке программирования Python, способствующий репродуцируемости исследования и упрощающий дальнейшее применение предложенного подхода другими исследователями.
На защиту выносятся следующие положения:
1. Объединение методов, основанных на измерении частотности, мерах сходства строк и векторной репрезентации текстов, демонстрирует значения метрик сходства между лектами, подтверждаемые введёнными ранее в научный оборот методами сравнительно-исторического языкознания, такими как сравнение списков базисной лексики при помощи мер сходства строк, использующих фонетическую информацию.
2. При помощи введённых в работе техник предварительной обработки данных увеличивается эффективность разработанного метода автоматического подсчёта расстояния между лектами, представленными малыми необработанными корпусами. Диалектометрические результаты становятся более интерпретируемыми.
3. Перекрёстная оценка улучшает качество интерпретации результатов метода подсчёта языкового расстояния.
4. Деловые древневосточнославянские грамоты конца XII - начала XIV вв., происходящие из Смоленска, Полоцка и Новгорода, демонстрируют следы формирования двух клад славянского континуума: древненовгородской (тексты из Новгорода) и протобелорусской (тексты из Смоленска и Полоцка). Однако на момент конца XII - начала XIV вв. данные черты сформированы не до конца, и в текстах, составляющих основной набор данных, часто замаскированы языковыми особенностями надрегионального койне.
5. Предложенная кластеризация отражает генетическое разделение между новгородскими лектами с одной стороны, и смоленскими и полоцкими с другой. Данное разделение ранее было показано с помощью квалитативного анализа в предыдущих работах, в которых затрагивается вопрос внутренней классификации древневосточнославянских лектов (Соболевский 1886; Соболевский 1907; Карский 1955; Крысько 1998; Дурново 2000; Зализняк 2004).
Информационной базой работы являются 308 научных публикаций: монографии, сборники статей, статьи в научных журналах и сборниках материалов конференций. 35 работ написаны на русском языке, 273 работы - на иностранных языках (английский, немецкий, сербохорватский, белорусский, французский).
Апробация работы была осуществлена в докладах, сделанных на заседаниях научного семинара Школы лингвистики НИУ ВШЭ, научного семинара Лаборатории языковой конвергенции НИУ ВШЭ, а также семинара «Алтайские языки и их соседи: диахрония, диалектология, контакты» Института языкознания РАН. Исследование обсуждалось на ряде научных конференций, в том числе международных:
• Мiжнародны кангрэс даследчыкау Беларусi [Международный конгресс исследователей Беларуси] (Вильнюс, Литва, 2021; Гданьск, Польша, 2023)
• CorCoDial [КорКоДиал] (Хельсинки, Финляндия, 2022)
• International Workshop «Computational Linguistics - 2023» [Международный воркшоп «Компьютерная лингвистика - 2023] (Санкт-Петербург, Россия, 2023)
• Tenth Workshop on NLP for Similar Languages, Varieties and Dialects [X воркшоп по автоматической обработке естественного языка для схожих языков, вариантов и диалектов] (Дубровник, Хорватия, 2023)
• XVIII (2023) и XIX (2024) чтения памяти С. А. Старостина (Москва, Россия)
• Xth Congress of the International Society for Dialectology and Geolinguistics [X конгресс международного общества диалектологии и геолингвистики] (Бухарест, Румыния, 2023)
• Славянские языки в условиях современных вызовов - X (Томск, Россия, 2024)
• Чтения памяти В. А. Дыбо (Москва, Россия, 2024)
• II научная конференция студентов и аспирантов «TERRA HOMINIS -2024» (Москва, Россия, 2024)
• The 11th Inter-Varietal Applied Corpus Studies (IVACS) Biennial Conference [11 конференция-биеннале по вопросам межвариантных прикладных корпусных исследований] (Университет Кембриджа, Великобритания, 2024)
По теме исследования опубликованы или приняты к публикации 3 статьи, в которых нашли отражение теоретические принципы и результаты работы:
1. Afanasev, I. Language distance: the evolution of an idea // Dialectologia. 2026. № 37 (принята к публикации).
2. Afanasev, I. Cipher, transform, get lost: an anti-transparent system for distance measurement in East Slavic lects // Journal of Language Relationship. 2023. № 21 (3-4). C. 157-177.
3. Lyashevskaya, O., Afanasev, I. An HMM-Based PoS Tagger for Old Church Slavonic // Jazykovedny casopis. 2021. № 2 (72). C. 556-567.
Другие работы автора, связанные с темой диссертации:
1. Afanasev, I. Vector-based string similarity measures as a means of classifying low-resourced closely-related lects // Journal of Historical Linguistics. (находится в процессе рецензирования)
2. Afanasev, I., Lyashevskaya, O. Measuring language distance based on small raw corpora // Proceedings of the 10th Congress of the International Society for Dialectology and Geolinguistics, Bucharest, September 4 - 8, 2023. / Eds. M. Nevaci [et al.]. 2024.
3. Afanasev, I. The Cross-evaluation Crux for Computational Phylogenetic Linguistics // Digital Geography: Proceedings of the International Conference on Internet and Modern Society (IMS 2023) / под ред. M. Bakaev, R. Bolgov, A. V. Chugunov, R. Pereira, E. R., W. Zhang. Springer, 2024.
4. Afanasev I., Lyashevskaya O. String Similarity Measures for Evaluating the Lemmatisation in Old Church Slavonic // Structuring Lexical Data and Digitising Dictionaries / под ред. J. M. Arista, A. E. O. López. 2024.
5. Afanasev I. [et al.]. The Effect of (Historical) Language Variation on the East Slavic Lects Lematisers Performance / I. Afanasev, O. Lyashevskaya, S. Rebrikov, Y. Shishkina, I. Trofimov, N. Vlasova // Jazykovedny casopis. 2023. № 1 (74). C. 225-233.
6. Afanasev I., Lyashevskaya O. From web to dialects: how to enhance non-standard Russian lects lemmatisation? // Proceedings of the 2023 CLASP Conference on Learning with Small Data / под ред. E. Breitholtz [et al.]. 2023. C. 167-175.
7. Afanasev I., Babanov A. The Old Church Slavonic Corpora and Their Use in Language Studies at the University // Literature, Language and Computing / под ред. P. Eismont [et al.]. 2023. C. 43-58.
8. Lyashevskaya O. [et al.]. Disambiguation in context in the Russian National Corpus: 20 years later / O. Lyashevskaya, I. Afanasev, S. Rebrkov, Y. Shishkina, E. Suleymanova, I. Trofimov, N. Vlasova // Computational Linguistics and Intellectual Technologies: Proceedings of the International Conference "Dialogue 2023". 2023. С. 1-8.
9. Afanasev I. The Use of Khislavichi Lect Morphological Tagging to Determine its Position in the East Slavic Group // Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023) / под ред. Y. Scherrer [et al.]. 2023. C. 174-186.
Наборы данных и код, используемые в работе, опубликованы на платформе Zenodo:
1. Afanasev, I. Corpus-based language distance measurement package [Электронный ресурс] // [Программное обеспечение]. [2024]. URL: https://doi.org/10.5281/zenodo.11409692 (дата обращения: 02.10.2024)
2. Afanasev, I. A hybrid approach to the small unannotated corpus-based language comparison and its application to the Old East Slavic charters -Supplementary material 1 (Old East Slavic) [Электронный ресурс] // [Набор данных]. [2024]. URL: https://doi.org/10.5281/zenodo.14057668 (дата обращения: 02.10.2024)
3. Afanasev, I. A hybrid approach to the small unannotated corpus-based language comparison and its application to the Old East Slavic charters -Supplementary material 2 (Modern East Slavic) [Электронный ресурс] //
[Набор данных]. [2024]. URL: https://doi.org/10.5281/zenodo.14148179 (дата обращения: 02.10.2024)
4. Afanasev, I. A hybrid approach to the small unannotated corpus-based language comparison and its application to the Old East Slavic charters -Supplementary material 3 (Modern standard Slavic lects) [Электронный ресурс] // [Набор данных]. [2024]. URL: https://doi.org/10.5281/zenodo.14148561 (дата обращения: 02.10.2024)
5. Afanasev, I. A hybrid approach to the small unannotated corpus-based language comparison and its application to the Old East Slavic charters -Supplementary material 4 (Code for statistical analysis) [Электронный ресурс] // [Программное обеспечение]. [2024]. URL: https://doi.org/10.5281/zenodo.14169792 (дата обращения: 02.10.2024)
Термины и определения. В настоящей работе применяются следующие термины с соответствующими определениями.
Внешняя группа (аутгруппа) - лект, имеющий наименьшее количество общих характеристик с остальными анализируемыми лектами. Например, внешняя группа в рамках индоевропейского дерева -анатолийские языки (Kassian et al. 2021: 955-956).
Внутренняя группа (ингруппа) - все анализируемые лекты, за исключением аутгруппы; в филогенетической лингвистике такие группы также называются «ядерными» (Egorov et al. 2022: 18). Так, все тюркские языки, за исключением чувашского, формируют ядерную тюркскую группу, или ингруппу тюркского дерева (Egorov et al. 2022: 18).
Восходящая кластеризация - тип иерархической кластеризации, при котором новые кластеры более высокого уровня создаются путём объединения существующих кластеров более низкого уровня (так называемый bottom-up подход).
Дерево - визуальное представление иерархической восходящей кластеризации лектов на основании информации об их внутреннем
устройстве. Иерархическая восходящая кластеризация, результат которой представляется при помощи дерева, должна в максимальной степени отражать вертикальные (демонстрирующие различия, накопленные в процессе удаления от общего предка) связи между лектами, и в минимальной степени испытывать влияние горизонтальных (демонстрирующих различия, накопленные в результате контактов) связей между лектами.
Докулект - языковая система конкретного памятника.
Золотой стандарт - предварительная кластеризация или разметка, выполненная с участием эксперта, используемая для оценки автоматических методов.
Иерархическая кластеризация - тип кластеризации, при котором кластеры более низкого уровня объединяются в кластеры более высокого уровня.
Клада - группа лектов (кластер).
Кластеризация - группировка множества единиц, при которой они образуют подмножества (кластеры), единицы внутри которых более похожи между собой, чем на единицы других групп. Задача внутренней классификации группы родственных языков является подмножеством задач кластеризации.4
Лект - любая самостоятельная языковая система (детальное определение см. выше).
Метод, использующий языковую информацию (language-aware method) - метод, который при сравнении двух лингвистических объектов
4 В данном случае классическое разграничение классификации и кластеризации в машинном обучении и статистических методах (классификация подразумевает соотнесение данных с заранее определёнными классами, кластеризация - формирование классов на основании данных) входит в конфликт с определением классификации в сравнительно-историческом языкознании (внутренняя классификация группы лектов - формирование групп более низкого порядка, возможность которого обусловлена заранее доказанным родством между лектами). В результате, термины «внутренняя классификация» и «иерархическая восходящая кластеризация» в рамках данной области оказываются взаимозаменяемы.
(чаще всего, слов) учитывает языковую информацию, которая закодирована с их помощью (например, насколько сильно фонетически различаются английское hound 'охотничья собака' и немецкое Hund 'собака', а именно, какое отличие лежит в основе соответствия ou/u).
Метод, не использующий языковую информацию (language-agnostic method) - метод, который при сравнении двух лингвистических объектов (чаще всего, слов) учитывает только их формальное сходство или различие (наличие или отсутствие одинаковых символов, а также их порядок).
Метод-«чёрный ящик» (black-box method) - автоматический метод, результаты которого не могут быть интерпретированы ни при помощи эксперта, ни при помощи других автоматических методов. Подробнее отличия методов-«чёрных ящиков» от других классов методов описаны в главах 2 и 3.
Таксон - минимальная единица иерархической восходящей кластеризации, которую нельзя поделить на совокупность единиц более низкого уровня.
Топология дерева - комбинация вершин (представляемых или анализируемыми лектами, или гипотетическими праязыками, выделяемыми на основе их группировки) и рёбер дерева с учётом относительного расстояния между ними. Совпадение топологии двух деревьев (или корректность одного из них по сравнению с другим) означает, что оба дерева визуализируют две максимально близких друг к другу иерархических восходящих кластеризации. Например, если одно дерево балто-славянских языков выделяет славянские языки как внешнюю группу по отношению к балтским, различия которой от общего предка западных балтских и восточных балтских минимальны, а другое выделяет славянские языки как внешнюю группу по отношению к балтским, различия которой от общего предка балтских существенны, деревья имеют разную топологию.
Структура дерева - комбинация вершин (представляемых или анализируемыми лектами, или гипотетическими праязыками, выделяемыми на основе их группировки) и рёбер дерева без учёта расстояния между ними. Совпадение структуры двух деревьев (или корректность одного из них по сравнению с другим) означает, что оба дерева визуализируют иерархические восходящие кластеризации, которые постулируют одинаковую последовательность разделения праязыка всех анализируемых лектов. Например, если одно дерево балто-славянских языков выделяет славянские языки как внешнюю группу по отношению к балтским, различия которой от общего предка западных балтских и восточных балтских минимальны, а другое выделяет славянские языки как внешнюю группу по отношению к балтским, различия которой от общего предка балтских существенны, деревья имеют одинаковую структуру.
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Список литературы диссертационного исследования кандидат наук Афанасьев Илья Андреевич, 2025 год
Библиография
Список использованных источников
1. Аванесов 1963 - Аванесов Р.И. (ред.) Смоленские грамоты XIII-XIV веков / подгот. Т.А. Сумникова, В.В. Лопатин. - М. : АН СССР, 1963. - 256 с.
2. ГЛБД - Глобальная лексикостатистическая база данных [Электронный ресурс] / ред. Г.С. Старостин. - М. : ВШЭ ; Санта-Фе : Институт Санта-Фе, 2011-2019. - URL: http: //starling.rinet.ru/new 100/ (дата обращения: 02.01.2025).
3. Крючкова и Гольдин 2011 - Крючкова О.Ю., Гольдин В.Е. Корпус русской диалектной речи: концепция и параметры оценки // Компьютерная лингвистика и интеллектуальные технологии: тр. междунар. конф. «Диалог-2011». - М., 2011. - С. 359-367.
4. Лобач 2006-2011 - Лобач Ю.А. (ред.). Полацк этнаграфiчны зборшк. - Наваполацк : ПДУ, 2006-2011. - Вып. 1-2. - (Серыя "Этнагpафiчная спадчына Паазер'я").
5. Марченко и др. 2025 - Марченко И.А. [и др.] База данных диалектологического атласа русского языка [Электронный ресурс]. -URL: https: //da.ruslang.ru/ (дата обращения: 02.01.2025).
6. Напиерский 1857 - Грамоты, касающиеся до сношений СевероЗападной России с Ригою и Ганзейскими городами в XII, XIII и XIV веке / Найдены в Рижском архиве К.Э. Напиерским и изданы Археографическою Комиссиею. - СПб. : Археогр. комис., 1857. - 22 с., 8 л. факс.
7. Рыко и Спиричева 2020 - Рыко А.И., Спиричева М.В. Корпус Хиславичского района Смоленской области [Электронный ресурс]. -М. : Международная лаборатория языковой конвергенции НИУ ВШЭ, 2020. - URL: https://lingconlab.ru/khislavichi/ (дата обращения: 01.04.2025).
8. Хорошкевич 2015 - Хорошкевич А.Л. Полоцкие грамоты XIII -начала XVI в. - М. : Русский Фонд Содействия Образованию и Науке, 2015. - Т. 2. - 350 с.
9. Evanjelium podl'a Jana 2025 - Evanjelium podl'a Jana - kapitola 1 [Электронный ресурс]. - URL: https: //svatepismo. sk/evanj elium-podla-jana-1 (дата обращения: 01.04.2025).
10. Slovenski standardni prevod 2025 - Slovenski standardni prevod : YouVersion / LiveChurch [Электронный ресурс]. - Edmond, OK, 2025.
- URL: https://www.wordproj ect.org/bibles/cr/index.htm (дата обращения: 01.04.2025).
11. Saric 2025 - Saric I. Перевод Библии Ивана Шарича : WordProject / International Biblical Association [Электронный ресурс].
- Macau, China, 2025. - URL: https ://www.wordproj ect.org/bibles/cr/index.htm (дата обращения: 01.04.2025).
Список использованной литературы
1. Алексеев и Кузнецова 1987 - Алексеев А.А., Кузнецова Е.Л. ЭВМ и проблемы текстологии древнеславянских текстов // Лингвистические задачи и обработка данных на ЭВМ / под ред. А.А. Алексеева, Е.Л. Кузнецовой. - М. : Институт русского языка АН СССР, 1987. - С. 111-121.
2. Арциховский и Янин 1978 - Арциховский А.В., Янин В.Л. Новгородские грамоты на бересте (из раскопок 1962-1976 гг.). - М.: Изд-во АН СССР, 1978. - 192 c.
3. Архангельский 2021 - Архангельский Т.А. Применение диалектометрического метода к классификации удмуртских диалектов // Урало-алтайские исследования. - 2021. - № 2 (41). - С. 7-20.
4. Баранникова 2005 - Баранникова Л.И. Говоры территорий позднего заселения и проблема их классификации // Общее языкознание: избранные
работы / под ред. В.Е. Гольдина, О.Ю. Крючковой. - М. : КомКнига, 2005. - С. 192-203.
5. Берзинь 2006 - Берзинь А.У. Измерение фономорфолексического расстояния между латышскими наречиями путём применения расстояния Вагнера-Фишера // Труды международной конференции «Диалог 2006». -М. : РГГУ, 2006. - С. 65-72.
6. Бурлак и Старостин 2005 - Бурлак С.А., Старостин С.А. Сравнительно-историческое языкознание : учебник для студентов высших учебных заведений. - М. : Академия, 2005. - 432 с.
7. Васильев и Саенко 2020 - Васильев М.Е., Саенко М.Н. Анализ топологии и оценка точности лексикостатистических классификаций (на примере славянских языков) // Вопросы языкового родства. - 2020. - № 18/3-4. - С. 320-347.
8. Гиппиус 2008 - Гиппиус А.А. Загадки Мстиславовой грамоты // Miscellanea Slavica: Сборник статей к 70-летию Б.А. Успенского / ред. Ф.Б. Успенский. - М., 2008. - С. 109-129.
9. Дурново 2000 - Дурново Н.Н. Избранные работы по истории русского языка / сост. и коммент. В.Б. Крысько ; отв. ред. А.А. Алексеев. - М. : Языки русской культуры, 2000. - 840 с. - (Классики отечественной филологии). -ISBN 5-7859-0144-1.
10. Дыбо и др. 2020 - Дыбо А.В. [и др.] Новые результаты в генеалогической классификации тюркских диалектов («случаи с аффрикатами») // Oriental Studies. — 2020. — Т. 13, № 3. — С. 696-713. — DOI: 10.22162/2619-0990-2020-49-3-696-713.
11. Зализняк 2004 - Зализняк А.А. Древненовгородский диалект. 2-е издание, переработанное с учетом материала находок 1995-2003 гг. - М. : Языки славянской культуры, 2004. - 872 с. - (Studia philologica).
12. Зализняк 1992 - Зализняк А.А. Падение редуцированных по данным берестяных грамот // Русистика сегодня: Функционирование языка: лексика и грамматика. - М., 1992. - С. 82-105.
13. Захарова и Орлова 2004 - Захарова К.Ф., Орлова Г.В. Диалектное членение русского языка. - М. : Просвещение, 2004. - 176 с.
14. Зеленков и Сегалович 2007 - Зеленков Ю.Г., Сегалович И.В. Сравнительный анализ методов определения нечетких дубликатов для Web-документов // Труды 9-ой Всероссийской научной конференции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» — RCDL'2007. - 2007. - С. 1-9.
15. Карский 1955 - Карский Е.Ф. Белорусы. Т. II: Язык белорусского народа. Выпуск 1: Исторический очерк звуков белорусского языка / АН СССР, Институт языкознания. - М. : Изд-во Академии наук СССР, 1955. -476 с.
16. Карский 1979 - Карский Е.Ф. Славянская кирилловская палеография.
- М. : Наука, 1979. - 494 с.
17. Крысько 1998 - Крысько В.Б. Древний новгородско-псковский диалект на общеславянском фоне // Вопросы языкознания. - 1998. - № 3. -С. 74-93.
18. Кузнецов 1953 - Кузнецов П.С. Историческая грамматика русского языка. Морфология. - М. : Издательство Московского университета, 1953.
- 302, [4] с. : 23 см.
19. Миронова 2018 - Миронова Д.М. Автоматизированная классификация древних рукописей (на материале 525 списков славянского Евангелия от Матфея Х1-ХУ1 вв.) : дис. ... канд. филол. наук. - СПб., 2018.
- 315 с.
20. Николаев 2015 - Николаев С.Л. Новые данные о рефлексах *о и *ъ в русских говорах // Исследования по славянской диалектологии. - М., 2015.
- Вып. 17: Судьба славянских диалектов и перспективы славянской диалектологии в XXI веке. - С. 90-188.
21. Норманская 2020 - Норманская Ю. Коми-язьвинский - диалект коми-пермяцкого или отдельный язык? // Ежегодник финно-угорских исследований. - 2020. - Т. 14, № 4. - С. 628-641.
22. Прокофьева и Рахилина 2004 - Прокофьева И., Рахилина Е.В. Родственные языки как объект лексической типологии: русские и польские глаголы вращения // Вопросы языкознания. - 2004. - № 1. - С. 60-78.
23. Рыко и Спиричева 2022 - Рыко А.И., Спиричева М.В. Степень сохранности диалектных черт у представителей разных поколений (Хиславичский район Смоленской области) // Вестник РГГУ. Серия «Литературоведение. Языкознание. Культурология». - 2022. - № 5. - С. 121-141. - 001: 10.28995/2686-7249-2022-5-121-141.
24. Соболевский 1886 - Соболевский А.И. Смоленско-полоцкий говор в ХШ-ХУ вв. - Варшава : тип. М. Земкевича, 1886. - 27 с. - Отд. отт. из "Рус. филол. вестника".
25. Соболевский 1907 - Соболевский А.И. Лекции по истории русского языка. - 4-е изд. - М. : Университетская типография, 1907. - 312 с.
26. Соловьёв 2010 - Соловьёв В.Д. Типологическая схожесть языков как метод изучения языковой эволюции // Вопросы языкового родства. - 2010.
- № 4. - С. 177-198.
27. Старостин 2007 - Старостин С.А. Сравнительно-историческое языкознание и лексикостатистика // Старостин С.А. Труды по языкознанию : сб. науч. тр. / под ред. С.В. Весниной. - М. : Языки славянских культур, 2007. - С. 407-447.
28. Старостин 2013 - Старостин Г.С. Языки Африки: опыт построения лексикостатистической классификации. Том I: Методология. Койсанские языки. - М. : Языки славянской культуры, 2013. - 510 с.
29. Трубецкой 1987 - Трубецкой Н.С. Мысли об индоевропейской проблеме // Избранные труды по филологии / сост. В.А. Виноградова, В.П. Нерознака; под общ. ред. Т.В. Гамкрелидзе и др. - М. : Прогресс, 1987. - C. 44-59.
30. Успенский 1983 - Успенский Б.А. Языковая ситуация Киевской Руси и ее значение для истории русского литературного языка. - М. : Изд-во Московского университета, 1983.— 144 с.; 21. — (IX Международный съезд славистов).
31. ЭССЯ 1 - Этимологический словарь славянских языков : Праславян. лекс. фонд / Ин-т рус. яз. им. В.В. Виноградова ; [ред. О.Н. Трубачёв]. - М. : Наука, 1974- . - Вып. 1 : (A-besed'livb). - 1974. - 258 с.
32. ЭССЯ 10 - Этимологический словарь славянских языков : Праславян. лекс. фонд / Ин-т рус. яз. им. В.В. Виноградова ; [ред. О.Н. Трубачёв]. - М. : Наука, 1974- . - Вып. 10 : (klepacb-konb). - 1983. - 198 с.
33. ЭССЯ 31 - Этимологический словарь славянских языков : Праславян. лекс. фонд / Ин-т рус. яз. им. В.В. Виноградова ; [ред. Ж.Ж. Варбот]. - М. : Наука, 1974- . - Вып. 31 : (obvelcenbje-obzbniviny). - 2005. - 258 с.
34. Янин и Зализняк 2000 - Янин В.Л., Зализняк А.А. Новгородские грамоты на бересте (из раскопок 1990-1996 гг.). Палеография берестяных грамот и их внестратиграфическое датирование. - М., 2000. - 430 с.
35. Янин и др. 2004 - Янин В.Л., Зализняк А.А., Гиппиус А.А. Новгородские грамоты на бересте (из раскопок 1997-2000 гг.). - М. : Русские словари, 2004. - Т. 11. - 288 с.
36. Янкоусю 1989 - Янкоусю Ф.М. Пстарычная граматыка беларускай мовы. - Мшск : Вышэйшая школа, 1989. - 301 с.
37. Abdul-Mageed et al. 2020 - Abdul-Mageed M. [et al.] Toward Micro-Dialect Identification in Diaglossic and Code-Switched Environments // Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) / под ред. B. Webber, T. Cohn, Y. He, Y. Liu. - Online :
Association for Computational Linguistics, 2020. - С. 5855-5876. - DOI: 10.18653/v1/2020.emnlp-main.472.
38. Afanasev 2023 - Afanasev I. The Use of Khislavichi Lect Morphological Tagging to Determine its Position in the East Slavic Group // Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023) / под ред. Y. Scherrer [et al.]. - Dubrovnik, Croatia : Association for Computational Linguistics, 2023. - С. 174-186.
39. Akavarapu and Bhattacharya 2023 - Akavarapu V.S.D.S.M., Bhattacharya A. Cognate Transformer for Automated Phonological Reconstruction and Cognate Reflex Prediction // Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing / под ред. H. Bouamor, J. Pino, K. Bali.
- Singapore : Association for Computational Linguistics, 2023. - С. 6852-6862.
- DOI: 10.18653/v1/2023.emnlp-main.423.
40. Alsentzer et al. 2019 - Alsentzer E. [et al.] Publicly Available Clinical BERT Embeddings // Proceedings of the 2nd Clinical Natural Language Processing Workshop / под ред. A. Rumshisky, K. Roberts, S. Bethard, T. Naumann. - Minneapolis, Minnesota, USA : Association for Computational Linguistics, 2019. - С. 72-78. - DOI: 10.18653/v1/W19-1909.
41. Archangeli and Pulleybank 2022 - Archangeli D., Pulleybank D. Emergent phonology. - Berlin : Language Science Press, 2022. - 207 с.
42. Atkinson and Gray 2005 - Atkinson Q.D., Gray R.D. Curious Parallels and Curious Connections—Phylogenetic Thinking in Biology and Historical Linguistics [Электронный ресурс] // Systematic Biology. - 2005. - Т. 54, № 4.
- С. 513-526. - DOI: 10.1080/10635150590950317.
43. Atteson 1999 - Atteson K. The Performance of Neighbor-Joining Methods of Phylogenetic Reconstruction // Algorithmica. - 1999. - Т. 25. - С. 251-278.
44. Auderset et al. 2023 - Auderset S. [et al.] Subgrouping in a 'dialect continuum': A Bayesian phylogenetic analysis of the Mixtecan language family
[Электронный ресурс] // Journal of Language Evolution. - 2023. - Т. 8, № 1. -С. 33-63. - DOI: 10.1093/jole/lzad004.
45. Auer and Hiskens 1996 - Auer P., Hiskens F. The convergence and divergence of dialects in Europe. New and not so new developments in an old area // Sociolinguistica. - 1996. - Т. 10. - С. 1-30.
46. Baric et al. 2023 - Baric A. [et al.] Target Two Birds With One SToNe: Entity-Level Sentiment and Tone Analysis in Croatian News Headlines // Proceedings of the 9th Workshop on Slavic Natural Language Processing 2023 (SlavicNLP 2023) / под ред. J. Piskorski [et al.]. — Dubrovnik, Croatia : Association for Computational Linguistics, 2023. — P. 78-85. — DOI: 10.18653/v1/2023.bsnlp-1.10.
47. Barrett et al. 2018 - Barrett M. [et al.] Sequence Classification with Human Attention // Proceedings of the 22nd Conference on Computational Natural Language Learning / под ред. A. Korhonen, I. Titov. - Brussels : Association for Computational Linguistics, 2018. - С. 302-312.
48. Bastings et al. 2022 - Bastings J., Belinkov Y., Elazar Y., Hupkes D., Saphra N., Wiegreffe S. Proceedings of the Fifth BlackboxNLP Workshop on Analyzing and Interpreting Neural Networks for NLP. - Abu Dhabi, United Arab Emirates (Hybrid) : Association for Computational Linguistics, 2022. - 490 с.
49. Bernier-Colborne et al. 2023 - Bernier-Colborne G. [et al.] Dialect and Variant Identification as a Multi-Label Classification Task: A Proposal Based on Near-Duplicate Analysis // Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023) / ed. by Y. Scherrer [et al.]. — Dubrovnik, Croatia : Association for Computational Linguistics, 2023. — P. 142-151. — DOI: 10.18653/v1/2023 .vardial-1.15.
50. Berwick and Chomsky 2015 - Berwick R.C., Chomsky N. Why only us? Language and Evolution. - Cambridge : The MIT Press, 2015. - 224 с.
51. Blei et al. 2003 - Blei D.M., Ng A.Y., Jordan M.I. Latent Dirichlet Allocation // Journal of Machine Learning Research. - 2003. - Т. 3. - С. 9931022.
52. Bloomfield 1918 - Bloomfield L. A note on sound change // Language. -1918. - Т. 4, № 2. - С. 99-100.
53. Borin 2012 - Borin L. Core Vocabulary: A Useful But Mystical Concept in Some Kinds of Linguistics // Shall We Play the Festschrift Game? Essays on the Occasion of Lauri Carlson's 60th Birthday / под ред. D. Santos, K. Linden, W. Ng'ang'a. — Berlin, Heidelberg : Springer Berlin Heidelberg, 2012. — P. 5365. — ISBN 978-3-642-30773-7. — DOI: 10.1007/978-3-642-30773-7_6.
54. Borin et al. 2021 - Borin L., Saxena A., Comrie D., Virk S.M. A bird's-eye view on South Asian languages through LSI: Areal or genetic relationships? // Journal of South Asian Languages and Linguistics. - 2021. - Т. 7, №2 2. - С. 203237.
55. Bromham 2017 - Bromham L. Curiously the same: swapping tools between linguistics and evolutionary biology // Biology & Philosophy. — 2017. — Vol. 32. — С. 855-886. — DOI: 10.1007/s10539-017-9594-y.
56. Brozovic and Ivic 1988 - Brozovic D., Ivic P. Jezik, srpskohrvatski/hrvatskosrpski, hrvatski ili srpski, Izvadak iz II izdanja Enciklopedije Jugoslavije. — Zagreb : Jugoslavenski leksikografski zavod "Miroslav Krleza", 1988. — 120 с.
57. Buch et al. 2013 - Buch A. [et al.] Towards automated language classification: A clustering approach // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. — Boston/Berlin : Walter De Gruyter GmbH, 2013. — С. 303-328. — (Trends in Linguistics. Studies and Monographs ; Т. 265).
58. Caballero 2022 - Caballero G. A grammar of Choguita Raramuri. — Berlin : Language Science Press, 2022. — 450 с. — (Comprehensive Grammar Library ; Т. 5).
59. Campbell and Poser 2008 - Campbell L., Poser W.J. Language Classification: History and Method. — Cambridge : Cambridge University Press, 2008. — IX, 536 с.
60. Campbell 2013 - Campbell L. Historical Linguistics: An Introduction. — Edinburgh : Edinburgh University Press, 2013. — 512 с.
61. Campos et al. 2019 - Campos J. [et al.] Measuring diachronic language distance using perplexity // Natural Language Engineering. — 2019. — Т. 26. — С. 1-22.
62. Campos et al. 2020 - Campos J. [et al.] A methodology to measure diachronic language distance between three languages based on perplexity // Journal of Quantitative Linguistics. — 2020. — Т. 28. — С. 1-31.
63. Camps and Cafiero 2018 - Camps J.-B., Cafiero F. Stemmatology: An R Package for the Computer-Assisted Analysis of Textual Traditions // Proceedings of the Second Workshop on Corpus-Based Research in the Humanities (CRH-2) / под ред. A.U. Frank [et al.]. — Vienna : Austrian Academy of Sciences, 2018. — С. 65-74.
64. Carling et al. 2013 - Carling G. [et al.] Contrasting linguistics and archaeology in the matrix model: GIS and cluster analysis of the Arawakan languages // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. — Boston/Berlin : Walter De Gruyter GmbH, 2013. — С. 29-56. — (Trends in Linguistics ; Т. 265).
65. Carvalho 2020 - Carvalho F.O. de. Evaluation of cognation judgments undermines computational phylogeny of the Arawakan language family // Journal of Language Relationship. — 2020. — Т. 18, № 1-2. — С. 87-110.
66. Cathcart and Rama 2020 - Cathcart C., Rama T. Disentangling dialects: a neural approach to Indo-Aryan historical phonology and subgrouping // Proceedings of the 24th Conference on Computational Natural Language Learning / под ред. R. Fernández, T. Linzen. — Online : Association for
Computational Linguistics, 2020. — P. 620-630. — DOI: 10.18653/v1/2020.conll-1.50.
67. Ceolin 2022 - Ceolin A. Neural Networks for Cross-domain Language Identification. Phlyers @ Vardial 2022 // Proceedings of the Ninth Workshop on NLP for Similar Languages, Varieties and Dialects / под ред. Y. Scherrer, T. Jauhiainen, N. Ljubesic, P. Nakov, J. Tiedemann, M. Zampieri. - Gyeongju, Republic of Korea : Association for Computational Linguistics, 2022. - P. 99108.
68. Chaudhuri and Dexter 2017 - Chaudhuri P., Dexter J.P. Bioinformatics and classical literary study // Journal of Data Mining. — 2017. — С. 1-8.
69. Chiu et al. 2020 - Chiu B. [et al.] Autoencoding Keyword Correlation Graph for Document Clustering // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics / под ред. D. Jurafsky, J. Chai, N. Schluter, J. Tetreault. - Online : Association for Computational Linguistics, 2020. - С. 3974-3981. DOI: 10.18653/v1/2020.acl-main.366.
70. Cho et al. 2014 - Cho K. [et al.]. Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation // Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP) / под ред. A. Moschitti, B. Pang, W. Daelemans. - Doha, Qatar : Association for Computational Linguistics, 2014. - С. 1724-1734. - DOI: 10.3115/v1/D14-1179.
71. Chomsky 1957 - Chomsky N. Syntactic Structures. — The Hague : Mouton, 1957. — 120 с.
72. Chomsky 1993 - Chomsky N. A minimalist program. — Cambridge : MIT, 1993. — 80 с. — (MIT papers ; № 1).
73. Chomsky 2017 - Chomsky N. The Galilean Challenge // Journal of Physics. — 2017. — Т. 880, № 1. — С. 012015. — DOI: 10.1088/17426596/880/1/012015.
74. Cock et al. 2009 - Cock P.J.A. [et al.]. Biopython: freely available Python tools for computational molecular biology and bioinformatics // Bioinformatics. - 2009. - Т. 25, №. 11. - P. 1422-1423. - DOI: 10.1093/bioinformatics/btp163.
75. Collinge 1985 - Collinge N.E. The Laws of Indo-European. — Amsterdam : Benjamins, 1985. — 300 с.
76. Comrie et al. 2008 - Comrie B. [et al.] The Leipzig Glossing Rules [Электронный ресурс]. — Leipzig : MPI, 2008. — URL: https://www.eva.mpg.de (дата обращения: 21.04.2024).
77. Croft 2008 - Croft W. Evolutionary Linguistics // Annual Review of Anthropology. — 2008. — Т. 37. — С. 219-234.
78. Currie 2023 - Currie P.J. Celebrating dinosaurs: their behaviour, evolution, growth, and physiology // Canadian Journal of Earth Sciences. — 2023. — Т. 60, № 3. — С. 263-293. — DOI: 10.1139/cjes-2022-0131.
79. Damerau 1964 - Damerau F.J. A technique for error detection // Communications of the ACM. — 1964. — Т. 7, № 3. — С. 171-176. — DOI: 10.1145/363958.363994.
80. Daniel et al. 2019 - Daniel M., von Waldenfels R., Ter-Avanesova A. [et al.] Dialect loss in the Russian North: Modeling change across variables // Language Variation and Change. - 2019. - Т. 31, № 3. - С. 353-376.
81. Darwin 1859 - Darwin C.R. On the origin of species by means of natural selection, or the preservation of favoured races in the struggle for life. - London : John Murray, 1859. - 1-е изд.
82. Davis 2017 - Davis J. The semantic difference between Italian vi and ci // Lingua. - 2017. - Т. 200. - С. 107-121.
83. Dediu 2011 - Dediu D. A Bayesian phylogenetic approach to estimating the stability of linguistic features and the genetic biasing of tone // Proceedings of the Royal Society B: Biological Sciences. - 2011. - Т. 278. - С. 474-479.
84. Deri and Knight 2016 - Deri A., Knight K. Grapheme-to-Phoneme Models for (Almost) Any Language // Proceedings of the 54th Annual Meeting of the
Association for Computational Linguistics / под ред. K. Erk, N.A. Smith. -Berlin : Association for Computational Linguistics, 2016. - С. 399-408.
85. Devlin et al. 2019 - Devlin J., Chang M.-W., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding // Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies / под ред. J. Burstein, C. Doran, T. Solorio. - Florence, Italy : Association for Computational Linguistics, 2019. - Т. 1. - С. 4171-4186. - DOI: 10.18653/v1/N19-1423.
86. Dellert et al. 2020 - Dellert J., Daneyko T., Münch A. [et al.] NorthEuralex: A wide-coverage lexical database of Northern Eurasia // Language resources and evaluation. - 2020. - Т. 54, № 1. - С. 273-301.
87. Di Carlo and Pizziolo 2012 - Di Carlo P., Pizziolo G. Spatial Reasoning and GIS in Linguistic Prehistory. Two Case Studies from Lower Fungom (Northwest Cameroon) // Language Dynamics and Change. - 2012. - Т. 2, № 2.
- С. 150-183. - DOI: 10.1163/22105832-20120202.
88. Ding et al. 2020 - Ding C.A., Utiyama M., Sumita E. Three-Parameter Rank-Frequency Relation in Natural Languages // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics / под ред. D. Jurafsky, J. Chai, N. Schluter, J. Tetreault. - Online : Association for Computational Linguistics, 2020. - С. 460-464. - DOI: 10.18653/v1/2020.acl-main.44.
89. Diver 1995[2012] - Diver W. Theory. Meaning as explanation: Advances in linguistic sign theory / W. Diver // Language: Communication and human behavior: The linguistic essays of William Diver / ed. by A. Huffman, J. Davis.
- Leiden ; Boston : Brill, 1995. - P. 445-519. - Revised and repr. 2012.
90. Dong et al. 2021 - Dong J., Li A., Chen C. [et al.] Language distance in orthographic transparency affects cross-language pattern similarity between
native and non-native languages // Human Brain Mapping. - 2021. - T. 42, № 4. - C. 893-907. - DOI: 10.1002/hbm.25266.
91. Johnson et al. 2019 - Johnson J., Douze M., Jégou H. Billion-scale similarity search with GPUs // IEEE Transactions on Big Data. - 2019. - T. 7, № 3. - C. 535-547.
92. Eckhoff et al. 2012 - Eckhoff H.M., de Swart P., Thomason O. A Source of Variation: A Corpus-Based Study of the Choice between ano and sk in the NT Greek Gospels // Journal of Greek Linguistics. - 2012. - T. 12, № 1. - C. 161187. - DOI: 10.1163/156658412X649760.
93. Eder et al. 2016 - Eder M., Rybicki J., Kestemont M. Stylometry with R: a package for computational text analysis // R Journal. - 2016. - T. 8, № 1. - C. 107-121.
94. Egorov et al. 2022 - Egorov I.M., Dybo A.V., Kassian A.S. Phylogeny of the Turkic Languages Inferred from Basic Vocabulary: Limitations of the Lexicostatistical Methods in an Intensive Contact Situation // Journal of Language Evolution. - 2022. - T. 7, № 1. - C. 16-39. - DOI: 10.1093/jole/lzac006.
95. Feld and Maxwell 2019 - Feld J., Maxwell A. Sampling error in lexicostatistical measurements: A Slavic case study // Diachronica. - 2019. - T. 36, № 1. - C. 100-120.
96. Fisher 1918 - Fisher R.A. The Correlation Between Relatives on the Supposition of Mendelian Inheritance // Philosophical Transactions of the Royal Society of Edinburgh. - 1918. - T. 52. - C. 399-433.
97. Forey et al. 1992 - Forey P., Humphries C., Kitching I., Scotland R., Siebert D., Williams D. Cladistics: A Practical Course in Phylogeny Reconstruction. — London : Oxford University Press, 1992. — 212 c. — ISBN 0-19-857766-4.
98. Gage 1994 - Gage P. A New Algorithm for Data Compression // The C User Journal. - 1994. - T. 12, № 2. - C. 23-38.
99. Gamallo et al. 2017 - Gamallo P., Campos J., Alegria I. From language identification to language distance // Physica A: Statistical Mechanics and Its Applications. - 2017. - Т. 484. - С. 152-162.
100. Gamallo et al. 2019 - Gamallo P., Sotelo S., Pichel J.R., Artetxe M. Contextualized Translations of Phrasal Verbs with Distributional Compositional Semantics and Monolingual Corpora // Computational Linguistics. - 2019. - Т. 45, № 3. - С. 395-421.
101. Gamallo et al. 2020 - Gamallo P., Campos J., Alegria I. Measuring Language Distance of Isolated European Languages // Information. - 2020. - Т. 11, № 4. - С. 181-193.
102. Garcia 1985 - Garcia E. Quantity into quality: Synchronic indeterminacy and language change // Lingua. - 1985. - Т. 65. - С. 275-306.
103. Gavashelishvili et al. 2023 - Gavashelishvili A., Chukhua M., Sakhltkhutsishvili K. [et al.] The time and place of origin of South Caucasian languages: insights into past human societies, ecosystems and human population genetics // Scientific Reports. - 2023. - Т. 13. - С. 21133. - DOI: 10.1038/s41598-023-45500-w.
104. Geeraerts et al. 2023 - Geeraerts D., Speelman D., Heylen K. [et al.] Lexical Variation and Change: A Distributional Semantic Approach. - Oxford ; New York : Oxford University Press, 2023. - 336 с.
105. Gillin 2022 - Gillin N. Is Encoder-Decoder Transformer the Shiny Hammer? // Proceedings of the Ninth Workshop on NLP for Similar Languages, Varieties and Dialects / под ред. Y. Scherrer, T. Jauhiainen, N. Ljubesic [et al.]. - Gyeongju, Republic of Korea : Association for Computational Linguistics, October 2022. - С. 80-85.
106. Gooskens and Heeringa 2004 - Gooskens C., Heeringa W. Perceptive evaluation of Levenshtein dialect distance measurements using Norwegian dialect data // Language Variation and Change. - 2004. - Т. 16. - С. 189-207.
107. de Graaf et al. 2022 - de Graaf E., Stopponi S., Bos J.K., Peels-Matthey S., Nissim M. AGILe: The First Lemmatizer for Ancient Greek Inscriptions // Proceedings of the Thirteenth Language Resources and Evaluation Conference. - Marseille : European Language Resources Association, 2022. - С. 5334-5344.
108. Greenberg 1955 - Greenberg J.H. Studies in African Linguistic Classification. - New Haven : Compass Publishing Company, 1955. - 116 с.
109. Greenberg 1963 - Greenberg J. The Languages of Africa. - Bloomington : Indiana University Press, 1963. - 180 c.
110. Gueddah et al. 2015 - Gueddah H., Yousfi A., Belkasmi M. The filtered combination of the weighted edit distance and the Jaro-Winkler distance to improve spellchecking Arabic texts // Proceedings of the 12th IEEE/ACS International Conference of Computer Systems and Applications (AICCSA). -2015. - С. 1-6.
111. Gunnink et al. 2022 - Gunnink H., Chousou-Polydouri N., Bostoen K. Divergence and contact in Southern Bantu language and population history: A new phylogeny in cross-disciplinary perspective // Language Dynamics and Change. - 2022. - Т. 13, № 1. - С. 74-131. - DOI: 10.1163/22105832-bja10022.
112. Guldemann 2005 - Guldemann T. Tuu as a language family // Studies in Tuu (Southern Khoisan) / под ред. T. Guldemann. - Leipzig : Institut fur Afrikanistik, University of Leipzig, 2005. - С. 11-30. - (University of Leipzig Papers on Africa, Languages and Literatures ; 23).
113. Guldemann and Loughnane 2012 - Guldemann T., Loughnane R. Are There "Khoisan" Roots in Body-Part Vocabulary? On Linguistic Inheritance and Contact in the Kalahari Basin // Language Dynamics and Change. - 2012. - Т. 2, № 2. - P. 215-258. - DOI: 10.1163/22105832-20120209.
114. Guldemann 2018 - Guldemann T. Historical linguistics and genealogical language classification in Africa // African Languages and Linguistics / под ред. T. Guldemann. - Berlin : DeGruyter Mouton, 2018. - С. 58-444.
115. Hammarström and O'Connor 2013 - Hammarström H., O'Connor L. Dependency-sensitive typological distance // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Boston/Berlin : Walter De Gruyter GmbH, 2013. - (Trends in Linguistics. Studies and Monographs ; Vol. 265). - С. 329-352
116. Hangya et al. 2023 - Hangya V., Severini S., Ralev R., Fraser A., Schütze H. Multilingual Word Embeddings for Low-Resource Languages using Anchors and a Chain of Related Languages // Proceedings of the 3rd Workshop on Multilingual Representation Learning (MRL) / под ред. D. Ataman. - Singapore : Association for Computational Linguistics, 2023. - P. 95-105. - DOI: 10.18653/v1/2023.mrl-1.8.
117. Haspelmath 2009 - Haspelmath M. Lexical borrowing: concepts and issues // Loanwords in the world's language: A Comparative Handbook. - 2009. - С. 35-54. - DOI: 10.1515/9783110218442.
118. Hejna and Walkden 2022 - Hejna M., Walkden G. A History of English. -Berlin : Language Science Press, 2022. - (Textbooks in Language Sciences ; Vol. 9). - DOI: 10.5281/zenodo.6560337. - 461 c.
119. Paul 1880 - Paul H. Prinzipien der Sprachgeschichte. - Halle a.S. : Max Niemeyer, 1880. - 396 c.
120. Heylen and Ruette 2013 - Heylen K., Ruette T. Degrees of semantic control in measuring aggregated lexical distances // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Boston/Berlin : Walter De Gruyter GmbH, 2013. - С. 241-278. - (Trends in Linguistics. Studies and Monographs ; Vol. 265).
121. Hill 2011 - Hill J.H. Subgrouping in Uto-Aztecan // Language Dynamics and Change. - 2011. - Т. 1, №. 2. - С. 241-278. - DOI: 10.1163/221058212X643978.
122. Hill 2014 - Hill N.W. Grammatically conditioned sound change // Language and Linguistics Compass. - 2014. - Т. 8, №. 6. - С. 211-229.
123. Ho 1995 - Ho T.K. Random decision forests // Proceedings of the 3rd International Conference on Document Analysis and Recognition. - 1995. - C. 278-282.
124. Holman et al. 2008 - Holman E., Wichmann S., Brown C., Velupillai V., Müller A., Bakker D. Explorations in automated language classification // Folia Linguistica. - 2008. - Т. 42. - С. 331-354.
125. Holzer 1995 - Holzer G. Die Einheitlichkeit des Slavischen um 600 n. Chr und ihr Zerfall // Wiener Slavistisches Jahrbuch. - 1995. - Т. 41. - С. 55-89.
126. Howcroft et al. 2020 - Howcroft D.M., Belz A., Clinciu M.-A. [et al.] Twenty Years of Confusion in Human Evaluation: NLG Needs Evaluation Sheets and Standardised Definitions // Proceedings of the 13 th International Conference on Natural Language Generation. - Dublin : Association for Computational Linguistics, 2020. - С. 169-182.
127. Hua 2022 - Hua X. BayesVarbrul: a unified multidimensional analysis of language change in a speaker community // Journal of Language Evolution. -2022. - Т. 7, №№. 1. - С. 40-52. - DOI: 10.1093/jole/lzac004. - EDN: KGBMUC.
128. Huffman and Diver 2012 - Huffman A., Diver W. The phonological motivation for Verner's law and Grimm's law // Language: Communication and Human Behavior: The Linguistic Essays of William Diver / под ред. A. Huffman, J. Davis. - Leiden : Brill, 2012. - С. 343-367. - (Amsterdam Studies in the Theory and History of Linguistic Science, Series IV: Current Issues in Linguistic Theory ; Vol. 328). - ISBN 978-90-04-23191-4.
129. Jaccard 1912 - Jaccard P. The distribution of the flora in the alpine zone // New Phytologist. - 1912. - Т. 11, №. 2. - С. 37-50. - DOI: 10.1111/j.1469-8137.1912.tb05611.x.
130. Jaro 1989 - Jaro M. Advances in Record-Linkage Methodology as Applied to Matching the 1985 Census of Tampa, Florida // Journal of The American Statistical Association. - 1989. - Т. 84. - С. 414-420.
131. Jauhiainen et al. 2022 - Jauhiainen T., Jauhiainen H., Linden K. Italian Language and Dialect Identification and Regional French Variety Detection using Adaptive Naive Bayes // Proceedings of the Ninth Workshop on NLP for Similar Languages, Varieties and Dialects / под ред. Y. Scherrer [et al.]. - Gyeongju : Association for Computational Linguistics, 2022. - С. 119-129.
132. Jäger 2013 - Jäger G. Phylogenetic Inference from Word Lists Using Weighted Alignment with Empirically Determined Weights // Language Dynamics and Change. - 2013. - Т. 3, №. 2. - С. 245-291. - DOI: 10.1163/22105832-13030204.
133. Jäger 2019 - Jäger G. Computational historical linguistics // Theoretical Linguistics. - 2019. - Т. 45, №. 3-4. - С. 151-182.
134. Jäger and List 2018 - Jäger G., List J.-M. Using ancestral state reconstruction methods for onomasiological reconstruction in multilingual word lists // Language Dynamics and Change. - 2018. - Т. 8, №2. 1. - P. 22-54. - DOI: 10.1163/22105832-00801002.
135. Jeszenszky et al. 2023 - Jeszenszky P., Hasse A., Stöckle P. Dialect areas and contact dialectology // Language contact: Bridging the gap between individual interactions and areal patterns / под ред. R. van Gijn [et al.]. - Berlin : Language Science Press, 2023. - С. 135-177. - (Language Variation ; Vol. 5).
136. Jiang et al. 2018 - Jiang C., Yu H.-F., Hsieh C.-J., Chang K.-W. Learning Word Embeddings for Low-Resource Languages by PU Learning // Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies / под ред. M. Walker [et al.]. - New Orleans : Association for Computational Linguistics, 2018. - Т. 1. - С. 1024-1034. - DOI: 10.18653/v1/N18-1093.
137. Jolliffe and Cadima 2016 - Jolliffe I.T., Cadima J. Principal component analysis: a review and recent developments // Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences. - 2016. - Т. 374, №. 2065. - С. 20150202.
138. Josephson 2013 - Josephson F. How aberrant are divergent Indo-European subgroups? // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Berlin : De Gruyter Mouton, 2013. - С. 83-106. - (Trends in Linguistics. Studies and Monographs ; Vol. 265).
139. Joulin et al. 2016 - Joulin A., Grave E., Bojanowski P., Mikolov T. Bag of Tricks for Efficient Text Classification [Электронный ресурс]. - 2016. - 5 с. -DOI: 10.48550/arXiv.1607.01759. - URL: https://arxiv.org/abs/1607.01759 (дата обращения: 01.03.2025).
140. Kaiping and Klamer 2022 - Kaiping G., Klamer M. The dialect chain of the Timor-Alor-Pantar language family: A new analysis using systematic Bayesian phylogenetics // Language Dynamics and Change. - 2022. - Т. 12, №. 2. - С. 274-326. - DOI: 10.1163/22105832-bja10019.
141. Kamphuis 2020 - Kamphuis J. Verbal Aspect in Old Church Slavonic: A Corpus-Based Approach. - Leiden : Brill, 2020. - 312 c. - (Brill's Studies in Historical Linguistics ; Vol. 12). - ISBN 978-90-04-43294-6.
142. Kanjirangat et al. 2023 - Kanjirangat V., Samardzic T., Dolamic L., Rinaldi F. Optimizing the Size of Subword Vocabularies in Dialect Classification // Proceedings of the Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023) / под ред. Y. Scherrer [et al.]. - Dubrovnik : Association for Computational Linguistics, 2023. - С. 14-30.
143. Kassian et al. 2010 - Kassian A., Starostin G., Dybo A. The Swadesh wordlist. An attempt at semantic specification // Journal of Language Relationship. - 2010. - Т. 4. - С. 46-89.
144. Kassian et al. 2015 - Kassian A., Zhivlov M., Starostin G. Proto-Indo-European-Uralic Comparison from the Probabilistic Point of View // Journal of Indo-European Studies. - 2015. - Т. 43, № 3-4. - С. 301-356.
145. Kassian et al. 2021 - Kassian A.S., Zhivlov M., Starostin G. [et al.] Rapid radiation of the inner Indo-European languages: an advanced approach to Indo-
European lexicostatistics // Linguistics. - 2021. - Т. 59, №. 4. - С. 949-979. -DOI: 10.1515/ling-2020-0060.
146. Kassian 2023 - Kassian A. Lexicostatistics // Encyclopedia of Slavic Languages and Linguistics Online / под ред. M.L. Greenberg. - Leiden : Brill, 2023. - DOI: 10.1163/2589-6229_ESLO_COM_047338.
147. Kenny 1986 - Kenny A. A Stylometric Study of the New Testament. -Oxford : Clarendon Press, 1986. - 208 c. - ISBN 0-19-826178-4.
148. Khabtagayeva 2022 - Khabtagayeva B. On some shared and distinguishing features of Nercha and Khamnigan Ewenki dialects // Tungusic languages: Past and present / под ред. A. Holzl, T.E. Payne. - Berlin : Language Science Press, 2022. - С. 185-212. - (Studies in Diversity Linguistics ; 32). - ISBN 978-396110-395-9.
149. Kilani 2021 - Kilani M. FAAL: A Feature-based Aligning ALgorithm // Language Dynamics and Change. - 2021. - Т. 11, №. 1. - С. 30-76. - DOI: 10.1163/22105832-01001300.
150. Kolipakam et al. 2018 - Kolipakam V., Jordan F.M., Dunn M. [et al.] A Bayesian phylogenetic study of the Dravidian language family // Royal Society Open Science. — 2018. — Т. 5, № 3. — С. 171504. — DOI: 10.1098/rsos.171504.
151. Kondrak 2013 - Kondrak G. Word similarity, cognation, and translation equivalence // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. — Berlin : De Gruyter Mouton, 2013. — С. 355-370. — (Trends in Linguistics. Studies and Monographs ; Vol. 265). — ISBN 978-3-11030525-8.
152. Kosmajac and Keselj 2020 - Kosmajac D., Keselj V. Language Distance using Common N-Grams Approach // 2020 19th International Symposium INFOTEH-JAHORINA (INFOTEH). — 2020. — С. 1-5. — DOI: 10.1109/INFOTEH48170.2020.9066342.
153. Kristiansen et al. 2023 - The Indo-European Puzzle Revisited: Integrating Archaeology, Genetics, and Linguistics / под ред. K. Kristiansen, G. Kroonen, E. Willerslev. — Cambridge : Cambridge University Press, 2023. — 350 с. — ISBN 978-1-009-26100-8.
154. Kuparinen 2023 - Kuparinen O. Murreviikko—A Dialectologically Annotated and Normalized Dataset of Finnish Tweets // Proceedings of the Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023) / под ред. Y. Scherrer [et al.]. — Dubrovnik : Association for Computational Linguistics, 2023. — С. 31-39. — DOI: 10.18653/v1/2023.vardial-1.3.
155. Kuparinen and Scherrer 2023 - Kuparinen O., Scherrer Y. Dialect Representation Learning with Neural Dialect-to-Standard Normalization // Proceedings of the Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023). — 2023. — С. 200-212.
156. Kuparinen and Scherrer 2024 - Kuparinen O., Scherrer Y. Corpus-based dialectometry with topic models // Journal of Linguistic Geography. — 2024. — Т. 12, № 1. — С. 1-12. — DOI: 10.1017/jlg.2024.6.
157. Kuzman et al. 2023 - Kuzman T., Rupnik P., Ljubesic N. [et al.] Get to Know Your Parallel Data: Performing English Variety and Genre Classification over MaCoCu Corpora // Proceedings of the Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023) / под ред. Y. Scherrer [et al.].
— Dubrovnik : Association for Computational Linguistics, 2023. — С. 91-103.
— DOI: 10.18653/v1/2023 .vardial-1.9.
158. Ladoukakis et al. 2022 - Ladoukakis E.D., Michelioudakis D., Anagnostopoulou E. [et al.] Toward an evolutionary framework for language variation and change // BioEssays. - 2022. - Т. 44, № 3. - С. e2100216. - DOI: 10.1002/bies.202100216.
159. Lameli and Schonberg 2023 - Lameli A., Schonberg A. A Measure for Linguistic Coherence in Spatial Language Variation // Proceedings of the Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023)
/ под ред. Y. Scherrer, T. Jauhiainen, N. Ljubesic [et al.]. - Dubrovnik : Association for Computational Linguistics, May 2023. - С. 133-141. - DOI: 10.18653/v1/2023.vardial-1.13.
160. Lantto 2023 - Lantto H. Code-switching // Language contact: Bridging the gap between individual interactions and areal patterns / под ред. R. van Gijn [et al.]. - Berlin : Language Science Press, 2023. - С. 49-81. - (Studies in Diversity Linguistics ; 36). - DOI: 10.5281/zenodo.8269230.
161. Lara-Martínez et al. 2021 - Lara-Martínez P., Obregón-Quintana B., Reyes-Manzano C.F. [et al.] Comparing phonological and orthographic networks: A multiplex analysis // PloS ONE. - 2021. - Т. 16, №№ 2. - С. e0245263. - DOI: 10.1371/journal.pone.0245263.
162. Lees 1953 - Lees R. The basis of glottochronology // Language. - 1953. -Т. 29, № 2. - С. 113-127.
163. Lendvai et al. 2023 - Lendvai P., Reichel U., Jouravel A., Rabus A., Renj e E. Domain-Adapting BERT for Attributing Manuscript, Century and Region in Pre-Modern Slavic Texts // Proceedings of the 4th Workshop on Computational Approaches to Historical Language Change / под ред. N. Tahmasebi, S. Montariol, H. Dubossarsky [et al.]. - Singapore : Association for Computational Linguistics, 2023. - С. 15-21. - DOI: 10.18653/v1/2023.lchange-1.2.
164. Levenshtein 1966 - Levenshtein V.I. Binary codes capable of correcting deletions, insertions, and reversals // Soviet Physics Doklady. - 1966. - Т. 10, № 8. - С. 707-710.
165. Levshina 2022 - Levshina N. Corpus-based typology: applications, challenges and some solutions // Linguistic Typology. - 2022. - Т. 26, № 1. - С. 129-160. - DOI: 10.1515/lingty-2020-0118.
166. Lewandowska-Tomaszczyk 2021 - Lewandowska-Tomaszczyk B. Comparing languages and cultures: Parametrization of analytic criteria // Russian Journal of Linguistics. - 2021. - Т. 25, № 2. - С. 343-368. - DOI: 10.22363/2687-0088-2021-25-2-343-368.
167. Lewis et al. 2020 - Lewis M., Liu Y., Goyal N. [et al.] BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. - Online : Association for Computational Linguistics, 2020. - С. 7871-7880.
168. Li et al. 2020 - Li X., Sun X., Meng Y. [et al.] Dice Loss for Data-imbalanced NLP Tasks // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics / под ред. D. Jurafsky [et al.]. - Online : Association for Computational Linguistics, 2020. - С. 465-476. - DOI: 10.18653/v1/2020.acl-main.45.
169. Lightfoot 1999 - Lightfoot D. The Development of Language: Acquisition, Change and Evolution. - New York : Wiley-Blackwell, 1999. - 300 c. - ISBN 0631-21059-1.
170. Lightfoot 2006 - Lightfoot D. How New Languages Emerge. - Cambridge : Cambridge University Press, 2006. - 210 c. - ISBN 978-0-521-85913-0. - DOI: 10.1017/CBO9780511616204.
171. List 2014 - List J.-M. Sequence Comparison in Historical Linguistics. -Berlin : Walter de Gruyter, 2014. - 280 c. - (Topics in English Linguistics ; 82).
- ISBN 978-3-11-033008-3.
172. List 2022 - List J.-M. Correcting a bias in TIGER rates resulting from high amounts of invariant and singleton cognate sets // Journal of Language Evolution.
- 2022. - Т. 7, № 1. - C. 53-58. - DOI: 10.1093/jole/lzab007.
173. List et al. 2014 - List J., Shijulal N., Martin W., Geisler H. Using Phylogenetic Networks to Model Chinese Dialect History // Language Dynamics and Change. - 2014. - Т. 4, № 2. - С. 222-252. - DOI: 10.1163/2210583200402008.
174. List et al. 2016 - List J.-M., Cysouw M., Forkel R. Concepticon: A Resource for the Linking of Concept Lists // Proceedings of the Tenth
International Conference on Language Resources and Evaluation (LREC'16). -Portoroz : ELRA, 2016. - С. 2393-2400.
175. Lonsdale and Huff 2011 - Lonsdale D., Huff P. Positing Language Relationships Using ALINE // Language Dynamics and Change. - 2011. - Т. 1, № 1. - P. 128-162. - DOI: 10.1163/221058211X577964. - URL: [указать URL] (дата обращения: чч.мм.гггг).
176. Lyashevskaya and Afanasev 2021 - Lyashevskaya O., Afanasev I. An HMM-Based PoS Tagger for Old Church Slavonic // Jazykovedny casopis. -2021. - No. 2 (72). - С. 556-567.
177. Lyashevskaya et al. 2023 - Lyashevskaya O., Afanasev I., Rebrkov S., Shishkina Y., Suleymanova E., Trofimov I., Vlasova N. Disambiguation in context in the Russian National Corpus: 20 years later // Computational Linguistics and Intellectual Technologies: Proceedings of the International Conference "Dialogue 2023". - Moscow : RGGU, 2023. - С. 1-8.
178. Maaten 2014 - Maaten L. van der. Accelerating t-SNE using Tree-Based Algorithms // Journal of Machine Learning Research. - 2014. - Т. 15. - С. 32213245.
179. Maaten and Hinton 2008 - Maaten L. van der, Hinton G. Visualizing Data using t-SNE // Journal of Machine Learning Research. - 2008. - Т. 9, № 86. - С. 2579-2605.
180. Mansfield et al. 2023 - Mansfield J., Leslie-O'Neill H., Li H. [et al.] Dialect differences and linguistic divergence: A crosslinguistic survey of grammatical variation // Language Dynamics and Change. - 2023. - Т. 13, № 2. - С. 232276. - DOI: 10.1163/22105832-bja10026.
181. Mares 1980 - Mares F.V. Die Tetrachotomie und doppelte Dichotomie der slavischen Sprachen (R. Turek zum 70. Geburtstag) // Wiener Slawistiches Jahrbuch. - 1980. - Т. 26. - С. 33-45.
182. Marlo et al. 2022 - Marlo M.R., Grollemund R., Nguyen T., Platner E., Pribe S., Thein A. A phylogenetic classification of Luyia language varieties //
Descriptive and theoretical approaches to African linguistics: Selected papers from the 49th Annual Conference on African Linguistics / ed. by G. Sibanda [et al.]. - Berlin : Language Science Press, 2022. - С. 383-407. - (Contemporary African Linguistics ; 6). - ISBN 978-3-96110-340-9.
183. Martins and Abbasi 2020 - Martins P., Abbasi M. End to end distance measurement algorithms in biology sequences // 2020 15th Iberian Conference on Information Systems and Technologies (CISTI). - 2020. - С. 1-6. - DOI: 10.23919/CISTI49556.2020.9141042.
184. Matasovic 2008 - Matasovic R. Poredbenopovij esna gramatika hrvatskoga jezika. - Zagreb : Matica Hrvatska, 2008. - 362 с. - (Biblioteka Theoria). - ISBN 978-953-150-840-7.
185. McGregor 2013 - McGregor W.B. Comparing linguistic systems of categorization // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Berlin : De Gruyter Mouton, 2013. - С. 107-132. - (Trends in Linguistics. Studies and Monographs ; 265). - ISBN 978-3-11-030525-8.
186. McInnes et al. 2017 - McInnes L., Healy J., Astels S. hdbscan: Hierarchical density based clustering // Journal of Open Source Software. - 2017. - Т. 2, № 11. - С. 205. - DOI: 10.21105/joss.00205.
187. Meletis and Dürscheid 2022 - Meletis D., Dürscheid C. Writing Systems and Their Use: An Overview of Grapholinguistics. - Berlin : De Gruyter Mouton, 2022. - 300 с. - ISBN 978-3-11-075777-4. - DOI: 10.1515/9783110757835.
188. Miao et al. 2024 - Miao Z., Wu Q., Zhao K., Wu Z., Tsuruoka Y. Enhancing Cross-lingual Sentence Embedding for Low-resource Languages with Word Alignment // Findings of the Association for Computational Linguistics: NAACL 2024 / под ред. K. Duh, H. Gomez, S. Bethard. - Mexico City : Association for Computational Linguistics, 2024. - С. 3225-3236. - DOI: 10.18653/v1/2024.findings -naacl .204.
189. Michael et al. 2014 - Michael L., Chang W., Stark T. Exploring Phonological Areality in the Circum-Andean Region Using a Naive Bayes
Classifier // Language Dynamics and Change. - 2014. - Т. 4, № 1. - С. 27-86. -DOI: 10.1163/22105832-00401004.
190. Michalove et al. 1998 - Michalove P.A., Peter A., Georg S., Ramer A.M. Current Issues in Linguistic Taxonomy // Annual Review of Anthropology. -1998. - Т. 27. - С. 451-472.
191. Mikolov et al. 2013 - Mikolov T., Chen K., Corrado G., Dean J. Efficient Estimation of Word Representations in Vector Space [Электронный ресурс]. -2013. - 12 с. - DOI: 10.48550/arXiv.1301.3781. - URL: https: //arxiv. org/abs/1301.3781 (дата обращения: 01.03.2025).
192. Mohammadi-Kambs et al. 2017 - Mohammadi-Kambs M., Hölz K., Somoza M.M., Ott A. Hamming Distance as a Concept in DNA Molecular Recognition // ACS Omega. - 2017. - Т. 2, № 4. - С. 1302-1308. - DOI: 10.1021/acsomega.7b00048.
193. Morozova et al. 2023 - Morozova M., Escher A., Rusakov A. [et al.] Linguistic complexity of South Slavic dialects: A new perspective on old data // Linguistics Vanguard. - 2023. - Т. 9, № 1. - С. 133-154. - DOI: 10.1515/lingvan-2021-0116.
194. Moser 1998 - Moser M. Urostslavisch oder Gemeinostslavisch? // Wiener Slavistisches Jahrbuch. - 1998. - Т. 44. - С. 129-144.
195. Munn and Pitman 2022 - Munn M., Pitman D. Explainable AI for Practitioners. - Sebastopol : O'Reilly Media, 2022. - 250 с. - ISBN 978-1-49208335-4.
196. Nerbonne and Heeringa 1997 - Nerbonne J., Heeringa W. Measuring Dialect Distance Phonetically // Proceedings of the EACL 1997. - 1997. - С. 118.
197. Nerbonne et al. 1999 - Nerbonne J., Kleiwig P., Heeringa W. Edit distance and dialect proximity // Time Warps, String Edits and Macromolecules: The Theory and Practice of Sequence Comparison / под ред. D. Sankoff, J. Kruskal.
- 2-е изд. - Stanford : CSLI Publications, 1999. - P. v-xvi. - ISBN 1-57586217-4.
198. Nerbonne et al. 2013 - Nerbonne J., van Ommen S., Gooskens C., Wieling M. Measuring socially motivated pronunciation differences // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Berlin : De Gruyter Mouton, 2013. - С. 107-140. - (Trends in Linguistics. Studies and Monographs ; 265). - ISBN 978-3-11-030525-8.
199. Neureiter et al. 2022 - Neureiter N., Ranacher P., Efrat-Kowalsky N. [et al.] Detecting contact in language trees: a Bayesian phylogenetic model with horizontal transfer // Humanities and Social Sciences Communications. - 2022.
- Т. 9, № 1. - С. 205. - DOI: 10.1057/s41599-022-01211-7.
200. Nixon and Carpenter 1993 - Nixon K., Carpenter J. On Outgroups // Cladistics. - 1993. - Т. 9, № 4. - С. 413-426.
201. Novikova et al. 2017 - Novikova J., Dusek O., Curry A.C., Rieser V. Why We Need New Evaluation Metrics for NLG // Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing. -Copenhagen : Association for Computational Linguistics, 2017. - С. 2241-2252.
202. Nurse and Watters 2022 - Nurse D., Watters J.R. Tense in Proto-Bantu // On reconstructing Proto-Bantu grammar / под ред. K. Bostoen, G.-M. de Schryver, R. Guerois, S. Pacchiarotti. - Berlin : Language Science Press, 2022. -С. 59-101. - (Contemporary African Linguistics ; 5). - ISBN 978-3-96110-3409.
203. Olander 2022 - Olander T. Introduction // The Indo-European Language Family / ed. by T. Olander. - Cambridge : Cambridge University Press, 2022. -С. 1-18. - DOI: 10.1017/9781108758666.
204. OpenAI 2023 - OpenAI. GPT-4 Technical Report [Электронный ресурс].
- 2023. - 100 с. - arXiv:2303.08774. - URL: https://doi.org/10.48550/arXiv.2303.08774 (дата обращения: 01.03.2025).
205. O'Reilly and Donoghue 2018 - O'Reilly J.E., Donoghue P.C.J. The Efficacy of Consensus Tree Methods for Summarizing Phylogenetic Relationships from a Posterior Sample of Trees Estimated from Morphological Data // Systematic Biology. - 2018. - Т. 67, № 2. - С. 354-362. - DOI: 10.1093/sysbio/syx086.
206. Oskolskaya et al. 2022 - Oskolskaya S., Koile E., Robbeets M. [et al.] A Bayesian approach to the classification of Tungusic languages // Diachronica. -2022. - Т. 39, № 1. - С. 128-158.
207. Otheguy 2002 - Otheguy R. Saussurean anti-nomenclaturism in grammatical analysis: A comparative theoretical perspective // Signal, Meaning, and Message: Perspectives on Sign-Based Linguistics / под ред. W. Reid, R. Otheguy, N. Stern. - Amsterdam : John Benjamins, 2002. - С. 373-403. -(Studies in Functional and Structural Linguistics ; 48). - DOI: 10.1075/sfsl.48.18oth.
208. Otheguy and Stern 2011 - Otheguy R., Stern N. On so-called Spanglish // International Journal of Bilingualism. - 2011. - Т. 15, № 1. - С. 85-100.
209. Phillips and Bowern 2022 - Phillips J., Bowern C. Bayesian methods for ancestral state reconstruction in morphosyntax: Exploring the history of argument marking strategies in a large language family // Journal of Language Evolution. - 2022. - Т. 7, № 1. - С. 1-15. - DOI: 10.1093/jole/lzac002.
210. Pearson 1895 - Pearson K. Notes on regression and inheritance in the case of two parents // Proceedings of the Royal Society of London. - 1895. - Т. 58. -С. 240-242.
211. Pedregosa et al. 2011 - Pedregosa F., Varoquaux G., Gramfort A. [et al.] Scikit-learn: Machine learning in Python // Journal of Machine Learning Research. - 2011. - Т. 12. - С. 2825-2830.
212. Perez 2023 - Perez D. Contact languages // Language contact: Bridging the gap between individual interactions and areal patterns / под ред. R. van Gijn,
H. Ruch, M. Wahlstrom, A. Hasse. - Berlin : Language Science Press, 2023. - С. 111-133.
213. Peterson 2022 - Peterson J. A sociolinguistic-typological approach to the linguistic prehistory of South Asia: Two case studies // Language Dynamics and Change. - 2022. - Т. 12, № 2. - С. 224-273. - DOI: 10.1163/22105832-bja10018.
214. Piotrowski 2012 - Piotrowski M. Natural Language Processing for Historical Texts. - Kentfield : Morgan & Claypool, 2012. - 145 c. - (Synthesis Lectures on Human Language Technologies ; Т. 17).
215. Pistorelli 2017 - Pistorelli D.A. Classification of Manuscripts Based on A New Quantitative Method: The Old Latin Witnesses of John's Gospel as Text Case // Journal of Data Mining and Digital Humanities, Special Issue in Computer-Aided Processing of Intertextuality in Ancient Languages. - 2017. -С. 1-48.
216. Piwowarczyk 2022 - Piwowarczyk D. Computational Approaches to Linguistic Chronology and Subgrouping // The Indo-European Language Family / под ред. T. Olander. - Cambridge : Cambridge University Press, 2022. - С. 3351.
217. Prokic and Cysouw 2013 - Prokic J., Cysouw M. Combining Regular Sound Correspondences and Geographic Spread // Language Dynamics and Change. - 2013. - Т. 3, №° 2. - С. 147-168. - DOI: 10.1163/22105832-13030205.
218. Prokic and Moran 2013 - Prokic J., Moran S. Black box approaches to genealogical classification and their shortcomings // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Boston/Berlin : Walter De Gruyter GmbH, 2013. - (Trends in Linguistics. Studies and Monographs ; Т. 265). - С. 429-446.
219. Qi et al. 2018 - Qi P., Dozat T., Zhang Y., Manning C.D. Universal Dependency Parsing from Scratch // Proceedings of the CoNLL 2018 Shared Task: Multilingual Parsing from Raw Text to Universal Dependencies / под ред.
D. Zeman, J. Hajic. - Brussels : Association for Computational Linguistics, 2018.
- С. 160-170. - DOI: 10.18653/v1/K18-2016.
220. Qi et al. 2020 - Qi P., Zhang Y., Zhang Y., Bolton J., Manning C.D. Stanza: A Python Natural Language Processing Toolkit for Many Human Languages // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics: System Demonstrations / под ред. A. Celikyilmaz, T.-H. Wen. -Online : Association for Computational Linguistics, 2020. - С. 101-108. - DOI: 10.18653/v1/2020.acl-demos.14.
221. Radford et al. 2019 - Radford A., Wu J., Child R., Luan D., Amodei D., Sutskever I. Language Models are Unsupervised Multitask Learners [Электронный ресурс.]. - 2019. - 24 с. - URL: https://cdn.openai.com/better-language-models/language models are unsupervised multitask learners.pdf (дата обращения: 01.03.2025).
222. Rahman et al. 2024 - Rahman S., Choi F., Kim H., Zhang D., Hruschka E. Knowledge Acquisition and Integration with Expert-in-the-loop // arXiv preprint.
- 2024. - 12 с. - URL: https://arxiv.org/pdf/2402.03291v1 (дата обращения: 01.03.2025). - arXiv:2402.03291 [cs.AI].
223. Rama 2018 - Rama T. Three tree priors and five datasets: A study of Indo-European phylogenetics // Language Dynamics and Change. - 2018. - Т. 8, №2 2.
- С. 182-218. - DOI: 10.1163/22105832-00802005.
224. Rama and Borin 2015 - Rama T., Borin L. Comparative Evaluation of String Similarity Measures for Automatic Language Classification // Sequences in Language and Text / под ред. G.K. Mikros, J. Macutek. -Berlin/Munchen/Boston : De Gruyter Mouton, 2015. - С. 171-200.
225. Rama et al. 2017 - Rama T., Qoltekin Q., Sofroniev P. Computational analysis of Gondi dialects // Proceedings of the Fourth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial) / под ред. P. Nakov, M. Zampieri, N. Ljubesic, J. Tiedemann, S. Malmasi, A. Ali. - Valencia :
Association for Computational Linguistics, 2017. - С. 26-35. - URL: https://aclanthology.org/W17-1203/. - DOI: 10.18653/v1/W17-1203.
226. Rama and Kolachina 2013 - Rama T., Kolachina S. Distance-based phylogenetic inference algorithms in the subgrouping of Dravidian languages // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Boston/Berlin : Walter De Gruyter GmbH, 2013. - (Trends in Linguistics. Studies and Monographs ; Т. 265). - С. 141-174.
227. Rama et al. 2014 - Rama T., Kolachina S., Bai B.L. Quantitative methods for Phylogenetic Inference in Historical Linguistics: An experimental case study of South Central Dravidian // CoRR. - 2014. - 14 c. - arXiv: 1401.0708.
228. Rama and Wichmann 2018 - Rama T., Wichmann S. Towards identifying the optimal datasize for lexically-based Bayesian inference of linguistic phylogenies // Proceedings of the 27th International Conference on Computational Linguistics / под ред. E.M. Bender, L. Derczynski, P. Isabelle. -Santa Fe : Association for Computational Linguistics, 2018. - С. 1578-1590.
229. Ramponi and Casula 2023 - Ramponi A., Casula C. DiatopIt: A Corpus of Social Media Posts for the Study of Diatopic Language Variation in Italy // Proceedings of the Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023) / под ред. Y. Scherrer, T. Jauhiainen, N. Ljubesic [et al.]. - Dubrovnik : Association for Computational Linguistics, 2023. - С. 113120.
230. Ranacher et al. 2021 - Ranacher P., Neureiter N., van Gijn R. [и др.] Contact-tracing in cultural evolution: A Bayesian mixture model to detect geographic areas of language contact // Journal of the Royal Society Interface. -2021. - Т. 18, № 20201031. - С. 1-15.
231. Rask 1818 - Rask R.K. Undersögelse om det gamle Nordiske eller Islandske Sprogs Oprindelse. - Kj0benhavn : Gyldendal, 1818. - XII, 312 с.
232. Reverter-Rambaldi 2022 - Reverter-Rambaldi M. Topic Modelling in Spontaneous Speech Data: Honorary Thesis. - Australian National University, 2022. - URL: http://hdl.handle.net/1885/281664 (дата обращения: 09.03.2025).
233. Rickford 2022 - Rickford J.R. The value of online corpora for the analysis of variation and change in the Caribbean // Social and Structural Aspects of Language Contact and Change / под ред. B. Migge, S. Gooden. - Berlin : Language Science Press, 2022. - С. 213-232. - DOI: 10.5281/zenodo.6979333.
234. Ritchie and Ho 2019 - Ritchie A.M., Ho S.Y.W. Influence of the tree prior and sampling scale on Bayesian phylogenetic estimates of the origin times of language families // Journal of Language Evolution. - 2019. - Т. 4, № 2. - С. 108-123. - DOI: 10.1093/jole/lzz005.
235. Robbeets and Oskolskaya 2022 - Robbeets M., Oskolskaya S. Proto-Tungusic in time and space // Tungusic languages: Past and present / под ред. A. Holzl, T.E. Payne. - Berlin : Language Science Press, 2022. - С. 263-294. -(Studies in Diversity Linguistics ; Т. 32).
236. Robinson and Holton 2012 - Robinson L.C., Holton G. Internal Classification of the Alor-Pantar Language Family Using Computational Methods Applied to the Lexicon // Language Dynamics and Change. - 2012. -Т. 2, № 2. - С. 123-149. - DOI: 10.1163/22105832-20120201.
237. Rojas-Berscia and Roberts 2020 - Rojas-Berscia L.M., Roberts S. Exploring the history of pronouns in South America with computer-assisted methods // Journal of Language Evolution. - 2020. - Т. 5, № 1. - С. 54-74. -DOI: 10.1093/jole/lzz006.
238. Romanov and Khusainova 2019 - Romanov V., Khusainova A. Evaluation of Morphological Embeddings for English and Russian Languages // Proceedings of the 3rd Workshop on Evaluating Vector Space Representations for NLP / под ред. A. Rogers, A. Drozd, A. Rumshisky, Y. Goldberg. - Minneapolis : Association for Computational Linguistics, 2019. - С. 77-81. - DOI: 10.18653/v1/W19-2010.
239. Rosemeyer and Van de Velde 2021 - Rosemeyer M., Van de Velde F. On cause and correlation in language change: Word order and clefting in Brazilian Portuguese // Language Dynamics and Change. - 2021. - Т. 11, № 1. - С. 130166. - DOI: 10.1163/22105832-01001500.
240. Rupnik et al. 2023 - Rupnik P., Kuzman T., Ljubesic N. BENCHic-lang: A Benchmark for Discriminating between Bosnian, Croatian, Montenegrin and Serbian // Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023) / под ред. Y. Scherrer, T. Jauhiainen, N. Ljubesic [et al.]. -Dubrovnik : Association for Computational Linguistics, 2023. - С. 113-120. -DOI: 10.18653/v1/2023 .vardial-1.11.
241. Rehûrek and Sojka 2010 - Rehûrek R., Sojka P. Software Framework for Topic Modelling with Large Corpora // Proceedings of LREC 2010 Workshop New Challenges for NLP Frameworks. - 2010. - С. 46-50.
242. Sagart et al. 2019 - Sagart L., Jacques G., Lai Y. [et al.] Dated language phylogenies shed light on the ancestry of Sino-Tibetan // Proceedings of the National Academy of Sciences of the United States of America. - 2019. - Т. 116, № 21. - С. 10317-10322.
243. Saussure 1879 - de Saussure F. Memoire sur le systeme primitif des voyelles dans les langues indo-europeennes. - Leipzig : Vieweg, 1879. - 326 с.
244. Saxena and Borin 2013 - Saxena A., Borin L. Carving Tibeto-Kanauri by its joints: Using basic vocabulary lists for genetic grouping of languages // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Boston/Berlin : Walter De Gruyter GmbH, 2013. - (Trends in Linguistics. Studies and Monographs ; Т. 265). - С. 175-198.
245. Saxena et al. 2022a - Saxena A., Sjöberg A., Sagar P., Borin L. [и др.] Linguistic variation: A challenge for describing the phonology of Kanashi // Synchronic and Diachronic Aspects of Kanashi / под ред. A. Saxena, L. Borin. -Berlin : Mouton de Gruyter, 2022. - С. 131-144.
246. Saxena et al. 2022b - Saxena A., Borin L., Comrie B. [и др.] Kanashi and West Himalayish: Genealogy, language contact, prehistoric migrations // Synchronic and Diachronic Aspects of Kanashi / под ред. A. Saxena, L. Borin. -Berlin/Boston : De Gruyter Mouton, 2022. - С. 237-254.
247. Savelyev and Robbeets 2020 - Savelyev A., Robbeets M. Bayesian phylolinguistics infers the internal structure and the time-depth of the Turkic language family // Journal of Language Evolution. - 2020. - Т. 5, № 1. - С. 3953. - DOI: 10.1093/jole/lzz010.
248. Salesky et al. 2020 - Salesky E., Chodroff E., Pimentel T. [et al.] A Corpus for Large-Scale Phonetic Typology // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics / под ред. D. Jurafsky, J. Chai, N. Schluter, J. Tetreault. - Online : Association for Computational Linguistics, 2020. - С. 4526-4546. - DOI: 10.18653/v1/2020.acl-main.415.
249. Schaeken 1987 - Schaeken J. Die Kiever Blätter. - Amsterdam : Rodopi, 1987. - 284 с.
250. Scheffe 1959 - Scheffe H. The Analysis of Variance. - 1-е изд. - New York : Wiley-Interscience, 1959. - 477 c.
251. Schepens et al. 2013 - Schepens J., Dijkstra T., Grootjen F., van Heuven W.J.B. Cross-Language Distributions of High Frequency and Phonetically Similar Cognates // PLoS ONE. - 2013. - Т. 8, № 5. - С. e63006. - DOI: 10.1371/journal.pone.0063006.
252. Scherrer 2021 - Scherrer Y. Adaptation of morphosyntactic taggers // Similar Languages, Varieties, and Dialects: A Computational Perspective / под ред. M. Zampieri, P. Nakov. - Cambridge : Cambridge University Press, 2021. -(Studies in Natural Language Processing). - С. 138-166.
253. Schleicher 1863 - Schleicher A. Die Darwinsche Theorie und die Sprachwissenschaft: Offenes Sendschreiben an Herrn Dr. Ernst Haeckel. -Weimar : H. Boehlau, 1863.
254. Schuchardt 1922 - Schuchardt H. Über die Lautgesetze: Gegen die Junggrammatiker // Hugo-Schuchardt-Brevier: Ein Vademekum der allgemeinen Sprachwissenschaft / под ред. L. Spitzer. - Halle (Saale), 1922.
255. Shim and Nerbonne 2022 - Shim R.S.-E., Nerbonne J. dialectR: Doing Dialectometry in R // Proceedings of the Ninth Workshop on NLP for Similar Languages, Varieties and Dialects / под ред. Y. Scherrer, T. Jauhiainen, N. Ljubesic [et al.]. - Gyeongju : Association for Computational Linguistics, 2022.
- С. 20-27.
256. Sidwell and Alves 2021 - Sidwell P., Alves M. The Vietic languages: a phylogenetic analysis // Journal of Language Relationship. - 2021. - № 19/3-4.
- С. 166-194.
257. Siewert et al. 2020 - Siewert J., Scherrer Y., Wieling M., Tiedemann J. LSDC - A comprehensive dataset for Low Saxon Dialect Classification // Proceedings of the 7th Workshop on NLP for Similar Languages, Varieties and Dialects / под ред. M. Zampieri, P. Nakov, N. Ljubesic [et al.]. - Barcelona : International Committee on Computational Linguistics (ICCL), 2020. - С. 2535.
258. Simons et al. 2024 - Simons A., De Pascale S., Franco K. [et al.] Highly Granular Dialect Normalization and Phonological Dialect Translation for Limburgish // Proceedings of the Eleventh Workshop on NLP for Similar Languages, Varieties, and Dialects (VarDial 2024) / под ред. Y. Scherrer [et al.].
- Mexico City : Association for Computational Linguistics, 2024. - С. 152-162.
259. Sims-Williams 2022 - Sims-Williams H. Token frequency as a determinant of morphological change // Journal of Linguistics. - 2022. - Т. 58, № 3. - С. 571-607. - DOI: 10.1017/S0022226721000438.
260. Sejane and Eger 2013 - Sejane I., Eger S. Semantic typologies by means of network analysis of bilingual dictionaries // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Boston ; Berlin : Walter
De Gruyter GmbH, 2013. - (Trends in Linguistics. Studies and Monographs ; Т. 265). - С. 447-474.
261. Smith 2020 - Smith M.R. Information theoretic Generalized Robinson-Foulds metrics for comparing phylogenetic trees // Bioinformatics. - 2020. - Т. 36, № 20. - С. 5007-5013. - DOI: 10.1093/bioinformatics/btaa614.
262. Snoek 2013 - Snoek C. Using semantically restricted word-lists to investigate relationships among Athapaskan languages // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Boston ; Berlin : Walter De Gruyter GmbH, 2013. - (Trends in Linguistics. Studies and Monographs ; Т. 265). - С. 231-248.
263. Snoek and Cox 2013 - Snoek C., Cox C. Measuring Linguistic Distance in Athapaskan // Proceedings of the 39th Annual Meeting of the Berkeley Linguistics Society. - New York : Linguistic Society of America, 2013. - С. 245258.
264. Snoek et al. 2022 - Snoek C., Stang M., Rice S. [et al.] Linguistic Relationships between Apachean and Northern Athapaskan: On the possibility of 'Eastern Athapaskan' // Holes in Our Moccasins, Holes in Our Stories: Apachean Origins and the Promontory, Franktown, and Dismal River Archaeological Records / под ред. J.W. Ives, J. Janetski. - Salt Lake City : The University of Utah Press, 2022. - С. 8-26.
265. Soeren 2023 - Soeren D.P.V. The role of word recognition factors and lexical stress in the distribution of consonants in Spanish, English and Dutch // Journal of Linguistics. - 2023. - Т. 59, № 1. - С. 149-177. - DOI: 10.1017/S0022226722000081.
266. Sokal and Michener 1958 - Sokal R.R., Michener C.D. A statistical method for evaluating systematic relationships // University of Kansas Science Bulletin. - 1958. - Т. 38. - С. 1409-1438.
267. S0rensen 1948 - S0rensen T. A method of establishing groups of equal amplitude in plant sociology based on similarity of species and its application to
analyses of the vegetation on Danish commons // Kongelige Danske Videnskabernes Selskab. - 1948. - Т. 5, № 4. - С. 1-34.
268. Starostin 2009 - Starostin G. [Review] Lyle Campbell & William Poser: Language Classification: History and Method // Journal of Language Relationship. - 2009. - № 2. - С. 158-174.
269. Starostin 2010 - Starostin G. Preliminary lexicostatistics as a basis for language classification: A new approach // Вестник РГГУ. Серия: Филологические науки. Языкознание. - 2010. - № 3. - С. 79-116. - EDN MSWCRD.
270. Starostin 2011 - Starostin G. On Mimi // Journal of Language Relationship.
- 2011. - Т. 6, № 1. - С. 115-140.
271. Starostin 2021 - Starostin G. Lexicostatistical studies in Khoisan II/1: How to make a Swadesh wordlist for Proto-Tuu // Journal of Language Relationship.
- 2021. - Т. 19, № 1-2. - С. 99-135.
272. Starostin 2022a - Starostin G. The value of "triangulation" in determining phylogenetic relationship: On the areal and genetic connections of the Bertha languages // Language in Africa. - 2022. - Т. 3, № 2. - С. 352-367.
273. Starostin 2022b - Starostin G. Lexicostatistical studies in Khoisan II/2: Towards a more precise phylogeny for the Tuu family // Journal of Language Relationship. - 2022. - Т. 20, № 1-2. - С. 25-70.
274. Steiner et al. 2011 - Steiner L., Cysouw M., Stadler P. A Pipeline for Computational Historical Linguistics // Language Dynamics and Change. - 2011.
- Т. 1, № 1. - С. 89-127. - DOI: 10.1163/221058211X570358.
275. Steinke 1992 - Steinke K. Urkunden in der Slavia Orthodoxa // Gattungen und Genologie der slavisch-orthodoxen Literaturen des Mittelalters (Dritte Berliner Fachtagung 1988) / под ред. K.-D. Seemann. - Wiesbaden : O. Harrassowitz, 1992. - С. 245-258.
276. Student 1908 - Student. The Probable Error of a Mean // Biometrika. -1908. - Т. 6, № 1. - С. 1-25. - DOI: 10.2307/2331554.
277. Srivastava and Chiang 2023 - Srivastava A., Chiang D. Fine-Tuning BERT with Character-Level Noise for Zero-Shot Transfer to Dialects and Closely-Related Languages // Proceedings of the Tenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial 2023) / под ред. Y. Scherrer, T. Jauhiainen, N. Ljubesic [et al.]. - Dubrovnik : Association for Computational Linguistics, 2023. - С. 152-162. - DOI: 10.18653/v1/2023.vardial-1.16.
278. Suchard et al. 2018 - Suchard M.A., Lemey P., Baele G. [и др.] Bayesian phylogenetic and phylodynamic data integration using BEAST 1.10 // Virus Evolution. - 2018. - Т. 4. - С. 1-5. - DOI: 10.1093/ve/vey016.
279. Sung 2019 - Sung M. Is San Diu a Cantonese variety or is it something else? A historical phonological analysis of the Sinitic words in San Diu // Undergraduate Linguistics Association of Britain (ULAB). - London : Queen Mary University of London, 2019. - С. 1-31. - DOI: 10.5282/ulab2019.365.
280. Sutskever et al. 2014 - Sutskever I., Vinyals O., Le Q.V. [et al.] Sequence to sequence learning with neural networks // Advances in Neural Information Processing Systems. - 2014. - С. 3104-3112.
281. Swadesh 1955 - Swadesh M. Towards greater accuracy in lexicostatistic dating // International Journal of American Linguistics. - 1955. - Т. 21, № 2. -С. 121-137.
282. Syrjänen et al. 2021 - Syrjänen K., Maurits L., Leino U. [et al.] Crouching TIGER, hidden structure: Exploring the nature of linguistic data using TIGER values // Journal of Language Evolution. - 2021. - Т. 6, № 2. - С. 99-118. -DOI: 10.1093/jole/lzab004.
283. Syvokon et al. 2023 - Syvokon O., Nahorna O., Kuchmiichuk P., Osidach N. UA-GEC: Grammatical Error Correction and Fluency Corpus for the Ukrainian Language // Proceedings of the Second Ukrainian Natural Language Processing Workshop (UNLP) / под ред. M. Romanyshyn. - Dubrovnik : Association for Computational Linguistics, 2023. - С. 96-102. - DOI: 10.18653/v1/2023.unlp-1.12.
284. §ahin et al. 2020 - §ahin G.G., Kementchedjhieva Y., Rust P., Gurevych I. PuzzLing Machines: A Challenge on Learning From Small Data // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics / под ред. D. Jurafsky, J. Chai, N. Schluter, J. Tetreault. - Online : Association for Computational Linguistics, 2020. - С. 1241-1254. - DOI: 10.18653/v1/2020.acl-main.115.
285. Tadmor 2009 - Tadmor U. Loanwords in the world's languages: Findings and results // Loanwords in the World's Languages: A Comparative Handbook / под ред. M. Haspelmath, U. Tadmor. - Berlin ; New York : De Gruyter Mouton, 2009. - С. 55-75. - ISBN 9783110218442. - DOI: 10.1515/9783110218442.55.
286. Testelets 2020 - Testelets Y.G. Kartvelian (South Caucasian) Languages // The Oxford Handbook of Languages of the Caucasus / под ред. M. Polinsky.
- Oxford : Oxford University Press, 2020. - (Oxford Handbooks Series). - С. 489-526.
287. Turchin et al. 2010 - Turchin P., Peiros I., Gull-Mann M. [и др.] Analyzing genetic connections between languages by matching consonant classes // Journal of Language Relationship. - 2010. - Т. 3. - С. 117-126.
288. Vajda 2012 - Vajda E. The Dene-Yeniseian connection: a reply to G. Starostin // Journal of Language Relationship. - 2012. - Т. 8, № 1. - С. 138-152.
289. Van Rooy 2020 - Van Rooy R. Language or Dialect? The History of a Conceptual Pair. - Oxford : Oxford Academic, 2020. - 349 с.
290. Vaswani et al. 2017 - Vaswani A., Shazeer N., Parmar N. [и др.] Attention Is All You Need // Advances in Neural Information Processing Systems. - 2017.
- Т. 30. - С. 1-11.
291. Verner 1877 - Verner K.A. Eine Ausnahme der ersten Lautverschiebung // Zeitschrift für vergleichende Sprachforschung auf dem Gebiete der Indogermanischen Sprachen. - 1877. - Т. 23, № 2. - С. 97-130.
292. Wattel 1996 - Wattel E. Clustering Stemmatological Trees // Studies in Stemmatology / под ред. P. van Reenen, M. van Mulken. - Amsterdam ; Philadelphia : John Benjamins Publishing Company, 1996. - С. 123-134.
293. Wälchli 2009 - Wälchli B. Data reduction typology and the bimodal distribution bias // Linguistic Typology. - 2009. - Т. 13, № 1. - С. 77-94. - DOI: 10.1515/LITY.2009.004.
294. Wälchli and von Waldenfels 2013 - Wälchli B., von Waldenfels R. Measuring morphosemantic language distance in parallel texts // Approaches to Measuring Linguistic Differences / под ред. L. Borin, A. Saxena. - Boston ; Berlin : Walter De Gruyter GmbH, 2013. - (Trends in Linguistics. Studies and Monographs ; Т. 265). - С. 475-506.
295. Welch 1947 - Welch B.L. The generalization of "Student's" problem when several different population variances are involved // Biometrika. - 1947. - Т. 34, № 1-2. - С. 28-35. - DOI: 10.1093/biomet/34.1-2.28.
296. Wichmann 2010 - Wichmann S. Internal language classification // The Continuum Companion to Historical Linguistics / под ред. S. Luraghi, V. Bubenik. - London ; New York : Continuum Books, 2010. - С. 70-86.
297. Wichmann and Rama 2018 - Wichmann S., Rama T. Jackknifing the Black Sheep: ASJP Classification Performance and Austronesian // Let's Talk about Trees / под ред. R. Kikusawa, L.A. Reid. - Japan : National Museum of Ethnology, 2018. - (Senri Ethnological Studies ; Т. 98). - С. 39-58.
298. Wichmann et al. 2011 - Wichmann S., Holman E.W., Stauffer D. [et al.] Similarities among languages of the Americas: An exploration of the WALS evidence // Journal of Language Relationship. - 2011. - Т. 5. - С. 130-134.
299. Wiese 2023 - Wiese H. Grammatical systems without language borders. -Berlin : Language Science Press, 2023. - 108 с. - DOI: 10.5281/zenodo.10276182.
300. Wilbur and Sirotkin 1992 - Wilbur W.J., Sirotkin K. The automatic identification of stop words // Journal of Information Science. - 1992. - Т. 18, №2 1. - С. 45-55. - DOI: 10.1177/016555159201800106.
301. Wills 2022 - Wills J. Sorting out Proto-Bantu *j // On reconstructing Proto-Bantu grammar / под ред. K. Bostoen, M. de Schryver, R. Guerois, S. Pacchiarotti. - Berlin : Language Science Press, 2022. - С. 59-101.
302. Winkler 1990 - Winkler W. String Comparator Metrics and Enhanced Decision Rules in the Fellegi-Sunter Model of Record Linkage // Proceedings of the Section on Survey Research Methods. - Boston : American Statistical Association, 1990. - С. 354-358.
303. Wu and List 2023 - Wu M., List J.-M. Annotating cognates in phylogenetic studies of Southeast Asian languages // Language Dynamics and Change. - 2023. - Т. 13, № 2. - С. 161-197. - DOI: 10.1163/22105832-bja10023.
304. Yang 2000 - Yang C.D. Internal and external forces in language change // Language Variation and Change. - 2000. - Т. 12. - С. 231-250.
305. Yokoi et al. 2020 - Yokoi S., Takahashi R., Akama R. [и др.] Word Rotator's Distance // Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) / под ред. B. Webber, T. Cohn, Y. He, Y. Liu. - Online : Association for Computational Linguistics, 2020. - С. 2944-2960.
306. Ziegler et al. 2021 - Ziegler A., Edler S., Oberdorfer G. [и др.] Urban Matters: Current approaches in variationist sociolinguistics. - Amsterdam ; Philadelphia : John Benjamins Publishing Company, 2021. - X, 280 с.
307. Zeitlhuber 2024 - Zeitlhuber P. Linguistically Mapping Asoka: A Dialectometric Approach to the Major Rock and Major Pillar Edicts // Proceedings of the 7th International Sanskrit Computational Linguistics Symposium / под ред. A. Bhattacharya. - Auroville : Association for Computational Linguistics, 2024. - С. 27-38. - DOI: 10.18653/v1/2024.iscls-1.3.
308. Zhivlov 2021 - Zhivlov M. Does the comparative method work in New Caledonia? [Электронный ресурс] // Proceedings of the 15th International Conference on Austronesian Linguistics. - Olomouc : The Department of Asian Studies at Palacky University Olomouc, 2021. - URL: https://www.hse.ru/data/2021/07/04/1432013048/Comparative%20method.pdf (дата обращения: 01.09.2023).
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.