Разработка алгоритмических и программных средств извлечения знаний из исследовательских отчетов систем большой размерности тема диссертации и автореферата по ВАК РФ 05.13.11, кандидат технических наук Сорочинская, Наталия Константиновна
- Специальность ВАК РФ05.13.11
- Количество страниц 165
Оглавление диссертации кандидат технических наук Сорочинская, Наталия Константиновна
ОПРЕДЕЛЕНИЯ, ОБОЗНАЧЕНИЯ И СОКРАЩЕНИЯ.
Введение.
ГЛАВА 1 СОВРЕМЕННЫЕ МЕТОДЫ ПРОЕКТИРОВАНИЯ И РЕАЛИЗАЦИИ СРЕДСТВ АВТОМАТИЗИРОВАННОГО ИЗВЛЕЧЕНИЯ ЗНАНИЙ.
1.1 Особенности организации ввода/вывода данных для системы большой размерности.
1.1.1 Области применения систем большой размерности. Методы анализа систем большой размерности.
1.1.2 Определение системы большой размерности.
1.1.2.1 Факторы, влияющие на сложность системы.
1.1.2.2 Организации ввода/вывода, верификации и обработки данных для семантической сети системы большой размерности.
1.1.2.2.1 Семантическая сеть для хранения естественно-языковой информации системы большой размерности.
1.1.2 Поиск данных в информационных системах (Data Mining).
1.1.2.2 Основные минусы DM для работы с системами большой размерности.
1.3 Структуры программного комплекса системы большой размерности
Выводы по главе.
ГЛАВА 2 ОПИСАНИЕ ИСПОЛЬЗОВАННЫХ И РАЗРАБОТАННЫХ РАСЧЕТНЫХ МЕТОДИК И АЛГОРИТМОВ МОДЕЛИРОВАНИЯ.
2.1 Разработка и исследование методов автоматизированной обработки естественно-языковой информации.
2.2 Составление тезауруса синонимов.
2.2.1 Соответствие и однородность.
2.2.2 Тезаурус синонимов.
2.3 Общие понятия системного анализа.
2.3.1 Задачи идентификации и реконструкции.
2.3.2 Задача идентификации систем.
2.3.3 Коэффициент идентифицируемости.
2.3.4 Единственный выбор из реконструктивного семейства.
2.3.5 Процедуры соединения.
2.3.6 Базовая процедура соединения.
2.3.7 Итеративная процедура соединения.
2.3.8 Задача реконструкции.
2.4 Использование матрицы значений на неполных информационных системах редуцирования признаков.
2.4.1 Неполная информационная система. Определение.
2.4.3 Матрицы значений, базирующиеся на алгоритме редукции признака
2.4.4 Адаптация алгоритма для работы с экспериментальными данными
Выводы по главе.
ГЛАВА 3 РЕАЛИЗАЦИЯ И ИССЛЕДОВАНИЕ МОДУЛЯ АВТОМАТИЗИРОВАННОГО АНАЛИЗА ИССЛЕДОВАТЕЛЬСКИХ ОТЧЕТОВ ПРОГРАММНОГО КОМПЛЕКСА ДЛЯ СИСТЕМЫ БОЛЬШОЙ РАЗМЕРНОСТИ.
3.1 Задачи программного средства.
3.2 Архитектура модуля.
3.3 Модуль автоматизированного анализа отчетов.
3.5 Экспериментальные данные.
3.5.1 Решение задач идентификации и реконструкции с неизвестными подсистемами.
3.5.2 Решение задач идентификации и реконструкции с неполными данными.
3.5.3 Обработка отчетов о грузоперевозках.
3.6 Общий алгоритм работы модуля обработки естественно-языковых отчетов системы большой размерности.
Выводы по главе.
Рекомендованный список диссертаций по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК
Прагматически-ориентированные модели и методы обработки естественно-языковых вопросно-ответных текстов2024 год, кандидат наук Прокопьев Николай Аркадиевич
Комплекс средств адаптации информационных систем поддержки принятия решений в области экономики2004 год, доктор технических наук Романов, Виктор Петрович
Использование естественного языка при автоматизации слабо структурируемых процессов в проектировании технических, программных и информационных систем2004 год, доктор технических наук Заболеева-Зотова, Алла Викторовна
Разработка автоматизированного центрального аналитического регистра с автоматическим кодированием наименований понятий1984 год, кандидат экономических наук Литвинова, Валентина Александровна
Методы и алгоритмы адаптивной реконструкции моделей сложных систем2005 год, доктор технических наук Булдакова, Татьяна Ивановна
Введение диссертации (часть автореферата) на тему «Разработка алгоритмических и программных средств извлечения знаний из исследовательских отчетов систем большой размерности»
Общая характеристика работы
Актуальность темы. На современном этапе развития науки и техники все чаще возникают междисциплинарные проблемы, и для их решения привлекается большое число специалистов из различных областей. Это обуславливает потребность развития новых методов работы с сложными системами и системами большой размерности.
При разработке компьютерной дедуктивной системы синтеза и исследования описаний сложных явлений [1], выявилась необходимость разработки нового модуля автоматизированного анализа отчетов пользователя, позволяющего автоматически извлекать знания из систем большой размерности (СБР).
Исследования проблемы извлечения знаний из больших баз данных сосредоточены на развитии новых алгоритмов или усовершенствовании скорости или точности существующих [3]: концепция Фаяда [2], нечеткие ОМ [4], концепция Рейнартса [5].
Современные программные продукты, предназначенные для извлечения знаний [6-8], не подходят для решения вопросов, требующих привлечения большого числа узких специалистов. В первую очередь это вызвано сложностью в их освоении; требованиями к предварительной подготовке данных и большим количеством нерелевантных результатов. Практическая значимость подходов к решению проблем извлечения знаний, необходимость использования новых методов извлечения информации обуславливают актуальность данного диссертационного исследования.
В диссертационной работе показаны основные методы автоматизированного извлечения знаний из систем большой размерности.
Объектом исследования являются системы большой размерности.
Предметом исследования является математическое обеспечение извлечения знаний из исследовательских отчетов на естественном языке.
Цели и задачи исследования
Целью данной работы является исследование и разработка моделей, методов и программных средств автоматизированного извлечения знаний из печатных исследовательских отчетов для системы большой размерности (МААО). Для достижения указанной цели в работе решаются следующие задачи:
• разработать требования к инструментам извлечения знаний из систем большой размерности;
• разработать средства автоматизированного извлечения знаний из естественно-языковых отчетов;
• провести экспериментальную апробацию предложенных алгоритмов и разработанных программных .решений для системы большой размерности.
Основными теоретическими результатами работы, выносимыми на защиту и определяющими научную новизну работы, являются:
1. Методика анализа естественно-языковых печатных отчетов, включает в себя: автоматизированный выбор синонимов, идентификацию системы (анализ наличия системы в отчетах) и реконструкцию системы (анализ зависимостей между элементами системы), использование матрицы значений на неполных информационных системах из отчетов (с целью упрощения систем).
2. Впервые был предложен алгоритм анализа естественно-языковых отчетов, который применяется для извлечения знаний в том числе и на неполных наборах данных.
3. Модуль автоматизированного анализа естественно-языковых печатных исследовательских отчетов системы большой размерности, созданный на основе предложенной методики. Он позволяет получить упрощенную модель системы (если таковая содержится в отчетах), выявить структурные связи между элементами системы и обнаружить менее важные (наиболее слабо связанные с другими) элементы, упростить систему. Практическая значимость подтверждается возможностью построения упрощенной модели представления знаний, содержащихся в исследовательских отчетах. На примере показано:
- как проводить анализ наличия системы знаний (идентификацию системы);
- как делать анализ взаимосвязей внутри системы (реконструкцию системы);
- как производить упрощение системы за счет сокращения наиболее слабо влияющих на поведение системы элементов (редукцию признаков).
Научная значимость результатов исследования заключается в совершенствовании методов обработки экспериментальных естественноязыковых данных с целью выявления параметрически инвариантных связей между ними на основе методов системологии. Спроектированный модуль позволяет:
1. Выявлять подсистемы знаний из естественно-языковых печатных отчетов исследователей, проанализировать возможность объединения их в обобщенную систему и объединять их в систему.
2. На основе знаний из подсистем выявлять взаимосвязи между компонентами объединенной системы.
3. Проводить редукцию признаков в случае неполной системы (в случае если известны не все значения параметров системы).
Благодаря использованию системного подхода, созданный модуль универсален, т.е. его можно использовать для анализа целого ряда системных задач в разных областях знаний (биологии, экологии, медицине, и т.д.), где используются системы больших размерностей.
Апробация работы. Основные научные выводы и результаты работы докладывались на следующих конференциях: «Научно-техническая конференция МИРЭА» 56, 57 и 58 и Международной научно-технической конференции 1гйегта1лс-2009. Материалы работы были опубликованы в 8-и печатных работах (тезисы и материалы международных и российских конференций). Три статьи опубликованы в журналах, рекомендованных ВАК. Имеется 2 акта внедрения результатов исследования в работу компании ООО "Форин-транс" и в работу кафедры МОВС МИРЭА.
Структура и объем работы: Диссертация, объемом в 119 страниц, состоит из введения, трех глав, заключения, списка использованной литературы из 129 наименований, двух приложений.
Похожие диссертационные работы по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК
Математическое и программное обеспечение построения списков семантически близких слов на основе рейтинга вики-текстов2008 год, кандидат технических наук Крижановский, Андрей Анатольевич
Модели, методы и программные средства построения естественно-языкового пользовательского интерфейса к базам данных2018 год, кандидат наук Посевкин, Руслан Владимирович
Метод и алгоритмы интерпретации неполных высказываний пользователя для управления устройствами Интернета вещей на основе онтологического подхода2019 год, кандидат наук Шилин Иван Андреевич
Информационно-поисковая система для разработки программного обеспечения систем автоматизации на основе паттернов проектирования2009 год, кандидат технических наук Бевзов, Алексей Николаевич
Совершенствование методов компьютерной обработки текстовой информации в аспекте задач, связанных с омонимией и синонимией2026 год, кандидат наук Большакова Светлана Анатольевна
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.