Высокоуровневые методы и алгоритмы классификации интеграционных взаимосвязей структур данных тема диссертации и автореферата по ВАК РФ 05.13.11, кандидат технических наук Юмагужин, Николай Валерьевич

  • Юмагужин, Николай Валерьевич
  • кандидат технических науккандидат технических наук
  • 2008, Переславль-Залесский
  • Специальность ВАК РФ05.13.11
  • Количество страниц 135
Юмагужин, Николай Валерьевич. Высокоуровневые методы и алгоритмы классификации интеграционных взаимосвязей структур данных: дис. кандидат технических наук: 05.13.11 - Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей. Переславль-Залесский. 2008. 135 с.

Оглавление диссертации кандидат технических наук Юмагужин, Николай Валерьевич

1. Введение.

1.1. Постановка задачи.

1.2. Содержание диссертации.

1.3. Актуальность и новизна.

1.4. Методы исследования.

2. Теоретическая работа.

2.1. Обзор.

2.2. Классификация взаимосвязей между схемами баз данных.

2.2.1. Примеры взаимосвязей.

2.2.2. Классификация взаимосвязей между доменами.

2.2.3. Классификация взаимосвязей схем данных.

2.3. Способы сопоставления записей.

2.3.1. Алгоритм Смита-Ватермана Р$н>.

2.3.2. Оптимизированный алгоритм Р8\\/о.

2.3.3. Обобщенный алгоритм РБюд.

2.4. Способы устранения дубликатов.

2.4.1. Полное устранение дублирования.

2.4.2. Устранение дубликатов с сохранением истории.

2.4.3. Пометка дубликатов в БД.

2.4.4. Хранение информации о дублировании в НСИ.

2.5. Организационные вопросы.

2.5.1. Разрешение организационных конфликтов.

3. Экспериментальная работа.

3.1. Пример 1: Задача учета ЮЛ и ФЛ.".

3.1.1. Описание предметной области и проекта.

3.1.2. Интеграция банковской и контрольной систем.

3.1.3. Интеграция регистрирующей и контрольной систем.

3.1.4. Устранение дублирования.

3.2. Пример 2: Задача централизованных закупок.

3.2.1. Описание предметной области и проекта.

3.2.2. Анализ процесса планирования закупок.

3.2.3. Формирование справочника-прейскуранта.

3.2.4. Бизнес-процесс формирования плана закупок.

3.2.5. Задача расчета цен.

Рекомендованный список диссертаций по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК

Введение диссертации (часть автореферата) на тему «Высокоуровневые методы и алгоритмы классификации интеграционных взаимосвязей структур данных»

Последние годы усиливается интерес к исследованиям в областях интеграции баз данных, очистки данных и извлечения знаний. Такой интерес вызван экспоненциальном ростом объемов информации обрабатываемых компьютерными системами и доступной через интернет. С ростом количества источников информации увеличивается разнообразие форматов данных, и ухудшается качество представляемой информации. Разнообразие форматов приводит к проблемам при переносе данных между системами, а также при поиске одних и тех же объектов в различных системах. Ухудшениение качества данных связано с возникновением дубликатов, нарушением логических связей и ссылочной целостности, орфографическими ошибками, абревиатурами, недопустимыми значениями и другими проблемами.

Целью данной работы является построение предметно-независимой классификации взаимосвязей между различными схемами данных, а также разработка технологии интеграции баз данных на основе построенной класификации. В данной задаче рассматривается две или более баз данных, которые могут иметь различную архитектуру, систему кодирования и типы данных, но должны содержать однотипные или взаимосвязанные визические сущности. Под интеграцией понимается возможность:

1. Делать запросы, для обработки которых требуется информация из нескольких баз;

2. Конвертировать данные для передачи между базами;

3. Синхронизировать однотипные справочные данные между интегрируемыми базами.

Похожие диссертационные работы по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК

Заключение диссертации по теме «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», Юмагужин, Николай Валерьевич

4. Заключение

Исследования в области сопоставления схем данных и сопоставления записей (поиска и устранения дубликатов) имеют большое практическое значение. Приведенная в данной работе классификация взаимосвязей в схемах данных может применяться в широком спектре проектов по интеграции информационных систем, на этапе анализа предметной области и формирования проектных решений. В соответствии с технологией, описанной в данной работе, разработчикам совместно со специалистами в предметной области необходимо определить взаимосвязи между отдельными атрибутами в интегрируемых системах и наборы атрибутов, которые являются потенциальными ключами. Это достаточно простая процедура, суть которой не трудно объяснить специалисту предметной области далекому от информационных технологий. Преимущество такого подхода перед классическим описанием алгоритмов переноса данных заключается не только в простоте понимания неподготовленным человеком, но и в снижении риска скрытых ошибок. При описании бизнес-процесса, сценария или алгоритма переноса данных очень легко пропустить некоторые альтернативные пути или непредвиденные события, которые могут повлиять на процесс. При описании взаимосвязей между схемами данных такие ошибки практически исключены. Кроме того, в данной работе приводятся строгие доказательства возможности или не возможности применения определенных операций над данными в зависимости от указанных взаимосвязей. То есть уже в самом начале этапа анализа можно делать гарантированные выводы: понадобится или нет участие пользователя в переносе данных, возможно ли появление дубликатов при перносе данных, будет ли возможность делать запросы, использующие информацию из нескольких источников данных.

4.1. Планируемое продолжение работы

В продолжение данной работы планируется разработать схему метаданных для описания структур интегрируемых баз данных. Схема должна быть основана на классификации конфликтов из главы 2. Далее планируется разработать приложение для предметно-независимой интеграции схем данных и автоматизированного формирования таблиц соответствия нормативно справочной информации. После этого возможно создание прототипа, предназначенного для интеграции двух наборов таблиц из разных источников данных, описывающих одну сущность. Прототип может работать по следующему сценарию: Начальные условия:

1. Прототип установлен на рабочей станции, с которой есть доступ к двум различным источникам данных

2. Источники данных доступны по протоколу SOAP Основной сценарий:

1. Пользователь указывает путь к источникам данных А и В.

2. Прототип загружает структуры и генерирует метаданные, описывающие найденные схемы данных.

3. Пользователь указывает взаимосвязи между таблицами и атрибутами обоих источников, определяет типы конфликтов и вводит конвертирующие функции.

4. Прототип генерирует таблицу НСИ Конечные условия:

Получена таблица соответствия между кодами записей в указанных базах данных

Список литературы диссертационного исследования кандидат технических наук Юмагужин, Николай Валерьевич, 2008 год

1. Rahm, Bernstein, 2001. E. Rahm, P.A. Bernstein. "A survey of Approaches to Automatic Schema Matching". VLDB Journal, 10(4):334-350, 2001

2. Roth at al., 2006. M. Roth, M.A. Hernandez, P. Coulthard, L. Yan, L. Popa, H.C.-T. Ho, and C.C. Salter "XML Mapping Technology: Making Connections in an XML-centric World". IBM Sys. J. (45,2), 389-409, 2006.

3. Bernstein, Melnik, 2007. Bernstein, P.A., Melnik, S., "Model Management 2.0—Manipulating Richer Mappings," Proc. SIGMOD, 1-12, 2007.

4. Ram, Park, 2004. Ram, S., Park, J. "Semantic Conflict Resolution Ontology (SCROL): An Ontology for Detecting and Resolving Data and Schema-Level Semantic Conflict", TKDE, 16(2), 189-202, 2004

5. Kim et al., 1993. W. Kim, I. Choi, S. Gala, and M. Scheevel. On resolving schematic heterogeneity in multidatabase systems. Distributed and Parallel Databases, 1(3):251-279, July 1993.

6. Madhavaram et al., 1996. M. Madhavaram, D. L. Ali, and Ming Zhou. Integrating heterogeneous distributed database systems. Computers & Industrial Engineering, 31 (l-2):315-318, October 1996.

7. Song et al., 1996. W. W. Song, P. Johannesson, and J. A. Bubenko Jr. Semantic similarity relations and computation in schema integration. Data & Knowledge Engineering, 19(l):65-97, May 1996.

8. Newcombe, 1988. Howard B. Newcombe. Handbook of record linkage: methods for health and statistical studies, administration, and business. Oxford University Press, 1988.

9. Hernandez and Stolfo, 1995. M. Hernandez and S. Stolfo. The merge/purge problem for large databases. In Proceedings of the ACM SIGMOD International Conference on Management of Data, pages 127-138, May 1995.

10. Левенштейн, 1966. В.И. Левенштейн. Двоичные коды, обеспечивающие синхронизацию и исправление ошибок. Тезисы кратких научных сообщений Международного конгресса математиков, Секция 13, Москва, 1996, 24.

11. Ямпольский, 1973. М.И. Ямпольский, А.Е. Горбоносов. Поиск дублирующих документов. Научно-техническая информация, серия 1, №8, 1973.

12. Galil and Giancarlo, 1988. Z. Galil and R. Giancarlo. Data structures and algorithms for approximate string matching. Journal of Complexity, 4:33-72, 1988.

13. Chang and Lampe, 1992. W. I. Chang and J. Lampe. Theoretical and empirical comparisons of approximate string matching algorithms. In CPM: 3rd Symposium on Combinatorial Pattern Matching, pages 175-84, 1992.

14. Du and Chang, 1994. M.-W. Du and S. C. Chang. Approach to designing very fast approximate string matching algorithms. IEEE Transactions on Knowledge and Data Engineering, 6(4):620-633, August 1994.

15. Smith and Waterman, 1981. T. F. Smith and M. S. Waterman. Identification of common molecular subsequences. Journal of Molecular Biology, 147:195-197, 1981.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.