Исследование и разработка метода автоматической классификации поведения пользователей Интернет тема диссертации и автореферата по ВАК РФ 05.13.11, кандидат физико-математических наук Щербина, Андрей Андреевич
- Специальность ВАК РФ05.13.11
- Количество страниц 88
Оглавление диссертации кандидат физико-математических наук Щербина, Андрей Андреевич
Введение.
1.1 Аюуальность темы.
1.2 Цель и задачи работы.
1.3 Научная новизна.
1.4 Практическая значимость.
1.5 Апробация работы и публикации.
1.6 Структура работы.
1.7 Краткое содержание работы.
1.7.1 Предметная область.
1.7.2 Предлагаемые решения.
1.7.3 Обсуждение результатов.
Рекомендованный список диссертаций по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК
Адаптивные гипермедиа издания, интегрированные в Интернет2005 год, кандидат технических наук Зайцев, Илья Борисович
Система поиска текстовых документов на основе автоматически формируемого электронного каталога2010 год, кандидат технических наук Борисюк, Федор Владимирович
Метод адаптивной нечеткой кластеризации на основе субъективных оценок для управления качеством производства светотехнических изделий2009 год, кандидат технических наук Мальков, Александр Анатольевич
Модели и методы автоматической классификации текстовых документов2003 год, кандидат технических наук Шабанов, Владислав Игоревич
Управление контентом веб-сайта на основе персонализации данных2011 год, кандидат технических наук Царев, Анатолий Геннадиевич
Введение диссертации (часть автореферата) на тему «Исследование и разработка метода автоматической классификации поведения пользователей Интернет»
1.1 Актуальность темы
На данный момент практически в любой области знания накоплены огромные объёмы данных. Каждый день новые данные поступают в наше распоряжение, и их больше, чем можно просто просмотреть, не говоря уже об эффективном использовании для принятия решений. Очевидно, что такие объемы данных не поддаются эффективной обработке традиционными методами ручного анализа.
Интерес со стороны научно-технических и коммерческих организаций породил в начале 1990-х годов острую необходимость в разработке новых технологий и средств, которые могли бы автоматически переводить обрабатываемые данные в полезную информацию и знания. Технология Data mining (извлечение знаний) - один из результатов этих научных разработок.
На данный момент, отсутствуют полностью автоматизированные методики классификации пользователей Интернет. Существующие решения требует достаточно больших затрат времени со стороны эксперта на обучение системы, её настройку или контроль. Рост числа пользователей, объёма накопленных данных и экономического значения Интернет требует появления, независимых от экспертов, программных средств для поиска информации и получения данных об использовании определенных ресурсов.
В данной работе предлагается метод автоматической классификации пользователей Интернет, основанный на расстоянии редактирования. Создан прототип системы, обеспечивающий полную автоматизацию процесса классификации от очистки данных до контроля качества полученной классификации.
Похожие диссертационные работы по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК
Модели, алгоритмы и программные средства бикластеризации на основе замкнутых множеств2010 год, кандидат технических наук Игнатов, Дмитрий Игоревич
Интеллектуальные методы организации архивов технической документации научно-производственного объединения2012 год, кандидат технических наук Радионова, Юлия Александровна
Разработка и исследование алгоритмических, программных и архитектурных решений для проектирования систем тематической категоризации Интернет-ресурсов в телекоммуникационных сетях2008 год, кандидат технических наук Свечников, Сергей Владимирович
Адаптивное управление настройками в контуре аспектно-ориентированной архитектуры средств обучения2010 год, кандидат физико-математических наук Сай Кхин Аунг Тинт
Разработка методов и инструментальных средств повышения пертинентности поиска в современных информационных средах2010 год, кандидат технических наук Терехов, Алексей Андреевич
Заключение диссертации по теме «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», Щербина, Андрей Андреевич
5 Выводы
В ходе работы получены более чем 200 разбиений данных. В ходе тестирования были выявлены следующие закономерности: результаты кластеризации (количество и состав кластеров) существенно зависят от метрики и алгоритма; для определения оптимального разбиения эффективно применение предлагаемого метода подсчёта ассоциативных правил; предложенный индекс, основанный на подсчете ассоциативных правил, позволяет однозначно определить оптимальное количество кластеров или значения входных параметров метода.
Оптимальные результаты демонстрирует применение предлагаемой метрики, основанной на структуре каталогов веб-сайта.
В рамках работы получены следующие результаты: разработан и апробирован метод кластеризации сессий пользовательского доступа в Интернет; разработан и апробирован метод автоматической верификации результатов кластеризации; создана программная система, обеспечиавающая кластеризацию сессий пользовательского доступа на основании журнала вебсервера.
Основные преимущества предложенного метода кластеризации состоят в следующем: применение метода не требует предварительной индексации или обработки самих страниц сайта; предложенное расстояние обеспечивает корректное сравнение сессий пользовательского доступа за счёт использования данных по последовательности посещенных страниц и размещения страниц.
Основные преимущества предложенного метода верификации результатов кластеризации состоят в следующем: предложенный индекс отображает семантические отношения, характерные для каждого из кластеров; предложенный индекс определяет качество разбиения сессий в соответствие с их внутренней логикой.
Все предлагаемые методы были реализованы в программном комплексе, обеспечивающем кластеризацию пользовательских сессий. Можно отметить следующие возможные пути развития данной работы: интеграция прототипа в систему динамического изменения наполнения страниц; организация параллельного вычисления и обработки данных о поведение пользователей; улучшение методики поиска ассоциативных правил. Поиск ассоциативных правил может вестись для более длинных последовательностей в три-четыре и более страниц. В рамках данной работы, подсчитывались последовательности из двух страниц, которые могут встречаться в любой точке сессии; на основании найденных наиболее популярных последовательностей возможна генерация портретов кластеров (какие последовательности характеризуют данный кластер); внедрение самообучающейся методики определения весов операций замены для оптимизации результатов кластеризации для каждого набора данных.
2 Agrawal et al, 1993
3 Agrawal et al, 1994
4 Agrawal et al, 1995
5 Barford et al 1998
Список литературы диссертационного исследования кандидат физико-математических наук Щербина, Андрей Андреевич, 2007 год
1. Agrawal, J.C. Shafer: "Parallel Mining of
2. Association Rules", IEEE Transactions on Knowledge and Data Engineering, Vul. 8, No. 6, December 1996.
3. Dieberger and Lonnqvist, 200017 Directive 95/46/EC18 Ester et al, 1996
4. Ed Huai-hsin Chi, Adam Rosien, Jeffrey Heer: Lumberjack: Intelligent Discovery and Analysis of Web User Traffic Composition. WEBKDD 2002: 1-16http://www.w3.org/Daemon/User/Config/Loggin g.html
5. U.M. Fayyad, G. Piatetsky-Shapiro, P. Smyth, and R. Uthurusamy, Advances in Knowledge Discovery and Data Mining, AMI Press/MIT Press, 1996.
6. Ginsburg, Fenstermacher, K. D. and Ginsburg, M. 2003.
7. Koschke and Eisenbarth, 200038 Krane and Langdon, 200539 Levene and Loizou, 1999
8. Heer, J. and Chi, E.H. Mining the Structure of User Activity using Cluster Stability, in Proceedings of the Workshop on Web Analytics, SIAM Conference on Data Mining (Arlington VA, April 2002).
9. Hong, J.I., J. Heer, S. Waterson, and J.A. Landay, WebQuilt: A Proxy-based Approach to Remote Web Usability Testing, ACM Transactions on Information Systems, 2001, 19(3): pp. 263285.
10. Joshi, A., Joshi, K., Krishnapuram, R., On mining Web Access Logs, in Proceedings of the ACM-SIGMOD Workshop on Research Issues in Data Mining and Knowledge Discovery, 2000, pp. 6369
11. Kerkhofs J., Vanhoof K., Pannemans D.- Web usage mining on proxy servers: a case study.-In: Proceedings of Data Mining for Marketing Applications Workshop at ECML/PKDD 2001, September 3-7 2001, Freiburg (Germany), s.l., 2001
12. Y. S. Maarek, Z. Ben Shaul. «Automatically Organizing Bookmarks per Contents.» In proc. of Fifth International World Wide Web Conference 1996, Paris, France
13. Pazzani, M., Muramatsu, J. & Billsus, D., Syskill & webert: Identifying interesting web sites, in 'AAI Spring Symposium on Machine Learning in Information Access'. Lecture Notes in Computer Science 11,1996
14. Pirolli, P. L. and Pitkow, J. E. Distributions of surfers' paths through the World Wide Web: Empirical characterizations. World Wide Web 2, 1-2 (Jan. 1999), 29-45.
15. James E. Pitkow, Krishna A. Bharat. «Webviz: A Tool For World-Wide Web Access Log Analysis.» Graphics. 1994.
16. Alexandrin Popescul, Lyle Ungar, David Pennock, Steve Lawrence. «Probabilistic Models for Unified Collaborative and Content-Based
17. Shahabi, Banaei-Kashani, 200161 Spiliopoulou et al, 199962 Wang and Zaiane, 200263 Wang et al, 199764 Wang et al, 200565 Weiss et al, 199666 Xie and Beni, 199167 Zaiane et al 1998).
18. Santosh K. Rangarajan, Vir V. Phoha, Kiran S. Balagani, Rastko R.Selmic, S.S. Iyengar. "Adaptive Neural Network Clustering of Web Users," Computer, vol. 37, no. 4, pp. 34-40, April, 2004
19. T.A. Runkler and J.C. Bezdek, "Web mining with relational clustering.", International Journal of Approximate Reasoning, Vol. 32 (2-3), 2003, pp. 217-236
20. Myra Spiliopoulou, Carsten Pohle, Lukas Faulstich. «Improving the Effectiveness of a Web Site with Web Usage Mining.» WEBKDD, crp. 142-162, 1999.
21. Wang, W. and Zaiane, 0. R. 2002. Clustering Web Sessions by Sequence Alignment. In Proceedings of the 13th international Workshop on Database and Expert Systems Applications (September 02 06, 2002). DEXA. IEEE Computer Society, Washington, DC, 394-398.
22. X. L. Xie and G. A. Beni, "A validity measure for fuzzy clustering," IEEE Trans, on Pattern Analysis and Machine Intelligence, vol. 3, no. 8, pp. 841 846, 1991.
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.