Исследование и разработка метода автоматической классификации поведения пользователей Интернет тема диссертации и автореферата по ВАК РФ 05.13.11, кандидат физико-математических наук Щербина, Андрей Андреевич

  • Щербина, Андрей Андреевич
  • кандидат физико-математических науккандидат физико-математических наук
  • 2007, Москва
  • Специальность ВАК РФ05.13.11
  • Количество страниц 88
Щербина, Андрей Андреевич. Исследование и разработка метода автоматической классификации поведения пользователей Интернет: дис. кандидат физико-математических наук: 05.13.11 - Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей. Москва. 2007. 88 с.

Оглавление диссертации кандидат физико-математических наук Щербина, Андрей Андреевич

Введение.

1.1 Аюуальность темы.

1.2 Цель и задачи работы.

1.3 Научная новизна.

1.4 Практическая значимость.

1.5 Апробация работы и публикации.

1.6 Структура работы.

1.7 Краткое содержание работы.

1.7.1 Предметная область.

1.7.2 Предлагаемые решения.

1.7.3 Обсуждение результатов.

Рекомендованный список диссертаций по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК

Введение диссертации (часть автореферата) на тему «Исследование и разработка метода автоматической классификации поведения пользователей Интернет»

1.1 Актуальность темы

На данный момент практически в любой области знания накоплены огромные объёмы данных. Каждый день новые данные поступают в наше распоряжение, и их больше, чем можно просто просмотреть, не говоря уже об эффективном использовании для принятия решений. Очевидно, что такие объемы данных не поддаются эффективной обработке традиционными методами ручного анализа.

Интерес со стороны научно-технических и коммерческих организаций породил в начале 1990-х годов острую необходимость в разработке новых технологий и средств, которые могли бы автоматически переводить обрабатываемые данные в полезную информацию и знания. Технология Data mining (извлечение знаний) - один из результатов этих научных разработок.

На данный момент, отсутствуют полностью автоматизированные методики классификации пользователей Интернет. Существующие решения требует достаточно больших затрат времени со стороны эксперта на обучение системы, её настройку или контроль. Рост числа пользователей, объёма накопленных данных и экономического значения Интернет требует появления, независимых от экспертов, программных средств для поиска информации и получения данных об использовании определенных ресурсов.

В данной работе предлагается метод автоматической классификации пользователей Интернет, основанный на расстоянии редактирования. Создан прототип системы, обеспечивающий полную автоматизацию процесса классификации от очистки данных до контроля качества полученной классификации.

Похожие диссертационные работы по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК

Заключение диссертации по теме «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», Щербина, Андрей Андреевич

5 Выводы

В ходе работы получены более чем 200 разбиений данных. В ходе тестирования были выявлены следующие закономерности: результаты кластеризации (количество и состав кластеров) существенно зависят от метрики и алгоритма; для определения оптимального разбиения эффективно применение предлагаемого метода подсчёта ассоциативных правил; предложенный индекс, основанный на подсчете ассоциативных правил, позволяет однозначно определить оптимальное количество кластеров или значения входных параметров метода.

Оптимальные результаты демонстрирует применение предлагаемой метрики, основанной на структуре каталогов веб-сайта.

В рамках работы получены следующие результаты: разработан и апробирован метод кластеризации сессий пользовательского доступа в Интернет; разработан и апробирован метод автоматической верификации результатов кластеризации; создана программная система, обеспечиавающая кластеризацию сессий пользовательского доступа на основании журнала вебсервера.

Основные преимущества предложенного метода кластеризации состоят в следующем: применение метода не требует предварительной индексации или обработки самих страниц сайта; предложенное расстояние обеспечивает корректное сравнение сессий пользовательского доступа за счёт использования данных по последовательности посещенных страниц и размещения страниц.

Основные преимущества предложенного метода верификации результатов кластеризации состоят в следующем: предложенный индекс отображает семантические отношения, характерные для каждого из кластеров; предложенный индекс определяет качество разбиения сессий в соответствие с их внутренней логикой.

Все предлагаемые методы были реализованы в программном комплексе, обеспечивающем кластеризацию пользовательских сессий. Можно отметить следующие возможные пути развития данной работы: интеграция прототипа в систему динамического изменения наполнения страниц; организация параллельного вычисления и обработки данных о поведение пользователей; улучшение методики поиска ассоциативных правил. Поиск ассоциативных правил может вестись для более длинных последовательностей в три-четыре и более страниц. В рамках данной работы, подсчитывались последовательности из двух страниц, которые могут встречаться в любой точке сессии; на основании найденных наиболее популярных последовательностей возможна генерация портретов кластеров (какие последовательности характеризуют данный кластер); внедрение самообучающейся методики определения весов операций замены для оптимизации результатов кластеризации для каждого набора данных.

2 Agrawal et al, 1993

3 Agrawal et al, 1994

4 Agrawal et al, 1995

5 Barford et al 1998

Список литературы диссертационного исследования кандидат физико-математических наук Щербина, Андрей Андреевич, 2007 год

1. Agrawal, J.C. Shafer: "Parallel Mining of

2. Association Rules", IEEE Transactions on Knowledge and Data Engineering, Vul. 8, No. 6, December 1996.

3. Dieberger and Lonnqvist, 200017 Directive 95/46/EC18 Ester et al, 1996

4. Ed Huai-hsin Chi, Adam Rosien, Jeffrey Heer: Lumberjack: Intelligent Discovery and Analysis of Web User Traffic Composition. WEBKDD 2002: 1-16http://www.w3.org/Daemon/User/Config/Loggin g.html

5. U.M. Fayyad, G. Piatetsky-Shapiro, P. Smyth, and R. Uthurusamy, Advances in Knowledge Discovery and Data Mining, AMI Press/MIT Press, 1996.

6. Ginsburg, Fenstermacher, K. D. and Ginsburg, M. 2003.

7. Koschke and Eisenbarth, 200038 Krane and Langdon, 200539 Levene and Loizou, 1999

8. Heer, J. and Chi, E.H. Mining the Structure of User Activity using Cluster Stability, in Proceedings of the Workshop on Web Analytics, SIAM Conference on Data Mining (Arlington VA, April 2002).

9. Hong, J.I., J. Heer, S. Waterson, and J.A. Landay, WebQuilt: A Proxy-based Approach to Remote Web Usability Testing, ACM Transactions on Information Systems, 2001, 19(3): pp. 263285.

10. Joshi, A., Joshi, K., Krishnapuram, R., On mining Web Access Logs, in Proceedings of the ACM-SIGMOD Workshop on Research Issues in Data Mining and Knowledge Discovery, 2000, pp. 6369

11. Kerkhofs J., Vanhoof K., Pannemans D.- Web usage mining on proxy servers: a case study.-In: Proceedings of Data Mining for Marketing Applications Workshop at ECML/PKDD 2001, September 3-7 2001, Freiburg (Germany), s.l., 2001

12. Y. S. Maarek, Z. Ben Shaul. «Automatically Organizing Bookmarks per Contents.» In proc. of Fifth International World Wide Web Conference 1996, Paris, France

13. Pazzani, M., Muramatsu, J. & Billsus, D., Syskill & webert: Identifying interesting web sites, in 'AAI Spring Symposium on Machine Learning in Information Access'. Lecture Notes in Computer Science 11,1996

14. Pirolli, P. L. and Pitkow, J. E. Distributions of surfers' paths through the World Wide Web: Empirical characterizations. World Wide Web 2, 1-2 (Jan. 1999), 29-45.

15. James E. Pitkow, Krishna A. Bharat. «Webviz: A Tool For World-Wide Web Access Log Analysis.» Graphics. 1994.

16. Alexandrin Popescul, Lyle Ungar, David Pennock, Steve Lawrence. «Probabilistic Models for Unified Collaborative and Content-Based

17. Shahabi, Banaei-Kashani, 200161 Spiliopoulou et al, 199962 Wang and Zaiane, 200263 Wang et al, 199764 Wang et al, 200565 Weiss et al, 199666 Xie and Beni, 199167 Zaiane et al 1998).

18. Santosh K. Rangarajan, Vir V. Phoha, Kiran S. Balagani, Rastko R.Selmic, S.S. Iyengar. "Adaptive Neural Network Clustering of Web Users," Computer, vol. 37, no. 4, pp. 34-40, April, 2004

19. T.A. Runkler and J.C. Bezdek, "Web mining with relational clustering.", International Journal of Approximate Reasoning, Vol. 32 (2-3), 2003, pp. 217-236

20. Myra Spiliopoulou, Carsten Pohle, Lukas Faulstich. «Improving the Effectiveness of a Web Site with Web Usage Mining.» WEBKDD, crp. 142-162, 1999.

21. Wang, W. and Zaiane, 0. R. 2002. Clustering Web Sessions by Sequence Alignment. In Proceedings of the 13th international Workshop on Database and Expert Systems Applications (September 02 06, 2002). DEXA. IEEE Computer Society, Washington, DC, 394-398.

22. X. L. Xie and G. A. Beni, "A validity measure for fuzzy clustering," IEEE Trans, on Pattern Analysis and Machine Intelligence, vol. 3, no. 8, pp. 841 846, 1991.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.