Модели и алгоритмы классификации веб-контента на основе теоретико-игрового подхода тема диссертации и автореферата по ВАК РФ 05.13.01, кандидат наук Супруненко, Александр Владимирович

  • Супруненко, Александр Владимирович
  • кандидат науккандидат наук
  • 2017, Нижний Новгород
  • Специальность ВАК РФ05.13.01
  • Количество страниц 125
Супруненко, Александр Владимирович. Модели и алгоритмы классификации веб-контента на основе теоретико-игрового подхода: дис. кандидат наук: 05.13.01 - Системный анализ, управление и обработка информации (по отраслям). Нижний Новгород. 2017. 125 с.

Оглавление диссертации кандидат наук Супруненко, Александр Владимирович

СОДЕРЖАНИЕ

Введение

Глава 1. Состояние проблемы и обзор существующих методов классификации и фильтрации веб-контента. Постановка задачи

1.1. Методы классификации веб-контента

1.2. Способы хранения информации о классифицированных источниках веб-контента

1.3. Методы фильтрации веб-контента

1.4. Постановка задачи

Выводы по Главе 1

Глава 2. Базовая модель сети доверия для классификации веб-контента

2.1. Сеть доверия для классификации веб-контента

2.2. Обоснование целесообразности использования теории игр для формализации взаимодействия агентов сети доверия. Необходимые сведения из теории игр

2.3. Теоретико-игровая модель сети доверия

Выводы по Главе 2

Глава 3. Разработка алгоритмов классификации, фильтрации источников веб-контента и определения устойчивости равновесных состояний

3.1. Алгоритм А1 классификации веб-контента

3.2. Алгоритм А2 фильтрации веб-контента

3.3. Алгоритмы А3, А4 для определения устойчивости равновесных состояний теоретико-игровой модели

Выводы по Главе 3

Глава 4. Практическая реализация

4.1. Система классификация и фильтрации веб-контента «Этикум»

4.2. Сценарий работы системы

4.3. Возможности дальнейшего развития теоретико-игрового подхода в сфере

информационно-телекоммуникационных систем

Выводы по Главе 4

Заключение

Список литературы

Список использованных аббревиатур и сокращений

Приложения

Приложение 1. Акты о внедрении

Приложение 2. Патенты и свидетельства о регистрации программ для ЭВМ . 121 Приложение 3. Диплом победителя конкурса «ГТ-Уо1§а»

Рекомендованный список диссертаций по специальности «Системный анализ, управление и обработка информации (по отраслям)», 05.13.01 шифр ВАК

Введение диссертации (часть автореферата) на тему «Модели и алгоритмы классификации веб-контента на основе теоретико-игрового подхода»

ВВЕДЕНИЕ

В настоящее время интернет является неотъемлемой частью деятельности человека. В связи с активным развитием мобильных устройств с доступом в сеть, всё чаще посетителями интернета становятся дети. По данным портала Internet Live Stats, за последние 10 лет количество интернет-пользователей в мире увеличилось в 3 раза и превысило 3 млрд.1, а количество интернет-сайтов в сети достигло 1 млрд.2 Обычно текстовые и мультимедийные данные сайтов — веб-контент — определяются их владельцами или администраторами, не рецензируется и не подвергается цензуре, в том числе законодательной. В связи с этим актуальной является проблема ограничения доступа к ресурсам, содержащим контент, не предназначенный для определённых категорий населения.

Для решения данной проблемы используется специализированное программное обеспечение, осуществляющее фильтрацию доступа к источникам веб-контента. В основе большинства таких программных комплексов лежит информация о принадлежности источников веб-контента к тому или иному классу. От качества этой информации зависит эффективность фильтрации, поэтому задача классификации веб-контента является актуальной для развития программных решений фильтрации интернет-трафика.

В существующих программных реализациях чаще всего используются базы данных с информацией о классифицированных источниках веб-контента, администрируемые компанией-разработчиком программного обеспечения или администратором. Альтернативным подходом к решению задачи классификации источников веб-контента является наполнение базы данных силами интернет-сообщества, объединённого в сеть доверия. Исследованиями в области построения сетей доверия занимались В. Н. Бурков, Д. А. Новиков, М. В. Губко, А. Г.

1 Number of Internet Users — Internet Live Stats — Режим доступа: http://www.internetlivestats.com/internet-users/

2 Total number of Websites — Internet Live Stats — Режим доступа: http://www.internetlivestats.com/total-number-of-websites/

Чхартишвили, Д. А. Губанов, J. Carter, J. Golbeck, J. Tirole, M. Schillo, G. Zacharia и другие отечественные и зарубежные исследователи.

Один из способов описания и формализации сетей доверия заключается в использовании игрового подхода. Исследованиями в области теории игр занимались Н. Ш. Кремер, Л. А. Петросян, Н. А. Зенкевич, Р. Г. Стронгин, А. П. Горяшко, J. von Neumann, J. Nash, R. Gradwohl, N. Nisan и другие отечественные и зарубежные исследователи. Использование элементов теории игр для описания взаимодействия агентов в сетях доверия позволяет количественно оценить мотивацию агентов сети и определить устойчивость результата её работы. Таким образом, исследование сетей доверия на основе теоретико-игровых моделей является актуальной задачей и необходимо для эффективного построения систем классификации.

Объектом исследования являются текстовые и мультимедийные данные сайтов — веб-контент.

Предметом исследования являются модели и алгоритмы классификации веб-контента.

Целю работы является разработка и исследование теоретико-игровой модели сети доверия для реализации системы классификации веб-контента, позволяющей повысить точность определения принадлежности его источников к определённому классу.

Задачи работы

Для достижения поставленной цели требуется решение следующих задач:

— анализ научных публикаций по теме исследования;

— разработка и исследование теоретико-игровой модели сети доверия;

— разработка алгоритма классификации веб-контента в рамках предложенной теоретико-игровой модели сети доверия;

— разработка и исследование алгоритма для определения устойчивости равновесных состояний;

— программная реализация алгоритмов классификации, фильтрации веб-контента и определения устойчивости равновесных состояний;

— применение полученных научных результатов на практике.

Методы исследования

Для решения задач применялись методы системного анализа, математического моделирования, исследования операций и теории игр. Для исследования устойчивости равновесных состояний использовались методы эволюционно-генетического моделирования.

Научная новизна работы состоит в следующем:

1. Обоснована целесообразность использования теории игр для формализации взаимодействия агентов сети доверия, что позволило построить теоретико-игровую модель.

2. В рамках предложенной теоретико-игровой модели:

• разработан новый алгоритм классификации веб-контента, позволяющий повысить точность определения принадлежности его источников к определённому классу за счёт естественной мотивации игроков к увеличению их выигрыша.

• разработан и исследован алгоритм для определения устойчивости равновесных состояний, основанный на эволюционно-генетическом моделировании, позволяющий уменьшить использование вычислительных ресурсов.

Соответствие диссертации паспорту специальности

В диссертации теоретические основы игрового подхода применены и развиты при создании теоретико-игровой модели сети доверия. Предложен новый алгоритм классификации источников веб-контента, а также алгоритмы для определения устойчивости равновесных состояний (области исследования 1, 2, 4, 5 специальности 05.13.01).

Обоснованность и достоверность результатов диссертационной работы обеспечены корректным использованием математических методов моделирования и подтверждены результатами экспериментальных исследований на реальных примерах.

Практическая ценность работы

Полученные в ходе написания диссертации теоретические и практические результаты наглядно демонстрируют возможность использования сетей доверия для решения задач классификации; показывают целесообразность использования игрового подхода для описания взаимодействия агентов сети доверия; содержат алгоритмы для определения устойчивости равновесия в предложенной теоретико-игровой модели, позволяющие оценить эффективность данной модели; позволяют применять сети доверия для решения задач классификации и коллективного принятия решений в интеллектуальных автоматизированных и экспертных системах.

Разработанной системой классификации и фильтрации контента «Этикум» пользуются для безопасного доступа в интернет в трёх общеобразовательных школах Нижнего Новгорода.

Реализация результатов работы

Разработанные алгоритмы применяются в ООО «Сетевые экспертные системы» при реализации системы фильтрации веб-контента «Этикум». Проект «Распределённая система фильтрации контента «Этикум» является победителем конкурса «IT-Volga» в номинации «Стратегические компьютерные технологии и программное обеспечение», организованного Фондом «Сколково» и Нижегородским инновационным бизнес-инкубатором.

Результаты работы используются в учебном процессе Нижегородского государственного технического университета им. Р. Е. Алексеева при подготовке бакалавров и магистров по программе «Диагностические и информационно-поисковые системы» направления 09.04.01 «Информатика и вычислительная техника». Система «Этикум» внедрена и используется в ряде учреждений среднего

образования Нижнего Новгорода. Использование подтверждено актами о внедрении.

Полученные новые результаты защищены патентами РФ, разработанный программный комплекс зарегистрирован в Реестре программ для ЭВМ (Патенты на ПМ №№ 117657, 119908, Свидетельство о государственной регистрации программы для ЭВМ № 2009613799).

Апробация полученных результатов

Основные положения диссертации представлялись и докладывались на следующих научных конференциях:

— Международных научно-технических конференциях «Информационные системы и технологии (ИСТ-2010, ИСТ-2011, ИСТ-2017)», Нижний Новгород.

— Международных молодёжных конференциях «Будущее технической науки», Н. Новгород, 2010 г., 2011 г.

— Международной научно-практической интернет-конференции «Актуальные проблемы методики обучения информатике в современной школе», Москва, 2016 г.

— XX Международной научно-практической конференции «Системный анализ в проектировании и управлении», Санкт-Петербург, 2016 г.

— Всероссийской научно-методической конференции «Инновационные технологии в образовательной деятельности», Н. Новгород, 2017 г.

Основные положения, выносимые на защиту

1. Теоретико-игровая модель сети доверия;

2. Алгоритмы классификации и фильтрации интернет-ресурсов и их программная реализация;

3. Алгоритмы для определения устойчивости равновесных состояний и их программная реализация;

4. Результаты экспериментальных исследований.

Публикация результатов

По теме диссертации опубликовано 1 6 работ, в том числе 3 работы в рецензируемых научных изданиях, рекомендуемых ВАК, 2 патента РФ на полезные модели, 1 евразийская заявка на изобретение, 1 свидетельство о государственной регистрации программы для ЭВМ.

Структура и объём работы

Диссертационная работа состоит из введения, четырёх глав, заключения, библиографического списка, списка сокращений и приложений. Общий объём работы 125 страниц текста, содержащего 30 рисунков и 11 таблиц. Список литературы содержит 106 наименований.

В первой главе (Обзор существующих методов классификации и фильтрации веб-контента. Постановка задачи) приведён обзор существующих методов классификации и фильтрации мультимедийных данных с указанием их достоинств и недостатков. Описаны особенности реализации методов классификации текстовых и мультимедийных данных в существующих системах классификации и фильтрации веб-контента. Обоснована необходимость разработки модели и алгоритмов классификации веб-контента, отмечены свойства веб-контента, затрудняющие процесс классификации при использовании существующих методов. Отмечена недостаточная эффективность описанных методов классификации при анализе мультимедийных данных различного типа. Сформулирована постановка задачи, задано направление исследований.

Во второй главе (Базовая модель сети доверия) приведено описание разработанной модели сети доверия, представляющей собой онлайн-сообщество агентов (пользователей и автоматизированных систем). Мнение каждого агента, участвующего в процессе классификации, учитывается пропорционально значению его репутации. Предложенная модель сети доверия не позволяет оценить устойчивость работы сети, зависящую от рационального поведения агентов. В связи с этим обоснована целесообразность использования теоретико-игрового подхода для формализации взаимодействия между агентами сети доверия и

определения устойчивости. Предложена базовая теоретико-игровая модель сети доверия и описаны её свойства.

В третьей главе (Разработка алгоритмов классификации, фильтрации веб-контента и определения устойчивости равновесных состояний) рассматриваются разработанные алгоритмы классификации и фильтрации веб-контента. Предложены алгоритмы для определения устойчивости равновесных состояний. Представлены результаты проведённых экспериментов по определению устойчивости равновесных состояний разработанной теоретико-игровой модели сети доверия.

Алгоритм А1 классификации веб-контента описывает последовательность действий, исходными данными для которых являются идентификатор источника веб-контента и оценка веб-контента, сформированная агентом сети доверия. Результатом работы алгоритма является рассчитанная итоговая оценка источника веб-контента.

Алгоритм А2 фильтрации веб-контента описывает последовательность действий, исходными данными для которых являются профиль фильтрации, определяющий критерии предоставления и запрета доступа к веб-контенту, и идентификатор источника веб-контента, доступ к которому запрашивается. Результатом работы алгоритма является решение о предоставлении или запрете доступа к запрашиваемому источнику веб-контента.

Алгоритм А3 определения устойчивости равновесных состояний описывает последовательность действий, исходными данными для которых являются диапазон значений репутации игроков и количество игроков, участвующих в игре. Результатом работы алгоритма является зависимость отношения суммарного значения репутации игроков, изменивших свои стратегии на невыигрышные, к сумме значений репутации всех игроков, участвующих в игре, от количества игроков.

Алгоритм А4 моделирования атаки на сеть доверия описывает последовательность действий, исходными данными для которых являются сумма значений репутации игроков, выбравших выигрышную стратегию, сумма значений

репутации игроков, выбравших невыигрышную стратегию, количество игроков, последовательно присоединяющихся к игре, и начальное значение репутации присоединяющихся игроков. Результатом работы алгоритма является зависимость суммы значений репутации игроков, выбравших невыигрышную стратегию, от количества игроков, присоединившихся к игре.

В четвёртой главе (Практическая реализация) описана архитектура разработанной системы классификации и фильтрации веб-контента «Этикум». Приведён типовой сценарий работы системы в процессе классификации и фильтрации веб-контента. Описаны возможные варианты и опыт внедрения системы. Приведены возможности дальнейшего развития теоретико-игрового подхода в сфере информационно-телекоммуникационных систем.

В заключении изложены основные научные и практические результаты диссертационной работы.

Приложение содержит акты о внедрении разработанной системы в производственный процесс ООО «Сетевые экспертные системы», в МБОУ «Лицей №8», МБОУ «Школа № 135» и МАОУ СШ № 151 с углубленным изучением отдельных предметов, а также патенты на полезные модели «Устройство классификации интернет-ресурсов на основе результатов автоматической обработки текста и взвешенного мнения экспертов», «Устройство классификации HTML-страниц с предварительным выделением значимой части страницы и определением функционально-смыслового типа текста» и свидетельство о государственной регистрации программ для ЭВМ «Система управления сайтом «Итари».

ГЛАВА 1. СОСТОЯНИЕ ПРОБЛЕМЫ И ОБЗОР СУЩЕСТВУЮЩИХ МЕТОДОВ КЛАССИФИКАЦИИ И ФИЛЬТРАЦИИ ВЕБ-КОНТЕНТА.

ПОСТАНОВКА ЗАДАЧИ

Рассмотрены существующие методы классификации веб-контента. Выделены методы, использующиеся в полностью автоматизированных информационных системах, и методы, требующие участия человека. Приведён обзор существующих способов хранения информации о классифицированных ресурсах. Рассмотрены существующие методы ограничения доступа к источникам веб-контента. Приведены достоинства и недостатки существующих методов классификации и фильтрации веб-контента.

Здесь и далее под веб-контентом понимается мультимедийное содержимое, доступ к которому осуществляется по протоколу HTTP(S). Под данное определение попадают веб-страницы, включающие в себя связанное с ними текстовое, графическое, аудио- и видео-содержимое, а также любые документы, доступ к которым возможен посредством URL. В свою очередь, каждый URL, по которому осуществляется доступ к веб-контенту, будем называть источником веб-контента. Веб-контент является одним из видов информационной продукции.

1.1. Методы классификации веб-контента

Под классификацией веб-контента понимается процесс его распределения по классам, представляющим собой возрастные, тематические, отраслевые и другие группы [1]. Существует два метода классификации веб-контента, отличающиеся способом получения конечного результата: полностью автоматизированный и с участием человека.

1.1.1. Автоматизированная классификация веб-контента

Методы классификации веб-контента, в которых отсутствует участие человека, основаны на автоматизированном анализе содержимого и принятии

решения о принадлежности источника веб-контента к одному или нескольким классам. Для анализа в подобных методах используются данные HTTP(S)-запросов и ответов [2, 3]: заголовки, содержащие кроме всего прочего URL, и тело ответа на запрос. С учётом того, что в теле НТТР^)-ответа может передаваться текстовое, графическое, аудио, видео и другое содержимое, в методах автоматизированной классификации можно выделить методы, позволяющие обрабатывать текстовые, графические, аудио- и видео-данные.

Для автоматической классификации используются методы информационного поиска [4, 5] и машинного обучения [5-7]. Классификаторы текста реализуются на основе сетей Байеса [8, 9], нейронных сетей [10-16], с использованием генетического моделирования [17, 18], N-грамм [19, 20] и др. Для графических данных применяются классификаторы, использующие линейную машину опорных векторов [21] с описанием изображений векторами Фишера [22], конволюционные нейронные сети [23], основанные на деревьях решений и их ансамблях [24].

В процессе формирования веб-страницы, как основного элемента веб-контента, могут принимать участие несколько ресурсов: непосредственно запрашиваемый ресурс (чьё имя является частью запрашиваемого URL), множество сторонних ресурсов, которые могут являться источником связанных со страницей данных (графики и/или других мультимедиа-данных; средств визуального отображения, например, CSS; выполняющихся на стороне клиента скриптов и т. п.), а также данные, полученные при помощи различных клиентских технологий. Часто текстовое и мультимедийное содержимое интегрируется непосредственно в тело запрашиваемой страницы со сторонних ресурсов. Примером такого способа формирования страницы является использование различных сетей доставки (и дистрибуции) контента (CDN) [25]. Существует два способа интеграции внешнего содержимого в страницу: встраивание на стороне сервера и запрос содержимого со стороны клиента (браузером). Первый способ используется в основном для встраивания текстовых данных в страницу, а второй — как текстовых, так и любых других связанных со страницей данных (графика и другие мультимедиа-данные). В настоящее время в процессе

формирования страниц в браузере широко используются клиентские технологии, возлагающие часть нагрузки по преобразованию и/или визуализации данных на клиента. Основной из таких технологий является AJAX [26], позволяющая загружать порции данных и/или разметки в определённый XML/HTML-контейнер. Подобный способ загрузки может использоваться для частей страницы, не относящихся непосредственно к её содержанию (например, реклама, всплывающие окна и т. п.), но влияющих в целом на восприятие страницы пользователем, а значит, и на принадлежность к тому или иному классу.

Таким образом, при решении задачи классификации веб-контента автоматизированные методы не являются достаточно эффективными при обработке веб-страниц, представляющих собой в общем случае мультимедийное содержимое из множества источников, и использующих клиентские технологии для генерации контента.

Автором предложен метод автоматизированной классификации HTML-страниц с предварительным выделением значимой части страницы и определением функционально-смыслового типа текста. Схема программного комплекса, реализующего данный метод, показана на рис. 1.1.

Программный модуль взаимодействия с браузером (1) реализует приём данных от браузера, содержащих код страницы и метаданные, и передачу этих данных модулю принятия решения для получения решения о разрешении или запрете отображения запрошенной страницы. Реализация интерфейса взаимодействия с браузером предполагает использование интерфейса программирования приложений (API) браузера для получения кода запрошенной страницы и ее метаданных (рис. 1.1, вход 1). Извлеченная информация преобразуется в объект, передаваемый модулю принятия решения (рис. 1.2). После получения от модуля 2 решения о разрешении или запрете отображения запрошенной страницы, браузеру чрез его API передается код страницы для отображения. Для обеспечения совместимости с различными браузерами, одно устройство может иметь несколько различных модулей 1 взаимодействия с браузером.

Рис. 1.1. Схема программного комплекса, реализующего метод классификации HTML-страниц с предварительным выделением значимой части страницы и определением функционально-смыслового типа текста

Программный модуль принятия решения (2) осуществляет приём от модуля взаимодействия с браузером объекта, содержащего код страницы и ее метаданные (рис. 1.2), и передачу модулю взаимодействия с браузером решения о разрешении или запрете отображения запрошенной страницы. После получения данных от модуля взаимодействия с браузером модуль отправляет запрос характеристик страницы модулю хранения информации о классифицированных интернет-ресурсах и, если запись о странице существует в базе данных, получает от модуля 4 сообщение о характеристиках страницы в формате RDF/XML (рис. 1.3). Каждое сообщение содержит URL ресурса в поле Identifier, факторы E3 (aims) и I1 (topic) классификации Синклера-Шарова [27] в полях Type и Subject соответственно. Поле Creator для внутренних сообщений не заполняется. Если в базе данных отсутствует запись о запрошенной странице, модуль 2 отправляет объект, содержащий код страницы и её метаданные (рис. 1.2), модулю классификации HTML-страниц и в ответ получает сообщение о характеристиках страницы в формате RDF/XML (рис. 1.3) с пустым полем Creator. На основании полученного сообщения и действующей политики (настроек устройства) модуль 2 принимает решение о разрешении или запрете отображения запрошенной страницы и перенаправляет принятое решение в модуль взаимодействия с браузером.

Meta Object

{

[url] => string [lastModified] => datetime [eTag] => string [title] => string [meta] => array of strings [link] => array of strings [html] => string

}

Рис. 1.2. Структура объекта, содержащего метаданные страницы

Программный модуль классификации HTML-страниц (3) принимает от модуля принятия решения объект, содержащий код страницы и её метаданные (рис. 1.2), осуществляет процесс классификации HTML страницы с предварительным выделением значимой части страницы и определением функционально -смыслового типа текста и передаёт результат классификации в модуль принятия решения в виде RDF/XML-сообщения (рис. 1.3) с пустым полем Creator, а также в модуль отправки рекомендаций для распространения результатов классификации за пределы устройства. Процесс классификации проходит в 3 этапа:

<?xml version-'1.0" encoding="utf-8"?>

<rdf:RDF xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#" xm lns :dc=" http:// purl .org/dc/el ements/1.1/"> <rdf: Descriptio n>

<dc: creator>идентификатор классификатора<Мс: creator> <dc: identifier>URL ресурса<Мс: identifier> <dc:type>rHn ресурса (E3)</dc:type> <dc: subject>тема ресурса (I1 )</dc: subject> </rdf:description> </rdf:RDF>

Рис. 1.3. Структура RDF-описания интернет-ресурсов

1. Выделение значимой части страницы

Алгоритм выделения значимой части страницы основан на одновременном анализе структурной и содержательной частей страницы. Под структурой страницы подразумевается иерархия узлов разметки страницы, а под содержательной частью — множество значений текстовых узлов страницы.

Алгоритм включает в себя следующую последовательность действий (рис.

1.4):

Рис. 1.4. Алгоритм выделения значимой части страницы

1. Формирование из исходного дерева узлов HTML-страницы трех массивов — массива элементов разметки страницы (имен тегов), массива текстовых узлов страницы, а также массива локальных ссылок (теги «a»), содержащего множество локальных URL.

2. Создание массива деревьев узлов HTML-страниц, запрошенных по адресам, содержащимся в массиве локальных URL (шаг 1).

3. Формирование двух массивов — элементов разметки и текстовых узлов — для каждого из деревьев узлов, полученных на шаге 2 (по аналогии с шагом 1).

4. Формирование двух массивов расстояний между соответствующими элементами массивов элементов разметки для каждого документа и массивов текстовых узлов для каждого документа. Расстояния рассчитываются на основе реализации алгоритма сравнения последовательностей [28].

5. Определение значимой части страницы как пересечения элементов массивов расстояний, имеющих минимальные расстояния между структурными частями страницы и максимальные расстояния между текстовыми узлами страницы.

2. Определение функционально-смыслового типа текста

Алгоритм определения функционально-смыслового типа текста позволяет отнести текст к определенному функционально-смысловому типу текста (внутренняя классификация) и сформировать характеристики текста, определяющие состав слов, необходимых для классификации текста, и изменить весовые коэффициенты соответствующих частей речи. В качестве входных данных для алгоритма используется массив слов, полученный из значимой части текста страницы (п. 1). В основу алгоритма положено утверждение о соответствии между коэффициентом лексического разнообразия (КЛР) текста и его функциональным стилем [29].

Алгоритм включает в себя следующую последовательность действий (рис.

1.5):

1. Создание из массива слов массива идентификаторов соответствующих словоформ после выполнения морфологического анализа слов.

2. Определение КЛР путём получения вектора частотной характеристики словоформ в массиве идентификаторов словоформ посредством частотного анализа с использованием словаря словоформ.

3. Определение функционально-смыслового типа текста при помощи нейросетевого классификатора. На вход сети подается полученный на 2-м шаге вектор частотной характеристики словоформ. Полученный на выходе функционально-смысловой тип текста определяет весовые коэффициенты для частей речи, использующиеся при частотном анализе массива нормализованных слов, при выполнении нейросетевой классификации текста (п. 3).

Рис. 1.5. Алгоритм определения функционально-смыслового типа текста

Похожие диссертационные работы по специальности «Системный анализ, управление и обработка информации (по отраслям)», 05.13.01 шифр ВАК

Список литературы диссертационного исследования кандидат наук Супруненко, Александр Владимирович, 2017 год

СПИСОК ЛИТЕРАТУРЫ

1. Федеральный закон Российской Федерации от 29 декабря 2010 г. N 436-Ф3 «О защите детей от информации, причиняющей вред их здоровью и развитию» [Электронный ресурс]. URL: http://www.rg.ru/2010/12/31/deti-inform-dok.html

2. Wagner B. Deep Packet Inspection and Internet Censorship: International Convergence on an 'Integrated Technology of Control' (June 23, 2009) [Electronic resource]. URL: https://ssrn.com/abstract=2621410

3. Trabelsi Z., Zeidan S., Masud M. M. Network Packet Filtering and Deep Packet Inspection Hybrid Mechanism for IDS Early Packet Matching // Advanced Information Networking and Applications (AINA), 2016 IEEE 30th International Conference on. — IEEE, 2016. — С. 808-815.

4. Manning C., Raghavan P., Schultze H. Introduction to Information Retieval. Cambridge University Press, 2008. 544 p.

5. Berger A. Statistical Machine Learning for Information Retrieval. Carnegie Mellon University, 2001. 143 p.

6. Witten I. H., Frank E. Data Mining: Practical Machine Learning Tools and Techniques (Second Edition). Morgan Kaufmann, 2005. 525 p.

7. Paliouras G., Karkaletsis V., Spyropoulos C. D. Machine Learning and Its Applications: Advanced Lectures (Lecture Notes in Computer Science / Lecture Notes in Artificial Intelligence). Springer, 2001. 325 p.

8. Heckerman D. A Tutorial on Learning with Bayesian Networks // Learning in graphical models. 1999. p. 301-354.

9. De Campos L. M., Romero A. E. Bayesian Network Models for Hierarchical Text Classification from a Thesaurus // International Journal of Approximate Reasoning. 2009. v. 50, n. 7. p. 932-944.

10.Schutze H., Hull D. A., Pedersen J. O. A comparison of classifiers and document representations for the routing problem // Proceedings of SIGIR-95, 18th ACM

International Conference on Research and Development in Information Retrieval, Seattle. 1995. p. 229-237.

11.Ng H. T., Goh W. B., Low K. L. Feature selection, perceptron learning, and a usability case study for text categorization // Proceedings of SIGIR-97, 20th ACM International Conference on Research and Development in Information Retrieval, Philadelphia. 1997. p. 67-73.

12.Dagan I., Karov Y., Roth D. Mistake-driven learning in text categorization // Proceedings of EMNLP-97, 2nd Conference on Empirical Methods in Natural Language Processing, Providence, RI 1997. p. 55-63.

13.Lam S. L., Lee D. L. Feature reduction for neural network based text categorization // Proceedings of DASFAA-99, Taiwan. 1999. p. 195-202.

14.Ruiz M., Srinivasan P. Hierarchical Text Categorization Using Neural Networks // Information Retrieval. 2002. v. 5, n. 1. p. 87-118.

15.Yang Y., Liu X. A re-examination of text categorization methods // Proceedings of SIGIR-99, 22nd ACM International Conference on Research and Development in Information Retrieval, Berkeley, CA. 1999. p. 42-49.

16.Супруненко А. В. Модель открытой распределенной системы фильтрации веб-контента // Журнал «Системы управления и информационные технологии». — ВГТУ, Воронеж — 2011. — № 1 (43), — с. 90-95

17.Wong M. L., Cheung K. S. Data Mining Using Grammar Based Genetic Programming and Applications. Kluwer Academic Publishers, 2002. 228 p.

18.Lankhorst M. Automatic Word Categorization with Genetic Algorithms // Proceedings of the ECAI'94 Workshop on Applied Genetic and other Evolutionary Algorithms. 1994.

19.Cavnar W. B., Trenkle J. M. N-Gram-Based Text Categorization // Proceedings of SDAIR-94, 3rd Annual Symposium on Document Analysis and Information Retrieval. 1994. p. 161-175.

20.Ломакина Л. С. Построение и исследование модели текста для его классификации по предметным категориям / Л. С. Ломакина, А. В. Мордвинов,

А. С. Суркова // Журнал «Системы управления и информационные технологии». — ВГТУ, Воронеж — 2011. — № 1 (43), — с. 16-20

21.Hastie T., Tibshirani R., Friedman J. The Elements of Statistical Learning. Springer, 2008.

22.Perronnin F., Liu Y., Sanchez J., Poirier H. Large-Scale Image Retrieval with Compressed Fisher Vectors // Proc. of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 2010. p. 3384-3391

23.Krizhevsky A., Sutskever I., Hinton G. ImageNet Classification with Deep Convolutional Neural Networks //Advances in Neural Information Processing Systems (NIPS). 2012. p. 1106-1114.

24.Fellbaum C. WordNet: An Electronic Lexical Database. MIT Press, 1998.

25.Peng G. CDN: Content Distribution Network. Tech Report, SUNY Stony Brook, 2003.

26.Garrett J. J. Ajax: A New Approach to Web Applications [Electronic resource]. URL: http: //adaptivepath. org/ideas/aj ax-new-approach-web-applications/

27. Шаров С. А. Представительный корпус русского языка в контексте мирового опыта // Научно-техническая информация, сер. 2, 2003, № 6, с. 9-18.

28.Wu S. et al. An O (NP) sequence comparison algorithm // Information Processing Letters. — 1990. — Т. 35. — № 6. — С. 317-323.

29.Ягунова Е. В. Набор опорных слов как вид свертки текста (в сопоставлении с набором ключевых слов) // Компьютерная лингвистика и интеллектуальные технологии: По материалам ежегодной международной конференции «Диалог», периодическое издание, выпуск 7 (14). — М. : РГГУ, 2008. — С. 588-594, (0,6 п.л.).

30.Патент на ПМ 119908 Российская Федерация, МПК8 G06F15/16. Устройство классификации HTML-страниц с предварительным выделением значимой части страницы и определением функционально-смыслового типа текста / А. В. Супруненко; заявитель А. В. Супруненко; патентообладатель общество с ограниченной ответственностью «Сетевые экспертные системы». — № 2012117469/08; заявл. 26.04.2012; опубл. 27.08.2012.

31.Liao S. H. Expert system methodologies and applications—a decade review from 1995 to 2004 // Expert systems with applications. — 2005. — Т. 28. — №. 1. — p. 93-103.

32.Golbeck J., Parsia B., Hendler J. Trust Networks on the Semantic Web // Cooperative Information Agents VII, 2003, p. 238-249

33.Zacharia G. Trust management through reputation mechanisms // Applied Artificial Intelligence, 2000, vol. 14, p. 881-907

34.Губанов Д. А., Новиков Д. А., Чхартишвили А. Г. Модели влияния в социальных сетях //Управление большими системами: сборник трудов. — 2009. — №. 27.

35.DCMI Metadata Terms [Electronic resource]. URL: http://dublincore.org/documents/dcmi-terms/

36.ГОСТ Р. 7.0. 10-2010 (ИСО 15836: 2003) «НАЦИОНАЛЬНЫЙ СТАНДАРТ РОССИЙСКОЙ ФЕДЕРАЦИИ» // Система стандартов по информации, библиотечному и издательскому делу. НАБОР ЭЛЕМЕНТОВ МЕТАДАННЫХ «ДУБЛИНСКОЕ ЯДРО».

37.Патент на ПМ 117657 Российская Федерация, МПК8 G06F12/00. Устройство классификации интернет-ресурсов на основе результатов автоматической обработки текста и взвешенного мнения экспертов / А. В. Супруненко; заявитель А. В. Супруненко; патентообладатель общество с ограниченной ответственностью «Сетевые экспертные системы». — № 2012100711/08; заявл. 11.01.2012; опубл. 27.06.2012.

38.Cloud Delivered Enterprise Security by OpenDNS [Electronic resource]. URL: http s: //www. opendns .com/

39.Контроль доступа к интернет, быстрый и бесплатный DNS, родительский контроль [Электронный ресурс]. URL: http://rejector.ru/

40. Решения SkyDNS для контент-фильтрации и безопасного доступа в интернет [Электронный ресурс]. URL: https://www.skydns.ru/solutions

41. Единый реестр доменных имен, указателей страниц сайтов в сети «Интернет» и сетевых адресов, позволяющих идентифицировать сайты в сети «Интернет»,

содержащие информацию, распространение которой в Российской Федерации запрещено [Электронный ресурс]. URL: http://eais.rkn.gov.ru/

42. Федеральный список экстремистских материалов [Электронный ресурс]. URL: http: //minj ust.ru/ru/extremist-materials

43. Технологии контентной фильтрации [Электронный ресурс]. URL: http: //www. netpolice. ru/page/tech

44.Kaspersky Internet Security для всех устройств [Электронный ресурс]. URL: http://www.kaspersky.ru/multi-device-security

45.Hash buster Definition from PC Magazine Encyclopedia [Electronic resource]. URL: http: //www.pcmag.com/encyclopedia/term/44127/hash-buster

46.RFC 1738: Uniform Resource Locators (URL) [Electronic resource]. URL: https: //www.ietf. org/rfc/rfc 1738.txt

47.RFC 2616: Hypertext Transfer Protocol — HTTP/1.1 [Electronic resource]. URL: https://www.ietf.org/rfc/rfc2616.txt

48.HTML5. A vocabulary and associated APIs for HTML and XHTML. W3C Recommendation 28 October 2014 [Electronic resource]. URL: http s: //www.w3 .org/TR/html 5/

49.Ramchurn S. D., Huynh D., Jennings N. R. Trust in multi-agent systems // The Knowledge Engineering Review. — 2004. — Т. 19. — №. 01. — p. 1-25.

50.Sanger J., Richthammer C., Pernul G. Reusable components for online reputation systems // Journal of Trust Management 2015, 2:5, 2015

51.Sherchan W., Nepal S., Paris C. A Survey of Trust in Social Networks // ACM Computing Surveys, Vol. 45, No. 4, Article 47, August 2013

52.Marsh S. Formalising Trust as a Computational Concept // PhD dissertation, University of Stirling, 1994

53.Carter J. Reputation Formalization for an Information-Sharing Multi-Agent System // Computational Intelligence, vol. 18 (2), p. 515-534

54.Abdul-Rahman A., Hailes S. Supporting trust in virtual communities // In: Proc. of Hawaii International Conference on System Sciences, 2000

55.Advogato Trust Metric [Electronic resource]. URL: http://www.advogato.org/trust-metric.html

56.Kamvar S.D., Schlosser M.T., Garcia Molina H.. The EigenTrust Algorithm for Reputation Management in P2P Networks // Proceedings of the 12th international conference on World Wide Web, 2003, p. 640-651

57.Richardson M., Agrawal R., Domingos P. Trust management for the semantic web // International Semantic Web Conference, 2003, p. 351-368

58.Yu B., Singh, M. P. An evidential model of distributed reputation management // Proceedings of the first international joint conference on Autonomous agents and multiagent systems, 2002, p. 294-301

59. Schillo M., Funk P., Rovatsos M. Using trust for detecting deceitful agents in artificial societies // Applied Artificial Intelligence, 14, 2000, p. 825-848

60.Sabater J., Sierra C. Reputation and social network analysis in multi-agent systems // Proceedings of the first international joint conference on Autonomous agents and multiagent systems, 2002, p. 475-482

61. Ожегов С. И., Шведова Н. Ю. Толковый словарь русского языка [Электронный ресурс]. URL: http://www.ozhegov.org/words/30637.shtml

62. Супруненко А. В. Способ экспертной оценки с использованием сети репутации для решения задачи классификации веб-контента // Журнал «Искусственный интеллект и принятие решений». — Москва — 2016. — № 3

63. Фон-Нейман Д., Моргенштерн О. Теория игр и экономическое поведение. — М., «Наука», 1970.

64.Lamport L., Shostak R., Pease M. The Byzantine generals problem // ACM Transactions on Programming Languages and Systems (TOPLAS). — 1982. — Т. 4. — №. 3. — p. 382-401.

65.Губко М. В., Новиков Д. А. Теория игр в управлении организационными системами. Издание 2, М.: 2005

66.Khan M. A. et al. Non-cooperative games with many players. — 1996. — №. 382.

67.Воробьёв Н. Н. Основы теории игр. Бескоалиционные игры. М.: Наука, 1984.

68. Воробьёв Н. Н. Теория игр для экономистов-кибернетиков. М.: Наука, 1985.

69.Петросян Л. А., Зенкевич Н. А., Семина Е. А. Теория игр. М.: ВШ, Книжный дом «Университет», 1998.

70.Fudenberg D., Tirole J. Game Theory. — Cambridge: MIT Press, 1993.

71.Гермейер Ю. Б. Введение в теорию исследования операций. — 1971.

72.Венцель Е. С. Исследование операций // Советское радио // Москва. — 1972.

73.Стронгин Р. Г. Исследование операций. Модели экономического поведения // М.: Бином. Лаборатория знаний. — 2007. — Т. 208.

74.Myerson R. B. Game theory. — Harvard university press, 2013.

75.Nash J. F. et al. Equilibrium points in n-person games // Proceedings of the national academy of sciences. — 1950. — Т. 36. — №. 1. — С. 48-49.

76.Van Damme E. Refinements of the Nash equilibrium concept. — Springer Science & Business Media, 2012. — Т. 219.

77.Harsanyi J. C. et al. A general theory of equilibrium selection in games // MIT Press Books. — 1988. — Т. 1.

78.Mookherjee D., Sopher B. Learning and decision costs in experimental constant sum games // Games and Economic Behavior. — 1997. — Т. 19. — №. 1. — С. 97-132.

79.Николис Д. С. Динамика иерархических систем: Эволюционное представление: Пер. с англ. — Мир, 1989.

80.Терехов С. А. Адаптивные нейросетевые методы в многошаговых играх с неполной информацией // В сб.: «Лекции по нейроинформатике». — М.: Изд-во МИФИ. — 2005. — С. 111-139.

81.Горяшко А. П. Теория игр: от анализа к синтезу. Обзор результатов // Cloud of science. — 2014. — Т. 1. — №. 1.

82.Messick D. M., McClintock C. G. Motivational bases of choice in experimental games // Journal of experimental social psychology. — 1968. — v. 4. — №. 1. — p. 1-25.

83.Gradwohl R., Reingold O. Fault tolerance in large games // Proceedings of the 9th ACM Conference on Electronic Commerce. — ACM, 2008. — p. 274-283.

84.Rajappa G. P. Solving combinatorial optimization problems using genetic algorithms and ant colony optimization. — 2012.

85.Сегаран Т. Программируем коллективный разум. // СПб.: Символ-Плюс, 2012. — 368 с., ил.

86.Батищев Д. И., Неймарк Е. А., Старостин Н. В. Применение генетических алгоритмов к решению задач дискретной оптимизации. — Н. Новгород: Изд-во Нижегор. госуниверситета, 2006.

87.Holland J. H. Genetic algorithms //Scientific american. — 1992. — v. 267. — №. 1. — p. 66-72.

88.Golberg D. E. Genetic algorithms in search, optimization and machine learning reading // MA: Addisonn-Wisley, USA. — 1989.

89.Емельянов В. В., Курейчик В. В., Курейчик В. М. Теория и практика эволюционного моделирования // М.: физматлит. — 2003. — Т. 432. — С. 7.

90. Карпенко А. П. Популяционные алгоритмы глобальной поисковой оптимизации // Обзор новых и малоизвестных алгоритмов // Информационные технологии. — 2012. — №. 7. — С. 1-32.

91.Хливненко Л. В. Практика нейросетевого моделирования // Воронеж: ФГБОУ ВО ВГТУ.-2015.-214 с. — 2015, с. 175-179.

92.Супруненко А. В. Определение устойчивости равновесных состояний в теоретико-игровой модели сети доверия // Труды НГТУ им. Р. Е. Алексеева / НГТУ им. Р. Е. Алексеева. — Нижний Новгород, 2017. № 1 (116). — с. 63-68

93.Заявка 201500119 ЕАПВ, МПК8 G06/F 17/40, G06N 5/02. Способ фильтрации веб-контента и система для его реализации / А. В. Супруненко, С. А. Мерсиков; заявитель общество с ограниченной ответственностью «Сетевые экспертные системы»; пат. поверенный Петухов И. Е. — № 201500119/26; заявл. 10.02.2015; опубл. 29.07.2016, Бюл. № 7.

94.Супруненко А. В. Система управления сайтом «Итари» // Свидетельство о государственной регистрации программы для ЭВМ № 2009613799. Зарегистрировано в Реестре программ для ЭВМ Федеральной службы по интеллектуальной собственности РФ (Роспатент) от 13 июля 2009 г.

95.Супруненко А. В. Унифицированное хранение разнотипных данных для публикации на web // Тезисы докладов международной научно-технической конференции «ИСТ-2008». — Н. Новгород: НГТУ, 2008

96.Abiteboul S. et al. Web data management. — Cambridge University Press, 2011.

97. Токмаков Д. И. Использование средств языка RDF в аннотировании интернет ресурсов // Информационные ресурсы России. — 2007. — №. 5. — С. 9.

98.Шустиков В. В Нижнем Новгороде определены победители «IT-Volga» [Электронный ресурс]. URL: http://sk.ru/news/b/press/archive/2014/09/17/v-nizhnem-novgorode-opredeleny-pobediteli-itvolga.aspx

99. Супруненко А. В. О проектировании и внедрении технических средств создания безопасной образовательной среды // Инновационные технологии в образовательной деятельности. Материалы Всероссийской научно-методической конференции / НГТУ им. Р. Е. Алексеева. — Нижний Новгород, 2017. — с. 118-121

100. Шевцова Л. А., Супруненко А. В. Об итогах пилотной апробации системы фильтрации контента «Этикум» // Материалы международной научно-практической интернет-конференции «Актуальные проблемы методики обучения информатике в современной школе», 16-17 февраля 2016 г. — Москва: МПГУ, 2016. — с. 253-256

101. The Pan-European Game Information (PEGI) [Electronic resource]. URL: http: //www.pegi. info

102. The Entertainment Software Rating Board (ESRB) [Electronic resource]. URL: http: //www.esrb .org

103. The Motion Picture Association of America (MPAA) [Electronic resource]. URL: http: //www.mpaa.org

104. Hurwicz L. On informationally decentralized systems // Decision and optimization. Ed.: B. McGuire, B. Radner.— Amsterdam: North-Holland, 1972.

105. Friedman E. J., Halpern J. Y., Kash I. Efficiency and Nash equilibria in a scrip system for p2p nerwork // Proc. 7th ACM conference on Electronic commerce. — NY: ACM, 2006. P.140-149.

106. Nisan N. et al. (ed.). Algorithmic game theory. — Cambridge : Cambridge University Press, 2007. — Т. 1.

Список использованных аббревиатур и сокращений AJAX — Asynchronous JavaScript and XML, асинхронный JavaScript и XML API — Application programming interface, интерфейс программирования приложений

CDN — Content Delivery Network, сеть доставки контента

CSS — Cascading Style Sheet, каскадные таблицы стилей

CMS — Content Management System, система управления контента

DC — Dublin Core, дублинское ядро

DNS — Domain Name Service, доменная служба имён

HTML — Hypertext Markup Language, язык разметки гипертекста

HTTP(S) — Hypertext Transfer Protocol (Secure), протокол передачи гипертекста

(безопасный)

IP — Internet Protocol, протокол интернета JS — JavaScript

RDF — Resource Definition Format, формат определения ресурсов URL — Universal Resource Locator, универсальный указатель ресурса XML — eXtensible Markup Language, расширяемый язык разметки БД — База данных

КЛР — Коэффициент лексического разнообразия

ОУ — Образовательное учреждение

ПО — Программное обеспечение

СУБД — Система управления базами данных

ТИ — Теория игр

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.