Алгоритмы интеллектуального поиска информации в сети Интернет для формирования электронной библиотеки тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Аль-Амиди Мустафа Абдулкадим Дхаир
- Специальность ВАК РФ00.00.00
- Количество страниц 172
Оглавление диссертации кандидат наук Аль-Амиди Мустафа Абдулкадим Дхаир
ВВЕДЕНИЕ
1. Необходимость применения методов машинного обучения в алгоритмах информационного поиска в сети Интернет
1.1. Актуальность научно-исследовательской работы
1.2. Виды поиска информации
1.3. Методы поиска информации
1.4. Анализ существующих тенденций в области поисковых систем
1.5. Машинное обучение
1.5.1. Основы машинного обучения
1.5.2. Машинное обучение и искусственный интеллект
1.5.3. Языковые модели машинного обучения
1.6. Модели машинного обучения для поиска информации в электронных библиотеках
1.7. Постановка цели и задач исследования
2. Применение теории нечётких множеств в информационных поисковых системах
2.1. Нечёткая логика
2.2. Использование Т-норм и Т-конорм при построении методов поиска информации в сети Интернет
2.3. Генетическое программирование
2.4. Построение системы нечёткой классификации с применением генетического программирования
2.5. Выводы по второй главе
3. Методы эффективного информационного поиска
3.1. Методика оценки эффективности информационного поиска в многофакторных потоках с частично открытыми данными
3.2. Модели и алгоритмы повышения точности тематико-ориентированного интернет-поиска в многофакторных потоках частично скрытых данных
3.2.1. Использование расширения запроса для изменения качественных характеристик поисковой выборки
3.2.2. Алгоритмы тематико-ориентированного Интернет-поиска в частично скрытых данных многофакторных потоков
3.2.3. Алгоритм тематико-ориентированного Интернет-поиска на основе фреймового подхода
3.2.4. Алгоритмы тематико-ориентированного Интернет-поиска на основе нечёткой логики
3.2.5. Алгоритмы тематико-ориентированного Интернет-поиска на основе лингвистического 2-кортежного представления
3.2.6. Алгоритмы тематико-ориентированного Интернет-поиска на основе мультиобъективной оптимизации нечётких правил
3.3. Сравнение эффективности предложенных методов
3.4. Выводы по третьей главе
4. Анализ эффективности работы интеллектуального алгоритма поиска информации в решении практической задачи
4.1. Устройство программы для сравнения традиционного и интеллектуального алгоритма информационного поиска
4.2. Сравнение результатов работы методов информационного поиска
4.3. Выводы по четвёртой главе
ЗАКЛЮЧЕНИЕ
СПИСОК ЛИТЕРАТУРЫ
ПРИЛОЖЕНИЕ А. ПРОГРАММНЫЙ КОД СРАВНЕНИЯ РАЗЛИЧНЫХ АЛГОРИТМОВ МАШИННОГО ОБУЧЕНИЯ
ПРИЛОЖЕНИЕ Б. АКТЫ ВНЕДРЕНИЯ
ПРИЛОЖЕНИЕ В. СЕРТИФИКАТЫ УЧАСТНИКА КОНФЕРЕЦИИ
ВВЕДЕНИЕ
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Развитие методов и моделей формирования интеллектуального контента2012 год, кандидат экономических наук Евсюткин, Александр Сергеевич
Математическое и программное обеспечение интеллектуальных поисковых систем на основе использования мультиагентной архитектуры2013 год, кандидат наук Минашкин, Сергей Александрович
Теоретическое обоснование и разработка интеллектуальной русскоязычной информационно-поисковой системы2002 год, кандидат технических наук Волков, Сергей Сергеевич
Модель нечеткого классификатора и генетический алгоритм обучения для поддержки принятия решений в медицинской информационной системе2026 год, кандидат наук Шамсулдин Хайдар Абдулваххаб Х.
Исследование и разработка информационно-аналитической системы получения релевантных данных и знаний в сети интернет2015 год, кандидат наук Толкачев, Демид Максимович
Введение диссертации (часть автореферата) на тему «Алгоритмы интеллектуального поиска информации в сети Интернет для формирования электронной библиотеки»
Актуальность темы исследования.
В современном мире объём и скорость распространения информации в сети Интернет растут невероятными темпами. Всемирная сеть стала крупнейшим хранилищем данных, среди которых значительная часть имеет научную, образовательную и культурную ценность.
Несмотря на тот факт, что искусственный интеллект в той или иной форме существует уже несколько десятков лет, он до сих пор не был полноценно внедрён в алгоритмы поиска информации. Тем не менее, такие современные вызовы, как необходимость обработки больших объёмов информации и поиск среди них полезных данных, особенно актуальны. Даже профильные поисковые системы не всегда в ответ на пользовательские запросы обеспечивают необходимую точность поиска.
В эпоху повсеместного внедрения методов машинного обучения, поиск информации приобретает ключевое значение. Традиционные алгоритмы поиска показывают свою точность на массивах структурированных и достоверных данных. Однако сеть Интернет является не привычным информационным массивом, а неструктурированным набором ресурсов разного формата, содержащих информацию разного уровня достоверности.
Разработка алгоритмов информационного поиска на основе интеллектуальной обработки данных является ключевой и актуальной задачей для формирования электронных библиотек знаний, это приобретает особую значимость когда необходимо учитывать целый ряд специфических особенностей при их построении так как они имеют узкую направленность.
В условиях введённых санкций особое значение приобретают вопросы создания специальных математических моделей и алгоритмов для формирования электронных библиотек знаний, что способствует решению задач:
- импортозамещения востребованных поисковых систем;
- ускорения научного развития (за счёт уменьшения времени и улучшения точности поиска необходимой информации).
Построение алгоритмов интеллектуального поиск на основе применение методов машинного обучения, в частности нечётких классификационных систем, является наиболее перспективным направлением развития, поскольку данные методы позволяют учитывать неопределенность как данных, получаемых от пользователя в виде поискового запроса, так и в анализируемых источниках информации, что способствует повышению точности результатов поиска.
Всё вышеизложенное, обуславливает актуальность разработки алгоритмов интеллектуального поиска информации в сети Интернет. При этом ключевым фактором является повышение точности, ГОСТ 7.73-96, выдаваемой поисковой системой информации, при этом, как отмечалось выше особое значение имеет создание узкоспециализированных библиотек, для областей двойного применения.
Степень разработанности темы исследования.
Вопросы, связанные с теорией нечётких множеств и методами машинного обучения, рассматривались в работах следующих отечественных авторов: М.В. Поленка, С.В. Бондаренко, И.Р. Козловой, О.Н. Юрковой и Ф.Н. Бузылева.
Методам информационного поиска посвящены работы Arasu A., Cho J., Yilmaz Z.A., Wang Sh., Taylor H., Fernandes B., Wraight S., Todd P.M., Hills T.T., Robbins T.W. и др., а также в работах отечественных учёных В.М. Тютюнника, А.Ю. Сергеева, А.Д. Вылегжанина, Е.А. Ивановой, М.С. Агеева, М.П. Кривенко, И.В. Сегаловича и др.
В России, ведутся исследования по разработке алгоритмов интеллектуального поиска информации в сети Интернет, однако недостаточное внимание уделяется созданию специализированных электронных библиотек узкой направленности, включающих разноформатные данные (электронные копии документов, графическую информацию и т. д.).
На мировом рынке существует несколько организаций, предлагающих компьютерные системы поиска информации с применением методов искусственного интеллекта. Самые распространенные подобные системы: «Google AI Overview», «Яндекс Нейро», «Perplexity AI», но ни один из подобных программных продуктов, не использует интеллектуальные методы поиска информации в сети Интернет, а лишь делает сводку по итогам поисковой выдачи с применением больших языковых моделей.
В свете вышеизложенного, тема диссертационной работы, направленная на разработку алгоритмов интеллектуального поиска информации в сети Интернет для формирования электронной библиотеки, представляется чрезвычайно актуальной. Это определяют практическую задачу исследования - повышение точности работы алгоритмов интеллектуального поиска информации в сети Интернет. Для её решения необходимо рассмотреть научную задачу, связанную с разработкой алгоритмов интеллектуального поиска на основе моделей классификаторов, обеспечивающих повышение точности восприятия контекста
пользовательских запросов и как следствие обеспечивает повышение точности поиска.
Объект исследования: алгоритмы информационного поиска.
Предмет исследования: алгоритмы и нечеткие классификаторы, для информационно-поисковых систем.
Цель и задачи исследования. Повысить точность поиска информации в сети Интернет за счет использования построенных алгоритмов интеллектуального поиска, использующих модели классификаторов, для формирования электронной библиотеки.
Для достижения цели были поставлены следующие задачи:
1) Сделать обзор и провести анализ алгоритмов информационного поиска в сети Интернет.
2) Предложить модели классификаторов, для повышение точности алгоритмов интеллектуального поиска.
3) Разработать алгоритмы интеллектуального поиска информации, которые обеспечивают повышение точности, на основе использования предложенных моделей классификаторов в сети Интернет.
4) Оценить точность предложенных алгоритмов поиска информации по сравнению с известными.
Научная новизна исследования заключается в:
1. Построении моделей классификаторов, основанных на системе правил, отличающихся применением гибких структурных конфигураций на основе расчёта их степени активации, с использованием одно параметрических норм и конорм и функции приспособленности, которая сочетает максимизацию количества правильно классифицированных образцов с минимизацией числа нечётких правил.
2. Генетический алгоритм с настройкой на основе градиента, для построения нечетких правил, отличающийся дополнительными шагами, обеспечивающими его применение для решения многокритериальной комбинаторной оптимизационной задачи с построенной функцией приспособленности.
3. Алгоритм тематико-ориентированного интеллектуального Интернет-поиска на основе мультиобъективной оптимизации нечётких правил, отличающийся использованием следующих компонент обеспечивающих кодирование каждого решения бинарной строкой, где каждый бит соответствует включению или исключению кандидатного правила и нечёткое разбиение: решение кодируется конкатенированной строкой, включающей биты для выбора признаков, определения количества правил и формы функций приспособленности.
Теоретическая и практическая значимость работы. Теоретическая значимость работы заключается в развитии методов теории нечётких множеств для построения моделей классификаторов и алгоритмов интеллектуального поиска информации при создании специализированных электронных библиотек.
Практическая значимость работы заключается в разработке программного обеспечения, реализующего предложенные модели классификаторов и алгоритмы, интеллектуального поиска. Применение разработанного программного обеспечения позволит упростить и повысить точность поиска информации в сети Интернет, повысит оперативность, точность и объективность при создании специализированных электронных библиотека
Методология и методы исследования. Методология исследования дает характеристику компонентов научного исследования: объекта, предмета анализа, задачи исследования, совокупности исследования средств, необходимых для решения задачи данного типа, а также формирует представление о последовательности движения исследования в процессе решения задачи и основывается на корректном применении основных положений системного анализа и теории информационных процессов и систем.
При решении поставленных задач в работе были использованы методы: теории нечетких множеств, генетического программирования, машинного обучения, статистического анализа.
Диссертационная работа выполнена в соответствии с требованиями паспорта специальности 2.3.8 «Информатика и информационные процессы» и соответствует пунктам 8 «Разработка систем принятия решения на основе баз данных и знаний, реализующих имитационные модели прогнозирования изменения материальных процессов и событий», 13 «Разработка и применение методов распознавания образов, кластерного анализа, нейро-сетевых и нечетких технологий, решающих правил, мягких вычислений при анализе разнородной информации в базах данных».
Положения, выносимые на защиту:
1. Предложенные модели классификаторов, которые основаны на системе нечётких правил.
2. Генетический алгоритм с настройкой на основе градиента, для построения нечетких правил.
3. Алгоритм тематико-ориентированного интеллектуального Интернет-поиска на основе мультиобъективной оптимизации нечётких правил
Степень достоверности и апробация результатов.
Достоверность результатов диссертационного исследования подтверждается достаточным количеством наблюдений, использованием современных методов исследования, соответствующих поставленным в работе целям и задачам. Научные положения, выводы и рекомендации, сформулированные в диссертации, подкреплены убедительными фактическими данными, наглядно представленными в приведенных таблицах и рисунках. Частичным совпадением с результатами, полученными другими авторами. Подготовка, статистический анализ и интерпретация полученных результатов проведены с использованием современных методов обработки информации и статистического анализа.
Основные результаты представлены и обсуждены на: 10-й ВСЕРОССИЙСКОЙ. Конф. Молдых учёных, Тамбов, ТГТУ 2023г., Всероссийской научно-практической конференции. Воронеж, 2024, IV Международной научно-практическаой конференции «ЦИФРОВИЗАЦИЯ АГРОПРОМЫШЛЕННОГО КОМПЛЕКСА» Тамбов, ТГТУ 2024 г., Международная научно-практическая конференция «НаБиТЭМ» Нано-био-технологии. Тепло- и электроэнергетика. Математическое моделирование. Липецк, ЛГТУ, 2025г, а так же на семинарах кафедры «Информационные системы и защита информации» ФГБОУ ВО «Тамбовский государственный технический университет» и Научно-образовательного центра «Проблемы управления, информатики и защиты информации в организационных и технических системах» созданный решением Ученого совета федерального государственного бюджетного учреждения науки «Институт проблем управления им. В.А. Трапезникова» Российской академии наук и Ученого совета федерального государственного бюджетного образовательного учреждения высшего образования «Тамбовский государственный технический университет»
Внедрение результатов исследования. Воронеж, РТУ МИРЭА г. Москва, РосБиоТех г Москва , АОО ВО «Международный институт компьютерных технологий» г. Воронеж, Межвидовый центр подготовки и боевого применения войск радиоэлектронной борьбы (учебный и испытательный)
Публикации. По теме диссертации опубликовано 27 работ, в том числе 3 статьей в изданиях, рекомендованных ВАК при Минобрнауки РФ, 2 статьи в международном издании из перечня SCOPUS, 22 статей в прочих изданиях,и сборниках трудов международных и всероссийских конференций.
Выносимые на защиту результаты получены лично соискателем. В тех публикациях, которые были написаны, личный вклад автора заключается в:
построении моделей классификаторов, разработке алгоритмов настройки классификаторов и интеллектуального поиска.
Структура и объём работы. Диссертационная работа состоит из оглавления, введения, четырех глав и списка источников, который содержит 125 наименований и 3 приложение. Полный объём диссертации составляет 172 страницу. Основной текст работы включает 14 рисунков и 14 таблиц.
Введение включает в себя обоснование актуальности выбранной темы с демонстрацией её значимости в контексте современных научных исследований. Введение также содержит описание степени исследованности выбранной темы, сформулированную цель работы и постановку задач, необходимых для достижения цели, определена научная новизна работы, её теоретическая и практическая значимость, методы, применяемые в процессе исследования, положения, выносимые на защиту, степень достоверности результатов исследования и их апробации, информацию о публикациях автора и его личном вкладе, объёме и содержании исследования, краткое описание глав и разделов диссертации.
Первая глава посвящена анализу состояния проблемы разработки алгоритма интеллектуального поиска информации. В ней проводится всесторонний обзор существующих решений, их преимуществ и недостатков в контексте поиска информации, подходящей для формирования электронной библиотеки. Особое внимание уделяется методам машинного обучения, которые позволяют улучшить качество информации в поисковой выдаче. Материалы, представленные в данной главе, послужили основой для формулирования цели и задач исследования. Они демонстрируют необходимость применения машинного обучения в алгоритмах информационного поиска. Материалы данной главы позволили сформулировать цель и задачи исследования.
Во второй главе рассматривается генетическое программирование как метод автоматической генерации и оптимизации нечётких правил «ЕСЛИ-ТО». Генетическое программирование основывается на принципах естественного отбора и позволяет формировать компактные и интерпретируемые наборы правил, что особенно важно для задач информационного поиска. В главе описывается процесс построения нечеткого классификатора с использованием генетического программирования, где пространство образов делится на нечёткие подпространства, и для каждого из них генерируются правила.
Результаты, полученные в главе, позволяют сделать вывод, что применение нечёткой логики и генетического программирования позволяет создавать адаптивные и точные интеллектуальные поисковые алгоритмы,
которые ближе к человеческому способу обработки информации и способны учитывать неопределённость как в данных так и в запросах.
Третья глава посвящена анализу методов и моделей повышения точности информационного поиска в условиях частично скрытых данных, что очень важно в условия поиска информации в сети Интернет, где множество ресурсов являются закрытыми, а документы могут ссылаться на ресурсы, отсутствующие в открытом доступе.
Важным аспектом главы является сравнение точности предложенных методов, таких как расширение запроса, фреймовый подход и нечёткая логика. Показано, что каждый из этих методов имеет свои преимущества и ограничения. Например, расширение запроса повышает полноту поиска, но может приводить к увеличению информационного шума, в то время как фреймовый подход обеспечивает высокую семантическую точность, но требует значительных усилий для создания и поддержания базы знаний.
Примером асимметрии является библиотека eLIBRARY, где документы распределены по уровням доступа, значительная часть из них частично скрыта. Аналогично, ошибки в библиографическом описании приводят к непреднамеренному сокрытию данных.
Нечёткая же логика позволяет моделировать размытые критерии релевантности, учитывать контекст и степень соответствия документа запросу, а не только бинарное совпадение ключевых слов.
Четвертая глава посвящена анализу точности работы интеллектуального алгоритма поиска информации в сравнении с традиционными методами.
В начале главы описывается устройство программы, разработанной для сравнения двух подходов: традиционного поиска по ключевым словам и интеллектуального поиска на основе методов машинного обучения. Программа реализована на языке Python с использованием библиотек numpy, sentence_transformers и matplotlib, что позволяет обрабатывать данные, применять современные модели семантического поиска и визуализировать результаты. В главе продемонстрировано превосходство интеллектуального алгоритма информационного поиска над традиционным.
1. Необходимость применения методов машинного обучения в алгоритмах информационного поиска в сети Интернет
1.1. Актуальность научно-исследовательской работы
В наши дни скорость генерации и распространения информации достигла беспрецедентных масштабов. Сеть Интернет, являясь ключевой мировой платформой информационного обмена, ежедневно пополняется невероятно огромными объемами данных, немалая часть которых представляет научную, образовательную и культурную ценность.
Первоначально информационное пространство сети Интернет рассматривали как сетевой информационный массив. На тот момент задача эффективного информационного поиска в традиционных информационных массивах уже была глубоко проработана как на фундаментальном, так и на прикладном уровнях. Поэтому методы и приёмы поиска, реализованные и предлагаемые для традиционных массивов, были спроецированы исследователями на Интернет-массив. Тем не менее, содержащаяся в Интернете информация ни качественно, ни количественно не соответствует традиционным представлениям об информационных массивах. Возникшая в области Интернет-поиска проблема связана с тем, что интеллектуальные методы поиска, разработанные и реализованные в традиционных информационно-поисковых системах (ИПС), поначалу показали свою высокую эффективность, но в последующем их оказалось невозможно реализовать на Интернет-массиве в силу его серьёзных отличий от традиционных информационных массивов [63, 116].
Во-первых, невозможно получить точные данные об объёме поискового массива. Согласно предположениям исследователей, к 2025 году общий объём информации должен был достигнуть объёма в 163 зеттабайта [1] (1Збайт = 1021байт), но данный прогноз был выдвинут до появления многих существующих на данный момент социальных сетей и медиа-
ресурсов. В это же время объем поисковой выборки поисковых машин (ПМ) сети Интернет составляет в среднем одну тысячу документов вне зависимости от поискового запроса [2].
Во-вторых, информация в сети Интернет чрезвычайно динамична. Продолжительность существования половины страниц в Интернете в среднем не превышает 10 дней [3], а объём всей существующей информации в сети возрастает в 2 раза каждый год.
В-третьих, данные в Интернете не являются структурированными и довольно часто являются некачественными. Принято считать, что Интернет -это распределенный гипертекст, подразумевающий наличие концептуальной модели, накладывающей ограничения согласованности на данные и гиперсвязи, но это не так. Около 30% информации в сети Интернет составляют точные или приблизительные копии других документов [4]. Популяризация рерайтинга и копирайтинга, наполнение Интернет-ресурсов их результатами в виде статей, постов и т.п. негативно повлияли на достоверность, полноту и объективность информации. Важную роль играет и отсутствие контроля публикуемой информации в Интернете, вследствие чего значительная часть данных может быть некорректной, устаревшей, плохо сформулированной, ложной, содержащей массу ошибок (опечаток, фактических и грамматических ошибок) или субъективной. Особый вред качеству информации в сети Интернет наносит обилие документов, созданных авторами методами с применением методов копирайтинга без надлежащей компетенции в рассматриваемых ими вопросах [50, 61].
В-четвертых, некоторые типы информационных источников зачастую обладают низкой ценностью. Веб-форумы, пользовательские блоги и социальные сети содержат сугубо субъективные точки зрения слабо разбирающихся в конкретной теме участников беседы. Процентное содержание ценных данных на таких ресурсах несущественно. Тем не менее, данные источники информации участвуют в индексировании (добавлении
сведений роботом ПМ в базу данных, которая впоследствии используется для поиска информации) на равных правах с теми же научными статьями.
В-пятых, информация в Интернете представлена множеством разных форматов. Интернет содержит текстовую, графическую, аудио, видео и прочую мультимедийную и интерактивную информацию. Более того, каждый вид представления информации основан на разных форматах файлов. Например, источники одних только текстовых данных представлены форматами html, txt, rtf, doc (docx), odt, djvu, fb2, epub, pdf и т.д. Очевидно, что данное многообразие видов данных и форматов их представления значительно усложняет процесс поиска информации [9, 10, 77].
Таким образом, под информационным массивом Интернета можно подразумевать бесконечный, неструктурированный массив документов различных форматов, находящийся в процессе постоянного изменения, характеристиками которого являются низкое качество, избыточность и дублирование информации.
Именно поэтому необходимо разработать алгоритм поиска информации в сети Интернет, который будет производить точный поиск в Интернет-массиве. Решить проблемы поиска, связанные с перечисленными ранее особенностями информации, можно с применением алгоритмов интеллектуального поиска, включающих в себя алгоритмы классификации и ранжирования, методы кластеризации и алгоритмы машинного обучения [5].
Целью данного исследования является формирование комплексного алгоритма интеллектуального поиска информации в сети Интернет для формирования электронной библиотеки. Для достижения этой цели необходимо выполнить ряд задач:
- Проанализировать методы и алгоритмы для усовершенствования интеллектуального поиска, среди которых: машинное обучение, алгоритмы поиска, методы поиска;
- Изучить существующие тенденции на рынке;
- Определить стандартные методы повышения точности поисковых задач и на их основе сформировать улучшенный алгоритм повышения точности поиска;
- Провести сравнительный анализ различных алгоритмов поиска;
1.2. Виды поиска информации
Поиск информации в цифровых массивах классифицируется по методу обработки данных и типу искомых объектов. Современные системы комбинируют несколько видов поиска для повышения релевантности результатов, что особенно важно для специализированных платформ, таких как электронные библиотеки, где пользователи сталкиваются с необходимостью анализа больших объёмов неструктурированных данных (научные статьи, диссертации, архивы). В этом разделе мы рассмотрим основные виды поиска, их преимущества, ограничения и применение в современных системах [62, 78].
Поиск по метаданным - это метод поиска информации по таким атрибутам документа, как название документа, дата создания, размер, автор и т.д. Такой поиск можно встретить в базах научных работ по типу «eLГОRARY». Недостатками этого вида поиска является необходимость формировать метаданные для искомой информации, что делает невозможным поиск в неструктурированных данных [65, 66].
Полнотекстовый поиск - это автоматизированный поиск информации, производимый не по именам документам, а по их полному или частичному содержимому. ПМ, работающие на базе полнотекстового поиска, анализируют содержимое документов и используют специальные индексы, чтобы находить результаты, релевантные поисковому запросу, даже если
точные слова запроса в них не содержатся. Многие современные поисковые системы основаны на полнотекстовом поиске.
Тем не менее, подробности реализации полнотекстового поиска и особенности архитектуры ПМ на базе полнотекстового поиска освещаются их разработчиками лишь частично. Например, в рамках семинара РОМИП-2004 были описаны некоторые аспекты полнотекстового поиска ПМ Яндекс [6]. С точки зрения архитектуры, полнотекстовый индекс Яндекса устроен по традиционной для информационного поиска схеме, включающей [82, 85]:
- «keyfile» - блочно организованный файл, содержащий ключи (слова);
- «invfile» - файл, содержащий списки словопозиций, упакованные с использованием Variable Byte Coding и оригинальной схемы Яндекса [101], оптимизированной для архитектуры Intel;
- Субиндекс, ускоряющий операции пересечения списков.
Таким образом можно выделить несколько этапов работы среднестатистического алгоритма полнотекстового поиска:
Индексирование - создание индекса, где каждому слову сопоставлен список документов;
Обработка естественного языка:
- Лемматизация;
- Удаление стоп-слов;
- Учёт морфологии.
Контекстный анализ - учёт близости слов в запросе.
К недостаткам такого вида поиска относится чувствительность к формулировкам, а также коннекту, так как недостаточно чёткие формулировки могут приводить к огромной погрешности.
Мультимодальный поиск - это поиск, комбинирующий анализ разных типов данных (текст, изображения, видео, аудио) и актуальный для современных коллекций, где документы содержат не только текст, но и графики, диаграммы, фотографии. Такой подход позволяет анализировать не только текст, но и иные данные, будь то медиа или файлы. При этом используются технологии распознавания изображений, оптическое распознавание символов, распознавание речи и транскрипция. Данный подход требует куда более высоких вычислительных мощностей, так как в обработке задействовано множество алгоритмов для анализа данных различны форматов.
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Разработка и модификация моделей и алгоритмов поиска данных в INTERNET/INTRANET среде для улучшения качества поиска2014 год, кандидат наук Хорошко, Максим Болеславович
Метод и алгоритмы интеллектуальной обработки информации в корпоративных хранилищах2012 год, кандидат технических наук Летовальцев, Виктор Иванович
Модель структурного представления текстовой информации и метод ее тематического анализа на основе частотно-контекстной классификации2003 год, кандидат технических наук Чугреев, Валерий Леонидович
Разработка и исследование нечетких моделей интеллектуального поискового сервиса для сетевых сообществ Интернет2011 год, кандидат технических наук Краснощеков, Евгений Евгеньевич
Разработка методов и инструментальных средств повышения пертинентности поиска в современных информационных средах2010 год, кандидат технических наук Терехов, Алексей Андреевич
Список литературы диссертационного исследования кандидат наук Аль-Амиди Мустафа Абдулкадим Дхаир, 2026 год
Список литературы
1. A combined algorithm based on fuzzy clustering for textual information analysis. / Gromov YY, Karasev P.I., Shelpuck M.I., Antonov E.V., Mustafa Abdulkadhim Dhahir Al-Ameedee. // The proceedings will be submitted to IEEE Xplore online digital library (published by the Institute of Electrical and Electronics Engineers) and indexed by SCOPUS November, 8 - 10 2023 | Lipetsk, Russia
2. A. Bonarini, Evolutionary learning of fuzzy rules: competition and cooperation, in: W. Pedrycz (Ed.), Fuzzy Modelling: Paradigms and Practice, Kluwer Academic Press, Norwell, MA, 1996, pp. 265-284.https://www.kaggle.com/datasets/yasserh/breast-cancer-dataset
3. A. Geyer-Schulz, Fuzzy Rule-Based Expert Systems and Genetic Machine Learning, Physica-Verlag, Heidelberg, 1995.
4. A. Gonzalez, R. Perez, Selection of relevant features in a fuzzy genetic learning algorithm, IEEE Trans. System Man Cybernet. B 31 (3) (2001) 417-425. https://www.cancerimagingarchive.net/collection/cbis-ddsm/
5. A. Rajapakse, K. Furuta, S. Kondo, Evolutionary learning of fuzzy logic controllers and their adaptation through perpetual evolution, IEEE Trans. Fuzzy Systems 10 (3) (2002) 309-321.
6. A. Rajapakse, K. Furuta, S. Kondo, Evolutionary learning of fuzzy logic controllers and their adaptation through perpetual evolution, IEEE Trans. Fuzzy Systems 10 (3) (2002) 309-321.
7. A.F. Gomez-Skarmeta, F. Jimenez, Fuzzy modeling with hybrid systems, Fuzzy Sets and Systems 104 (1999) 199-208.
8. Agichtein, E. Learning search engine specific query transformations for question answering / E.Agichtein, S.Lawrence, L.Gravano // Proc. of the WWW-10, 2001. - P. 169-178.
9. Akerlof, G.A. The market for "Lemons": Quality uncertainty and the market mechanism // The Quarterly Journal of Economics. - 1970. - Vol.84, No. 3 (Aug.). - P.488-500.
10. Al-Ameedee Mustafa Abdulkadhim Dhahir. Моделирование действий потенциального злоумышленника в коммерческой организации.// Нано-био технологии. Теплоэнергетика. Математическое моделирование: сборник статей международной научно-практической конференции 27-28 февраля 2024 года, г.Липецк. - 2024. -303 с. - С. 164-167.
11. Al-Kudaimi А.А.А., Sunaid H.A.S., Tyutyunnik V.M. Simulation of interactive data processing information systems. Science and business: ways to develop, 2019, No.2(92), pp.151-154.
12. Angelov P. P., Zhou X. Evolving fuzzy-rule-based classifiers from data streams //Ieee transactions on fuzzy systems. - 2008. - Т. 16. - №. 6. - С. 1462-1475.
13. Arasu A., Cho J., Garcia-Molina H., Paepcke A., Raghavan S. Searching the web // ACM Transactions on Internet Technology, 2001. - № 1(1). -P. 2-43.
14. B. Carse, T.C. Fogarty, A. Munro, Evolving fuzzy rule based controllers using genetic algorithms, Fuzzy Sets and Systems 80 (1996) 273-294.
15. B.P. Buckles, F.E. Petry, D. Prabhu, R. George, R. Srikanth, Fuzzy clustering with genetic search, in Proc. 1st IEEE Conf. on Evolutionary Computation (ICEC'94), Orlando, FL, USA, 1994, pp. 46 -50.
16. Baeza-Yates R., Ribeiro-Neto B. Modern Information Retrieval // ACM Press, 1999.- pp. 17-28
17. Bashar, Khdr & Farou, Zakarya. (2021). A Comparison of Classification Models for Imbalanced Datasets. 10.13140/RG.2.2.26879.12966.
18. C. Karr, E.J. Gentry, Fuzzy control of pH using genetic algorithms, IEEE Trans. Fuzzy Systems 1 (1) (1993) 46-53.
19. C. Karr, Genetic algorithms for fuzzy controllers, AI Expert 6 (2) (1991) 26-33.
20. C.A. Coello, D.A. Van Veldhuizen, G.B. Lamont, Evolutionary Algorithms for Solving Multi-Objective Problems, Kluwer Academic Publishers, Dordrecht, 2002.
21. Conf. on Fuzzy Systems (FUZZ-IEEE'94), Vol. 3, Orlando, FL, USA, 1994, pp. 1708-1712.
22. Cordón, O., María José del Jesús, Francisco Herrera and Manuel Lozano. "MOGUL: A methodology to obtain genetic fuzzy rule-based systems under the iterative rule learning approach." Int. J. Intell. Syst. 14 (1999): 1123 -1153.
23. D. Nauck, F. Klawoon, R. Kruse, Foundations of Neuro-Fuzzy Systems, Wiley, New York, 1997.
24. D. Park, A. Kandel, G. Langholz, Genetic-based new fuzzy reasoning models with application to fuzzy control, IEEE Trans. Systems Man Cybernet. 24 (1) (1994) 39-47.
25. D.E. Goldberg, Genetic Algorithms in Search, Optimization, and Machine Learning, Addison-Wesley, Reading, MA, 1989.
26. D.E. Goldberg, The Design of Competent Genetic Algorithms: Steps Toward a Computational Theory of Innovation, Kluwer Academic Publishers, Dordrecht, 2002.
27. D.T. Pham, D. Karaboga, Optimum design of fuzzy logic controllers using genetic algorithms, J. System Eng. 1 (1991) 114-118.
28. Data Age 2025: The Evolution of Data to Life-Critical // Seagate URL: https://www.seagate.com/www-content/our-story/trends/files/Seagate-WP-DataAge2025-March-2017.pdf (дата обращения: 19.08.2025).
29. Decision Support in Problems of Course Selection During Personalization of Learning Based on the Fuzzy Logic Method / Zh. Seitakhmetova, S. Kumargazhanova, A. Bektenova [et al.] // Труды университета. - 2024. - No. 1(94). - P. 535-541. - DOI 10.52209/1609-1825_2024_1_535. -EDN LFKZAQ.
30. Di Wang X. Z., Keane J. A survey of hierarchical fuzzy systems //International journal of computational cognition. - 2006. - Т. 4. - №. 1. - С. 1829.
31. E. Alba, C. Cotta, J.M. Troya, Evolutionary design of fuzzy logic controllers using strongly-typed GP, Mathware Soft Comput. 6 (1) (1999) 109-124
32. E. Alba, M. Tomassini, Parallelism and evolutionary algorithms, IEEE Trans. Evolutionary Computation 6 (5) (2002) 443-462.
33. E. Sanchez, T. Shibata, L. Zadeh (Eds.), Genetic Algorithms and Fuzzy Logic Systems. Soft Computing Perspectives, World Scientific, Singapore, 1997.
34. F. Cheong, R. Lai, Constraining the optimization of a fuzzy logic controller using an enhanced genetic algorithm, IEEE Trans. Systems Man Cybernet. B 30 (2000) 31-46.
35. F. Herrera, J.L. Verdegay (Eds.), Genetic Algorithms and Soft Computing, Physica-Verlag, Wurzburg, 1996.
36. F. Herrera, M. Lozano, J.L. Verdegay, Tuning fuzzy controllers by genetic algorithms, Int. J. Approx. Reasoning 12 (1995) 299-315.
37. Fernandez A. et al. Evolutionary fuzzy systems for explainable artificial intelligence: Why, when, what for, and where to? //IEEE Computational intelligence magazine. - 2019. - Т. 14. - №. 1. - С. 69-81.
38. Gualtieri, M. The Forrester wave: Cognitive search and knowledge discovery solution. - [Электронный ресурс]. - URL: https://www.forrester.com/blogs/17-06-12-cognitive_search_is _the_ai_version _of_ enterprise_search.
39. H. Heider, T. Drabe, A cascade genetic algorithm for improving fuzzy-system design, Int. J. Approximate Reasoning 17 (4) (1997) 351-368.
40. H. Ishibuchi, K. Nozaki, N. Yamamoto, H. Tanaka, Selecting fuzzy if-then rules for classification problems using genetic algorithms, IEEE Trans. Fuzzy Systems 3 (3) (1995) 260-270.
41. H. Ishibuchi, T. Murata, A genetic-algorithm-based fuzzy partition method for pattern classification problems, in: F. Herrera, J.L. Verdegay (Eds.), Genetic Algorithms and Soft Computing, Physica-Verlag, Wurzburg, 1996, pp. 555-578.
42. H. Ishibuchi, T. Nakashima, Effect of rule weights in fuzzy rule-based classification systems, IEEE Trans. Fuzzy Systems 9 (4) (2001) 506-515.
43. H. Ishibuchi, T. Nakashima, T. Murata, Performance evaluation of fuzzy classifier systems for multidimensional pattern classification problems, IEEE Trans. System Man Cybernet. 29 (1999) 601-618.
44. H.B. Gurocak, A genetic-algorithm-based method for tuning fuzzy logic controllers, Fuzzy Sets and Systems 108 (1) (1999) 39-47.
45. H.-M. Lee, C.-M. Chen, J.-M. Chen, Y-L. Jou, An efficient fuzzy classifier with feature selection based on fuzzy entropy, IEEE Trans. Systems Man Cybernet. B 31 (3) (2001) 426-432.
46. http://www.lucene.apache.org/core/. - [Электронный ресурс]. - Дата обращения: 15.02.2023.
47. I.G. Damousis, P. Dokopoulos, A fuzzy expert system for the forecasting of wind speed and power generation in wind farms, in Proc. of Int. Conf. on Power Industry Computer Applications PICA 2001, Sydney, Australia, 2001, pp. 63- 69.
48. I-F. Chung, C.J. Lin, C.T. Lin, A GA-based fuzzy adaptive learning control network, Fuzzy Sets and Systems 112 (1) (2000) 65-84.
49. Karaboga D., Kaya E. Adaptive network based fuzzy inference system (ANFIS) training approaches: a comprehensive survey //Artificial Intelligence Review. - 2019. - Т. 52. - С. 2263-2293.
50. Leite D., Skrjanc I., Gomide F. An overview on evolving systems and learning from stream data //Evolving systems. - 2020. - Т. 11. - №. 2. - С. 181198.
51. Made the presentation Smart card with biometric authentication using a fingerprint scanner / Gromov YY, Karasev P.I., Gladyshev M.A., Mustafa Abdulkadhim Dhahir Al-Ameedee, Shamsuldaeen Haidar Abdulwahhab H, Almali Ahmed Adnan Lateef. //The proceedings will be submitted to IEEE Xplore online digital library (published by the Institute of Electrical and Electronics Engineers) and indexed by SCOPUS November, 8 - 10 2023 | Lipetsk, Russia.
52. Maksimov N.V., Golitsyna O.L. From semantic to cognitive information search: the fundamental principles and models of deep semantic search // Automatic documentation and mathematical linguistics. - 2022. - Vol.56, No.3.
- P.145-159. DOI: 10.3103/S0005105522030074.
53. METSK-HDe: A multiobjective evolutionary algorithm to learn accurate TSK-fuzzy systems in high-dimensional and large-scale regression problems / M.J. Gacto, M. Galende, R. Alcalá, F. Herrera // Information Sciences.
- 2014. - Vol. 276. - P. 63-79.
54. Moral A. et al. Explainable fuzzy systems. - New York : Springer International Publishing, 2021.
55. Ojha V., Abraham A., Snásel V. Heuristic design of fuzzy inference systems: A review of three decades of research //Engineering Applications of Artificial Intelligence. - 2019. - Т. 85. - С. 845-864.
56. Taylor H., Fernandes B., Wraight S. The evolution of complementary cognition: humans cooperatively adapt and evolve through a system of collective cognitive search // Cambridge Archaeol. J. - 2022. - Vol.32, No.1. - P.61-77. DOI: 10.1017/S0959774321000329.
57. The Importance of Google PageRank: A Guide For Small Business Executives // HubSpot URL: https://blog.hubspot.com/blog/tabid/6307/bid/45/the-importance-of-google-pagerank-a-guide-for-small-business-executives.aspx (дата обращения: 27.08.2025).
58. The PageRank Citation Ranking: Bringing Order to the Web // AWS URL: https://knowen-production. s3 .amazonaws.com/uploads/attachment/file/1887/The%2BPageRank% 2BCitation%2BRanking%2B-%2BGoogle%2Bguys.pdf (дата обращения: 25.08.2025).
59. Todd P.M., Hills T.T., Robbins T.W. Search, goals, and the brain, Cognitive Search: Evolution, Algorithms, and the Brain. - Massachusetts: MIT Press, 2012. - P. 125-156.
60. Torra V. A review of the construction of hierarchical fuzzy systems //International journal of intelligent systems. - 2002. - Т. 17. - №. 5. - С. 531-543.
61. Tyutyunnik, V.M. Data analysis and information process model for application information systems. Industrial ASU and controllers, 2019, No.4, pp.1929 (Rus).
62. Tyutyunnik, V.M. Information flows in models of thermodynamics of irreversible processes and self-organization. Devices and systems. Management, control, diagnosis, 2019, No.4, pp.27-31.
63. Tyutyunnik, V.M. Thermodynamics of irreversible processes and self-organization in information flows. International Journal of Advanced Research in IT and Engineering, 2019, Vol.8, No.3 (March), pp.18-24.
64. Yilmaz Z.A., Wang Sh., Yang W., Zhang H., and Lin J. Applying bert to document retrieval with birch. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP): System Demonstrations, 2019, pp.19-24;
65. Алгоритм «Палех»: как нейронные сети помогают поиску Яндекса // Яндекс URL: https://yandex.ru/blog/company/algoritm-palekh-kak-neyronnye-seti-pomogayut-poisku-yandeksa (дата обращения: 19.08.2025).
66. Аль Каркхи, М. М. Повышение эффективности поиска в многофакторных потоках Интернета с частично скрытыми данными / М. М. Аль Каркхи // Информационные процессы, системы и технологии. - 2023. -Т. 4, № 2(26). - С. 22-38. - DOI 10.52529/27821617_2023_4_2_22. - EDN CFSEYH.
67. Анализ методов и средств аутентификации пользователей для защиты информации автоматизированной системы / Мустафа Абдулкадхим Ал-Амееди. // Проектное управление в строительстве. - 2023. - №2(29). -С.86-89.
68. Анализ решений в области средств защиты информации в автоматизированной системе / Мустафа Абдулкадхим Ал-Амееди. // Проектное управление в строительстве. - 2023. - №2(29). - С.81-86.
69. Анализ решений в области средств защиты информации в автоматизированной системе / К.В. Стародубов, Шамсулдин Хайдар Абдулваххаб Х., Мустафа Абдулкадим Ал-Амееди, Алмали Ахмед Аднан Латиф// Научный журнал актуальные исследования - Белгород, 2023.- C.50-53.
70. Анализ решений для безопасной передачи данных между Android-приложениями на одном устройстве / Мустафа Абдулкадим Ал-Амееди. , В.В.Свиридов, И.П.Карасев // Информационная безопасность и защита персональных данных. Проблемы и пути их решения: сборник материалов и докладов / под общей редакцией М. Ю. Рытова - Брянск : БГТУ, 2023.- 297 с. - С. 232-235.
71. Анализ современных систем защиты информации агропромышленного комплекса / K. V. Kuptsov, Shamsuldaeen Haidar Abdulwahhab H., Mustafa Abdulkadhim Dhahir Al-Ameedee // «Цифровизация агропромышленного комплекса» IV Международная научно-практическая конференция - Тамбов, 2024. - T.1.-C.95-99.
72. Анализ современных систем защиты информации промышленного комплекса / К.В.Купцов, Шамсулдин Хайдар Абдулваххаб Х., Мустафа Абдулкадим Аль-Амиди Дхаир // Проблемные вопросы моделирования систем и процессов, конференция - Воронеж, 2024. - C.628-631.
73. Ананенков, В. А. Применение xgboost для решения задач классификации / В. А. Ананенков // Инновации. Наука. Образование. - 2020. - № 24. - С. 1663-1669. - EDN VZVDYM.
74. Болдырев, В. В. Анализ эффективности алгоритмов нечеткого вывода sugeno и mamdani в задачах оптимизации автоматизированных систем слежения / В. В. Болдырев // Производственные технологии будущего: от
создания к внедрению : Материалы IV Международной научно-практической конференции, Комсомольск-на-Амуре, 16-26 февраля 2021 года / Редколлегия: С.И. Сухоруков (отв. ред.), А.С. Гудим, Н.Н. Любушкина. -Комсомольск-на-Амуре: Комсомольский-на-Амуре государственный университет, 2021. - С. 164-167. - EDN AMBIIK.
75. Бузылев, Ф. Н. Фильтрация цифровых изображений на основе элементов нечеткой логики / Ф. Н. Бузылев, Д. Д. Мухин, С. Н. Щербакова // Технологии и материалы для экстремальных условий : материалы XIV Всероссийской научной конференции, с. Агой, Россия, 16-20 сентября 2019 года. - с. Агой, Россия: Межведомственный центр аналитических исследований в области физики, химии и биологии при Президиуме Российской академии наук, 2019. - С. 281-284. - DOI 10.26103/MZ.2019.55.95.040. - EDN ZXGEEN.
76. Васильева, Н. В. Построение функций принадлежности параметров технологического процесса на основе нечеткой кластеризации производственных данных / Н. В. Васильева, Э. Д. Кадыров // Записки Горного института. - 2013. - Т. 202. - С. 251-253. - EDN ROOUZJ.
77. Вылегжанин, А. Д. Сравнительный анализ алгоритмов интеллектуального поиска / А. Д. Вылегжанин, Е. А. Иванова // Научное обеспечение агропромышленного комплекса : Сборник статей по материалам 79-й научно-практической конференции студентов по итогам НИР за 2023 год. В 2-х частях, Краснодар, 25 апреля 2024 года. - Краснодар: Кубанский государственный аграрный университет им. И.Т. Трубилина, 2024. - С. 245247. - EDN NFYMZT.
78. Громов, Ю.Ю. Анализ Марковских моделей непрерывных случайных процессов в локальных сетях / Ю.Ю.Громов, И.Г.Карпов, Т.Г.Самхарадзе, В.М.Тютюнник // Инженерная физика. - 2005. - № 3. - С.47-50.
79. Громов, Ю.Ю. Структурная избыточность в детерминированных топологиях информационных сетей с подвижными объектами / Ю.Ю.Громов,
И.И.Пасечников, В.В.Желонкин, В.М.Тютюнник, Т.Г.Самхарадзе // Инженерная физика. - 2005. - № 3. - С.55-59.
80. Двумерный нечеткий метод кластеризации ^средних для сегментации изображений / Ю.Ю.Громов, П.И.Карасев, Шамсулдин Хайдар Абдулваххаб Х., Мустафа Абдулкадим Аль-Амиди Дхаир // Журнал век 21, 2024. - № 4 (68). - СШ-117.
81. Жетимекова, Г. Ж. Нечеткая классификация с использованием нечеткого анализа кластеризации / Г. Ж. Жетимекова // Вестник Кыргызского государственного университета строительства, транспорта и архитектуры им. Н.Исанова. - 2014. - № 4. - С. 117-120. - EDN UMKRWN.
82. Изменение критериев релевантности и проблема этапности выполнения информационного поиска: пер. с англ. // Экспресс-информация. -2001. - №19. - С6-18; Некрестьянов, И. К вопросу об эффективности метода «общего котла» / И.Некрестьянов, М.Некрестьянова, А.Нозик // Труды RCDL'2005. - Ярославль, 2005. - С.84-86.
83. Интеграция смарт-контрактов в системы управления информационной безопасностью / Мустафа Абдулкадим Ал-Амееди., И.С.Новиков, Н.С.Ершов // Информационная безопасность и защита персональных данных. Проблемы и пути их решения : сборник материалов и докладов / под общей редакцией М. Ю. Рытова - Брянск : БГТУ, 2023.- 297 с. - С. 186-190.
84. Информационная безопасность в биотехнологических системах теплоэнергетики: риски и методы защиты / Т.А.Григорьев, Д.Е.Ким, Аль-Амиди Мустафа Абдулкадим Дхаир, Аль-Судани Зайд Али Хуссейн // -Липецк,ЛГТУ: Изд-во «Набитем».- 2025
85. Исследование крупномасштабных ИТ-систем / Мустафа Абдулкадим Ал-Амееди., А.С.Катруш, Е.О.Карамышева, П.И.Карасев // Информационная безопасность и защита персональных данных. Проблемы и пути их решения : сборник материалов и докладов / под общей редакцией М. Ю. Рытова - Брянск : БГТУ, 2023.- 297 с. - С. 132-135.
86. Классификация запросов и оптимизация факторов для поиска нормативных документов / М.С.Агеев, Б.В.Добров, Н.В.Лукашевич, А.В. Сидоров, С.В.Штернов // Российский семинар по Оценке Методов Информационного Поиска. Труды РОМИП 2009: семинар в рамках Всерос. науч. конф. RCDL'2009, 16 сент. 2009 г. - СПб: НУ ЦСИ, 2009. - С.151-162.
87. Кравец, Е. В. Анализ понятия "нечеткая логика", методы и области применения нечеткой логики / Е. В. Кравец, О. С. Солодова // "Цифра" - реальность, меняющая мир: готовность российской экономики к новым правилам игры : Материалы Национальной научно-практической конференции, Москва, 23 апреля 2019 года. Том 13. - Москва: Федеральное государственное унитарное предприятие "Всероссийский научно-исследовательский институт "Центр", 2019. - С. 110-112. - EDN YXOTFD. https: //archive .ics. uci.edu/dataset/14/breast+cancer
88. Кривенко, М.П. Проблемы разработки и внедрения технологий извлечения информации / М.П.Кривенко, В.ГВасильев // Системы высокой доступности 3-4. - М.: Радиотехника, 2006. - Т.2. - С.6-21.
89. Майстренко, А.В. Информационные технологии в инженерной графике / А.В.Майстренко, Н.В.Майстренко. - Тамбов: Изд-во ФГБОУ ВО «ТГТУ», 2017.
90. Маннинг, К.Д. Введение в информационный поиск: пер. с англ. / К.Д.Маннинг, П.Рагхаван, Х.Шютце. - М.; СПб.; Киев: Вильямс, 2011. - 528 с.
91. Некрестьянов, И. Анализ «лабораторной» парадигмы оценки систем поиска / И.Некрестьянов, М.Некрестьянова, А.Нозик // Интернет-математика 2005: автоматич. обработка Веб-данных. - М, 2005. - С. 189-215.
92. Некрестьянов, И., Пантелеева Н. Системы текстового поиска для Веб / И.Некрестьянов, Н.Пантелеева. [Электронный ресурс]. - URL: meta.math.spbu.ru/_nadejda/papers/web-ir/web-ir.html#SECTION00021.
93. Особенности окрашивания 3D-моделей, синтезируемых в режиме реального времени методами машинной графики / Мустафа Абдулкадхим
Захир. // XXI век: итоги прошлого и проблемы настоящего плюс. - 2023. -Т. 12, №2(62). - С.68-73.
94. Поленок, М. В. О методах машинного обучения при принятии управленческих решений в области здравоохранения / М. В. Поленок, С. В. Бондаренко, И. Р. Козлова, О. Н. Юркова // Вызовы цифровой экономики: тренды развития в условиях последствий пандемии COVID-19 : Сборник статей IV Всероссийской научно-практической конференции, приуроченной к Году науки и технологий в России, Брянск, 25 мая 2021 года. - Брянск: Федеральное государственное бюджетное образовательное учреждение высшего образования "Брянский государственный инженерно-технологический университет", 2021. - С. 225-229. - EDN CFXOPQ.
95. Применение блокчейн технологий в промышленном комплексе / Е.С.Жирнов, Шамсулдин Хайдар Абдулваххаб Х., Мустафа Абдулкадим Аль-Амиди Дхаир // Проблемные вопросы моделирования систем и процессов, конференция - Воронеж, 2024. - C.318-321.
96. Применение блокчейн-технологий в агропромышленном комплексе / E.S.Zhirnov1, Shamsuldaeen Haidar Abdulwahhab H.2, Mustafa Abdulkadhim Al-Ameedee Dhahir3 // Цифровизация агропромышленного комплекса, IV Международная научно-практическая конференция - Тамбов, 2024.- T.1.- C.85-88.
97. Проблемы безопасности интернета вещей в сфере агропромышленного комплекса / А. В. Виноградский, Мустафа Абдулкадим Аль-Амиди Дхаир, Аль-Судани Зайд Али Хуссейн // - Москва: РТУ МИРЭА; АльКадисия, Ирак; Багдад.- Тамбов, 2024.- T.1.- С. 62-65.
98. Проблемы безопасности интернета вещей в сфере производства / Виноградский А.В., Мустафа А.А.А.Д., Аль-Судани З.А.Х. // Проблемные вопросы моделирования систем и процессов. Материалы Всероссийской научно-практической конференции - Воронеж, 2024. - С. 520-523.
99. Проблемы и методы защиты персональных данных в веб-сервисах коммерческой организации / Мустафа Абдулкадим Ал-Амееди.,
А.В.Рязанцев, И.П.Карасев // Информационная безопасность и защита персональных данных. Проблемы и пути их решения : сборник материалов и докладов / под общей редакцией М. Ю. Рытова - Брянск : БГТУ, 2023.- 297 с. - С. 225-228.
100. Светлаков, М. О. Применение алгоритма кластеризации Autonomous Data Partitioning для построения начальной базы правил нечетких классификаторов / М. О. Светлаков // Сборник избранных статей научной сессии ТУСУР. - 2020. - № 1-2. - С. 79-82. - EDN PQYLMQ.
101. Сегалович, И. Яндекс на РОМИП-2004. Некоторые аспекты полнотекстового поиска и ранжирования в Яндексе / И.Сегалович, М.Маслов // Труды РОМИП'2004. - [Электронный ресурс]. - URL: http://download.yandex.ru/company/experience/romip2004/romip2004 aspects.pdf
102. Сегалович, И.В. Методы сравнительного анализа современных поисковых систем и определения объёма Рунета / И.В.Сегалович, Ю.Г. Зеленков, Д.О.Нагорнов // Электронные библиотеки: перспективные методы и технологии, электронные коллекции: тр. VIII Всерос. науч. конф. RCDL'2006. - Суздаль, 2006. - [Электронный ресурс]. - URL: http://download.yandex.ru/company/ paper_76_v1.pdf.
103. Сегментация цветных изображений яблок с использованием методов нечеткой кластеризации / Ю.Ю.Громов, П.И.Карасев, Шамсулдин Хайдар Абдулваххаб Х., Мустафа Абдулкадим Аль-Амиди Дхаир // Журнал век 21, 2024. - № 4 (68). - C.35-40.
104. Сергеев, A. Ю. Методика повышения эффективности тематико-ориентированного интернет-поиска / A. Ю. Сергеев, В. М. Тютюнник // Фундаментальные исследования. - 2013. - № 8-2. - С. 306-311. - EDN QJEZFP.
105. Сергеев, А.Ю. Методика оценки и повышения эффективности тематико-ориентированного интернет-поиска с помощью минимизации объёма поисковой выборки, обеспечивающей тематическую полноту поиска /
A.Ю.Сергеев, В.М.Тютюнник // Научно-техническая информация. Сер.2: Информ. процессы и системы. - 2012. - №7. - С.18-36.
106. Сергеев, А.Ю. Тематико-ориентированный поиск в распределённых информационных системах: монография / А.Ю.Сергеев,
B.М.Тютюнник. - М.; СПб.; Баку; Вена; Гамбург: изд-во МИНЦ, 2013. - 160 с.
107. Создание безопасной сети для агробизнеса: пример внедрения vpn-технологий в сельском хозяйстве / A.R.Emin, Mustafa Abdulkadhim Dhahir Al-Ameedee , Shamsuldaeen Haidar Abdulwahhab H. // Цифровизация агропромышленного комплекса , IV Международная научно-практическая конференция - Тамбов, 2024. - T.1. -C.157-160.
108. Требования к сложности паролей и анализ методов парольной защиты / Мустафа Абдулкадим Ал-Амееди., Н.Д.Потапова, М.А.Гладышев // Информационная безопасность и защита персональных данных. Проблемы и пути их решения : сборник материалов и докладов / под общей редакцией М. Ю. Рытова - Брянск : БГТУ, 2023.- 297 с. - С. 212-215.
109. Тютюнник, В. М. Аналитические и процедурная модели информационного поиска в многофакторных потоках с частично скрытыми данными / В. М. Тютюнник, К. М. М. Аль // Промышленные АСУ и контроллеры. - 2023. - № 5. - С. 8-19. - DOI 10.25791/asu.5.2023.1435. - EDN TNWDZZ.
110. Тютюнник, В.М. Библиотеки сирийских высших учебных заведений: современное состояние и пути развития / В.М.Тютюнник, Х.Шегри // Научные и технические библиотеки. - 2022. - №3. - С. 61-72. DOI: 10.33186/1027-3689-2022-3-61-84.
111. Тютюнник, В.М. Интеллектуальные информационные системы: учебник: 2-е изд., стереотип. / В.М.Тютюнник, А.Д.Дубровин. - Тамбов; М.; СПб.; Баку; Вена; Гамбург: изд-во МИНЦ «Нобелистика», 2012. - 356 с.
112. Тютюнник, В.М. Математическая модель информационной системы как открытой динамической системы // Компьютерная хроника. -2001. - № 6. - С.69-71.
113. Тютюнник, В.М. Математическая модель информационно -поисковой системы виртуального музея нобелистики / В.М.Тютюнник, И.В.Тявкин, А.О.Войтин // Формирование профессионала в условиях региона: новые подходы: материалы XV Междунар. науч. конф., г. Тамбов, 27-28 ноября 2015 г. / под ред. В.М.Тютюнника, С.А.Мамонтова. - Тамбов; М.; СПб.; Баку; Вена; Гамбург: изд-во МИНЦ «Нобелистика», 2015. - С.64-65.
114. Тютюнник, В.М. Музей, библиотека и архив семейства Нобелей и лауреатов Нобелевских премий / В.М.Тютюнник, В.В.Каменская, Д.С.Рязанов // Перспективы науки. - 2016. - №8(83). - С.66-71.
115. Тютюнник, В.М. Экспериментальная оценка показателей функциональной эффективности сетевого информационного проблемно-ориентированного поиска (на примере нобелистики) / В.М.Тютюнник, А.Ю.Сергеев // Информатика: проблемы, методология, технологии: Материалы 7-й междунар. науч.-метод. конф., Воронеж, ВГУ, 8-9 февр.2007 г. - Воронеж: Воронеж. гос. ун-т, 2007. - С.430-434.
116. Тявкин, И.В. Математическая модель информационного поиска и оценка эффективности поисковой системы / И.В.Тявкин, В.М.Тютюнник // Вестн. Тамб. гос. техн. ун-та. - 2008. - Т.14, №3. - С.478-481.
117. Тявкин, И.В. Оценка эффективности поисковой системы виртуального музея нобелистики / И.В.Тявкин, А.О.Войтин, В.М.Тютюнник // Формирование профессионала в условиях региона: новые подходы: материалы XV Междунар. науч. конф., г. Тамбов, 27-28 ноября 2015 г. / под ред. В.М.Тютюнника, С.А.Мамонтова. - Тамбов; М.; СПб.; Баку; Вена; Гамбург: изд-во МИНЦ «Нобелистика», 2015. - С.57-60.
118. Тявкин, И.В. Поиск в информационно-поисковой системе виртуального музея нобелистики / И.В.Тявкин, В.М.Тютюнник // Успехи соврем. естествознания. - 2010. - № 1. - С.128-132.
119. Усиление контракта для изображений со сжатием на основе нечеткого метода / Yu.Yu.Gromov , S.V.Artemova , P. U. Pushkin , AL-Ameedee Mustafa Abdulkadhim Dhahir .//СТЭК-В журнал Первью , 2024 , С 62-65.
120. Устойчивость агропредприятий к кибератакам: Угрозы и приемы по их предотвращению / Mustafa Abdulkadhim Dhahir Al-Ameedee, Shamsuldaeen Haidar Abdulwahhab H. // Цифровизация агропромышленного комплекса, IV Международная научно-практическая конференция - Тамбов, 2024.- T.1.-C.69-72.
121. Устойчивость транспортной отрасли к кибератакам: грозы и приемы по их предотвращению /А.А. Двойных, Мустафа Абдулкадим Аль-Амиди Дхаир, Шамсулдин Хайдар Абдулваххаб Х. // Проблемные вопросы моделирования систем и процессов, конференция - Воронеж, 2024. - C.301-304.
122. Ходашинский, И. А. Методика построения компактных и точных нечетких систем типа Такаги-Сугено / И. А. Ходашинский, К. С. Сарин // Доклады Томского государственного университета систем управления и радиоэлектроники. - 2016. - Т. 19, № 1. - С. 50-56. - DOI 10.21293/1818-04422016-19-1-50-56. - EDN WAGWPJ.
123. Шеллинг, Т. Стратегия конфликта: пер. с англ. - 2-е изд., испр. -М.: ИРИСЭН; Социум, 2019. - 368 с. - (Международные отношения); Nogueira R. and Cho K. Passage re-ranking with bert. arXiv preprint arXiv:1901.04085, 2019;
124. Шиллер, Р. Иррациональный оптимизм: Как безрассудное поведение управляет рынками: пер. с англ. - М.: Альпина ПРО, 2023. - 418 с.
125. Яндекс запустил Нейро. Рассказываем, как он работает // Хабр URL: https://habr.com/ru/companies/yandex/articles/807801/ (дата обращения: 21.08.2025).
ПРИЛОЖЕНИЕ А. Программный код сравнения различных алгоритмов машинного
обучения
import numpy as np
from sentence_transformers import SentenceTransformer import matplotlib.pyplot as plt
model = SentenceTransformer('sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2')
documents = [
"Машинное обучение используется для классификации изображений и распознавания объектов",
"Глубокое обучение - это продвинутая техника машинного обучения на основе нейронных сетей",
"Python является популярным языком программирования для анализа данных и AI",
"Нейронные сети имитируют работу человеческого мозга для решения сложных задач",
"Искусственный интеллект преобразует многие отрасли включая медицину и финансы",
"Котики - милые домашние животные, которые любят играть с мячиком", "Программирование на Java требует написания многословного кода",
"Большие данные обрабатываются с помощью распределенных систем как
Hadoop" ]
queries = [
"искусственный интеллект и нейросети", "как научить машину думать", "язык для анализа информации", "распознавание картинок с помощью компьютера", "что такое глубокие нейросети"
]
def traditional_keyword_search(query, docs): query_words = query.lower().split() results = []
for i, doc in enumerate(docs): matches = 0
for word in query_words: if len(word) > 3 and word in doc.lower(): matches += 1 if matches > 0:
coverage = matches / len([w for w in query_words if len(w) > 3]) results.append((i, coverage, doc)) return sorted(results, key=lambda x: x[1], reverse=True)
def ml_semantic_search(query, docs, model): doc_embeddings = model.encode(docs)
query_embedding = model.encode([query])
similarities = np.dot(query_embedding, doc_embeddings.T).flatten() results = [(i, score, docs[i]) for i, score in enumerate(similarities)] return sorted(results, key=lambda x: x[1], reverse=True)
total_trad_precision = 0 total_ml_precision = 0 relevant_docs_indices = {0, 1, 2, 3, 4} for query in queries: trad_results = traditional_keyword_search(query, documents) ml_results = ml_semantic_search(query, documents, model) trad_relevant = [i for i, _, _ in trad_results[:3] if i in relevant_docs_indices] ml_relevant = [i for i, _, _ in ml_results[:3] if i in relevant_docs_indices] trad_precision = len(trad_relevant) / min(3, len(trad_results)) if trad_results else
0
ml_precision = len(ml_relevant) / min(3, len(ml_results)) if ml_results else 0 total_trad_precision += trad_precision total_ml_precision += ml_precision
prmt("=== ИТОГОВЫЕ РЕЗУЛЬТАТЫ ===")
рпП:(ГСредняя точность традиционного поиска:
{total_trad_precision/len(queries):. 1 %}")
print(f" Средняя точность ML-поиска: {total_ml_precision/len(queries):.1%}")
improvement = ((total_ml_precision - total_trad_precision) / total_trad_precision * 100
if total_trad_precision > 0 else float('inf)) print(f,Улучшение точности: {improvement:+.1f}%")
print(f,ML-поиск эффективнее в {total_ml_precision/max(total_trad_precision, 0.1):.1f} раз")
plt.figure(figsize=(10, 6))
methods = ['Традиционный поиск', 'Интеллектуальный поиск'] precision_scores = [avg_trad_precision, avg_ml_precision] colors = ['#FF6B6B', '#4ECDC4']
bars = plt.bar(methods, precision_scores, color=colors, alpha=0.8, width=0.6) for bar, score in zip(bars, precision_scores):
plt.text(bar.get_x() + bar.get_width()/2, bar.get_height() + 0.01,
f{score:.1%}', ha='center', va='bottom', fontsize=12, fontweight='bold') plt.ylabel('Точность', fontsize=12)
plt.title('Сравнение точности методов поиска', fontsize=14, fontweight='bold')
plt.tight_layout()
plt.show()
ПРИЛОЖЕНИЕ Б.
Акты внедрения
МИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ
ФЕДЕРАЛЬНОЕ ГОСУДАРСТВЕННОЕ БЮДЖЕТНОЕ ОБРАЗОВАТЕЛЬНОЕ УЧРЕЖДЕНИЕ ВЫСШЕГО ОБРАЗОВАНИЯ
«РОССИЙСКИЙ БИОТЕХНОЛОГИЧЕСКИЙ УНИВЕРСИТЕТ»
в учебный процесс кафедры «Автоматизированные системы управления биотехнологическими процессами» ФГБОУ ВО «РОСБИОТЕХ» материалов диссертационной работы Аль-Амиди Мустафа Абдулкадим Дхаир по теме «Алгоритмы интеллектуального поиска информации в сети интернет для формирования электронной библиотеки», представленной на соискание ученой степени кандидата технических наук по специальности 2.3.8 - Информатика и инфор-
Мы, нижеподписавшиеся, заместитель директора института промышленной инженерии, информационных технологий и мехатроники, кандидат технических наук, доцент Назойкин Евгений Анатольевич, заведующий кафедрой АСУБП, доктор технических наук, профессор, Заслуженный деятель науки РФ Благовещенская Маргарита Михайловна, заместитель заведующего кафедрой АСУБП по научной работе, доктор технических наук, профессор Каргин Виталий Александрович настоящим актом подтверждаем, что материалы диссертационной работы Аль-Амиди Мустафа Абдулкадим Дхаирпо, связанные с разработкой алгоритмов интеллектуального поиска информации в сети интернет для формирования электронной библиотеки используются в учебном процессе, в лекционных курсах, при проведении лабораторных и практических занятий, при выполнении ВКР кафедры «Автоматизированные системы управления биотехнологическими процессами» при подготовке бакалавров направления 27.03.04 «Управление в технических системах», а также магистров направлений 09.04.01 «Информатика и вычислительная техника» и 27.04.04 «Управление в технических системах», а именно использованы:
1. Результаты анализа особенностей информационного массива и потоков Интернета, технологии типового бинарного информационного поиска.
АКТ О ВНЕДРЕНИИ
мационные процессы.
2. Комплекс эмпирических данных по оценке эффективности Интернет-поиска с применением традиционной методики и совокупности простых и расширенных поисковых образов запросов (ПОЗ), вывод о необъективности общепринятых показателей эффективности поиска для оценки эффективности тематико-ориентированного Интернет-поиска.
3. Оценка поисковых сессий в Интернете для расчёта эффективности оценки Интернет-поиска.
4. Введённый новый показатель эффективности Интернет-поиска - минимальный объём поисковой выборки, раскрывающий семантический потенциал поискового термина (обеспечивающий тематическую полноту поиска).
5. Новая методика оценки эффективности Интернет-поиска, оперирующая семантической составляющей результатов поиска на основе коэффициента семантического потенциала поискового термина.
6. Выявленная зависимость между семантическим потенциалом терминов, составляющих ПОЗ, и объёмом поисковой выборки, которая требуется для обеспечения тематической полноты поиска.
7. Данные о повышении эффективности Интернет-поиска и изменения поисковой выборки на качественном уровне с помощью расширения поискового образа запроса нижестоящими терминами с использованием оператора «И».
Данные разработки включены в разделы следующих дисциплин:
• Базы знаний и экспертные системы
• Математическое моделирование объектов и систем управления
• Интеллектуальные информационные системы
Зам. директора института ПИИТиМ и' __ кандидат техн. наук, доцент
Зав. кафедрой АСУБП, доктор техн. наук, профессор Засл. деятель науки РФ
Зам. заведующего кафедрой АСУБП, доктор техн. наук, профессор
Назойкин Е.А.
Благовещенская М.М.
Каргин В.А.
Экз. № _
УТВЕРЖДАЮ Начальник Межвидового центра подготовки и применения войск радиоэлектронной I (учебного и испытательного), 1Т технических наук, доцент ролко^ик / /
/ Ю.А. Губсков
юня 2025 г.
АКТ
реализации результатов диссертационной работы Аль-Амиди Мустафа Абдулкадим Дхаира в Межвидовом центре подготовки и боевого применения войск радиоэлектронной борьбы (учебном и испытательном)
Экспертная комиссия в составе председателя - начальника цикла боевой
подготовки (специалистов комплексов радиоэлектронной борьбы на
беспилотных летательных аппаратах и средств комплексного технического
контроля) полковника Каданцева СМ., членов комиссии: начальника
(обеспечения радиоэлектронной защиты) майора Казака П.А., начальника
отдела (измерений и объективного контроля) майора Синяковского A.B. в
период с 6 по 10 июня 2025г. провела экспертизу и составила настоящий акт о
реализации отдельных результатов диссертационной работы Аль-Амиди
Мустафа Абдулкадим Дхаира на соискание ученой степени кандидата
технических наук, посвященной разработке алгоритмов интеллектуального
поиска информации в сети интернет для формирования электронной библиотеки.
В работе обоснованы:
результаты анализа особенностей информационного массива и потоков Интернета, технологии типового бинарного информационного поиска;
комплекс эмпирических данных по оценке эффективности Интернет-поиска с применением традиционной методики и совокупности простых и
обп^ппиННЫХ П0ИСК0ВЫХ о6Р™°» запросов, вывод о необъективности теГтмГЯТЫХ ПОказателей эффективности поиска для оценки эффективности
тематико-ориентированного Интернет-поиска;
~ — показатель эффективности Интернет-поиска -пГ;цГ"ЪеМ П°ИСК0В0Й ВЫ6°РКИ' Решающий семантический поиска) П0ИСК0В0Г° теРмина (обеспечивающий тематическую полноту
АКТ О ВНЕДРЕНИИ
в учебный процесс кафедры промышленной информатики ФГБОУ ВО «МИРЭА - Российский технологический университет» материалов диссертационной работы Аль-Амиди Мустафа Абдулкадим Дхаир по теме «Алгоритмы
интеллектуального поиска информации в сети интернет для формирования электронной библиотеки», представленной на соискание ученой степени кандидата технических наук по специальности 2.3.8 - Информатика и информа-
Настоящим актом подтверждаю, что материалы диссертационной работы Аль-Амиди Мустафа Абдулкадим Дхаирпо, связанные с разработкой алгоритмов интеллектуального поиска информации в сети интернет для формирования электронной библиотеки используются в учебном процессе, в лекционных курсах, при проведении лабораторных и практических занятий кафедры «Промышленная информатика» при подготовке бакалавров и специалистов по 09.03.01 «Информатика и вычислительная техника» и по 15.03.04 «Автоматизация технологических процессов и производств», а также магистров по 15.04.04 «Автоматизация технологических процессов и производств», а именно использованы:
1. Результаты анализа особенностей информационного массива и потоков Интернета, технологии типового бинарного информационного поиска.
2. Комплекс эмпирических данных по оценке эффективности Интернет-поиска с применением традиционной методики и совокупности простых и расширенных поисковых образов запросов (ПОЗ), вывод о необъективности общепринятых показателей эффективности поиска для оценки эффективности тематико-ориентированного Интернет-поиска.
ционные процессы.
Зав. кафедрой промышленной информа кандидат техн. наук, доцент
ПРИЛОЖЕНИЕ В. Сертификаты участника конфереции
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.