Методы автоматической обработки изображений и видео однородных плотно сгруппированных объектов тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Румянцева Мария Юрьевна
- Специальность ВАК РФ00.00.00
- Количество страниц 341
Оглавление диссертации кандидат наук Румянцева Мария Юрьевна
Реферат
Synopsis
Введение
Глава 1. Обзор предметной области
1.1. Компьютерное зрение для анализа однородных плотно сгруппированных объектов
1.2. Классические методы для анализа однородных плотно сгруппированных объектов
1.3. Методы глубокого обучения для анализа однородных плотно сгруппированных объектов
1.4. Методы самообучения
1.5. Методы генерации синтетических данных для разметки изображений
1.5.1. Применимость синтетических данных для разметки изображений
1.5.2. Способы нейросетевой генерации изображений для обучения моделей сегментации
1.5.3. Автокодировщики и генеративно-состязательные сети
1.5.4. Диффузионные модели
1.5.5. Процедурная генерация изображений
1.5.6. Генерация наборов данных в формате видео
1.6. Класс однородных плотно сгруппированных объектов
1.7. Источники данных
1.8. Аналогичные решения
Выводы по главе
Глава 2. Метод «слабой» разметки
2.1. Базовый метод «слабой» разметки на основе водораздела
2.2. Модификация базового метода
2.3. Эксперимент
2.4. Анализ вычислительных требований
2.5. Оценка качества
2.6. Итоговый метод слабой разметки
Выводы по главе
Глава 3. Метод синтетической разметки
3.1. Базовый метод процедурной генерации изображений с однородными объектами
3.2. Базовый метод генерации масок на основе текстовой подсказки
3.3. Метод генерации изображения с однородными плотно сгруппированными объектами по маскам
3.4. Метод генерации масок на основе переноса разметки с другого домена
3.5. Доменная адаптация однородных данных
3.6. Эксперимент
3.7. Итоговый метод
Выводы по главе
Глава 4. Библиотека для анализа однородных промышленных данных
4.1. Понятие однородных плотно сгруппированных объектов
4.2. Описание библиотеки
4.3. Модуль предобработки
4.4. Модуль разметки
4.5. Модуль генерации синтетических изображений
4.6. Модуль самообучения
4.7. Модуль оценки качества
4.8. Модуль отслеживания объектов
Выводы по главе
Глава 5. Внедрение
5.1. Система анализа поризации
5.1.1. Общая организация процесса
5.1.2. Архитектура сервиса
5.1.3. Подготовка данных и обучение модели
5.1.4. Интерфейс системы анализа поризации
5.1.5. Эффект от внедрения
5.2. Система гранулометрического анализа
5.2.1. Алгоритм работы системы
5.2.2. Обучение и тестирование моделей сегментации руды
5.2.3. Калибровка камеры и расчёт масштабного коэффициента
5.2.4. Интеграция и развёртывание
5.2.4. Результаты внедрения
Выводы по главе
Заключение
Литература
Приложение 1. Список иллюстраций
Приложение 2. Список таблиц
Приложение 3. Акты внедрения и использования результатов работы
Приложение 4. Свидетельства о регистрации программ для ЭВМ
Приложение 5. Тексты публикаций
9
Реферат
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Сегментация объектов с отсутствием явных характеристических признаков на медицинских изображениях2025 год, кандидат наук Лаптев Владислав Витальевич
Методы автоматического анализа ретинальных изображений на основе нейронных сетей глубокого обучения2025 год, кандидат наук Волков Егор Николаевич
Методы адаптивного обучения на основе краудсорсинговой разметки данных для интеллектуального анализа медицинских изображений2026 год, кандидат наук Коваленко Лев Алексеевич
Математические методы обработки изображений пористых сред при отсутствии размеченных данных2024 год, кандидат наук Лаврухин Ефим Валерьевич
Математические методы совмещения биомедицинских микроскопических изображений2023 год, кандидат наук Симакова Надежда Алексеевна
Введение диссертации (часть автореферата) на тему «Методы автоматической обработки изображений и видео однородных плотно сгруппированных объектов»
Общая характеристика работы
Актуальность темы исследования
Многие промышленные задачи требуют анализа изображений с большим числом однородных, плотно сгруппированных объектов: пузырьки флотационной пены, рудные окатыши, камни на конвейере или частицы сыпучих материалов. Для всех указанных типов данных автоматическая обработка изображений обеспечивает критически важные возможности мониторинга и управления технологическими процессами.
Анализ пузырьков флотационной пены является ключевым инструментом контроля процесса обогащения полезных ископаемых, поскольку геометрические характеристики пены напрямую связаны с эффективностью разделения минералов. Как показано в работе Рао [136], диаметр, форма и распределение пузырей по размерам определяют вероятность столкновения и прилипания частиц, а также устойчивость пенного слоя, формируя тем самым гидродинамические условия в камере флотации и влияя на общий выход и качество концентрата.
Для рудных окатышей и камней на конвейере важно определять их гранулометрический состав, чтобы своевременно регулировать режимы дробления и измельчения. Это позволяет сократить износ оборудования и повысить производительность [180]. Дополнительно для камней определяется негабарит, а для окатышей - влажность и форма [3].
Для сыпучих и пористых материалов (например, строительных смесей или порошков) анализ структуры и формы частиц необходим для оценки качества продукта, соблюдения технологических норм и прогнозирования поведения материала в дальнейшем производственном цикле [184].
Несмотря на различия в происхождении, все эти изображения обладают общими чертами: высокой плотностью объектов, их частичным перекрытием, неоднородным фоном и сложной формой экземпляров. Тем не менее, задачи
их обработки до сих пор решаются разрозненно, без попытки создания универсальных методов. Это связано с тем, что исследования чаще всего ориентированы на конкретные прикладные цели, а системная типология таких изображений пока не разработана.
Такие задачи целесообразно решать с помощью методов сегментации, поскольку они позволяют выделять отдельные объекты на изображении даже в условиях их плотного расположения, перекрытия и сложной формы в отличие от детекции, которая предлагает только ограничивающие рамки, которые могут исказить измерение объектов. Сегментация обеспечивает получение всех количественных характеристик - размеров, формы и распределения частиц, что критически важно для контроля качества, оптимизации технологических режимов и прогнозирования поведения материала. Использование таких методов делает возможным систематический и воспроизводимый анализ больших объёмов данных, что значительно повышает эффективность мониторинга промышленных процессов. Применение методов сегментации более затратно на этапе реализации, однако позволяет быстро добавлять дополнительные этапы обработки.
Аннотирование подобных изображений требует значительных трудозатрат и высокой точности при разделении границ [127]. Современные методы машинного обучения, особенно основанные на нейросетевых архитектурах, чувствительны к качеству разметки [153] и плохо обобщаются на новые сцены без достаточного объёма обучающих данных. Классические алгоритмы сегментации и детекции при этом часто демонстрируют низкую точность из-за сложности фона, вариативности объектов и наложения их контуров. Это создаёт ключевую проблему - дефицит качественно размеченных данных.
Разработка методов, позволяющих автоматизировать процесс разметки или сократить потребность в размеченных данных, имеет большое практическое значение. Это особенно актуально для промышленного сектора, где анализ изображений в реальном времени позволяет повысить
эффективность технологических процессов, автоматизировать контроль качества и снизить затраты на обработку данных.
В диссертации предлагаются методы обработки изображений с однородными объектами, позволяющие минимизировать затраты на разметку данных. Предложенные методы адаптируются к различным видам изображений. В рамках исследования разработаны методы «слабой» разметки и генерации синтетических данных, а также создана специализированная библиотека для работы с такими изображениями.
Степень разработанности проблемы
Исследования в области анализа изображений рудных материалов, флотационной пены и пористых структур представлены рядом независимых направлений. Для флотационной пены использовались методы анализа текстур и пузырьковой структуры: Мулман, Олдрих и ван Девентер применяли нейросетевые подходы к оценке пены [113]; Альдрих и Лю изучали многомерные признаки пузырьков [7]; Мехршад и Массинаеи разработали алгоритмы измерения размеров пузырей на основе пороговой сегментации [108]. Современные архитектуры сегментации для пены применялись Гхарехчобогом и др. [57], Ченом и др. [35], Чжаном и Сюем [210].
В направлении гранулометрического анализа руды использовались как традиционные, так и глубокие методы: Фу и Альдрих применяли CNN для анализа частиц на конвейере [56]; Сун и соавт. предложили облегчённую модель для сегментации в реальном времени [164]; Чжан и др. разработали метод LODM для обнаружения крупных камней [212]; Ян и др. применили Mask R-CNN для оценки формы гранул [198].
Для анализа пористых и порошковых материалов Ансари и др. [8]
использовали модели на основе свёрточных нейронных сетей.
В целом, с точки зрения возможных методов анализа изображений в литературе представлены методы классического компьютерного зрения: пороговая сегментация Отсу [125], маркерный водораздел Бюшэ и Мейера [16], детектор Канни [21].
Широко используются нейросетевые архитектуры для сегментации — U-Net (Роннебергер и др.) [140], UNet++ (Чжоу и др.) [217], Mask R-CNN (Хэ и др.) [68], DeepLab (Чен и др.) [32], HRNet [187], SegFormer [195].
Методы слабой разметки представлены работами Чан, Хоссейни, Платаниотиса [27] и Вана [188]. Методы самообучения включают SimCLR [22], BYOL [61], SwAV [26], MoCo [73], Barlow Twins [203]. Представленные методы не применялись для анализа изображений с однородными плотно сгруппированными объектами.
Для расширения обучающих выборок используются методы синтетической генерации изображений: BlenderProc (Деннингер и др.) [47], доменная рандомизация (Трембле и др.) [177], диффузионные модели (Ромбах и др.) [141], а также специализированные подходы MaskFactory [135], One-Shot Synthesis [162], CoSimGen [18].
Целью исследования является снижение трудоёмкости и обеспечение качества обработки изображений и видео однородных плотно сгруппированных объектов за счёт использования методов «слабой» разметки и генерации синтетических данных для обучения глубоких нейронных сетей без использования экспертной разметки изображений и видео. Для достижения цели поставлены следующие задачи:
1. Провести обзор существующих методов обработки изображений с однородными плотно сгруппированными объектами.
2. Разработать метод «слабой» разметки, предназначенный для сегментации изображений и видео однородных плотно сгруппированных объектов.
3. Разработать метод генерации синтетических данных для обучения нейронных сетей, предназначенных для сегментации изображений и видео однородных плотно сгруппированных объектов без ручной разметки.
4. Разработать библиотеку программ, реализующих предложенные методы и обеспечивающих оценку обобщённых групповых характеристик изображений и видео.
5. Провести экспериментальные исследования разработанных программ, включающие:
- гранулометрический анализ руды;
- оценку эффективности процесса флотации;
- анализ структуры пористых материалов;
6. Внедрить результаты исследований в промышленность.
Научная новизна
1. Разработаны методы «слабой» разметки изображений и видео с однородными плотно сгруппированными объектами и экспериментально подтверждена их эффективность.
2. Разработаны методы обучения без учителя для анализа однородных данных, учитывающие информацию о структуре объектов и временные зависимости в видеоданных.
3. Предложены методы генерации синтетических данных для анализа однородных объектов без необходимости их разметки и экспериментально подтверждена их эффективность. Теоретическая значимость исследования заключается в разработке
универсальных подходов к анализу изображений с однородными объектами, которые можно эффективно применять независимо от специфики конкретной предметной области. Предложенные методы «слабой» разметки, самообучения и генерации синтетических данных вносят вклад в решение актуальной проблемы недостатка дефицита данных. В рамках работы введено понятие «однородные плотно сгруппированные объекты» и определены их ключевые характеристики, что позволяет унифицировать подходы к решению задач анализа и расширяет теоретическую базу в области анализа изображений.
Теоретическое значение работы также заключается в предложении новой системы оценки эффективности сегментации, использующей метрики временной стабильности и сходства оптического потока.
В работе также обоснован выбор архитектур нейронных сетей и их комбинаций, наиболее эффективных для работы с однородными плотно сгруппированными объектами.
Практическое значение исследования
Разработанные в диссертационной работе методы могут быть применены, и частично применяются уже сегодня, в разных промышленных областях, где необходимо выполнить анализ групповых процессуально значимых характеристик. К таким характеристикам относятся размер, форма, цвет, скорость и направление движения объектов. Эти характеристики агрегируются по времени для анализа динамики технологического процесса. Для определения характеристик отдельного объекта необходимо его отделение от соседних, что достигается с помощью сегментации изображения. Сегментация изображений — это выделение объектов путём разделения сцены на осмысленные области, соответствующие отдельным объектам или их частям. Для обучения таких моделей необходимы данные с парами «изображение - разметка».
Экспертная разметка требует значительных временных затрат, обычно от получаса и более на одно изображение, и сопровождается трудностями, такими как утомляемость разметчиков, субъективность оценок и высокая вероятность ошибок из-за человеческого фактора [110]. Внедрение методов «слабой» и генеративной разметки позволяет полностью отказаться от экспертной разметки, тем самым сокращая число ошибок и время, затрачиваемое на подготовку обучающих данных. Скорость подготовки проекта по анализу промышленных данных увеличивается за счёт устранения необходимости ручной разметки изображений.
Конкретные примеры применения и достоинства автоматизации включают:
1. Контроль качества в металлургии в процессе флотации: автоматическое выявление и классификация пузырьков позволяют оперативно корректировать технологические параметры. Ранее на ручную разметку изображений пузырей могло уходить несколько часов рабочего времени для одного технологического цикла, а автоматизация позволяет получать результат в режиме реального времени, минимизируя ошибки и повышая стабильность процесса.
2. Горнодобывающая промышленность: автоматизированный анализ гранулометрического состава руды устраняет необходимость ручного измерения и классификации частиц, на что обычно тратится до нескольких рабочих дней для крупного объема образцов. Автоматизация обеспечивает оперативность (обработка одного изображения до 300 мс) и точность анализа (до 95 %), улучшая управление процессами дробления и измельчения. Решения при участии автора внедрены в процессы ГОК в районе г. Апатиты для управления дробильным оборудованием.
3. Материаловедение и анализ пористых структур: автоматизированные методы оценки пористости и структуры материалов устраняют необходимость трудоёмкой ручной оценки, которая могла занимать несколько дней на серию образцов. Это существенно ускоряет получение результатов (менее 10 с на изображение) и повышает их точность (до 99 %), помогая прогнозировать их эксплуатационные свойства с большей достоверностью. Решение при участи автора внедрены в процессы компании ООО «КНАУФ Гипс Кубань».
4. Производство и контроль сыпучих и гранулированных материалов: использование автоматических методов анализа структуры и однородности сыпучих материалов позволяет отказаться от ручного контроля, который проводится по выборкам из партии и подвержен человеческому фактору и статистическим ошибкам (нарушения могут не попадать в выборку). Автоматизация обеспечивает быструю и
объективную диагностику нарушений в размерах и цвете частиц, а также
выявление примесей.
Положения, выносимые на защиту:
1. Метод автоматизированной «слабой» разметки изображений и видео с однородными плотно сгруппированными объектами, использующий сегментацию, отличающийся тем, что с целью устранения ручной разметки, используется комбинация одного из классических методов и одной из фундаментальных моделей сегментации.
2. Метод генерации синтетических изображений и видео однородных плотно сгруппированных объектов, использующий сегментацию, отличающийся тем, что с целью устранения ручной разметки, при обучении глубоких нейронных сетей используются автоматически построенные маски.
3. Библиотека программ, обеспечивающих оценку групповых характеристик однородных плотно сгруппированных объектов на изображениях и видео, отличающаяся тем, что с целью автоматизации оценки этих характеристик, в ней реализованы предложенные методы. Первые два положения обладают научной новизной, третье положение
имеет важное практическое значение. Программы
библиотеки размещены по адресу https://github.com/CTLab-ITMO/CTCI/.
Методология и методы исследований. Методология исследования основана на применении методов машинного обучения и методов компьютерного зрения для анализа изображений с однородными объектами. Для оценки эффективности предложенных методов использовались как численные метрики, так и качественный анализ результатов в различных промышленных задачах.
Объектом исследования являются изображения и видео однородных плотно сгруппированных объектов: камней руды на конвейере, пузырьков флотации, пористых материалов и т. д.
Предметом исследования являются методы автоматической обработки изображений и видео однородных плотно сгруппированных объектов.
Достоверность научных положений, выводов и практических рекомендаций обеспечивается корректным обоснованием постановок задач, точной формулировкой критериев оценки, а также результатами экспериментов по использованию предложенных методов и их анализом.
Соответствие паспорту специальности
Диссертация соответствует следующим пунктам паспорта специальности 2.3.8. «Информатика и информационные процессы (технические науки)»:
Пункт 4: Разработка методов и технологий цифровой обработки аудиовизуальной информации...
Работа направлена на автоматизацию анализа изображений и видеоданных с плотными структурами, что непосредственно соответствует задачам цифровой обработки визуальной информации.
Пункт 7: Разработка методов обработки, группировки и аннотирования информации...
В диссертации предложены методы слабой разметки и генерации синтетических данных для изображений без использования ручной разметки, что относится к задачам аннотирования и подготовки информации для последующего анализа.
Пункт 16: Разработка алгоритмов, программных и программно-аппаратных средств интеллектуальной обработки информации и управления данными...
В рамках диссертационной работы разработана специализированная библиотека методов, предназначенная для решения задач нового класса, связанных с интеллектуальной обработкой изображений и видео.
Внедрение результатов работы
Результаты диссертационной работы использованы при разработке открытой библиотеки методов анализа изображений однородных плотно
сгруппированных объектов CTCI (https://github.com/CTLab-ITMO/CTCI/), зарегистрированную в качестве программы для ЭВМ «Библиотека для анализа однородных объектов». Также результаты диссертационной работы внедрены в производственные процессы компании ООО «КНАУФ Гипс Кубань» для анализа процесса поризации гипсокартона, а также в проект компании ООО «Статанли», посвящённый анализу гранулометрического состава руды на ГОК в районе г. Апатиты. Акты внедрения приведены в приложении 3.
Результаты работы использовались в учебном процесс Университета ИТМО в рамках образовательной программы бакалавриата по специальности 01.03.02 «Прикладная математика и информатика» и в рамках работы учебно-научной лаборатории компьютерных технологий, где были проведены вычислительные эксперименты по реализации методов «слабой» и синтетической разметки. Акт использования приведен в приложении 3. Апробация результатов работы
Основные результаты диссертации докладывались и обсуждались на трёх международных, двух всероссийских и одной межвузовской конференции.
Доклады на международных конференциях:
1. Rumiantceva M. Weak Segmentation and Unsupervised Evaluation: Application to Froth Flotation Images / The 20th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications (VISIGRAPP), Порту, Португалия.
2. Rumiantceva M. Self-supervised Learning to Improve Froth Images Segmentation / The 9th International Congress on Information and Communication Technology (ICICT 2024), онлайн.
3. Rumiantceva M. Deep Learning and Pseudo-Labeling for Ore Granulometry The 11th International Young Scientists Conference in Computational Science (YSC 2022), Санкт-Петербург.
Доклады на всероссийских конференциях:
1. Румянцева М. Ю., Универсальные алгоритмы сегментации однородных объектов / XII Конгресс молодых ученых 2023, Санкт-Петербург.
2. Румянцева М.Ю., Современные алгоритмы сегментации изображения в контексте определения контуров объектов, XI Конгресс молодых ученых 2022, Санкт-Петербург.
3. Румянцева М. Ю., Распознавание контуров флотационной пены в потоке / X Конгресс молодых ученых 2021, Санкт-Петербург.
4. Румянцева М. Ю., Выделение контуров на изображении / Пятидесятая научная и учебно-методическая конференция Университета ИТМО , Санкт-Петербург.
Доклад на межвузовской конференции: 1. Румянцева М. Ю., Выделение контуров камней на конвейере с помощью методов компьютерного зрения / Ежегодная межвузовская научно-техническая конференция студентов, аспирантов и молодых специалистов имени Е. В. Арменского, Москва. Награды:
1. Победитель конкурса грантов для студентов вузов, расположенных на территории Санкт-Петербурга, аспирантов вузов, отраслевых и академических институтов, расположенных на территории Санкт-Петербурга, в 2023 году. Публикации
Основные результаты по теме диссертации изложены в трёх публикациях, опубликованных в изданиях, индексируемых в базе цитирования Scopus. Также имеется два свидетельства о государственной регистрации программ для ЭВМ.
Публикации в изданиях, входящих в Web of Science и Scopus:
1. Rumiantceva M., Filchenkov A. Deep Learning and Pseudo-Labeling for Ore Granulometry // Procedia Computer Science. 2022. Vol. 212. P. 387-396.
2. Rumiantceva M., Kriukov A., Prokopov E., Efimova V. Self-supervised Learning to Improve Froth Images Segmentation // Proceedings of the Ninth International Congress on Information and Communication Technology. Springer, 2024. Vol. 1055, pp. 483-494.
3. Prokopov E., Usacheva D., Rumiantceva M., Efimova V. Weak Segmentation and Unsupervised Evaluation: Application to Froth Flotation Images // Proceedings of the 20th Int. Joint Conf. on Computer Vision, Imaging and Computer Graphics Theory and Applications (VISAPP). 2025. Vol. 3, pp. 500-507.
Регистрация программ:
1. Программа для ЭВМ «Библиотека для анализа однородных объектов», № 2024669273 от 15.08.2024, Ефимова В. А., Румянцева М. Ю., Прокопов Е. М., Усачева Д. М., Леманов А. А., Крюков А. Д.
2. Программа для ЭВМ «Программный комплекс детекции, сегментации и нахождения ключевых точек объектов на изображении» № 2024692026 от 25.12.2024, Муравьёв С.Б., Забашта А.С., Ефимова В.А., Румянцева М.Ю., Жарский И.А.
Личный вклад автора
1. В публикации [1] Rumiantceva M. - идея применения методов слабой разметки в гранулометрическом анализе, реализация и программная интеграция нейросетевых алгоритмов, проведение вычислительных экспериментов (80 %); Filchenkov A. - рекомендации по методологии исследования, анализ результатов и редактирование текста (20 %).
2. В публикации [2] Rumiantceva M. - идея применения методов самообучения для сегментации флотационной пены, разработка и внедрение алгоритмов, проведение экспериментов и анализ метрик (60 %); Kriukov A. D. - участие в реализации и тестировании моделей
(25 %); Prokopov Е. - участие в подготовке данных и интерпретации результатов (10%); Efimova V. - научное консультирование и участие в подготовке статьи (5%).
3. В публикации [3] Rumiantceva М. - основная концепция слабой разметки на основе маркерного водораздела, разработка метода оценки качества без разметки, участие в реализации и экспериментальной проверке (50 %); Prokopov Е. - участие в программной реализации и экспериментах (20 %); Usacheva D. - подготовка и предобработка данных (20 %); Efimova V. - методологическое консультирование и участие в оформлении текста (10 %).
4. В регистрациях программы для ЭВМ Румянцева М. Ю. - инициатор разработки и автор ключевых алгоритмов анализа однородных объектов, участие в проектировании архитектуры ПО и тестировании (40 %); соавторы - реализация отдельных компонентов, интеграция и дополнительное тестирование (60 %).
Объем и структура работы
Диссертация состоит из введения, пяти глав, заключения. Объем диссертации - 340 страниц, число иллюстраций - 52, таблиц - 8. Список литературы включает в себя 220 наименований.
Содержание работы Во введении обосновывается актуальность исследований, проводимых в рамках данной диссертационной работы, представлен краткий обзор существующих научных подходов к автоматизированному анализу однородных изображений, формулируется цель исследования, ставятся задачи работы, приводится научная новизна, описывается теоретическая и практическая значимость разработанных методов, указывается апробация и внедрение полученных результатов.
В первой главе приводится обзор предметной области и формулируются основные методологические положения исследования.
В разделе 1.1 приводятся примеры задач и обосновывается необходимость использования компьютерного зрения для анализа однородных промышленных данных. К числу таких задач относятся детекция - автоматическое обнаружение и локализация объектов на изображении, классификация - отнесение объекта к определённому типу или категории, и сегментация - выделение границ и формы объектов на изображении. Эти методы применяются при гранулометрическом анализе руды на конвейере, исследовании процессов флотации, контроле качества окатышей, удобрений, пластиковых гранул и поризации гипсокартона.
В разделе 1.2 приводится обзор исследований, рассматриваются классические методы анализа однородных данных, их достоинства и ограничения.
В производственных задачах, таких как контроль гранулометрического состава руды, анализ пузырьков в изображениях флотационной пены или отслеживание качества поверхности материалов, применяются классические методы компьютерного зрения - метод маркерного водораздела [16], пороговая сегментация и детекторы границ на основе операторов Собеля [156] или Кэнни [21]. Такие подходы могут обеспечить удовлетворительную точность в условиях относительно низкой плотности объектов и хорошего контраста между ними. Тем не менее, в ситуациях высокой плотности объектов и изменяющихся условий эти методы демонстрируют ограниченную эффективность, что приводит к ошибкам сегментации и необходимости постоянной ручной подстройки параметров.
В разделе 1.3 описываются методы анализа однородных объектов на основе нейронных сетей.
Современные методы анализа однородных объектов развиваются благодаря применению глубокого обучения, что позволяет преодолеть ограничения классических алгоритмов. Нейронные сети автоматически извлекают ключевые признаки и закономерности, обеспечивая высокую точность и устойчивость к изменениям освещения, шумам и перекрытиям
объектов — особенно в изображениях с высокой плотностью элементов, таких как пузыри флотационной пены или камни руды. Для сегментации наиболее распространены архитектуры типа кодировщик-декодировщик (например, U-Net [140]), преобразующие изображение в компактное представление и восстанавливающие его с передачей признаков через прямые соединения. Несмотря на потребность в больших обучающих выборках и вычислительных ресурсах, нейросетевые методы остаются наиболее эффективным и перспективным инструментом анализа однородных изображений.
В разделе 1.4 рассматриваются подходы к повышению качества анализа изображений и видео с однородными плотно сгруппированными объектами с применением методов самообучения.
Методы самообучения (self-supervised learning, SSL) [63] представляют собой подходы, позволяющие нейронным сетям извлекать полезные представления из данных без необходимости полной экспертной разметки. Это особенно актуально в задачах анализа однородных объектов, где получение разметки требует значительных трудозатрат и ресурсов, тогда как неразмеченные данные доступны в больших объёмах. В отличие от традиционного обучения с учителем, где модель тренируется на заранее размеченных данных, в SSL используются предобучающие (pretext) задачи, позволяющие сети выявлять структуру данных и закономерности без явного указания классов или границ объектов.
В разделе 1.5 описываются подходы к генерации синтетических данных для разметки изображений.
Генерация синтетических изображений является эффективным способом преодоления дефицита размеченных данных при обучении нейронных сетей, особенно в задачах анализа однородных объектов, где ручная аннотация требует значительных временных и ресурсных затрат. Синтетические данные позволяют моделировать сцены с варьируемыми параметрами освещения, текстуры и плотности объектов, обеспечивая более разнообразное и сбалансированное обучение моделей. Одним из
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Исследование переносимости нейросетевых моделей между различными распределениями данных в задаче детектирования объектов2022 год, кандидат наук Никитин Андрей Дмитриевич
Распознавание редких дорожных знаков с использованием синтетических обучающих выборок2021 год, кандидат наук Шахуро Владислав Игоревич
Методы и алгоритмы детектирования объектов на основе нейронной сети с полносвязным ядром свертки2019 год, кандидат наук Алексеев Алексей Алексеевич
Методы структурного обучения в задачах совместной разметки2014 год, кандидат наук Шаповалов, Роман Викторович
Методы восстановления параметров сцены для решения проблемы реалистичной визуализации в системах смешанной реальности2021 год, кандидат наук Сорокин Максим Игоревич
Список литературы диссертационного исследования кандидат наук Румянцева Мария Юрьевна, 2025 год
Литература
1. Кацер Ю., Мигаль И. Экосистема для разработки и применения Computer Vision (CV) в промышленности // Хабр. 2024. 13 февраля. URL: https://habr.com/ru/articles/882204/
2. Ai M., Xie Y., Tang Z., Wu J., Li P., Zhang J. Self-supervised dynamic and static feature representation learning method for flotation monitoring // Powder Technology. 2024.Vol. 442. Art. 119866.
3. Abouzeid A.-Z. M., Kotb I. M., Negm A. A. Iron ore fluxed pellets and their physical properties // Powder Technology. 1985.Vol. 42, No 3, pp. 225-230.
4. Abraham N., Khan N. M. A Novel Focal Tversky Loss Function With Improved Attention U-Net for Lesion Segmentation // Proceedings of the IEEE International Symposium on Biomedical Imaging (ISBI). 2019, pp. 683-687.
5. Aharon N., Orfaig R., Bobrovsky B.-Z. BoT-SORT: Robust Associations Multi-Pedestrian Tracking // arXiv preprint arXiv:2206.14651, 2022. URL: https://arxiv.org/abs/2206.14651.
6. Albelwi S. Survey on Self-Supervised Learning: Auxiliary Pretext Tasks and Contrastive Learning Methods in Imaging // Entropy. 2022.Vol. 24, № 4, pp. 551.
7. Aldrich C., Liu X. Monitoring of Flotation Systems by Use of Multivariate Froth Image Analysis // Minerals. 2021. Vol. 11, No. 7. Art. 683.
8. Ansari M. A., Crampton A., Garrard R., et al. A Convolutional Neural Network (CNN) classification to identify the presence of pores in powder bed fusion images // International Journal of Advanced Manufacturing Technology. 2022.Vol. 120, pp. 5133-5150.
9. Azizi S., Mustafa B., Ryan F., et al. Big Self-Supervised Models Advance Medical Image Classification // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). 2021, pp. 3478-3488.
10. Azqadan E., Jahed H., Arami A. Predictive microstructure image generation using denoising diffusion probabilistic models // Acta Materialia. 2023. Vol. 261. Art. 119406.
11. Baniukiewicz P., Josiah E. L., Collier S., BretschneiderVol. Generative adversarial networks for augmenting training data of microscopic cell images // Frontiers in Computer Science. 2019.Vol. 1.
12. Bao H., Dong L., Wei F. BEiT: BERT Pre-Training of Image Transformers // International Conference on Learning Representations (ICLR). 2022.
13. Bataineh B., Tounsi M., Zamzami N., Janbi J., Abu-ain W. A. K., AbuAin T., Elnazer S. A Comprehensive Review on Document Image Binarization // Journal of Imaging. 2025. Vol. 11, No. 5. Art. 133.
14. Berman M., Rannen Triki A., Blaschko M. B. The Lovasz-Softmax Loss: A Tractable Surrogate for the Optimization of the Intersection-over-Union Measure in Neural Networks // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2018, pp. 4413-4421.
15. Bernardin K., Stiefelhagen R. Evaluating Multiple Object Tracking Performance: The CLEAR MOT Metrics // EURASIP Journal on Image and Video Processing. 2008. Art. 246309.
16. Beucher S., Meyer F. The Morphological Approach to Segmentation: The Watershed Transformation // Mathematical Morphology in Image Processing. 1993, pp. 433-481.
17. Blender Foundation. Geometry Nodes: Attribute Evaluation on Instances May Cause Duplicated Memory Allocation (Bug report T91933) // Blender Developer Portal. URL: https://developer.blender.org/T91933
18. Bose R., Nwoye C. I., Bhat A., Padoy N. CoSimGen: Controllable Diffusion Model for Simultaneous Image and Mask Generation // arXiv preprint arXiv:2503.19661. 2025.
19. Bozic J., Tabernik D., Skocaj D. Mixed supervision for surface-defect detection: From weakly to fully supervised learning // Computers in Industry. 2021.Vol. 129. Art. 103459.
20. Bradley D., Roth G. Adaptive Thresholding Using the Integral Image // Journal of Graphics Tools. 2007. Vol. 12, No. 2, pp. 13-21.
21. Canny J. A Computational Approach to Edge Detection // IEEE Transactions on Pattern Analysis and Machine Intelligence. 1986. No 6 (PAMI-8), pp. 679698.
22. Chen T., Kornblith S., Norouzi M., Hinton G. A Simple Framework for Contrastive Learning of Visual Representations // Proceedings of the 37th International Conference on Machine Learning (ICML'20), 2020, pp. 1-11.
23. Cao H., Wang Y., Chen J., Jiang D., Zhang X., Tian Q., Wang M. Swin-Unet: Unet-like pure transformer for medical image segmentation // arXiv preprint arXiv:2105.05537. 2021.
24. Caicedo J. C., et al. Evaluation of Deep Learning Strategies for Nucleus Segmentation in Fluorescence Images // Cytometry A. 2019. Vol. 95(9), pp. 952-965.
25. Carion N., Massa F., Synnaeve G., Usunier N., Kirillov A., Zagoruyko S. End-to-End Object Detection with Transformers. In: ECCV 2020, LNCS 12346, pp. 213-229.
26. Caron M., Misra I., Mairal J., Goyal P., Bojanowski P., Joulin A. Unsupervised Learning of Visual Features by Contrasting Cluster Assignments // Advances in Neural Information Processing Systems. Curran Associates, Inc., 2020, pp. 9912-9924.
27. Chan L., Hosseini M. S., Plataniotis K. N. A Comprehensive Analysis of Weakly-Supervised Semantic Segmentation in Different Image Domains // International Journal of Computer Vision. 2020. Vol. 129, No. 2. pp. 361-384.
28. Chen J., Mei J., Li X., Lu Y., Yu Q., Wei Q., Luo X., Xie Y., Adeli E., Wang Y., Lungren M. P., Zhang S., Xing L., Lu L., Yuille A., Zhou Y. TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of transformers // Medical Image Analysis. 2024. Vol. 97. Art. 103280
29. Chen J., Lu Y., Yu Q., Luo X., Adeli E., Wang Y., Lu L., Zhou Y. TransUNet: Transformers make strong encoders for medical image segmentation // arXiv preprint arXiv:2102.04306. 2021.
30. Chen K., Debroux N., Le Guyader C. A Survey of Topology and Geometry-Constrained Segmentation Methods in Weakly Supervised Settings // In: Chen K., Schonlieb C.-B., Tai X.-C., Younes L. (eds.) Handbook of Mathematical Models and Algorithms in Computer Vision and Imaging: Mathematical Imaging and Vision. Springer, 2023, pp. 1437-1482.
31. Chen K., et al. MMDetection: Open MMLab Detection Toolbox and Benchmark // arXiv preprint arXiv:1906.07155. 2019.
32. Chen L.-C., Papandreou G., Kokkinos I., Murphy K., Yuille A. L. DeepLab: Semantic Image Segmentation with Deep Convolutional Nets, Atrous Convolution, and Fully Connected CRFs // IEEE Transactions on Pattern Analysis and Machine Intelligence. 2018. Vol. 40. No. 4, pp. 834-848
33. Chen M., Li H., Sun Y., Zhang C., Zhao J. End-to-End Bubble Size Distribution Detection Technique for High-Density Bubbly Flows // Sensors. 2023. Vol. 23, No. 14. Art. 6582.
34. Chen Y., Li W., Sakaridis C., Dai D., Van Gool L. Learning Semantic Segmentation from Synthetic Data: A Geometrically-Guided Input-Output Adaptation // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2019, pp. 4242-4251.
35. Chen Y., Xu D., Wan K. A froth velocity measurement method based on improved U-Net++ semantic segmentation in flotation process // International Journal of Minerals, Metallurgy and Materials. 2024.Vol. 31, pp. 1816-1827.
36. Chen Z., Sun Q. Weakly-supervised Semantic Segmentation with Image-level Labels: From Traditional Models to Foundation Models // ACM Computing Surveys. 2025.Vol. 57, № 5. Article 111, pp. 1-29.
37. Cheng B., Misra I., Schwing A. G., Kirillov A., Girdhar R. Masked-attention Mask Transformer for Universal Image Segmentation // arXiv preprint arXiv:2112.01527. 2022.
38. Chhipa P. C., et al. Depth Contrast: Self-supervised Pretraining on 3DPM Images for Mining Material Classification // Computer Vision - ECCV 2022 Workshops. Lecture Notes in Computer Science. Vol. 13807. Springer, Cham, 2023. URL: https://doi.org/10.1007/978-3-031-25082-8_14
39. Cho Y. S., Laskowski J. S. Effect of flotation frothers on bubble size and foam stability // International Journal of Mineral Processing. 2002.Vol. 64, No 2-3, pp. 69-80.
40. Choi D. H., Jang I. H., Kim M. H., Kim N. C. Color image enhancement using single-scale retinex based on an improved image formation model // Proceedings of the 16th European Signal Processing Conference (EUSIPCO). 2008, pp. 1-5
41. Community of Blender Foundation. Blender - Free and Open Source 3D Creation Suite. Blender Foundation, Amsterdam, 2025. URL: https://www.blender.org
42. Christen P., Hand D. J., Kirielle N. A Review of the F-Measure: Its History, Properties, Criticism, and Alternatives // ACM Computing Surveys. 2024. Vol. 56, No. 3, pp. 1-24.
43. CVAT (Computer Vision Annotation Tool). Zenodo Record.
44. Delgado G., et al. Methodology for generating synthetic labeled datasets for visual container inspection // Transportation Research Part E: Logistics and Transportation Review. 2023.Vol. 175, pp. 103174.
45. Delussu R., Putzu L., Fumera G. Synthetic Data for Video Surveillance Applications of Computer Vision: A Review // International Journal of Computer Vision. 2024. Vol. 132, pp. 4473-4509.
46. Deng J., Dong W., Socher R., Li L.-J., Li K., Fei-Fei L. ImageNet: A large-scale hierarchical image database // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, 2009, pp. 248-255.
47. Denninger M., et al. BlenderProc: A Procedural Pipeline for Photorealistic Rendering // arXiv preprint arXiv: 1911.01911. 2019.
48. Ding Z., Xu Y., Xu W., Parmar G., Yang Y., Welling M., Tu Z. Guided Variational Autoencoder for Disentanglement Learning // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2020, pp. 7920-7929.
49. Dhanush G., Khatri N., Kumar S., Shukla P. K. A comprehensive review of machine vision systems and artificial intelligence algorithms for the detection and harvesting of agricultural produce // Scientific African. 2023.Vol. 21. e01798.
50. Dosovitskiy A., Beyer L., Kolesnikov A., Weissenborn D., Zhai X., UnterthinerVol., Houlsby N. An image is worth 16x16 words: Transformers for image recognition at scale // International Conference on Learning Representations (ICLR). 2021. URL: https://arxiv.org/abs/2010.11929
51. Falcon W., The PyTorch Lightning Team. PyTorch Lightning // Zenodo. 2019.
52. Ferreira I., Ochoa L., Koeshidayatullah A. PetroGAN: A novel GAN-based approach to generate realistic, label-free petrographic datasets // arXiv preprint arXiv:2204.05114. 2022.
53. Engin I. C., Maerz N. H. Size distribution analysis of aggregates using LiDAR scan data and an alternate algorithm // Measurement. 2019.Vol. 143, pp. 136143.
54. Fan T., Wang G., Li Y., Zhang L. MA-Net: A Multi-Scale Attention Network for Semantic Segmentation // arXiv preprint arXiv:2007.11824. 2020.
55. Forsmo S. P. E., Apelqvist A. J., Bjorkman B. M.Vol., Samskog P.-O. Binding mechanisms in wet iron ore green pellets with a bentonite binder // Powder Technology. 2006.Vol. 169, No 3, pp. 147-158.
56. Fu Y., Aldrich C. Online particle size analysis on conveyor belts with dense convolutional neural networks // Minerals Engineering. 2023.Vol. 193, pp. 108019.
57. Gharehchobogh B. K., Kuzekanani Z. D., Sobhi J., Khiavi A. M. Flotation froth image segmentation using Mask R-CNN // Minerals Engineering. 2023.Vol. 192, pp. 107959.
58. Gidaris S., Singh P., Komodakis N. Unsupervised representation learning by predicting image rotations // International Conference on Learning Representations (ICLR). 2018. URL: https://arxiv.org/abs/1803.07728.
59. Goodfellow I., Pouget-Abadie J., Mirza M., Xu B., Warde-Farley D., Ozair S., Courville A., Bengio Y. Generative adversarial networks // Communications of the ACM. 2020.Vol. 63, № 11, pp. 139-144.
60. Griffioen N., Rankovic N., Zamberlan F., et al. Efficient annotation reduction with active learning for computer vision-based Retail Product Recognition // Journal of Computational Social Science. 2024.Vol. 7, pp. 1039-1070
61. Grill J.-B., Strub F., Altché F., et al. Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning // Advances in Neural Information Processing Systems (NeurIPS). 2020. URL: https://arxiv.org/abs/2006.07733.
62. Grau R. A., Heiskanen K. Visual technique for measuring bubble size in flotation machines // Minerals Engineering. 2002.Vol. 15, No 7, pp. 507-513.
63. Gui J., Chen T., Zhang J., Cao Q., Sun Z., Luo H., Tao D. A Survey on Self-supervised Learning: Algorithms, Applications, and Future Trends // arXiv preprint arXiv:2301.05712. 2024
64. Guo S., Tang J., Deng Y., Xia Q. An improved approach for the segmentation of starch granules in microscopic images // BMC Genomics. 2010.Vol. 11, Suppl. 2. S13.
65. Guo Q., Wang Y., Yang S., et al. A method of blasted rock image segmentation based on improved watershed algorithm // Scientific Reports. 2022.Vol. 12. Art. 7143.
66. Hatamizadeh A., Nath V., Tang Y., Yang D., Roth H. R., Xu D. Swin UNETR: Swin Transformers for Semantic Segmentation of Brain Tumors in MRI Images // MICCAI BrainLes Workshop. 2022.
67. He K., Chen X., Xie S., Li Y., Dollar P., Girshick R. Masked Autoencoders Are Scalable Vision Learners. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022, pp. 16000-16009.
68. He K., Gkioxari G., Dollár P., Girshick R. Mask R-CNN // IEEE Transactions on Pattern Analysis and Machine Intelligence. 2020. Vol. 42, No. 2, pp. 386397.
69. He K., Zhang X., Ren S., Sun J. Deep residual learning for image recognition // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, 2016, pp. 770-778.
70. Hlabangana N., Danha G., Muzenda E. Effect of Ball and Feed Particle Size Distribution on the Milling Efficiency of a Ball Mill: An Attainable Region Approach // South African Journal of Chemical Engineering. 2018. Vol. 25, pp. 79-84.
71. Ho J., Jain A., Abbeel P. Denoising diffusion probabilistic models // arXiv preprint arXiv:2006.11239. 2020. URL: https://arxiv.org/abs/2006.11239.
72. Huang Z., ZhangVol., Heng W., Shi B., Zhou S. Real-Time Intermediate Flow Estimation for Video Frame Interpolation (RIFE) // Computer Vision - ECCV
2022. Lecture Notes in Computer Science. Springer, Cham, 2022, pp. 624-642.
73. He K., Fan H., Wu Y., Xie S., Girshick R. Momentum Contrast for Unsupervised Visual Representation Learning // arXiv preprint arXiv:1911.05722. 2019.
74. Hugging Face. Diffusers: Stable Diffusion Pipeline Documentation. URL: https://huggingface.co/docs/diffusers/v0.8.0/en/api/pipelines/stable_diffusion.
75. Ihmsen M., Cornelis J., Solenthaler B., Horvath C., Teschner M. SPH Fluids in Computer Graphics // Eurographics 2014 - State of the Art Reports. 2014, pp. 21-42.
76. Intel® Distribution of OpenVINO™ Toolkit // Intel Developer Zone. URL: https://www.intel.com/content/www/us/en/developer/tools/openvino-toolkit/overview.html
77. Jahedsaravani A., Massinaei M., Zarie M. Measurement of bubble size and froth velocity using convolutional neural networks // Minerals Engineering.
2023.Vol. 204. Art. 108400.
78. Jaiswal A., Babu A. R., Zadeh M., Banerjee D., Makedon F. A survey on contrastive self-supervised learning // Technologies. 2021.Vol. 9, No 1. Art. 2.
79. Jing L., Tian Y. Self-Supervised Visual Feature Learning with Deep Neural Networks: A Survey // IEEE Transactions on Pattern Analysis and Machine Intelligence. 2021. Vol. 43, No. 11, pp. 4037-4058.
80. Jobson D. J., Rahman Z., Woodell G. A. Retinex image processing: improved fidelity to direct visual observation // Proceedings of the IS&T 4th Color Imaging Conference: Color Science, Systems and Applications. IS&T, 1997, pp. 212-219.
81. Kang Q., Ye F., Li Q., Li R., Wang J., Wang H., Yang C. Bubble boundary R-CNN: A multitask model for segmenting and reconstructing overlapping bubbles // Separation and Purification Technology. 2025.Vol. 358. Art. 130300.
82. Kannala J., Brandt S. S. A generic camera model and calibration method for conventional, wide-angle, and fish-eye lenses // IEEE Transactions on Pattern Analysis and Machine Intelligence. 2006.Vol. 28, No 8, pp. 1335-1340.
83. Karras T., Laine S., Aittala M., Hellsten J., Lehtinen J., Aila T. Analyzing and Improving the Image Quality of StyleGAN // arXiv preprint arXiv:1912.04958. 2019. URL: https://arxiv.org/abs/1912.04958
84. Kervadec H., Bouchtiba J., Desrosiers C., Granger E., Dolz J., Ayed I. B. Boundary Loss for Highly Unbalanced Segmentation // Medical Image Analysis. 2019. Vol. 67. Art. 101851.
85. Khan S., Phan B. T., Salay R., Czarnecki K. ProcSy: Procedural Synthetic Dataset Generation Towards Influence Factor Studies of Semantic Segmentation Networks // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). 2019. URL: https://openaccess.thecvf.com/content_CVPRW_2019/papers/Khan_ProcSy_ Procedural_Synthetic_Dataset_Generation_Towards_Influence_Factor_Studi es Of CVPRW 2019 paper.pdf.
86. Khanam R., Hussain M. YOLOvll: An Overview of the Key Architectural Enhancements // arXiv preprint arXiv:2410.17725. 2024
87. Kilian W. J., Prinsloo J., Vosloo J., Taljaard S. A synthetic segmentation dataset generator using a 3D modeling framework and raycaster: a mining industry application // Frontiers in Artificial Intelligence. 2024.Vol. 7, 1453931.
88. Kim S. E., Yoon H., Lee J. Fast and scalable earth texture synthesis using spatially assembled generative adversarial neural networks // Journal of Contaminant Hydrology. 2021. Vol. 243. Art. 103867.
89. Kingma D. P., Ba J. L. Adam: A Method for Stochastic Optimization // arXiv preprint arXiv:1412.6980. 2014.
90. Kingma D. P., Welling M. Auto-Encoding Variational Bayes // arXiv preprint arXiv:1312.6114. 2013.
91. Kirillov A., Mintun E., Ravi N., Mao H., Rolland C., Gustafson L., Xiao T., Whitehead S., Berg A. C., Lo W. Y., Dollar P., Girshick R. Segment Anything // arXiv preprint arXiv:2304.02643. 2023.
92. Laperche V., Lemière B. Possible Pitfalls in the Analysis of Minerals and Loose Materials by Portable XRF, and How to Overcome Them // Minerals. 2021. Vol. 11, Art. 33.
93. Laucka A., Adaskeviciute V., Andriukaitis D. Research of the Equipment Self-Calibration Methods for Different Shape Fertilizers Particles Distribution by Size Using Image Processing Measurement Method // Symmetry. 2019.Vol. 11 .Art. 838.
94. LeCun Y., Bottou L., Bengio Y., Haffner P. Gradient-Based Learning Applied to Document Recognition // Proceedings of the IEEE. 1998. Vol. 86, No. 11. pp. 2278-2324. Lehmussola A., et al. Computational framework for simulating fluorescence microscope images with cell populations // IEEE Transactions on Medical Imaging. 2007.Vol. 26, No 7, pp. 1010-1016.
95. Lee J., Yi J., Shin C., Yoon S. BBAM: Bounding Box Attribution Map for Weakly Supervised Semantic and Instance Segmentation // Proceedings of the
IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2021.
96. Lin T.-Y., Goyal P., Girshick R., He K., Dollar P. Focal Loss for Dense Object Detection // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). 2017, pp. 2999-3007.
97. Lin T.-Y., Maire M., Belongie S., Bourdev L., Girshick R., Hays J., Perona P., Ramanan D., Dollar P., Zitnick C. L. Microsoft COCO: Common objects in context // Computer Vision - ECCV 2014. Eds. B. Leibe, J. Matas, N. Sebe, M. Welling. Springer, 2014, pp. 740-755.
98. Lippel J., Bihlmeier R., Stuhlsatz A. A Computer Vision Approach to Fertilizer Detection and Classification SCITEPRESS, 2025, pp. 563-569.
99. Liu C., et al. CounTR: Transformer-based Generalised Visual Counting // Proceedings of the British Machine Vision Conference (BMVC). 2022.
100.Liu H., Wang L., Shi Y., Wang X., Chang F., Wu Y. A deep learning-based method for detecting granular fertilizer deposition distribution patterns in centrifugal variable-rate spreader fertilization // Computers and Electronics in Agriculture. 2023.Vol. 212. Art.108107.
101.Liu K. Some factors affecting sieving performance and efficiency // Powder Technology. 2009. Vol. 193, No 2, pp. 208-213.
102.Loshchilov I., Hutter F. SGDR: Stochastic Gradient Descent with Warm Restarts // arXiv preprint arXiv:1608.03983. 2016. URL: https://arxiv.org/pdf/1608.03983.pdf
103.Lu Y., Shen M., Wang H., Wang X. Machine Learning for Synthetic Data Generation: A Review // arXiv preprint arXiv:2302.04062. 2023.
104.MacQueen J. Some methods for classification and analysis of multivariate observations // Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability. Vol. 1. University of California Press, 1967, pp. 281297
105.McCormac J., et al. SceneNet RGB-D: Can 5M Synthetic Images Beat Generic ImageNet Pre-training on Indoor Segmentation? // Proceedings of the IEEE International Conference on Computer Vision (ICCV). 2017, pp. 2678-2687
106.Man K., Chahl J. A Review of Synthetic Image Data and Its Use in Computer Vision // Journal of Imaging. 2022. No. 11. Art. 310.
107.Marr D., Hildreth E. Theory of Edge Detection // Proceedings of the Royal Society of London. Series B, Biological Sciences. 1980.Vol. 207, No 1167, pp. 187-217.
108.Mehrshad N., Massinaei M. New image-processing algorithm for measurement of bubble size distribution from flotation froth images // Mining, Metallurgy & Exploration. 2011.Vol. 28, pp. 146-150.
109.Merkel D. Docker: Lightweight Linux Containers for Consistent Development and Deployment // Linux Journal. 2014. Vol. 2014, No. 239. Art. 2. URL: https://www.linuxj ournal .com/content/docker-lightweight-linux-containers-consistent-development-and-deployment.
110.Miceli M., Schuessler M., Yang T. Between Subjectivity and Imposition: Power Dynamics in Data Annotation for Computer Vision // Proceedings of the ACM on Human-Computer Interaction. 2020.Vol. 4, No CSCW2, pp. 1-25.
111.MinIO Inc. MinIO Object Storage for Linux - Documentation. 2025. URL: https://min.io/docs/minio/linux/index.html
112.Mirza M., Osindero S. Conditional Generative Adversarial Nets // arXiv preprint arXiv:1411.1784. 2014. URL: https://arxiv.org/abs/1411.1784.
113.Moolman D. W., Aldrich C., Van Deventer J. S. J. The monitoring of froth surfaces on industrial flotation plants using connectionist image processing techniques // Minerals Engineering. 1995.Vol. 8, No 1-2, pp. 23-30.
114.Moradi I., Abdollahzadeh A. A., Irannajad M. Computation of Fractal Dimension and Power Draw of Re-Grinding Depending on Particle Size Distribution // Scientific Reports. 2025. Vol. 15. Art. 14095.
115.Morrell S., Valery W. Influence of feed size on AG/SAG mill performance // Proceedings of SAG2001. Vancouver, Canada, 2001, pp. 203-214.
116.Muller D., Soto-Rey I., Kramer F. Towards a guideline for evaluation metrics in medical image segmentation // BMC Research Notes. 2022. Vol. 15. Art. 210.
117.Mumuni A., Mumuni F., Gerrar N. K. A Survey of Synthetic Data Augmentation Methods in Computer Vision // arXiv preprint arXiv:2403.10075. 2024.
118.al Nomaan Nafi A., Hossain M. A., Rifat R. H., Zaman M. M. U., Ahsan M. M., Raman S. Diffusion-Based Approaches in Medical Image Generation and Analysis // arXiv preprint arXiv:2412.16860. 2024. URL: http://arxiv.org/abs/2412.16860.
119.Neubeck A., Van Gool L. Efficient Non-Maximum Suppression // Proceedings of the 18th International Conference on Pattern Recognition (ICPR). 2006. Vol. 3, pp. 850-855.
120.Nikolenko S. I. Synthetic Data for Deep Learning. Springer Optimization and Its Applications. Vol. 1. Springer, Cham, 2021. Art. 348
121.Noroozi M., Favaro P. Unsupervised learning of visual representations by solving jigsaw puzzles // European Conference on Computer Vision (ECCV). Springer, 2016, pp. 69-84.
122.Oktay O., Schlemper J., Folgoc L., et al. Attention U-Net: Learning Where to Look for the Pancreas // arXiv preprint arXiv:1804.03999. 2018. URL: https://arxiv.org/abs/1804.03999
123.van den Oord A., Li Y., Vinyals O. Representation Learning with Contrastive Predictive Coding // arXiv preprint arXiv:1807.03748, 2018. URL: https://arxiv.org/abs/1807.03748
124.OpenAI. DALLE 3 research release. 2023. URL: https://openai.com/dall-e-3.
125. Otsu N. A Threshold Selection Method from Gray-Level Histograms // IEEE Transactions on Systems, Man, and Cybernetics. 1979. Vol. 9, No. 1, pp. 6266.
126.Pan S. J., Yang Q. A Survey on Transfer Learning // IEEE Transactions on Knowledge and Data Engineering. 2010. Vol. 22, No. 10, pp. 1345-1359
127.Papadopoulos D. P., Uijlings J. R. R., Keller F., Ferrari V. Extreme Clicking for Efficient Object Annotation // Proceedings of the IEEE International Conference on Computer Vision (ICCV). Venice, Italy, 2017, pp. 4940-4949.
128.Pathak D., Krahenbuhl P., Donahue J., Darrell T., Efros A. A. Context encoders: Feature learning by inpainting // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 2016, pp. 2536-2544.
129.Paszke A., Gross S., Massa F., et al. PyTorch: An Imperative Style, HighPerformance Deep Learning Library // Advances in Neural Information Processing Systems (NeurIPS). 2019. Vol. 32. URL: https://pytorch.org
130.Petruk W. Automatic Image Analysis for Mineral Beneficiation // JOM. 1988. No 4 (40), pp. 29-31.
131.Pizer S. M., Amburn E. P., Austin J. D., et al. Adaptive Histogram Equalization and Its Variations // Computer Vision, Graphics, and Image Processing. 1987. Vol. 39. No. 3, pp. 355-368.
132.PostgreSQL Global Development Group. PostgreSQL Documentation. 2024. URL: https://www.postgresql.org/docs/
133.Punn N. S., Agarwal S. BT-Unet: A Self-Supervised Learning Framework for Biomedical Image Segmentation Using Barlow Twins with U-Net Models // Machine Learning. 2022. Vol. 111. No. 12, pp. 4585-4600.
134.Python Software Foundation. Python Language Reference, version 3.x. 2025. URL: https://www.python.org.
135.Qian H., Chen Y. D., Lou S., Shahbaz K., Jin X., Fan D.-P. MaskFactory: Towards High-Quality Synthetic Data Generation for Dichotomous Image Segmentation // Advances in Neural Information Processing Systems (NeurIPS). 2024.
136.Rao S. R. Surface Chemistry of Froth Flotation: Volume 1: Fundamentals / S. R. Rao, Boston, MA: Springer US, 2004.
137.Reda F., Kontkanen J., Tabellion E., Sun D., Pantofaru C., Curless B. FILM: Frame Interpolation for Large Motion // arXiv preprint arXiv:2202.04901. 2022. URL: https://arxiv.org/abs/2202.04901.
138.Ren S., He K., Girshick R., Sun J. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks // IEEE Transactions on Pattern Analysis and Machine Intelligence. 2017. Vol. 39. No. 6, pp. 1137-1149.
139.Rodriguez C., et al. REST APIs: A Large-Scale Analysis of Compliance with Principles and Best Practices // In: Bozzon A., Cudre-Maroux P., Pautasso C. (eds) Web Engineering (ICWE 2016). Lecture Notes in Computer Science. Vol. 9671. Springer, Cham, 2016. URL: 10.1007/978-3-319-38791-8 2
140.Ronneberger O., Fischer P., Brox T. U-Net: Convolutional Networks for Biomedical Image Segmentation //MICCAI 2015 (LNCS 9351), pp. 234-241.
141.Rombach R., Blattmann A., Lorenz D., Esser P., Ommer B. High-Resolution Image Synthesis with Latent Diffusion Models (Stable Diffusion) // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2022, pp. 10684-10695.
142. Saharia C., Chan W., Saxena S., Li L., Whang J., Denton E., Salimans T., et al. Photorealistic text-to-image diffusion models with deep language understanding // arXiv preprint arXiv:2205.11487. 2022. URL: https://arxiv.org/abs/2205.11487.
143. Salami H., Wood C., Ouyang H., Zhao X., Skomski D. Deep learning image analysis models pretrained on daily objects are useful for the preliminary characterization of particulate pharmaceutical samples // Biotechnology and Bioengineering. 2023.Vol. 120. No 8, pp. 2175-2185.
144. Salehi S. S. M., Erdogmus D., Gholipour A. Tversky Loss Function for Image Segmentation Using 3D Fully Convolutional Deep Networks // Machine Learning in Medical Imaging (MLMI). Springer, 2017, pp. 379-387.
145.Saraiva P. A. R., de Souza E. F., Pinheiro J. M. H., Segreto T. H., Godoy R. V., Becker M. A Synthetic Dataset for Manometry Recognition in Robotic Applications // arXiv preprint arXiv:2508.17468. 2025.
146.Santos C. M. C. V., de Almeida R., Valadao C. T., Cuadros M. A. S. L., Almeida G. M. Iron ore pellets measurement using deep learning based on
YOLACT // Neural Computing and Applications. 2024.Vol. 36. No 24, pp. 14909-14924.
147.Schieber H. Indoor Synthetic Data Generation: A Systematic Review // Computers & Graphics. 2024. URL:
https://www.sciencedirect.com/science/article/pii/S1077314223002874.
148. Selvaraju R. R., Cogswell M., Das A., Vedantam R., Parikh D., Batra D. GradCAM: Visual Explanations from Deep Networks via Gradient-Based Localization // arXiv preprint arXiv:1610.02391. 2016.
149. Seninge L., et al. VEGA: VAE enhanced by gene annotations // Nature Communications. 2021. Vol. 12, pp. 1-12.
150. Serra J. Image Analysis and Mathematical Morphology. Academic Press, USA, 1983. ISBN 0126372403.
151.Simonyan K., Zisserman A. Very Deep Convolutional Networks for Large-Scale Image Recognition. arXiv preprint arXiv:1409.1556, 2015..
152.Shafait F., Keysers D., Breuel T. M. Efficient Implementation of Local Adaptive Thresholding Techniques Using Integral Images // Proceedings of SPIE Document Recognition and Retrieval XV, 2008. Vol. 6815, Art. 681510.
153. Shi J., Zhang K., Guo C., Yang Y., Xu Y., Wu J. A survey of label-noise deep learning for medical image analysis // Medical Image Analysis. 2024.Vol. 95, Art. 103166.
154. Shrivastava A., Pfister T., Tuzel O., Susskind J., Wang W., Webb R. Learning from Simulated and Unsupervised Images through Adversarial Training // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 2017, pp. 2107-2116.
155. Siegmund D. Boundary Crossing Probabilities and Statistical Applications // The Annals of Statistics. 1986. № 2 (14), pp. 361-404.
156.Sobel I., Feldman G. A 3*3 Isotropic Gradient Operator for Image Processing // Pattern Classification and Scene Analysis. 1973, pp. 271-272.
157.Song J., Zhou X., Jiang R. Research on Characterization of 3D Morphology of Coarse Aggregate Based on Laser Scanning // Buildings. 2023. Vol. 13, No. 4. Art. 1029.
158.Soviany P., Ionescu R. T., Rota P., Sebe N. Curriculum Learning: A Survey // arXiv preprint arXiv:2101.10382. 2021. URL:
https://arxiv.org/abs/2101.10382
159.Storti F., Balsamo F. Particle Size Distributions by Laser Diffraction: Sensitivity of the Method to Operating Procedures // Solid Earth. 2010. Vol. 1, pp. 25-42.
160.Strutz T. The Distance Transform and Its Computation // arXiv preprint arXiv:2106.03503. 2021. URL: https://arxiv.org/abs/2106.03503.
161.Sudre C. H., Li W., Vercauteren T., Ourselin S., Cardoso M. J. Generalised Dice Overlap as a Deep-Learning Loss Function for Highly Unbalanced Segmentations // arXiv preprint arXiv:1707.03237. 2017.
162.Sushko V., Zhao D., Sun J., et al. One-Shot Synthesis of Images and Segmentation Masks // Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). 2023.
163.Shen W. A Survey on Label-Efficient Deep Image Segmentation // arXiv preprint arXiv:2207.01223. 2022.
164. Sun G., Huang D., Cheng L., Jia J., Xiong C., Zhang Y. Efficient and Lightweight Framework for Real-Time Ore Image Segmentation Based on Deep Learning // Minerals. 2022.Vol. 12, No 5. Art. 526.
165.Sun T., et al. Computing Precision and Recall with Missing or Uncertain Ground Truth // In: Computer Vision - ECCV 2012 Workshops. Springer, 2013, pp. 146-155.
166.Tan M., Le Q. EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks. Proceedings of the 36th International Conference on Machine Learning (ICML), 2019, pp. 6105-6114.
167.Tanveer M. H., Fatima Z., Zardari S., Guerra-Zubiaga D. An In-Depth Analysis of Domain Adaptation in Computer and Robotic Vision // Applied Sciences, 2023, Vol. 13(23). Art. 12823.
168.TensorBoard - Visualizations for ML Experimentation // TensorFlow Documentation. URL: https://www.tensorflow.org/tensorboard
169.Tian K., Jiang Y., Diao Q., Lin C., Wang L., Yuan Z. Designing BERT for Convolutional Networks: Sparse and Hierarchical Masked Modeling (SparK) // arXiv preprint arXiv:2301.03580. 2023.
170.Tian Z., Chen Z., Zhu J., Du S., Li C. C-CAM: Causal CAM for Weakly Supervised Semantic Segmentation on Medical Images // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2022.
171.Tiangolo S. FastAPI. 2018. URL: https://fastapi.tiangolo.com
172.Tomasi C., Manduchi R. Bilateral Filtering for Gray and Color Images // Proceedings of the IEEE International Conference on Computer Vision (ICCV). 1998. pp. 839-846
173.Topaz C. M., Bertozzi A. L., Lewis M. A. A Nonlocal Continuum Model for Biological Aggregation // arXiv preprint arXiv:q-bio/0504001. 2005.
174. Toussaint G. T. Solving geometric problems with the rotating calipers // Proceedings of IEEE MELECON. 1983.Vol. 83, № 83.pp. A10.
175. Touvron H., Cord M., Douze M., Massa F., Sablayrolles A., Jégou H. Training data-efficient image transformers & distillation through attention // International Conference on Machine Learning (ICML). 2021.
176.Trabucco B., Doherty K., Gurinas M. A., Salakhutdinov R. Effective Data Augmentation with Diffusion Models // Proceedings of the Twelfth International Conference on Learning Representations (ICLR), 2024. URL: https://openreview.net/forum?id=ZWzUA9zeAg
177. Tremblay J., Prakash A., Acuna D., Brophy M., Jampani V., Anil C., To T., Cameracci E., Boochoon S., Birchfield S. Training Deep Networks with Synthetic Data: Bridging the Reality Gap by Domain Randomization //
Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) Workshops. 2018, pp. 969-977.
178. Tomasi C., Manduchi R. Bilateral filtering for gray and color images // Proceedings of the Sixth International Conference on Computer Vision (ICCV). IEEE, 1998, pp. 839-846.
179.Tu L., Dong C. Histogram Equalization and Image Feature Matching // Proceedings of the 6th International Congress on Image and Signal Processing (CISP), Hangzhou, China, 2013, pp. 443-447.
180.Vanarase A., Aslam R., Oka S., Muzzio F. Effects of mill design and process parameters in milling dry extrudates // Powder Technology. 2015.Vol. 278, pp. 84-93.
181.Varghese A., Jain A., Lawrence N. D., Zisserman A. Unsupervised Temporal Consistency Metric for Video Segmentation in Highly-Automated Driving // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). 2020.
182.Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Polosukhin I. Attention is all you need // Advances in Neural Information Processing Systems. 2017.Vol. 30.
183.Vincent L., Soille P. Watersheds in Digital Spaces: An Efficient Algorithm Based on Immersion Simulations // IEEE Transactions on Pattern Analysis and Machine Intelligence. 1991. Vol. 13, No. 6. pp. 583-598
184.Ulusoy U. A Review of Particle Shape Effects on Material Properties for Various Engineering Applications: From Macro to Nanoscale // Minerals. 2023.Vol. 13. Art. 91.
185.Wang G., Li Z., Weng G., Chen Y. An overview of industrial image segmentation using deep learning models // Intelligent Robotics. 2025.Vol. 5, No 1, pp. 143-180.
186.Wang J. S., Han S., Shen N. N., Li S. X. Features extraction of flotation froth images and BP neural network soft-sensor model of concentrate grade
optimized by shuffled cuckoo searching algorithm // The Scientific World Journal. 2014.
187.Wang J., Sun K., Cheng T., Jiang B., Deng C., Zhao Y., Liu D., Mu Y., Tan M., Wang X. Deep High-Resolution Representation Learning for Visual Recognition (HRNet) // IEEE Transactions on Pattern Analysis and Machine Intelligence. 2021.
188.Wang J. Weakly Supervised Image Segmentation Beyond Tight Bounding Boxes // arXiv preprint arXiv:2301.12053. 2023.
189.Wang Y., Zhou L., Chen X., Zhang H., Xu M. Synthetic MRI generation using diffusion models for brain tumor classification // Bioinformatics. 2023. Vol. 39, pp. 258-267.
190.Wang Z., Li Y., Chen Y., Wang Y., Zhang Y., Wang Z. Anchor DETR: Query Design for Transformer-Based Object Detection // AAAI Conference on Artificial Intelligence (AAAI). 2022.Vol. 36, No 2, pp. 2567-2575.
191.Weng X. [h gp.]. Improved Mask R-CNN algorithm: Multi-ore detection and positioning based multi-sensor fusion in complex field environment // Measurement. 2025. (246). Art. 116602.
192.Wojke N., Bewley A., Paulus D. Simple Online and Realtime Tracking with a Deep Association Metric (DeepSORT) // arXiv preprint arXiv:1703.07402. 2017.
193.Wu C., Zhou K., Kaiser J.-P., Mitschke N., Klein J.-F., Pfrommer J., Beyerer J., Lanza G., Heizmann M., Furmans K. MotorFactory: A Blender Add-on for Large Dataset Generation of Small Electric Motors // arXiv preprint arXiv:2301.05028. 2023.
194.Wu J., et al. Image Segmentation Algorithm Based on Improved U-Net for Mineral Froth Flotation Process // Artificial Intelligence in China. AIC 2023. Lecture Notes in Electrical Engineering. Vol. 1043.
195.Xie E., Wang W., Yu Z., Anandkumar A., Alvarez J. M., Luo P. SegFormer: Simple and efficient design for semantic segmentation with transformers // arXiv preprint arXiv:2105.15203. 2021.
196.Xie D. H., Lu M., Xie Y. F., Liu D., Li X. A fast threshold segmentation method for froth image base on the pixel distribution characteristic // PLoS ONE. 2019.Vol. 14, No 1. e0210411.
197.Yadan O. Hydra - A Framework for Elegantly Configuring Complex Applications // Proceedings of the Python in Science Conference (SciPy). 2020.
198.Yang D., Wang X., Zhang H., Yin Z., Su D., Xu J. A Mask R-CNN based particle identification for quantitative shape evaluation of granular materials // Powder Technology. 2021.Vol. 392, pp. 296-305.
199.Yang, Y., & Soatto, S. (2020). FDA: Fourier Domain Adaptation for Semantic Segmentation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4085-4095.
200.Yaseen M. What is YOLOv8: An In-Depth Exploration of the Internal Features of the Next-Generation Object Detector // arXiv preprint arXiv:2408.15857 [cs.CV]. 2024.
201.Ye H., Zhang J., Liu S., Han X., Yang W. IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models // arXiv preprint arXiv:2308.06721. 2023.
202.Yu C., Wu W., Zheng J., et al. A multi-stage adaptive Otsu thresholding algorithm for pore segmentation in rock thin-section images // Earth Science Informatics. 2025.Vol. 18, pp. 239.
203.Zbontar J., Jing L., Misra I., LeCun Y., Deny S. Barlow Twins: Self-Supervised Learning via Redundancy Reduction // arXiv preprint arXiv:2103.03230. 2021.
204.Zeng G., Chen J., Zhou Z., et al. Self-Supervised Learning Empowers Industrial Vision for Anomaly Detection and Segmentation // IEEE Transactions on Industrial Informatics. 2023. Vol. 19, No. 4, pp. 4531-4542.
205.Zhai A., et al. Optical Flow and Scene Flow Estimation: A Survey // Pattern Recognition. 2021. Vol. 114. Art. 107861.
206.Zhao J., Wang H., Zhang L., Wang C. The Method of Flotation Froth Image Segmentation Based on Threshold Level Set // Advances in Molecular Imaging. 2015.Vol. 5, pp. 38-48.
207.Zhao H., Shi J., Qi X., Wang X., Jia J. Pyramid Scene Parsing Network // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 2017, pp. 2881-2890.
208.Zhang H., Fang H., Wang P., Xie S., Li Z., Liu W., Zhang T. DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection // International Conference on Learning Representations (ICLR). 2023.
209.Zhang L., Rao A., Agrawala M. Adding Conditional Control to Text-to-Image Diffusion Models // arXiv preprint arXiv:2302.05543. 2023. DOI: 10.48550/arXiv.2302.05543.
210.Zhang L., Xu D. Flotation bubble size distribution detection based on semantic segmentation // IFAC-PapersOnLine. 2020.Vol. 53, No 2, pp. 11842-11847.
211.Zhang G. Y. [h gp.]. Ore image thresholding using bi-neighbourhood Otsu's approach // Electronics Letters. 2010. No 25 (46), pp. 1666-1668.
212.Zhang X., Jing H., Yu M., et al. Large Ore Detection in Blasting Piles Using LODM // Scientific Reports. 2025. Vol. 15. Art. 34759.
213.Zhang Y., Cheng L., Peng Y., Xu C., Fu Y., Wu B., Sun G. Faster OreFSDet: A Lightweight and Effective Few-Shot Object Detector for Ore Images // Pattern Recognition. 2023. Vol. 141. Art. 109664.
214. Zhan Y., Zhang G. An Improved OTSU Algorithm Using Histogram Accumulation Moment for Ore Segmentation // Symmetry. 2019. (11), pp. 431.
215.Zhang Y., Sun P., Jiang Y., Yu D., Weng F., Yuan Z., Luo P., Liu W., Wang X. ByteTrack: Multi-Object Tracking by Associating Every Detection Box // arXiv preprint arXiv:2110.06864, 2022.
216.Zhou C., et al. YOLOv12: You Only Look Once, Version 12. arXiv preprint arXiv:2408.12584, 2024..
217. Zhou Z., Siddiquee M. M. R., Tajbakhsh N., Liang J. UNet++: A Nested U-Net Architecture for Medical Image Segmentation // In: Deep Learning in Medical Image Analysis and Multimodal Learning for Clinical Decision Support. Springer, 2018. pp. 3-11.
218. Zhu J.-Y., Park T., Isola P., Efros A. A. Unpaired image-to-image translation using cycle-consistent adversarial networks // Proceedings of the IEEE International Conference on Computer Vision (ICCV). 2017, pp. 2242-2251.
219.Zhu X., Su W., Lu L., Li B., Wang X., Dai J. Deformable DETR: Deformable Transformers for End-to-End Object Detection // International Conference on Learning Representations (ICLR). 2021.
220.Zuo S., Xiao Y., Chang X., Wang X. Vision transformers for dense prediction: A survey // Knowledge-Based Systems. 2022.Vol. 253. Art. 109552.
Приложение 1. Список иллюстраций
Рисунок 1. Примеры собранных данных..................................................25
Рисунок 2. Предобработка изображения..................................................27
Рисунок 3. Процесс маркерного водораздела на примере изображений
руды........................................................................................................................27
Рисунок 4. Пример полученной разметки................................................28
Рисунок 5. Разметка для детекции............................................................29
Рисунок 6. Схема получения масок сегментации с помощью SAM......30
Рисунок 7. Общая схема процесса создания «слабой» разметки...........30
Рисунок 8. Результат модели, обученной на разметке, полученной с
помощью метода «слабой» разметки..................................................................32
Рисунок 9. Сгенерированные с помощью текстовой подсказки маски . 35
Рисунок 1. Структура сети Mask-RCNN...................................................97
Рисунок 2. Архитектура сети U-net..........................................................98
Рисунок 3. Архитектура визуального трансформера...........................100
Рисунок 4. Общая схема подходов к генерации данных.......................114
Рисунок 5. Структура вариационного автокодировщика.....................118
Рисунок 6. Структура генеративно-состязательной сети......................119
Рисунок 7. Структура диффузионной модели.......................................122
Рисунок 8. Процесс предобработки изображения на примере
изображений руды..............................................................................................140
Рисунок 9. Процесс маркерного водораздела на примере изображений
руды......................................................................................................................141
Рисунок 10. Результаты разметки, полученной методом водораздела 142 Рисунок 11. Систематические ошибки разметки на примере домена пузырьков (а , б- несколько объектов объединены в один, в - контур объекта меньше реального, г - один объект разделен на несколько)..........................143
Рисунок 12. Общая схема процесса создания «слабой» разметки.......144
Рисунок 13. Разметка для детекции........................................................145
Рисунок 14. Схема получения масок сегментации с помощью SAM .. 146 Рисунок 15. Сравнение использования модели SAM с подсказками в виде
точек и без...........................................................................................................146
Рисунок 16. Созданная разметка для разных типов пены.....................148
Рисунок 17. Пример разметки для домена камней................................149
Рисунок 18. Результат сегментации с помощью лучшей модели Swin-
UNETR для домена флотационной пены.........................................................152
Рисунок 19. Сравнение предсказаний моделей на рудных изображениях
(а - исходное изображение, б - полученная маска сегментации)..................156
Рисунок 20. Сравнение маски текущего кадра (вверху слева), трансформированной маски предыдущего кадра (вверху справа), пересечения
масок (внизу слева) и объединения масок (внизу справа)..............................161
Рисунок 21. Визуализация объектной полноты.....................................163
Рисунок 22. Пример синтетически сгенерированных сцен и
соответствующей разметки сегментации.........................................................175
Рисунок 23. Пример сгенерированного изображения разметки на основе подсказки "Scattered irregular white bubbles on black background, high contrast,
no texture"............................................................................................................177
Рисунок 24. Пример генерации разметок камней по текстовой инструкции. На первом и втором изображении показаны неудовлетворительные результаты генерации, на третьем изображении
показан итоговый результат генерации............................................................177
Рисунок 25. Полученные маски с помощью генерации по текстовой
подсказке.............................................................................................................179
Рисунок 26. Пример входных данных.....................................................180
Рисунок 27. Подбор количества итераций диффузии...........................181
Рисунок 28. Подбор коэффициента структурного контроля................182
Рисунок 29. Полученный результат после генерации изображения по
маске. Нижний ряд показывает соответствие контурам.................................183
Рисунок 30. Тестирование метода создания маски на домене окатышей
руды......................................................................................................................191
Рисунок 31. Тестирование метода на гранулах удобрений..................192
Рисунок 32.Тестирование метода на домене пузырьков флотации.....193
Рисунок 33. Результат обучения только на изображениях (без
дополнительных слоев контуров) на доменах окатышей и пузырьков.........194
Рисунок 34. Результат доменной адаптации с помощью метода FDA 197 Рисунок 35. Пример работы модели после обучения на сгенерированных
данных.................................................................................................................200
Рисунок 36. Пример работы модели на наборе данных, полученном с
помощью переноса знаний................................................................................201
Рисунок 37. Результаты работы модели, полученные на наборе данных, созданном с помощью переноса знаний, с применённой доменной адаптацией
..............................................................................................................................202
Рисунок 38. Распределение объектов в дикой природе........................208
Рисунок 39. Архитектура библиотеки....................................................212
Рисунок 40. Результат применения контрастивных методов
самообучения......................................................................................................228
Рисунок 41. Пример восстановления изображения с помощью модели SparK (а, б - восстановление мелкой пены, в, г- восстановление крупной пены)
..............................................................................................................................229
Рисунок 42. Виды поризации...................................................................243
Рисунок 43. Диаграмма компонентов приложения для определения
статуса поризации...............................................................................................246
Рисунок 44. Пример изображения и соответствующей ему сегментации ..............................................................................................................................248
Рисунок 45. Интерфейс системы анализа поризации
250
Рисунок 46. Сравнение результатов сегментации моделей HRNet и
YOLOv11.............................................................................................................257
Рисунок 47. Пример съемки с камеры до и после калибровки.............260
Рисунок 48. Визуализация контуров камней на конвейере с размерами
.............................................................................................................................. 262
Рисунок 49. Диаграмма развертывания системы гранулометрического
анализа.................................................................................................................264
Рисунок 50. Диаграмма последовательностей работы системы
гранулометрического анализа...........................................................................267
Рисунок 51. Интерфейс системы гранулометрии..................................268
Приложение 2. Список таблиц
Таблица 1. Сравнение моделей сегментации на данных флотационной
пены......................................................................................................................153
Таблица 2. Сравнение моделей сегментации на рудных изображениях
..............................................................................................................................155
Таблица 3. Зависимость качества и требований к ресурсам от
архитектуры........................................................................................................159
Таблица 4. Сравнение методов оценки качества по параметрам.........164
Таблица 5. Оценка качества работы моделей на синтетических наборах
данных.................................................................................................................199
Таблица 6. Сравнительные метрики качества для различных моделей
..............................................................................................................................227
Таблица 7. Сравнение методов отслеживания однородных объектов 238 Таблица 8. Сравнение 1ои и объектной полноты моделей...................258
Приложение 3. Акты внедрения и использования результатов
работы
1. Акт о внедрении результатов диссертации в систему анализа статуса поризации на предприятии «Кнауф Гипс Кубань».
2. Акт о внедрении результатов диссертации в проект по созданию системы гранулометрии на горно-обогатительном предприятии.
3. Акт об использовании результатов диссертации в учебном процессе в Университете ИТМО.
1ЛТМО
МИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ
федеральное государственное автономное образовательное учреждение высшего образования «Национальный исследовательский университет ИТМО» (Университет ИТМО)
КронверкскиЯ пр-т, д. 49. лит А. Санкт-Петербург. Россия, 197101 Те.1 - (812)480-00.00 о<1д11то ги; !то г1.]
«¿(У Ск^с)/}^ (?С.О /¡С
АКТ
об использовании в учебном процессе результатов диссертационного исследования Румянцевой Марии Юрьевны на тему «Методы автоматической обработки изображений и видео однородных плотно сгруппированных объектов»
Настоящий акт подтверждает, что результаты научно-исследовательской работы, выполненной Румянцевой Марией Юрьевной в рамках диссертационного исследования на тему «Методы автоматической обработки изображений и видео однородных плотно сгруппированных объектов», используются в учебном процессе Университета ИТМО в рамках образовательной программы бакалавриата по специальности 01.03.02 «Прикладная математика и информатика».
Назрабоганная Румянцевой М.Ю. библиотека для работы с однородными промышленными данными (https://github.com/CTLab/CTCl), а также предложенные методы слабой и генеративной разметки однородных плотно сгруппированных данных применяются в качестве примеров анализа изображений и видео с промышленными данными при подготовке бакалавров. Использование реализованных методов позволяет решать практические задачи по аннотированию промышленных данных. Также Румянцева М.Ю. руководила проектом в учебно-научной лаборатории компьютерных технологий, где
были проведены вычислительные эксперименты по реализации методов слабой и генеративной разметки.
Указанные результаты включены в курсы «Машинное обучение» и «Методы искусственного интеллекта в 2024-2025 году, а также работу учебно-научной лаборатории «Компьютерные технологии» в 2023-2025 году.
Л
Станкевич Андрей Сергеевич,
к.т.н, декан факультета информационных
технологий и программирования.
18.09.2025
Подпись удостове| Менедже Дьячук Ю
»
?/9
Приложение 4. Свидетельства о регистрации программ для ЭВМ
1. Программа для ЭВМ «Библиотека для анализа однородных объектов», № 2024669273 от 15.08.2024, Ефимова В. А., Румянцева М. Ю., Прокопов Е. М., Усачева Д. М., Леманов А. А., Крюков А. Д.
2. Программа для ЭВМ «Программный комплекс детекции, сегментации и нахождения ключевых точек объектов на изображении» № 2024692026 от 25.12.2024, Муравьёв С.Б., Забашта А.С., Ефимова В.А., Румянцева М.Ю., Жарский И.А.
Приложение 5. Тексты публикаций
1. Rumiantceva M., Filchenkov A. Deep Learning and Pseudo-Labeling for Ore Granulometry // Procedia Computer Science. 2022. Vol. 212. P. 387-396.
2. Rumiantceva M., Kriukov A., Prokopov E., Efimova V. Self-supervised Learning to Improve Froth Images Segmentation // Proceedings of the Ninth International Congress on Information and Communication Technology. Springer, 2024. Vol. 1055, pp. 483-494.
3. Prokopov E., Usacheva D., Rumiantceva M., Efimova V. Weak Segmentation and Unsupervised Evaluation: Application to Froth Flotation Images // Proceedings of the 20th Int. Joint Conf. on Computer Vision, Imaging and Computer Graphics Theory and Applications (VISAPP). 2025. Vol. 3, pp. 500-507.
Available online at www.sciencedirect.com
ScienceDirect
Procedía
Computer Science
ELSEVIER
Procedía Computer Science 212 (2022) 387-3%
www.elsevier.com/locate/procedia
11th International Young Scientist Conference on Computational Science
Deep Learning and Pseudo-Labeling for Ore Granulometry
Mariia Rumiantceva', Andrey Filchenkov
1TMO University. Kmmerksky Pr. 49. btdg. A, Si. Petersburg, 197101, Russia
Abstract
Determining the fractional composition of ore using artificial intelligence is an urgent task in recent decades. Classical methods do not achieve decent quality and deep learning methods require huge labeled datasets. We propose an algorithm for automating the masking of ore stones boundaries on a conveyor using classical computer vision methods. Also, we propose a method for tracking the ore particle size distribution on the conveyor based on the U-Net neural network that was trained on the dataset utilizing pseudolabels obtained with the algorithm. We compared several deep learning models for segmentation. Experiments on our dataset have shown that it is possible to segment ore with an accuracy of up to 70%. Also, we identified typical problems of granulometric analysis approaches on two-dimensional images and discussed ways for further possible development.
© 2022 The Authors. Published by Elsevier B.V.
This is an open access article under the CC BY-NC-ND license (https://creativec0mm0ns.0rg/licenses/by-nc-nd/4.0) Peer-review under responsibility of the scientific committee of the 11th International Young Scientist Conference on Computational Science.
Keywords: granulometry; granulomere analysis; deep learning; artificial intelligence in industry; ore segmentation
1. Introduction
Granulometry is a set of methods for determining the particle size distribution of ore rocks, soils, and artificial materials. Particle size distribution is the relative content of particles of different sizes in the material. It is an important physical indicator of ore quality because determines rock properties such as porosity, permeability, specific surface area, and capillary properties. The composition of the raw material affects further crushing and grinding, as well as the variability of use.
In the mining industry, significant efforts are being made to measure or evaluate particle size distributions to evaluate and optimize production in terms of productivity and production costs (energy, material, and equipment costs). Mine and quarry operators want to measure the particle sizing results, but screening/sorting is an imperfect evaluation tool due to slow feedback and inconsistent measurements caused by operator fatigue or changes in technique. As a result, it is possible to create online non-contact, fully automated machine vision systems for particle size measurement, which facilitates the evaluation and optimization of particle mining and processing processes.
• Corresponding author. Tel.; +7-906-228-7804; E-mail address: marrum@niuitmo.ru
1877-0509 © 2022 The Authors. Published by Elsevier B.V.
This is an open access article under the CC BY-NC-ND license (https://creativecommons.Org/licenses/by-nc-nd/4.0)
Peer-review under responsibility of the scientific committee of the 11th International Young Scientist Conference on Computational Science.
10.1016/j.procs.2022.11.023
One of the tasks of granulomere analysis is to determine the operating mode of a rod mill for crushing ore. Crushing is the proccss of ore or any other material destruction to obtain the material of the required particlc size distribution with a piece larger than 5 mm [4]. Crushing is based on the action of external lorccs, mcchanical crushing is most often used. According to the size of the resulting product, coarse (100-350 mm), medium (40-100 mm), and fine crushing (5-40 mm) arc distinguished. An illustration of crushing is presented in Fig. 1.
Modern computer vision is mostly deep learning-based. Providing an extremely powerful framework for transferring huge labeled collections of images to trained predicting algorithms, it is in essence data-hungry. Using assessors lor data labeling is costly and tricky, this is why a lot of effort was done to reduce dependency on labeling or provide methods for generating pseudo-labeled data, such as, for instance, deep generative models [20]. However, all of them but self-supervised learning cannot be used when no labels arc provided. Self-supervised learning requires huge unlabeled datasets |6], This makes it inapplicable in situations when only a relatively small dataset is provided with no labels. In such situation, classical shallow methods arc applied.
In this paper, we utilize a hybrid approach for determining the fractional composition of the ore given video. We propose a method to obtain pseudo-segmentation labels and use these labels to train deep learning models to segment image and reveal ore stones in order to evaluate their sizes.
The contributions of this paper arc the following:
• A novel algorithm for automated pseudo-labcling of ore images.
• A deep-learning based algorithm for determining the size of ore stones after the crushing proccss.
• Analysis of the general problems of ore segmentation and ways on their possible solutions.
2. Related Work
The standard for evaluating particlc distribution is sieve analysis applied to ore sampling from a container (about lm3). Mcchanical screening is used to separate particles into sieve fractions with analysis based on the principle that particlc sizes can be estimated using sieve frames of different sizes. This method eliminates the need for additional dcvices. Ore is collcctcd several times a day. The accuracy of this method is quite low since it works on the assumption that the stones are evenly distributed throughout the container, and in any portion of the stones the distribution will be the same, which will most likely lead to low efliciency of the mill. This approach is still in use in enterprises [11].
The problem of automating particle size distribution has been around for a long time and attempts to solve it using computer vision and image analysis were made as early as the 1980s [10]. Interest in the automation of mill control in production is still high, as evidenced by the availability of research in recent years. The development of machine learning methods allows us to bring the quality of analysis to a new level.
Studies use both 2D and 3D images as a base. Most of the research is devoted to 2D imaging, which is probably due to the technological availability of installing conventional cameras in production and the complexity of installing devices that allow obtaining a 3D image, such as a laser scanner or a 3D camera. Unfortunately, research data generally do not contain numerical data on the accuracy of the estimate, so one can only focus on visual data [3, 14, 13, 8].
Fig. 1. Crushing process
Most often, researchers use classical computer vision methods as methods of image analysis based on mathematical image transformations [15, 1, 12]. Many approaches use region growing techniques (such as watershed) to segment the ore [23, 19].
Existing deep learning-based ore segmentation methods mainly use convolutional neural networks. A popular approach is to use the U-Net network [17]. Sun et al. [18] implemented Feature Pyramid network.
The first step in all studies is image pre-processing, the purpose of which is high-quality image binarization to delineate stones and the space between stones. Existing solutions are proprietary, there are no open solutions.
3. Algorithm for automated image labeling
The algorithm we present uses video from the conveyor camera as input data. The camera is installed above the conveyor and captures a small area. Video duration is 5 minutes, fps is 30 frames per second.
The image contains a ribbon with stones on it and small areas of the environment. The video quality is good enough to visually clearly distinguish the borders of the stones. An example of such video is presented in Fig. 2.
Fig. 2. Ore conveyor belt
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.