Разработка методического, математического, программного, технического и приборного обеспечения системы компьютерного зрения для считывания маркировки и обнаружения поверхностных дефектов металлопроката тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Мортин Константин Владимирович
- Специальность ВАК РФ00.00.00
- Количество страниц 207
Оглавление диссертации кандидат наук Мортин Константин Владимирович
ОГЛАВЛЕНИЕ
ВВЕДЕНИЕ
Глава 1. АНАЛИЗ СОВРЕМЕННЫХ МЕТОДОВ И МОДЕЛЕЙ ОПРЕДЕЛЕНИЯ ДЕФЕКТОВ ИЗДЕЛИЙ МЕТАЛЛУРГИЧЕСКОГО ПРОИЗВОДСТВА
1.1. Основные подходы и методы обучения нейронных сетей с частичной разметкой дефектов изделий металлургического производства
1.2. Методы полуавтоматической разметки изображений дефектов изделий металлопроката
1.3. Алгоритмы активного обучения моделей нейронных сетей определения детектирования, классификации, маркировки изделий металлопроката
1.4. Проблемы применения систем компьютерного зрения в задачах обнаружения дефектов изделий металлургического производства
Выводы по Главе
ГЛАВА 2. РАЗРАБОТКА АЛГОРИТМОВ И МОДЕЛЕЙ ТРАНСФЕРНОГО ОБУЧЕНИЯ СИСТЕМЫ КОМПЬЮТЕРНОГО ЗРЕНИЯ ДЛЯ ЗАДАЧ ПРОМЫШЛЕННОЙ ДЕФЕКТОСКОПИИ
2.1 Разработка и модификация архитектур нейросетей, способных эффективно работать с малым набором аннотированных изображений
2.2 Разработка и оптимизация алгоритмов и методов с целью повышения качества трансферных моделей в дефектоскопии
2.3 Методика адаптации активных методов и алгоритмов обучения моделей
на ограниченном наборе дефектоскопических изображений
2.4 Особенности разработанных алгоритмов с оценкой трансферного подхода и методов активного обучения в комплексе системы компьютерного зрения для определения дефектов изделий металлургического производства
Выводы по Главе
ГЛАВА 3. ПРИМЕНЕНИЕ АЛГОРИТМОВ АКТИВНОГО МЕТОДА ОБУЧЕНИЯ В РАЗРАБОТАННОМ ПРОГРАММНО-АППАРАТНОМ КОМПЛЕКСЕ
3.1 Тестирование разработанных алгоритмов и моделей нейросетей активными методами обучения
3.2 Тестирование и сравнение моделей с выбором параметров оценок достоверности и качества полученных результатов
3.3 Оптимизация моделей и алгоритмов под специфику металлургического производства, включая анализ изображений с интеграцией разработанных решений
в систему компьютерного зрения
Выводы по Главе
Глава 4. РАЗРАБОТКА АППАРАТНОЙ ЧАСТИ СИСТЕМЫ КОМПЬЮТЕРНОГО ЗРЕНИЯ ДЛЯ МЕТАЛЛУРГИЧЕСКОГО ПРОИЗВОДСТВА
4.1 Методика оценки эффективности моделей, алгоритмов и показателей качества
4.2 Сравнение разработанных моделей с традиционными решениями
4.3 Практическая значимость и возможности применения разработанных моделей и алгоритмов на практике металлургического производства
4.4 Перспективы дальнейших исследований 160 Выводы по Главе 4 164 ЗАКЛЮЧЕНИЕ 167 СПИСОК ЛИТЕРАТУРЫ 169 ПРИЛОЖЕНИЕ 1 Акт о внедрении 188 ПРИЛОЖЕНИЕ 2 Свидетельства о государственной регистрации 191 ПРИЛОЖЕНИЕ 3 Акт об использовании 192 ПРИЛОЖЕНИЕ 4 Исходный код предобученной и дообученной моделей
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Методы и алгоритмы распознавания и классификации поверхностных дефектов листового проката на основе машинного обучения2023 год, кандидат наук Евстафьев Олег Александрович
Оптико-электронная система контроля качества листового металлопроката со средствами интеллектуальной поддержки решений по устранению дефектов2026 год, кандидат наук Климачев Сергей Александрович
Разработка метода контроля качества швейных изделий машинным зрением2024 год, кандидат наук Рогожина Юлия Владимировна
Развитие методов и средств вихретокового и магнитного контроля металлопроката для оценки его остаточного ресурса2014 год, кандидат наук Шубочкин, Андрей Евгеньевич
Модель, метод, алгоритм и вычислительный модуль обработки изображений символьной маркировки2024 год, кандидат наук Хомяков Олег Олегович
Введение диссертации (часть автореферата) на тему «Разработка методического, математического, программного, технического и приборного обеспечения системы компьютерного зрения для считывания маркировки и обнаружения поверхностных дефектов металлопроката»
ВВЕДЕНИЕ
Металлургическая промышленность играет стратегическую роль в обеспечении устойчивого развития экономики, поставляя сырьё для ключевых отраслей - строительства, машиностроения, энергетики и транспорта. Однако выпуск качественного металлопроката сталкивается с серьёзными вызовами, связанными с трудностями контроля поверхностных дефектов (трещины, коррозия, вмятины) и требованиями к точности распознавания маркировки (штрих-коды, текст). При использовании для этих целей технических средств на основе компьютерного зрения одним из решающих факторов в условиях металлургических цехов становится соотношение сигнал/шум, которое существенно ухудшается из-за специфических условий:
1. Экстремальное освещение. Блики от металлических поверхностей, резкие перепады освещённости создают ложные контуры, маскируют дефекты и искажают маркировку.
2. Загрязнения и вибрации. Металлическая пыль, конденсат на изделии металлопроката, а также вибрации технологического оборудования вызывают артефакты на изображениях, размытие и потери деталей.
3.Высокая динамика производства и тяжелые температурные условия. Скорость конвейера до 2 м/с и температурные колебания (до 100°С) усложняют захват изображений и стабильную работу оптики.
Эти особенности делают традиционные методы контроля с использованием простых автоматизированных систем недостаточными. Такие системы, основанные на упрощённых алгоритмах (например, пороговой сегментации), не справляются с динамикой условий реального производства и часто дают ложные срабатывания (до 30% ошибок) или пропускают дефекты. Это повышает риск выпуска некачественной продукции и связанных с этим финансовых потерь.
Для решения указанных проблем в диссертации предлагается комплексный подход, сочетающий адаптивные алгоритмы фильтрации, гибридные методы анализа данных и современную аппаратуру (высокоскоростные камеры,
стробируемые источники освещения, защищенные шаговые двигатели, микроконтроллеры).
Актуальность исследования обусловлена необходимостью создания устойчивой системы компьютерного зрения (СКЗ), способной работать в условиях низкого соотношения сигнал/шум и сильных промышленных помех.
Степень разработанности темы исследований
Значительный вклад в развитие технологий компьютерного зрения внесли российские и зарубежные исследователи: В.С. Лемпицкий, Д.П. Ветров, А.А. Савченко, С.И. Николенко, М.С. Бурцев, T. Lillicrap, I. Goodfellow, A. Efros, предложившие новые методы и подходы, которые находят применение в самых разных областях - от медицины до робототехники и автономного транспорта. Они изучали различные аспекты, начиная от оптимизации алгоритмов обучения с подкреплением до разработки генеративных моделей, способных создавать реалистичные изображения на основе ограниченного числа примеров. Исследователи: Y. LeCun, Gю Hinton, Aю Efros, A. Ng внесли значительный вклад в развитие методов слабо контролируемого и полуавтономного обучения нейронных сетей, а их работы продолжают оказывать влияние на современные достижения в области компьютерного зрения и машинного обучения. Проблемой трансферных методов активного обучения нейронных сетей занимались Y. Bengio, I. Goodfellow, P. Stone, D. Hauffner, М.А. Осипов, И.Б. Жигалов, А. Л. Дудин, Ю. Н. Загайнов, В. А. Горбатов, А.А. Агеев. Сформированные в работах вышеупомянутых авторов модели, алгоритмы, методы, математические описания слабо контролируемого обучения, трансферные методы, позволили определить существующие подходы к решению проблемы использования СКЗ для обнаружения дефектов изделий металлургического производства.
Объект исследования - методы и средства контроля качества изделий металлургического производства.
Предмет исследования - система компьютерного зрения для считывания маркировки и обнаружения поверхностных дефектов металлопроката.
Целью диссертационной работы является разработка системы компьютерного зрения для считывания маркировки и обнаружения поверхностных дефектов металлопроката на основе новых методических, математических, программных и технических решений.
Для достижения цели были поставлены и решены следующие задачи:
1. Разработка требований к системам компьютерного зрения и путей их модернизации применительно к задачам обнаружения дефектов металлопроката и распознавания маркировки на металлургическом производстве.
2. Разработка и реализация гибридных алгоритмов компьютерного зрения с адаптивным интеллектуальным анализом поверхностных дефектов и распознаванием маркировки для повышения надежности и эффективности контроля качества металлопроката в условиях промышленных помех.
3. Разработка программно-аппаратного комплекса, обеспечивающего устойчивую работу систем компьютерного зрения и методов автоматического измерения геометрических параметров дефектов и координат маркировки (клейм) для повышения точности, скорости и достоверности контроля качества металлопроката в условиях высокой динамики работы производства и промышленных помех.
Методология и методы исследования
Методология основывается на комплексной разработке математических моделей, программных алгоритмов и технических решений для систем компьютерного зрения, обеспечивающих как автоматическое считывание маркировки, так и выявление поверхностных дефектов металлопроката. Методы базируются на теории глубоких нейронных сетей, аппарате машинного обучения, теории множеств и теории оптимизации.
Соответствие паспорту научной специальности
Диссертация соответствует паспорту научной специальности 2.2.8 - Методы и приборы контроля и диагностики материалов, изделий, веществ и природной среды, в частности, пунктам 3, 4, 6, 7, 8.
Научная новизна заключается в следующем:
1. Предложена новая структура программно-аппаратного комплекса системы компьютерного зрения с повышенной надежностью, позволяющая уменьшить число пропущенных дефектов и неверных распознаваний маркировочных отметок за счет использования автоматических методов интеллектуального анализа изображений, гибридных алгоритмов компьютерного зрения на основе нейронных сетей, методов повышения контрастности и чёткости считываемого изображения анализируемого участка двигающейся ленты металлопроката, а также за счет динамического выбора метода схемы анализа в зависимости от условий-работы камеры.
2. Разработаны компьютерные методы, математическое и программное обеспечение, позволяющие повысить надежность считывания маркировки и обнаружения поверхностных дефектов металлопроката, устраняющие основной недостаток известных технических решений СКЗ - зависимость качества распознавания от скорости конвейера.
Теоретическая значимость работы заключается в разработке:
1.Адаптивной методики активного обучения, основанной на селекции наиболее информативных образцов с учетом неопределенности модели.
2. Теоретических основ для интеграции математического аппарата сверточных сетей, трансформеров и механизмов внимания в единую многозадачную модель. Впервые доказана эффективность совместной оптимизации при решении задач распознавания маркировки и дефектов через общие признаковые пространства, что повысило точность распознавания на 18% по сравнению с раздельными моделями.
3.Принципов адаптивных систем компьютерного зрения, основанных на многомерном анализе признаков (освещенность, геометрия объекта) и обратной связи к блоку обработки. Это создает предпосылку для построения самонастраивающихся систем, в которых устраняется зависимость от статичных алгоритмов.
4. На основе синтеза аппаратных и программных компонентов системы промышленного компьютерного зрения разработаны принципы синхронизации
камеры и освещения, что обеспечивает стабильное качество изображений при движении объектов со скоростью до 2 м/с.
Практическая значимость диссертационного исследования
1. Применение методики активного обучения и гибридных алгоритмов в комплексной математической модели системы компьютерного зрения позволило повысить эффективность распознавания символов маркировки и обнаружения поверхностных дефектов изделий металлургического производства (доверительная вероятность 98% для маркировки и 96% для дефектов).
2. Использование в математической модели методов интеллектуального анализа данных обеспечивает сокращение времени адаптации при внедрении системы компьютерного зрения в производство, повышение надежности и устойчивости к внешним факторам за счет динамической настройки параметров алгоритмов.
3. Разработанное программное обеспечение позволяет синхронизировать работу камеры и освещения, за счет чего повышается точность определения координат дефекта, позиций маркировки при движении изделия металлопроката.
Результаты диссертационной работы внедрены в:
- автоматизированную систему контроля обнаружения дефектов и маркировки на АО «Выксунский металлургический завод», г. Выкса;
- автоматизированную систему компьютерного зрения на участке производства, металлургических изделий в ООО «КАЯК МОТОРС», г. Ярославль;
- учебный процесс Московского института электроники и математики Национального исследовательского университета «Высшая школа экономики», г. Москва.
Акты внедрения прилагаются к диссертации.
Степень достоверности и апробация результатов
Достоверность результатов диссертационного исследования подтверждается опытом успешной эксплуатации разработанной СКЗ в условиях промышленного производства, что отмечается в актах внедрения. Научные утверждения, выводы и практические рекомендации опираются на статистическом анализе большого
объема данных, их интерпретации с использованием современных методов обработки и анализа цифровых изображений.
Результаты работы были представлены на 20-й Всероссийской конференции с международным участием «Математические методы распознавания образов» (ММРО-2021), г. Москва; XXV Международной конференции по мягким вычислениям и измерениям ^СМ'2022), г. Санкт-Петербург; VIII Международной конференции «Информационные технологии и нанотехнологии» (1ТЫТ 2022), г. Cамара; Балтийском форуме: нейронаука, искусственный интеллект и сложные системы на четвертой международной конференции «Нейротехнологии и нейроинтерфейсы» (СКЫ 2022), г.Санкт-Петербург; VI Научной школе «Динамика сложных сетей и их приложение» ^СКА 2022), г. Калининград; XXX Международной научной конференции студентов, аспирантов и молодых ученых «Ломоносов», г. Саров, 2023; IX Международной научно-технической конференции «Информационные технологии в науке, образовании и производстве» (ИТНОП-2023), г. Белгород, 2023; Межвузовской научно-практической конференции «Современные информационно-коммуникационные технологии в правоохранительной деятельности», г. Нижний Новгород, 2024.
Основные положения, выносимые на защиту:
1. Пути и методы совершенствования системы компьютерного зрения для считывания маркировки и обнаружения поверхностных дефектов металлопроката.
2. Комплексная математическая модель системы компьютерного зрения для совместного решения задач распознавания маркировки и идентификации дефектов проката с повышением точности контроля на 12-15% по сравнению с традиционными подходами.
3. Гибридные алгоритмы, способствующие оперативности и надежности работы системы компьютерного зрения в режиме реального времени при скорости движения изделий проката до 2 м/с (доверительная вероятность распознавания маркировки не менее 98% и дефектов 96%).
4. Программно-аппаратный комплекс, обеспечивающий надежную и устойчивую работу системы компьютерного зрения в условиях помех на производстве.
Статистическая информационная база исследования
Статистическая информационная база исследования включает в себя разнообразные источники данных, методы их сбора и подготовки, а также аналитические инструменты и программное обеспечение. Эта база необходима для всестороннего анализа данных, построения и тестирования моделей машинного обучения, а также для принятия обоснованных решений по результатам исследования.
Программные инструменты, используемые в диссертации: фреймворки глубокого обучения Pytorch, TensorFlow; инструменты для работы с данными C.V.A.T, Label Studio; библиотеки компьютерного зрения OpenCv, Pillow; методы активного обучения, слабого обучения; архитектуры моделей Mask R-CNN, YOLO, ResNet; технологии обучения Data Augmentation, Transfer Learning, Few-Shot Learning; оценки качества моделей IOU (Intersection over Union), mAP (mean Average Precision), Precision/Recall/F1 Score; среды программирования Visual Studio Code, Jupyter Notebook; язык Python.
Публикации
По результатам диссертации опубликованы 15 работ, в том числе 5 статей в рецензируемых научных изданиях, рекомендованных ВАК для публикации материалов диссертации по специальности 2.2.8, 4 статьи в журналах, индексируемых в международной базе данных Scopus, 6 статей в других изданиях, получены 5 Свидетельств о государственной регистрации программ для ЭВМ.
Структура и объем работы
Диссертационная работа состоит из введения, четырех глав, заключения и четырех приложений, изложена на 207 страницах, содержит 88 рисунков, 24 таблицы. Список литературы включает 155 наименований.
Основное содержание диссертации
Во введении рассматривается и обосновывается актуальность исследования, которая обусловлена растущей потребностью в автоматизации процессов контроля качества продукции на промышленных предприятиях, определены объект и предмет исследования, сформулированы цель и задачи диссертационной работы, ее научная новизна и практическая значимость, представлены положения, выносимые на защиту, приведены сведения о внедрении работы в производство и о публикациях.
В первой главе «Анализ современных методов и моделей определения дефектов изделий металлургического производства» рассмотрено современное состояние вопроса об использовании СКЗ для обнаружения дефектов металлопроката в заводских условиях, полуавтоматические методы разметки, которые позволяют существенно сократить затраты времени и ресурсов на подготовку обучающих наборов данных, интерактивные инструменты и подходы к обучению моделей нейронных сетей на ограниченных наборах данных. Обсуждаются результаты применения активных методов обучения нейронных сетей для целей детектирования дефектов и распознавания маркировки изделий металлопроката, а также предсказания ожидаемой точности методами прогнозирования с применением глубоких нейронных сетей. Сформулированы требования к разрабатываемой СКЗ и задачи исследований.
Во второй главе «Разработка алгоритмов и моделей трансферного обучения системы компьютерного зрения для задач промышленной дефектоскопии» предложена комплексная математическая модель СКЗ для обнаружения дефектов и распознавания маркировки изделий металлургического производства. Представлена архитектура трансферного обучения модели для предобучения ResNet50 с адаптацией и заморозкой слоев, с последующей передачей гиперпараметров на модель YOLOv10 (детекцию, сегментацию, классификацию). Созданы гибридные алгоритмы механизмов автоматического переключения режимов работы для обучения новой архитектуры глубокой нейронной сети, работающей с малым количеством аннотированных данных.
Разработана методика интеллектуального анализа данных для повышения надежности активного обучения комбинированной архитектуры сверточной нейронной сети. Проведена адаптация современных технологий глубокого обучения для решения задач промышленной дефектоскопии.
Третья глава «Применение алгоритмов активного метода обучения в разработанном программно-аппаратном комплексе» посвящена разработке программно-аппаратного комплекса, обеспечивающего устойчивость и надежность работы СКЗ и разработанных алгоритмов для детекции краев области интереса, поиска засвеченных изображений, их обработке в соответствии с моделями (ResNet50, YOLOv10) в условиях высоких производственных помех и динамики производства в реальном времени. Представлены результаты экспериментов с разработанными методами и алгоритмами, оцениваются их способность к эффективному обнаружению дефектов и распознаванию маркировки. Результаты сравниваются с параметрами дефектов из атласа типовых дефектов и проводится статистический анализ числа ложных срабатываний.
В четвертой главе «Разработка аппаратной части системы компьютерного зрения для металлургического производства» описан состав приборной части СКЗ и процесс ее функционирования. Показано, что автоматизация этого процесса позволяет снизить трудоемкость проверки качества металлопроката, увеличить оперативность получения результатов этой проверки. Приведены примеры, демонстрирующие повышение точности и надежности выявления дефектов и точности распознавания маркировки изделий с помощью разработанной СКЗ.
Рассмотрены перспективы дальнейшего совершенствования разработанных методик, алгоритмов и методов обучения моделей с ограниченной аннотацией наборов данных для системы компьютерного зрения на металлургическом производстве.
Глава 1. АНАЛИЗ СОВРЕМЕННЫХ МЕТОДОВ И МОДЕЛЕЙ ОПРЕДЕЛЕНИЯ ДЕФЕКТОВ ИЗДЕЛИЙ МЕТАЛЛУРГИЧЕСКОГО ПРОИЗВОДСТВА
1.1. Основные подходы и методы обучения нейронных сетей с частичной разметкой дефектов изделий металлургического производства
Поверхностные дефекты стальных полос приводят к ухудшению их качества, а классификация этих видов повреждений позволяет быстро выявлять и устранять причины их возникновения [1-3], поэтому оперативность и точность классификации дефектов является залогом контроля качества металлопродукции [4-7].
В последнее время создано много оптико-цифровых систем, позволяющих проводить дефектоскопию поверхности проката на достаточно высоком уровне. Однако известно значительное количество близких по форме дефектов, точное распознавание которых требует дополнительных исследований [8-10]. Кроме того, существующие системы, как правило, чувствительны к освещению полосы проката, поэтому в процессе должна быть обеспечена равномерность светового потока. Требования к контролю и основные признаки различных групп дефектов, таких как плена, трещины, заусенцы и т. д., описаны в соответствующих стандартах [11-13]. Максимальное количество дефектов можно учесть при использовании нейронных сетей, обученных на основе большого количества правильно маркированных изображений дефектов или примеров неповрежденной поверхности.
Для таких задач необходимо построить ряд моделей классификации на основе глубоких остаточных нейронных сетей. Их качественные метрики изучаются на плоских изображениях поверхности проката. Помимо использования изображений дефектов в качестве выявляемых дефектоскопических повреждений, они воспринимаются как исходная информация для классификации дефектов стальной полосы [17-20]. Использование нейронных сетей требует решения ряда
задач, таких как формирование и подготовка обучающей и контрольной выборок, выбор архитектуры нейронной сети, оптимизация рабочих параметров ее компонентов, верификация полученных результатов.
С быстрым развитием машинного зрения и глубокого обучения модели обнаружения объектов на основе сверточных нейронных сетей играют жизненно важную роль в обнаружении дефектов поверхности полосовой стали. Модели обнаружения дефектов на основе глубокого обучения в первую очередь делятся на две категории: одноступенчатые модели обнаружения, представленные SSD (Single Shot Neural Networks) [21] и YOLO (You Only Look Once) [21-26], вторая категория включает алгоритмы R-CNN (Region-Based Convolutional Neural Network) [27] и Faster R-CNN (Faster Region Convolutional Neural Networks) [27], которые являются репрезентативными для двухступенчатых моделей обнаружения. Двухступенчатые алгоритмы обнаружения объектов хорошо справляются с задачами обнаружения дефектов благодаря своей высокой скорости обнаружения и эффективности.
В 2012 году Джонатан [28] представил метод классификации дефектов стали, основанный на сверточной нейронной сети максимального объединения. Используя эту технику, контролируемое извлечение признаков выполняется прямо из пиксельного описания изображений дефектов стали. В 2014 году Соукуп и др. [29] предложили метод обнаружения дефектов поверхности стали с использованием фотометрических стереоскопических изображений и сверточных нейронных сетей (CNN).
Обнаружение объектов является ключевой областью в компьютерном зрении, посвященной идентификации объектов на изображениях, а также установлению их точного местоположения и соответствующих категорий. Первоначальные алгоритмы обнаружения объектов в основном опирались на созданные вручную признаки и классические методы машинного обучения, включая бустинг и опорные векторные машины (SVM) и другие. В 2014 году Чу и др. [30] представили метод, использующий улучшенные двойные опорные векторные машины для категоризации дефектов поверхности полосы. Этот подход использовал информацию о плотности для руководства обрезкой обширных
обучающих наборов данных, добавлял образцы без меток в разреженные обучающие наборы данных и совершенствовал двойную опорную векторную машину (TWSVM).
В 2016 году Аму и др. [31] применили алгоритм Region-CNN (R-CNN) для выявления дефектов в колесах железнодорожных грузовых вагонов. Этот алгоритм использует технологию выборочного поиска для обнаружения артефактов, сегментируя изображение (рентген) на области и впоследствии подвергая эти области обработке признаков CNN. Этот подход помогает выявлять различные типы дефектов колес, а также определять конкретные местоположения дефектов. В 2018 году Ли и др. [32] представили метод обнаружения дефектов поверхности полосы в реальном времени с использованием усовершенствованной сети обнаружения YOLO. Они сделали YOLO полностью сверточной. Эта улучшенная сеть предоставляет комплексное решение для проверки дефектов поверхности полосы. В 2020 году Вэй и др. [33] предложили улучшенную сеть Faster R-CNN для обнаружения дефектов поверхности стали. Чтобы снизить риск пропуска множества мелких дефектов, они использовали взвешенный пул областей интереса (RoI) вместо обычного, что дало значительное повышение производительности. Кроме того, они включили деформированную свертку для захвата большего количества спорадических дефектов и уменьшения количества ложноположительных ящиков за счет строгой реализации подавления немаксимума (NMS). В 2021 году Тан и др. [34] предложили метод распознавания дефектов, использующий многомасштабное максимальное объединение (MSMP) и принцип внимания. В качестве основы они построили двухэтапную сеть обнаружения с использованием предварительно обученной сети ResNet50 и ввели принцип внимания вместе с модулем MSMP. На каждом этапе ResNet50 принцип внимания улучшает извлеченные карты признаков, позволяя модели концентрироваться на областях, имеющих отношение к окончательным результатам обнаружения, игнорируя неэффективные или даже вредные фоновые области. Метод MSMP постепенно расширяет рецептивное поле, различая наиболее важные контекстные признаки, тем самым существенно повышая
точность обнаружения. Пэн и др. [35] использовали методы глубокого обучения в сочетании с моделью YOLOv4, чтобы предложить улучшенную версию для обнаружения поверхностных дефектов в автомобильной стали. Они использовали кластеризацию K-средних для создания опорных фреймов и ввели в сеть модуль внимания Squeeze-and-Excitation (SE) для увеличения способности извлечения признаков для небольших целей. Сеть MSFT-YOLO была представлена и разработан в 2022 году Го и др. [36] для промышленных сценариев, характеризующихся значительными помехами на фоне изображения и огромными вариациями в размерах дефектов. Чен и др. [37] предложили быструю сеть обнаружения поверхностных дефектов в полосовой стали на основе деформируемой свертки и механизма внимания (DCAM Net). Луо и др. [38] разработали скрытую сеть обнаружения дефектов (CDDNet). Они разработали легкое рекуррентное развязанное полностью связанное внимание (RDFCA) с расчетом эффективности затрат и новой адаптивной масштабно-уравновешивающей пирамидальной сверткой (ASEPC), которая использует межуровневую корреляцию признаков для достижения кросс-масштабного слияния признаков. Ли и др. [39] предложили многолучевую сеть агрегации признаков на основе YOLOv5, которая может значительно улучшить производительность обнаружения дефектов стали. Её точность была улучшена в определенной степени, но скорость обнаружения дефектов очень низкая.
Обнаружение дефектов — это специализированная ветвь задач компьютерного зрения. Это процесс, посредством которого компьютер определяет наличие и местоположение дефектов на изображениях и аннотирует их с помощью меток категорий дефектов, оценок уверенности и ограничивающих рамок, описывающих положение дефекта. В настоящее время алгоритмы обнаружения дефектов, основанные на сверточных нейронных сетях глубокого обучения, сталкиваются с рядом трудностей и проблем: нехватка образцов в наборах данных о дефектах поверхности стальных полос, неравномерное распределение образцов, чрезмерно упрощенные задачи классификации и неточность в аннотациях положения дефектов [40-41]. Некоторая информация о дефектах в изображениях
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Тепловой метод неразрушающего контроля и диагностики технического состояния материалов, изделий и конструкций2001 год, доктор технических наук Будадин, Олег Николаевич
Разработка метода оценки технического состояния стальных канатов технологических машин на основе компьютерного зрения2024 год, кандидат наук Юсупов Александр Рашидович
Алгоритмы компьютерного зрения для оценки состояния подводных сетчатых ограждений2022 год, кандидат наук Смагин Алексей Сергеевич
Система поддержки принятия врачебных решений на основе анализа эндоскопических видеоизображений с применением методов искусственного интеллекта2025 год, доктор наук Хрящев Владимир Вячеславович
Метод и средства оптоэлектронного контроля качества поверхности листового металлопроката2005 год, кандидат технических наук Ульянов, Андрей Николаевич
Список литературы диссертационного исследования кандидат наук Мортин Константин Владимирович, 2025 год
использована для
решения различных
задач, что делает её
более гибкой и удобной
в эксплуатации.
Слабое обучение — это метод машинного обучения, при котором данные размечены лишь частично или с низким уровнем детализации. Вместо точных
меток для каждого элемента данных предоставляются общие метки для всего набора данных или группы элементов. В таком случае необходимо разработать стратегию, позволяющую извлечь максимум полезной информации из этих неполных меток.
Рассмотрим набор изображений X = [х1,х2,... ,хп], каждое из которых принадлежит к одному из К классов. Однако вместо точных меток для каждого изображения даны только метки для групп изображений. Если изображение х^ принадлежит группе С], то известно, что хотя бы одно изображение в группе С] относится к классу ск.
Цель такого обучения — научиться предсказывать классы отдельных изображений на основе этих слабых меток. Это особенно актуально в случаях, когда полная разметка данных является дорогостоящей или трудоемкой, как, например, в определении дефектов в металлургии. В этой области методы слабого обучения могут оказаться полезными для автоматизации процесса контроля качества и снижения затрат на подготовку данных.
Пусть У1 Е [1,2,.., К] обозначает истинный класс изображения х^, а г^^ Е {0,1} указывает, принадлежит это изображение х^ группе С] или нет. Слабые метки представляются в виде матрицы 2 = [^¿,у],
где М — количество групп.
Пусть ду Е [1,2, ...,К] обозначает класс, которому соответствует группа С], если = 1 , то изображение х^ принадлежит классу ду с некоторой вероятностью. Пусть р^у^с) — условная вероятность того, что изображение х^ принадлежит классу с, зная, что оно принадлежит к С].
Общая вероятность того, что изображение х^ принадлежит классу с:
р(У1 = с\х,г)=±. ^ =
где ду — множество групп, к которым принадлежит изображение х^.
Функция потерь (кросс—энтропия) учитывает эти вероятности:
N К
£(в) = =с]1 °др(у1 = с\х>2'>в)>
1 = 1 С = 1
где [[•]- индикаторная функция равна 1, если условие выполняется, в -параметры модели.
Таблица 4 - преимущества и недостатки слабого обучения
Метод Достоинства Недостатки
Слабое обучение Минимизация затрат на Модели, обученные на
разметку, так как полная слабо размеченных
разметка не требуется, данных, могут быть
это снижает стоимость и менее точными, чем
время подготовки модели, обученные на
данных. полностью размеченных
данных.
Можно использовать При недостаточном
огромные наборы контроле за процессом
данных, даже если они обучения модель может
слабо размечены. начать "доверять" своим
собственным
предсказаниям, что
может привести к
переобучению.
Методы слабого
обучения позволяют
автоматизировать
процесс обучения
модели, что уменьшает
зависимость от
человеческого
вмешательства.
Применение трансферного обучения в металлургии открывает широкие возможности для автоматизации процессов контроля качества и повышения эффективности производства.
1.3 Алгоритмы активного обучения моделей нейронных сетей определения детектирования, классификации, маркировки изделий металлопроката
Рассмотрим несколько популярных методов активного обучения:
1. Метод неопределённости в активном обучении — это стратегия, используемая для выбора образцов данных, которые должны быть размечены человеком-экспертом. Основная идея заключается в том, чтобы выбирать те данные, в отношении которых текущая модель наименее уверена, поскольку они потенциально принесут наибольшее улучшение модели.
Неопределённость в предсказании модели можно измерять различными способами. Один из распространённых способов — это использование энтропии.
Энтропия для конкретного изображения х:
где Р1 - вероятность принадлежности к классу ¿, а к - общее число классов. Чем выше значение энтропии, тем менее точно модель предсказывает класс для данного изображения.
2. Выборка на основе несогласованности комитетов — это метод активного обучения, основанный на использовании ансамбля моделей (комитетов) для определения, какие неразмеченные данные стоит отправить на разметку человеку-эксперту. Идея заключается в том, чтобы выбирать те данные, по которым мнения членов комитета сильно расходятся. Это означает, что текущие модели недостаточно уверены в своих прогнозах для этих данных, и их разметка может существенно улучшить общую производительность модели.
Пусть имеется ансамбль моделей F = 2, т} , который принимает на вход х и возвращает предсказание у для соответствующего класса. Каждая модель предсказывает вероятности принадлежности к каждому классу
fi(x)=( pil, pi2,..., Pik), где pij - вероятность того, что x принадлежит классу j модели f , а к- общее число классов.
Неопределенность в предсказаниях комитета можно измерять следующими способами: среднее голосование и степень несогласованности.
Среднее голосование: средний голос для каждого класса j для изображения
x:
т
v>(x)=^Lpi>
i=i
Степень несогласованности для изображения х рассчитывается как дисперсия голосов моделей для каждого класса:
т
i
-^(Рц - vjWf
i=l
Б(х) =
N
Чем выше степень несогласованности, тем сильнее расхождение мнений среди моделей комитета, и тем важнее разметить данное изображение.
3. Методы диверсификации в активном обучении направлены на выбор таких образцов данных, которые увеличивают разнообразие обучающего набора, способствуя улучшению общей производительности модели. Они основываются на предположении, что выбор разнообразных данных приведет к лучшему общему пониманию модели и повышению её способности к обобщению на ранее невидимые данные. В активном обучении применяется два основных метода диверсификации: максимизация энтропии и минимизация расстояния между кластерами.
Идея метода максимизация энтропии заключается в выборе таких изображений, которые максимизируют энтропию текущего распределения данных. Энтропия измеряет неопределенность в данных и приводит к выбору наиболее разнообразных и непредсказуемых изображений. Общая энтропия для набора данных X: Н(Х) = Ех~х[Н(/(х))].
Метод минимизации расстояния между кластерами предполагает разделение неразмеченных данных на объекты и выбор изображений из каждой группы. Выбор изображений из разных областей увеличит разнообразие данных и улучшит способность модели к обобщению.
Пусть есть набор данных X = [х1)х2)... ,хп}, где каждый элемент х1 представляет собой вектор признаков. Расстояние между двумя кластерами Ci, Cj рассчитывается как расстояние между центрами масс кластеров:
d(Ci,Cj) = \\ßi-ßj\\, где iii и ij центры масс кластеров Ci и Cj.
Цель метода - минимизировать суммарное расстояние между всеми парами кластеров, выбирая изображения из разных групп.
4. Алгоритмы, основанные на значимости, являются одним из ключевых направлений в активном обучении. Их основная идея заключается в том, чтобы выбирать для разметки те данные, которые наиболее важны для улучшения производительности модели. Важность может определяться разными методами, включая оценку изменения модели после добавления нового изображения или анализ влияния на обобщающие свойства модели. В основном применяются два популярных подхода: выборка на основе ожидаемой потери и выборка на основе обобщённой неопределённости.
Метод на основе ожидаемой потери направлен на выборку данных, который, предположительно, приведет к наибольшей регрессии в ошибках модели после его включения в обучающий набор. Ожидаемая потеря для изображения х рассчитывается как разность между средней потерей до и после добавления изображения х в обучаемый набор.
R(x) = Е9т(х),у)] - Е9№(х)Ш где I - функция потерь, fi^)- текущая модель, ^(х) - обновленная модель после добавления х в обучающий набор, у - случайная переменная, представляющая истинный класс. Необходимо выбрать изображение х*, которое максимизирует ожидаемую потерю:
х* = агд тахЯ(х),
где и -неразмеченный набор данных.
Метод выборки, используемый концепцию обобщённой неопределённости для выбора изображений, поможет модели лучше справиться с новыми данными. Обобщённая неопределённость для изображения х рассчитывается как:
где р(х, у) - совместная плотность распределения и классов.
Алгоритмы, основанные на значимости, играют ключевую роль в активных методах обучения, помогая выбрать те данные, которые окажут максимальное влияние на повышение производительности модели. Выборка на основе ожидаемой потери фокусируется на снижении ошибок модели, тогда как подборка на основе обобщённой неопределённости направлена на улучшение обобщающих свойств модели. Эти подходы обеспечивают эффективное управление выбором данных, что важно для успешного активного обучения.
Для задачи аннотирования изображений с дефектами металлопроката целесообразно использовать комбинацию вышеуказанных подходов. Можно начать с метода неопределенности, чтобы выбрать самые сложные случаи для экспертной разметки. Затем, используя методы диверсификации, добавить разнообразие в размечаемые данные, чтобы покрыть весь спектр возможных дефектов. После этого можно применять методы, основанные на влиянии, чтобы оптимизировать процесс обучения модели.
Применимость моделей нейронных сетей и техники трансферного обучения в активном обучении играют ключевую роль для обнаружения и классификации дефектов изделий металлопроката, особенно в условиях ограниченного объема данных.
В таблице 5 представлены архитектуры нейронных сетей, используемых в активном обучении.
Таблица 5 - Архитектуры нейронных сетей, применяемых в активном
обучении [56-60]
Архитектура нейронной сети Применение в детектировании Применение в классификации Применение в распознавание Применение в сегментации
LeNet нет нет да нет
AlexNet да нет нет да
ResNet50 да да нет да
EfficientNet да да нет да
Faster R-CNN нет нет да нет
YOLO да да нет да
SSD да нет нет нет
U-Net нет нет нет да
Mask R-CNN нет нет нет да
Использование трансформеров на основе предобученных моделей, таких как ResNet50, и дообучение их с помощью современных архитектур, на основе YOLO, может значительно улучшить точность задач компьютерного зрения, включая детектирование, распознавание, классификацию и сегментацию дефектов в изделиях металлургической промышленности. ResNet50 является одной из самых популярных архитектур сверточных нейронных сетей для задач компьютерного зрения. Она состоит из нескольких слоев сверток, нормализаций и активации, что позволяет эффективно извлекать признаки из изображений. Веса ResNet50 инициализируются значениями, полученными в результате предобучения на большом наборе данных.
YOLOvlO - это семейство алгоритмов для детекции объектов в реальном времени. YOLOvlO представляет собой последнюю версию этой архитектуры, которая отличается высокой точностью и скоростью работы. После дообучения ResNet50 ее выходы используются в качестве входов для YOLOvlO. Это позволяет
объединить сильные стороны обеих моделей: извлечение признаков из ResNet50 и высокоскоростная детекция от YOLOv10.
Объединенная модель ResNet50 + YOLOv10 обучается на размеченных изображениях изделий металлургического производства. На этом этапе происходит настройка всех параметров модели для достижения максимальной точности в обнаружении, распознавании, классификации и сегментировании дефектов. Важным этапом является оптимизация гиперпараметров модели, таких как скорость обучения, размер мини-пакета, число эпох и другие параметры, влияющие на качество обучения.
Применение активных методов обучения совместно с современными архитектурами нейронных сетей и трансферными подходами позволяет создавать высокоэффективные системы для обнаружения и классификации дефектов металлопроката. Ключевым преимуществом является возможность эффективного использования ограниченных данных, что делает этот подход крайне полезным в промышленных предприятиях.
1.4 Проблемы применения систем компьютерного зрения в задачах обнаружения дефектов изделий металлургического производства
Применение камер видеофиксации в реальных условиях металлургического производства сталкивается с рядом технических сложностей, связанных с экстремальными условиями среды. Высокая температура, агрессивные химические вещества, пыль, вибрации и неравномерное освещение требуют использования специализированных термостойких, антикоррозийных и удароустойчивых камер с функциями широкого динамического диапазона и защитой от электромагнитных помех. Правильный выбор оборудования и соблюдение требований безопасности являются ключевыми аспектами успешной интеграции систем видеонаблюдения в металлургический процесс.
Более 90 процентов получаемых изображений из цехов имеют помехи, засветы, артефакты. Специалисты в лабораториях работают с такими изображениями, применяя алгоритмы предварительной обработки, тем самым
тратя дополнительное время. Все получаемые изображения передаются аннотатору, отсюда возникает еще одна проблема: фиксированный набор ограниченных данных исследуемого изделия. В реальном производстве чтобы собрать качественный набор данных для исследования — это очень долгий процесс, для сборки хотя бы 3000 изображений может уйти несколько лет. В связи с этим, пока соберется набор данных, задача будет не актуальной, а производство понесет большие убытки. На рисунке 1 представлена схема получения цифрового изображения из цеха в лабораторию.
Рисунок 1 - Схема получения цифрового изображения для формирования
набора данных
Такое взаимодействие дает возможность собрать набор данных для любой задачи производства, а обратная связь специалиста по компьютерному зрению с аннотатором обеспечивает качество разрабатываемой архитектуры у модели нейронной сети.
Для получения качественного изображения поверхности важно освещать исследуемое изделие металлопроката равномерно. Фактически, высокое качество освещения снижает вычислительную нагрузку при обработке изображений. Для
металлических поверхностей могут использоваться два типа методов освещения: визуализация интенсивности и дальности действия.
К сожалению, все дефекты поверхности не видны ни в ярком, ни в темном поле. Существует множество примеров использования двух наборов камер, охватывающих оба поля обзора [24-26]. Были получены данные об использовании на металлургическом заводе в Китае двадцатью камерами сканирования площади с помощью устройств с зарядовой связью, которые используются для получения изображения поверхности обеих сторон горячекатаных полос как в режиме яркого, так и в режиме темного поля [24]. Однако, учитывая проблемы с обслуживанием и сложностью с освещенностью, большинство систем размещают камеры между светлыми и темными участками.
Источник света необходим для обеспечения равномерного освещения без пульсаций, в то время как основное освещение требует специального устройства источника питания света [27]. Обеспечение равномерной интенсивности в большинстве случаев невозможно из-за использования более чем одного источника света. Обычно используются следующие типы источников света: вольфрам широкого спектра действия, люминесцентные лампы, галоген, xeon и LED.
В основном на производстве используются как камеры линейного, так и площадного сканирования. Камеры линейного сканирования получили широкое распространение, поскольку с их помощью легче обеспечить сильное и равномерное освещение контролируемой поверхности. Недостатком камер линейного сканирования является то, что они не генерируют полное изображение сразу и требуют внешнего оборудования для создания изображений из нескольких линейных сканирований. Разрешение камеры линейного сканирования обычно составляет 1024 (поперечная полоса) х 1 (нижняя полоса) и 2048 х 1 пикселей. Производители обычно используют камеру с разрешением 1,024/2,048/4,096 х 1 пиксель. Для сканирования площади: указано 600 х 400 пикселей. Имеются данные о различных значениях пикселизации
изображений. Разрешение между полотнами варьируется от 0,17 мм до примерно 1 мм, в то время как между полотнами варьируется от 0,25 до 1,25 мм.
Даже при таком подходе возникает проблема с получением нужного количества изображений для обучения, валидации и тестирования. Из этого следует, что необходимо разработать методику обучения ограниченных наборов данных для разрабатываемых моделей нейронных сетей, включающих детекцию, классификацию и сегментацию дефектов на металлургических предприятиях.
В последнее время (пять лет) компьютерное зрение активно внедряется в промышленные металлургические производства. Эффективность работы и простоты реализации схемы установки показана на рисунке 2.
Рисунок 2 - Схема установки системы компьютерного зрения на металлургическом производстве
Такая простая взаимосвязь системы обеспечивает производству экономический эффект от своевременного обнаружения и (или) ликвидации дефектов с внедрением новых технологических процессов. При получении ограниченного набора данных с камер, возникает ряд проблем для разработки системы компьютерного зрения.
В большинстве случаев в собранном наборе изображений дефектов имеется большой процент плохих или недействительных данных для аннотирования. Они отбрасываются, что приводит к их ограниченности и сложности сбора необходимого набора данных. В таком случае можно прибегнуть к частичной разметке полученных изображений.
Применение систем компьютерного зрения (СУ) в задачах обнаружения дефектов изделий металлургического производства имеет множество преимуществ, но наблюдается ряд проблем, связанных с особенностями металлургической отрасли и спецификой работы с материалами.
Рассмотрим ключевые проблемы, возникающие при использовании СУ-систем в этой сфере:
Металлургические изделия могут сильно различаться по форме, размеру, цвету и текстуре поверхности. Это усложняет создание универсальной системы компьютерного зрения, способной эффективно работать со всеми видами изделий.
Для успешного обучения моделей компьютерного зрения необходимы большие объемы размеченных данных, однако, в металлургии их сбор может быть затруднён из-за специфики производственного процесса и необходимости защиты интеллектуальной собственности.
Условия съемки на производственных площадках зачастую далеки от идеальных. Освещение может быть неравномерным, фон содержит посторонние объекты, а сами изделия могут находиться в движении. Все эти факторы негативно влияют на качество получаемых изображений.
Производственные процессы в металлургии могут меняться в зависимости от технологических режимов, типов сырья и конечной продукции. Это требует постоянной адаптации и обновления моделей компьютерного зрения.
В условиях непрерывного производства важно обеспечить высокую скорость обработки изображений и принятие решений о наличии дефектов.
Задержки в обработке могут привести к остановке конвейера и снижению эффективности производства.
Патентный поиск по использованию систем компьютерного зрения на металлургических предприятиях включает в себя следующее: в качестве первого аналога изобретения можно рассмотреть ЯШ785327С1, представляющую собой систему компьютерного зрения для ритейла, которая относится к области вычислительной техники. Основной технический результат заключается в повышении точности обнаружения мелких и близко расположенных объектов.
Данная система включает в себя набор видеокамер, соединенных с сервером в единую сеть для захвата изображений. Блок захвата видеопотока размещен на сервере и способен независимо считывать кадры из потока камер с помощью механизма очередей, который буферизует необходимые для обработки кадры. Блок захватывает каждый текущий кадр с заданной частотой, и, если разница между двумя фиксируемыми временными характеристиками достигает или превышает пороговое значение, то кадр декодируется и помещается в очередь. Очередь переполняется, кадр пропускается.
Второй аналог ЯШ703962С1 представляет собой систему компьютерного зрения, предназначенную для автоматизации продаж весовых товаров. Это изобретение позволяет модернизировать существующие прототипы, добавляя специализированные элементы системы компьютерного зрения, основанные на технологиях искусственного интеллекта, для автоматической идентификации весового товара. Система сопоставляет товар на весах с информацией из магазина или предоставляет пользователям возможность выбрать товар из ограниченного списка, предложенного нейронной сетью. Также целью изобретения является автоматизация процесса продаж весовых товаров в магазинах БМСО без необходимости замены действующего торгового оборудования.
Во всех упомянутых аналогах используется система камер и серверов для обработки информации, объединенных в одну сеть и работающих по единому алгоритму нейронной архитектуры. Эти аналоги применяются в торговле, однако не включают систему предварительной обработки для отчетности и визуализации, что ограничивает их использование для детектирования, классификации и
сегментации поверхностных дефектов в металлургических производствах. Кроме того, использование набора камер увеличивает нагрузку на систему.
Третий аналог - устройство RU2772555, предназначенное для обнаружения дефектов на поверхности сортового проката и труб. Суть этого устройства заключается в том, что оно включает рольганг для транспортировки контролируемого объекта, регулируемый по высоте стол и установленный на нем измерительный модуль. Этот модуль содержит как минимум два вращающихся датчика, которые измеряют параметры, характеризующие физические свойства поверхности объекта и фиксируют их изменения. В качестве датчиков используются лазерные профилометры, расположенные на равном угловом расстоянии друг от друга вокруг объекта и, как правило, в одном сечении относительно оси транспортного рольганга. Измерительная линия датчиков ориентирована вдоль направления транспортировки объекта, а минимальное количество N вращающихся лазерных профилометров определяется по заданному математическому выражению.
Четвертый аналог RU2264617C2 описывает способ бесконтактного выявления местоположения и характера дефектов в металлических сооружениях, а также устройство для его реализации. Это изобретение относится к трубопроводному транспорту, нефтегазодобывающей промышленности, коммунальному хозяйству и дефектоскопии металлоконструкций, и может быть использовано в других отраслях, связанных с эксплуатацией трубопроводов.
Способ включает в себя измерение в заданных точках над трубами в процессе перемещения векторов магнитного поля в прямоугольных координатах с использованием как минимум двух трехкомпонентных датчиков. На основе полученных данных формируется тензор градиентов магнитного поля, который обрабатывается с помощью матричного преобразования. В результате обработки определяются фоновое значение и отклонения от него, по которым судят о наличии и местоположении дефектов, а также строится магнитограмма с указанием этих мест.
Устройство для бесконтактного обнаружения дефектов металлических сооружений включает систему датчиков, кварцевый генератор, делитель частоты, аналого-цифровой преобразователь, блоки управления, пороговый, звуковой и световой сигнализации, автоматический индикатор разряда батарей, блоки вычисления градиентов магнитного поля и отображения информации, сегмент запоминающего устройства, блоки управления записью и ситуационных привязок, спутниковой географической привязки GPS и выбора сегмента записи.
Во всех аналогах используется система камер и датчиков, объединенных в одну сеть и работающих под единым алгоритмом нейронной архитектуры, с серверами GPU и CPU для обработки информации. Крепление камер осуществляется под определенным углом. Эти аналоги применяются в металлургии, однако, они не используют одну монохромную камеру с разрешением 4K и виброзащищенным объективом с естественным охлаждением для сканирования местности. В отличие от статично установленных камер в аналогах, в данном изобретении камера движется с поворотным механизмом по осям рельсов проката вдоль линии производства металлургических изделий.
Компьютерное зрение должно быть внедрено в существующие системы контроля качества и управления производством. Это требует учета различных стандартов и протоколов обмена данными, а также совместимости с другими программными и аппаратными компонентами.
Работа с металлургическими изделиями связана с высокими температурами, агрессивными средами и потенциальной опасностью для персонала. Системы компьютерного зрения должны быть надежны и безопасны в эксплуатации.
Таким образом, описанные выше проблемы должны решаться с описанием требований по улучшению системы компьютерного зрения, применяемой на металлургических производствах для повышения качества выпускаемой продукции.
Система предназначена для автоматического контроля качества изделий на линии проката металлургического производства путем обнаружения дефектов и проверки маркировки.
Аппаратная часть должна включать:
- монохромную камеру с разрешением 4К, которая обеспечивает высокую четкость изображения даже при быстром движении изделий на производственной линии;
- виброустойчивый и температуроустойчивый объектив, способный работать в условиях металлургического производства без потери качества изображения;
- специализированный корпус, защищающий оборудование от воздействия окружающей среды (влаги, пыли, высоких температур);
- микроконтроллер, управляющий работой камеры и алгоритмами нейросети, обеспечивающий их синхронизацию и обработку данных в реальном времени;
- механизм, позволяющий камере перемещаться вдоль направляющих и поворачиваться вокруг выбранной оси для оптимального обзора поверхности изделий.
Программная часть должна включать:
- встроенные алгоритмы нейросетей, способные обнаруживать дефекты и проверять маркировку изделий с высокой точностью;
- интерфейсы для настройки параметров работы системы, а также для мониторинга результатов анализа в режиме реального времени;
- алгоритмы обработки данных, позволяющие минимизировать погрешность прогнозирования до 5%, обеспечивая точное и своевременное обнаружение дефектов.
Функциональные требования должны включать:
- система должна автоматически выявлять поверхностные дефекты на изделиях, такие как трещины, царапины, пятна и прочие аномалии и проверять наличие и правильность нанесения маркировки на изделии;
- результаты анализа должны предоставляться оператору в режиме реального времени для оперативного принятия решений;
- система должна быть интегрирована в общую систему управления производством и обеспечивать синхронную работу с другими устройствами и системами.
Надежность и безопасность прибора:
- оборудование должно быть защищено от вибраций, перепадов температуры и других неблагоприятных условий эксплуатации;
- система должна функционировать стабильно и надежно в течение длительного времени без необходимости частого обслуживания;
- данные, полученные системой, должны храниться в зашифрованном виде и быть защищены от несанкционированного доступа.
Интеграция и совместимость системы компьютерного зрения:
- система должна быть совместима с уже установленными на производстве системами управления и контроля;
- наличие открытых интерфейсов для интеграции с другими системами и оборудованием.
Эти требования обеспечивают создание эффективной и надежной системы компьютерного зрения для автоматизации контроля качества изделий на линии проката металлургического производства.
ВЫВОДЫ ПО ГЛАВЕ 1
Рассмотрены:
- современное состояние вопроса создания систем компьютерного зрения обнаружения дефектов металлопроката в заводских условиях;
- полуавтоматические методы разметки, которые позволяют существенно сократить затраты времени и ресурсов на подготовку обучающих наборов данных;
- интерактивные инструменты, автоматическое создание меток на основе правил и др.;
- подходы к обучению моделей нейронных сетей на ограниченных наборах данных;
- современные модели обучения нейронных сетей на частичной разметке в задачах распознавания дефектоскопических изображений и методы прогнозирования (детектирования) дефектов, а также программные реализации этих методов.
Показано:
- что активное обучение позволяет выбрать наиболее информативные примеры для разметки.
Этот метод особенно полезен в условиях ограниченного бюджета на разметку в условиях реального производства.
Исследовано:
- современное состояние вопроса активных методов обучения и детектирования дефектов металлопроката и предсказания изменений прогнозирования с применением глубоких нейронных сетей.
Проанализировано:
- известные программные обеспечения моделирования систем компьютерного зрения обнаружения дефектов металлургических производств;
- использование трансформеров на базе предобученной модели ResNet50 с последующей интеграцией с YOLOv10 позволит создать мощную систему для решения задач детектирования, распознавания, классификации и сегментирования дефектов в изделиях металлургического производства.
- недостатки существующих систем компьютерного зрения, определено, что в России на рынке отсутствуют системы, свободные от данных недостатков, сформулированы требования на модернизацию существующих систем компьютерного зрения по преодолению выявленных недостатков.
Такая система может существенно повысить качество продукции и снизить затраты на производство за счет раннего выявления и устранения дефектов.
- детектирование дефектов в металлопрокате требует высокого уровня точности и скорости. YOLOv10, будучи быстрой моделью, отлично подходит для этих целей. Использование трансферного обучения позволит ускорить процесс обучения и повысить точность модели, так как она начинает с заранее накопленных знаний об объектах и их характеристиках с предобученной модели ResNet50.
Несмотря на значительные успехи в развитии систем компьютерного зрения, применение этих технологий в задачах обнаружения дефектов изделий металлургического производства и распознавания маркировки труб разного сортамента сталкивается с множеством трудностей.
Решение этих проблем требует комплексного подхода, включающего разработку специализированных алгоритмов, адаптацию существующих технологий к особенностям металлургии и интеграцию с современными системами автоматизации производства.
ГЛАВА 2. РАЗРАБОТКА АЛГОРИТМОВ И МОДЕЛЕЙ ТРАНСФЕРНОГО ОБУЧЕНИЯ СИСТЕМЫ КОМПЬЮТЕРНОГО ЗРЕНИЯ ДЛЯ ЗАДАЧ ПРОМЫШЛЕННОЙ ДЕФЕКТОСКОПИИ
Основной акцент сделан на разработке моделей, способных адаптироваться к новым задачам с минимальным количеством данных благодаря использованию трансферного обучения. В главе рассмотрены модели предобученная ResNet50 и до обучения YOLOv10 c адаптацией к конкретным условиям промышленного производства. Описаны методы активного обучения, позволяющие минимизировать объем необходимых данных дефектоскопических изображений для обучения и повышения точности модели детектирования, классификации и сегментации YOLOv10.
2.1 Разработка и модификация архитектур нейросетей, способных эффективно работать с малым набором аннотированных изображений
Алгоритм основывается на использовании комбинации предобученной модели ResNet50 и настраиваемой модели YOLOv10 для обучения на ограниченном наборе данных дефектоскопических изображений (относится к п. 6 паспорта специальности 2.2.8). Основная идея данного алгоритма — обеспечить высокую точность обнаружения дефектов изделий и минимизировать ошибку в обучении даже при небольшом количестве размеченных данных. Алгоритм будет состоять из следующей математической базы:
1 часть. Описание предобученной модели ResNet50.
Модель состоит из 50 слоев по своей архитектуре и использует остаточную связь для предотвращения проблемы с затуханием градиента при увеличении глубины слоев.
Основные компоненты архитектуры: сверточный слой, выполняется над входным дефектоскопическим изображением / с использованием фильтра Ш.
С = 1*Ш + Ь,
где * - операция свертки, Ь- смещение.
Остаточный блок, используется для фильтрации функции активации RELU [63-65] после выполнения сверток и добавления остатка:
у = a(W2 * (a(W1 * х + b1)) + b2) + х,
где о- функция активации RELU, х - вход блока, у - выход блока, W1,W2 -последовательность двух сверток, b1, Ь2 - смещение.
Пуллинг слои предназначены для уменьшения разрешения признаков. Они помогают снизить вычислительную сложность и предотвратить переобучение.
Ртах(Х) = max(Xi,j)
Полносвязные слои, применяются для преобразования признаков в вектор вероятностей классов:
z = Wx + b,
где z - выходной вектор слоя, W - матрица весов, х - размерность вектора признаков,
Функция потерь при обучении использует кросс-энтропию:
M
L = -^yclog(yc),
С=1
где ус - истинный класс дефекта изделия, ус - предсказанный класс, M -количество классов дефектов.
Оптимизация используется для обновления параметров модели с применением метода обратного распространения ошибки Adam [66-68].
2 часть. Математическое представление слоев модели YOLOvlO трансферного обучения системы компьютерного зрения обнаружения дефектов металлургического производства.
Для входного слоя Гауссова функция [69-70] показывает прямую действительных чисел в диапазоне [0;1], представляется в виде:
д(х) = e-x2,xeR
В этом случае вектор прямого кодирования с п компонентами координатный вектор в Rn имеет вид: et = (0, .„,0,1,0 ...,0), с единицей в i — ой позиции и с нулями в
остальных. Чтобы на входе нейросетевого классификатора получить определенные классы, используется функция активации эойтах [71-73].
I/ х Е — это вектор
exJ
then п = softmax(y) = z, Zj = = 1, —>n
\\ex\\=YZ=ieXiM 0 0,
"Xi p CX-ft
softmaxc(x) =
с — скорость срабатывания нейрона.
Для нескольких нейронов:
lim softmaxc(x) = ек, хк = max [хг, ...,хп].
Функция активации выдает линейные результаты с входа и использует их для дальнейших слоев классификатора. Для остальных слоев в классификаторе используется функция активации RELU, которая линейна только при х > 0.
RELU(x) = хН(х) = max[x, 0} = ^
Производная RELU - это функция Хэвисайда [74-75]. RELU'(x) = H (х). RELU не насыщается в отличии от сигмоидных функций, поэтому дает преимущество в задаче распознавания классификатора. RELU не дифференцируется в 0, но в задаче распознавания данных на дефектоскопических изображениях, передаваемых между слоями классификатора работает более точно, чем сигмоидные функции активации [76-79]. На вход сети подается вектор х Е R2, классификатор работает как функция, модифицирует входные переменные и выдает результат у Е R2. Преобразование входных данных в выходные регламентируется в виде fwb. Индексы w, b предполагают, что параметры в классификаторе будут для у = fwb (х).
Целевая функция для классификатора не зависит от параметров w,b и представляется как: z = ç(x). При таком подходе архитектура классификатора будет корректировать (w, b), пока выходной вектор не окажется рядом с z. Такая близость значений измеряется функцией стоимости. c(w) = dist(y,z), параметризируется (w, b) и оценивается расстоянием:
(\м*,Ь*) = ащт\пС(ш,Ь)
Сам процесс настройки параметров (ш, Ь) до (\м*,Ь*) - процесс обучения. Такой процесс обучения делается для минимизации функции стоимости. Для классификатора, которому на вход поступают зашумленные изображения с дефектами металлопроката, применяется функция стоимости расстояния Кульбака-Лейблера [80- 83].
д(х)
^кь(р\\ч) = -1 Р(х)1п~(^ах
'КЬ
Пусть х- случайное изображение из набора, подаваемое на вход классификатора, тогда выход: У = fв(х,^). 9 = (\\,Ь), случайный шум на изображении.
Учитывая плотность обучения рху — совместная плотность (х,г), г — целевая случайная переменная. Находится такое значение параметра 9, где стоимость с(9) минимальна. Функция стоимости представляет собой перекрестную энтропию между эмпирически обучаемым распределением с определенным набором данных для классификатора и распределением вероятностей. (х±, г±), (х2, г2),..., (хп, гп).
Тогда функция стоимости с использованием эмпирической плотности рХ,2 будет иметь вид:
п
Ро(х, г) Рх,г
Для предотвращения процесса переобучения необходимо ее минимизировать, используя потенциальную регуляризацию:
в(\\) = с(\) + Ли(ш), Л > 0,
Л - значение гиперпараметра вирируется, чтобы минимизировать эффект переобучения в положительный множитель Лангранжа [84-86].
С (ш) -функция стоимости.
Ошибка на тестовом наборе данных уменьшается после добавления потенциальной регуляризации и (ш) в исходную функцию стоимости с(ш).
с( 9) = Е?**
— п
п
= —^Х (ЫРо (хо — 1п рХ,г (хи г1) п
]=1
Рассмотренная функция стоимости будет являться ошибкой обучения и тестирования.
1 т
CT(w, b) = ^^(fw^Xj) - Zj)2, (xj,Zj)er,
j=i
1 k
CT(w, b) = ^^(fwfiixj) - Zj)2, (xj,Zj)eT,
j=i
m = card (т)- обучающий набор классификатора,
к = card (Т)- тестовый набор классификатора.
При активном обучении происходит корректировка весов и смещений, до тех пор, пока функция стоимости не будет минимизирована. Количество параметров при обучении всегда большое. Чтобы функция определялась безошибочно, нужен надежный алгоритм минимизации. Разработанный классификатор адаптивного обучения основывается на методах AdaGrad [87-90] и RMSProp [91-94]. Данные подходы используют оценку первого и второго моментов градиента с помощью экспоненциальных скользящих средних с применением поправок к смещению.
x(t + 1) = x(t) - у . m(t) ,
e - скаляр, используемый для предотвращения деления на ноль, у - 0,001, е = Ю-8 , m,v - смещение оценки первого и второго моментов градиента, заданного экспоненциальным скользящим средним.
m(t) = (l-fàïUPt^i, v(t) = (l-P2)%=iPi-i(9i)2, Pi = 0,9 $2 =
0,99.
Оптимизатор Adam отыскивает локальный минимум при обучении набора данных между слоями в классификаторе, делит области интереса изображения на классы и в каждом находит минимум. Математическое представление ошибки минимизации представляется как сумма информации всех обнаруженных данных правильно или ошибочно из классификации.
E(x, z) = YJl=i H(xt) = - YZ=i ln 8(zi(wTxi - b)) , zt = z(xt), 1<i<n
Оптимальные значения (w, b) определяются как:
( w*,b*) = argminE(x,z)
w,h
n n
= argmax / \nS(zi(wTxi — b)) = argmax ln\ \S (zi (wTxi — b)) =
ww h / I w,b 1 1
i=1 i=1
n
argmax In \ \Pw,h(Zi,Xi)
w,h 1 1
1=1
Ь (г^, х{) —вероятность того, что пиксель имеет цвет с учетом координаты х.
Для поиска оптимальных параметров ( ж*, Ь*) , определяющих линию решения, которая соответствует значениям ж, Ь. Описывается ж*тх^ — Ь* = 0.
Детектор делит дефектоскопическое изображение на сетку размером 5 * 5 и для каждой ячейки сетки предсказывает вероятность наличия дефекта рй, координаты центра якорных рамок (Ьх, Ьу) и их размеры (ЬW, Ьн), затем предсказывается вектор вероятности принадлежности дефекта к одному из С классов (рс):
р(х, с) = Ра* рс
Предсказания координат центра и размеров якорных рамок представляется через определение ее краев:
b = —
etwPw
left Lx 2 ,
b = —
ethPh
top uy 2 '
brinht Cy +
e"wPw
right bx + 2 ,
_ ethPh
bhottom СУ + 2 ,
где bieft, btop, bright, bhottom- координаты левого, верхнего, правого, нижнего края якорной рамки, (сх, су) - координаты центра ячейки сетки, (pw, ph) - размеры якорной рамки, (tx, ty, tw, th) - предсказания YOLOvlO, преобразующиеся в координаты и размеры ограничивающей рамки, е - основание натурального логарифма, необходимого для масштабирования ширины и высоты.
Для устранения избыточности предсказаний применяется метод, который оставляет только одно предсказание найденного дефекта изделия при этом удаляются все остальные, которые сильно пересекаются с ним.
Набор предсказаний В = [Ь±,Ь2,... ,ЬИ} , в котором каждое значение Ь представлено в виде кортежа (х^, Уи^^к^с^),
где (х^,у{)- координаты центра якорных рамок, - ширина и высота
якорных рамок, С1 - уверенность предсказания.
В нашем случае I (Ьь Ьу) - функция пересечения областей, возвращающая долю площади пересечения якорных рамок Ь^ и Ьу относительно их объединения:
ии ил Р(Ь П Ь)
где Р(Ь{ П Ьу)- функция, возвращающая площадь найденного дефекта.
Для предсказания Ь^ удаляются все предсказания Ьу с высоким пересечением порогового значения т с Ь^
1(Ь0Ьу)> т.
Данный метод работает как последовательность фильтрации, начиная с самого уверенного предсказания, последовательно удаляя менее уверенные, которые имеют высокое перекрытие с оставшимися (рисунок 3).
Г Начало^)
(А)
Инициализация
Исходный набор
Текущий набор
Фильтрация
Удаление не нужных рамок
^ Да
Сортировка
предсказаний
Конец )
Рисунок 3 - Алгоритм уверенного предсказания Алгоритм данного метода.
1. Инициализация В'' = В', где В' - исходный набор предсказаний, В''-текущий набор предсказаний.
2. Сортировка В'' = (В'', key = Xb\ b, с)
3. Фильтрация: для каждого Ь^В'', В'' = [bjll(bi,bj) < т]. Функция потерь в детекторе YOLOvlO состоит из трех компонент: 1. Потеря координат:
S2 в
Lcoord ^ K*i - + (У1 - П)2] + ^ [(Jb - 4®д2
i=0j=0
+ (Jb-Jik)2]
2. Потеря уверенности:
S2 В s2 в
iconfс w—¿о2+X-YL inoohJ (c-co2.
i=0j=0 i=0 j=0
где Л -коэффициенты, регулирующие вклад каждой потери в общую.
3. Потеря класса:
S2
Ldass = ^ ^ 1ohj(Pi(c) — Pi(c))2
i=0 ceclass
Таким образом, общая функция потерь:
L Лсoord^coord + Лcon^conf + Лс1аз5^с1аз5
Вышеописанные слои преобразуют карты признаков в предсказания якорных рамок и классы объектов. Предсказание осуществляется через серию полностью связанных слоев, которые принимают на входе плоские векторы признаков и выдают координаты и вероятности.
Итоговая методика по вышеописанному алгоритму будет иметь следующие
шаги:
1. Собрать набор дефектоскопических изображений изделий металлопроката, выполнить нормализацию изображений и привести их к единому разрешению (224x224 для ResNet50 и 416x416 для YOLOvlO).
2. Разметить дефекты на изображениях, указав их координаты и классы. Для YOLOvlO использовать формат аннотаций в виде ограничивающих рамок и соответствующих им классов дефектов.
3. Загрузить предобученую модель ResNet50, обученную на наборе данных о дефектах поверхности металла.
4. Заморозить первые несколько слоев ResNet50, чтобы сохранить обученные признаки.
5. Изменить последний слой ResNet50 для соответствия ограниченного набора данных, размеченного аннотатором. Если у нас к классов дефектов, изменить размер последнего полносвязанного слоя на к.
6. Дообучить последнюю часть ResNet50 на новом размеченном наборе данных, используя кросс-энтропию в качестве функции потерь.
7. Определить ключевые гиперпараметры YOLOvlO [95-96] (размер ячеек сетки, количество якорных боксов, пороговые значения IoU и уверенности).
8.Инициализировать модель YOLOvlO с выбранными гиперпараметрами.
9. Настроить функцию потерь YOLOvlO, учитывая потери координат, уверенности и класса.
10. Использовать ResNet50 для извлечения признаков из дефектоскопических изображений (эти признаки подаются на вход YOLOvlO).
11. Модифицировать архитектуру YOLOvlO (на вход подаются признаки полученные от ResNet5O).
12. Обучить комбинированную модель на новом размеченном наборе данных, используя функцию потерь YOLOvlO.
13.Провести гиперпараметрическую настройку для оптимизации производительности модели, используя байесовскую оптимизацию.
14. Оценить модель на тестовом наборе неразмеченных данных, рассчитать точность, полноту, П-меру, коэффициент Жаккара [97-98].
15. Интегрировать обученную модель в существующую систему компьютерного зрения металлургического производства.
Комбинированная модель, использующая предобученную ResNet5O для извлечения признаков и настраиваемую YOLOvlO для детектирования дефектов, позволяет эффективно обучаться на ограниченном наборе данных (тот случай, когда данных мало, они несбалансированные и не разнообразные, что усложняет обучение модели) дефектоскопических изображений. Правильная настройка гиперпараметров и интеграция моделей обеспечат высокую точность обнаружения дефектов и минимальную ошибку в обучении.
2.2 Разработка и оптимизация алгоритмов и методов с целью повышения качества трансферных моделей в дефектоскопии
Модель обнаружения базируется на слабо контролируемом обучении и позволяет создать оптимизированные алгоритмы системы компьютерного зрения (под использование CPU, а не только для GPU) дефектоскопии в условиях
промышленной металлургии для уменьшения пропуска дефектов на металлургических изделиях (относится к п. 4 паспорта специальности 2.2.8).
На рисунке 4 представлена блок-схема алгоритма трансферного обучения.
Рисунок 4 - Алгоритм трансферного обучения
Методика алгоритма состоит из следующей последовательности:
1. Собрать набор изображений металлопрокатных изделий с различными дефектами. Все данные должны включать различные типы дефектов, условий освещения, углов съемки и так далее.
2. Б = {(х1,у1),... ,(хп,уп)} - размеченный набор данных, у{ - метки дефектов. Автоматическое аннотирование обозначается:
А = {( аг, Ь±),..., (ат, Ьт)}, Ь^ - предсказанные метки.
3. Выполнить нормализацию, масштабирование и другие необходимые преобразования дефектоскопических изображений для улучшения качества обучающих данных.
4. Разделить данные на тренировочный, валидационный и тестовый наборы.
5. Выбрать архитектуру YOLOv10 и провести операцию свертки с применением фильтра К во всех позициях входного дефектоскопического изображения /.
С к-1 к-1
1 = (1,], т) = ^ ^ ^ 1(1 + к,] + ш,с)* К (к, ш, с, т) + В(т),
С=1 1=0 ш=0
где I,] - координаты выхода свертки (0< I < Н' — 1,0 < ] < Ш' — 1), к, ш -координаты внутри фильтра, с- индекс канала, т - индекс фильтра выходного канала. Использование страйда [99] необходимо, для понимания, насколько сдвигаются фильтры при каждом шаге свертки.
Н + 2Р — к
Н' =
+ 1
Использование пэдинга [100] необходимо для добавления дополнительных нулевых значений вокруг границы дефектоскопического изображения.
W + 2P-k
W' =
+1
Полная математическая модель сверточного слоя УОЬОуЮ будет выглядеть следующим образом:
У т) = ЯЕИЛ Т1У—=о1(1*3+Ь,]*3+™,с)*К(Нжс,т)+В(т)-цв(т)
1&§(т)+е
'' - итоговый выходной слой после свертки, нормализации и активации,
5 - страйд, \1В(т), &В(т) - среднее и дисперсия для каждого выходного канала.
6. Настроить гиперпараметры модели, такие как размер батча, количество
эпох, скорость обучения и т.д. Данные параметры будут влиять на точность и
скорость обучения модели.
Пусть f(6) — это функция, реализующая модель УОЬОуЮ с параметрами
6. Контролируемое обучение для минимизации функции потерь будет иметь
следующий вид: ттЬ^(6),Б), слабоконтролируемое обучение для
о
неразмеченного набора данных: и = {щ, ...,ит}. Модель делает прогноз у = /(в)(и]) и выбирает неопределенные примеры для аннотирования
5 = {(ик,$)1кЕКЯ{1.....т}}
7. Загрузить предварительно обученную модель YOLOv10 и инициализировать её для задачи обнаружения дефектов.
С = {(с1,у^),...,(с1,у']_)} - исправленный набор данных, где у' -исправленная метка. Объединяются исходные и новые данные
Б' = Б и С, и вводится регуляризационные члены в функцию потерь
Ьгед=Ь + уЯ(в),
где в) - Ь2- регуляризация, а у - коэффициент регуляризации.
8. Провести обучение модели на подготовленных данных, комбинируя ручную разметку с автоматическим расширением набора данных.
9. Проверить производительность модели на валидационном и тестовом наборах данных, используя метрики, такие как точность, полнота и F1-мера, для оценки качества работы модели.
Если результаты неудовлетворительны, необходимо провести дополнительное обучение модели с корректировкой гиперпараметров или добавлением новых данных.
Этот процесс позволит создать эффективную модель обнаружения дефектов изделий металлопроката с использованием слабо контролируемого обучения на базе архитектуры YOLOv10.
На рисунке 5 представлена блок-схема алгоритма слабоконтролируемого обучения.
Рисунок 5 - Алгоритм слабоконтролируемого обучения
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.