Применение нейронных сетей для определения аэродинамических характеристик космических аппаратов тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Дорофеев Федор Евгеньевич

  • Дорофеев Федор Евгеньевич
  • кандидат науккандидат наук
  • 2025, «Московский физико-технический институт (национальный исследовательский университет)»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 77
Дорофеев Федор Евгеньевич. Применение нейронных сетей для определения аэродинамических характеристик космических аппаратов: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Московский физико-технический институт (национальный исследовательский университет)». 2025. 77 с.

Оглавление диссертации кандидат наук Дорофеев Федор Евгеньевич

1.2, Искусственные нейронные сети

1.3, Метод обратного распространения ошибки

1.4, Алгоритмы обучения многослойных персептронов

2. Применение многослойных персептронов для определения аэродинамических характеристик космических аппаратов

2.1, Локальный метод. Триангуляция поверхности К А

2.2, Нейронная сеть, архитектура, обучение

2.3, Результаты

2.4, Выводы к главе

3. Определения аэродинамических характеристик малых космических аппаратов на основе сферической проекции с использованием сверточной нейронной сети

3.1. Нейросетевой аппроксиматор на основе сверточной нейронной сети глубокого обучения

3.2. Представление трёхмерной геометрии

3.2.1. Аугментация данных

3.2.2. Использование расчётов на основе локального метода

3.2.3. Сферические проекция

3.3. Построение обучающей выборки

3.4. Архитектура нейронной сети

3.5. Обучение модели

3.6. Анализ результатов

3.7. Выводы к главе

4. Исследование эффекта изменения знака подъемной силы для затупленных конических тел и тел вращения со степенной образующей

4.1. Построение нейросетевого аппроксиматора для определения критического угла полураствора в эффекте смены знака коэффициента подъемной силы для

затупленных конических тел

4.1.1, Методика нахождения критического угла полураетвора конуса

4.1.2, Построение нейронной сети для критического угла полураствора

4.1.3, Описание зависимостей критического угла полураствора от параметров геометрии конического тела

4.1.4, Сравнение численных результатов с теоретическими

4.2, Тела вращения со степенной образующей

4,2,1, Критическое удлинение

4.3. Выводы к главе

5. Применение квадратурных формул Галкина для исследования эффекта

смены знака подъемной силы осесимметричных тел

5.1. Квадратурные формулы Галкина

5.2. Тела вращения со степенной образующей

5.3. Вычисление критического удлинения с помощью квадратур Галкина

5.4. Сравнение с суммированием по триангуляции

5.5. Выводы к главе

Заключение

Введение

Космический аппарат, совершая движение по орбите с первой космической скоростью, на высотах от 100 до 800 км, взаимодействует с атмосферой, несмотря на ее относительную разреженность. Это взаимодействие приводит к возникновению нескомпенсированных моментов и сил торможения. Последние приводят к постепенному сходу аппарата с орбиты, а моменты приводят к нежелательным вращениям аппарата. Для увеличения устойчивости орбиты космического аппарата относительно этих воздействий необходимо уметь вычислять и контролировать его аэродинамические характеристики. Однако расчет аэродинамических характеристик космического аппарата с учетом, как правило, его сложной геометрии довольно нетривиальная задача, которая требует правильного учета взаимодействия аппарата с набегающим потоком. При этом прямое численное моделирование требует немало вычислительных ресурсов и времени и не подходит для текущего контроля.

Вместе с тем, в последнее десятилетие возникло новое и перспективное направление вычислительной аэродинамики, связанное с применением пейросетевых аппроксиматоров. Такой подход, уже неоднократно и успешно, применялся в задачах аэродинамики пассажирских самолетов [1, 2, 3, 4, 42, 45, 46], Этот успех приводит к идее, что и для космических аппаратов можно применить тот же метод, А именно возникает задача построения нейронной сети, которая по форме аппарата и по параметрам его движения на орбите, способна практически мгновенно вычислить необходимые аэродинамические характеристики. Решению данной задачи посвящена первая часть диссертационной работы.

Вторая часть диссертации посвящена изучению интересного явления в динамике разреженного газа, а именно эффекту изменения знака подъемной силы для конусообразных космических аппаратов и для осеснмметрпчных тел вращения. Впервые этот эффект был обнаружен в работе [5], для высокоскоростных плоских течений. Затем этот эффект был найден для евободномолекулярного течения в [6], В работе [8] было показано, что при обтекании клина свободно молекулярным потоком существует критический угол полураствора. При углах полураствора больших критического подъемная сила клина становится отрицательной при любом угле атаки. Оказалось, что этот эффект проявляется при любых скоростях газа и отношениях температур поверхности клина и газа,

В этой части диссертации изучается этот эффект для тел в форме сжатых затупленных конусов. Эффект изучается для потока разреженного газа без предположения о режиме евободномолекулярного обтекания. Для сжатых затупленных конусов построен нейросетевой аппрокеиматор, позволяющий практически мгновенно вычислить критический угол полураствора в зависимости от геометрии конуса и параметров потока. Для осесимметрнчных тел со степенной образующей изучено поведение критического удлинения тела, как функции показателя степени образующей, числа Рейнольдса и температурного фактора.

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Применение нейронных сетей для определения аэродинамических характеристик космических аппаратов»

Характеристика работы

Целью данной работы является разработка и программная реализация методики построения нейросетевых аппроксиматоров для вычисления аэродинамических характеристик космических аппаратов, на основе многослойных персептронов и еверточных нейронных сетей глубокого обучения.

Для достижения поставленных целей были решены следующие задачи:

1, Разработать способ параметризации геометрии космического аппарата,

2, Разработать метод триангуляции поверхности космического аппарата,

3, Разработать программу для генерации множества паттернов для обучения нейросетевых аппроксиматоров,

4, Провести обучение нейросетевых аппроксиматоров,

5, Разработать метод отображения триангуляции космического аппарата в двумерное изображение путём сферической проекции,

6, Разработать схему построения и обучения сверточной нейронной сети глубокого обучения для определения аэродинамических коэффициентов космических аппаратов,

7, Разработать метод построения и обучения нейросетевых аппроксиматоров для определения критического угла полураствора затупленных конусов и критических удлинений тел вращения для эффекта смены знака коэффициента подъемной силы,

8, Провести валидацию результатов расчета эффекта смены знака подъемной силы для тел вращения путем сравнения разультатов расчета суммированием по триангуляциям и расчета с использование аналитических квадратурных формул.

Научная новизна работы

1, Впервые разработана и реализована методика построения нейронных сетей типа многослойных персептронов для вычисления коэффициентов аэродинамических сил и моментов для космических аппаратов,

2, Впервые разработана и реализована схема построения сверточной нейронной сети глубокого обучения для определения аэродинамических характеристик космических аппаратов,

3, Впервые разработан метод отображения триангуляции тела в двумерное изображение путём сферической проекции,

4, Впервые разработаны и построены пейросетевые аппрокеиматоры для определения критического угла полураствора в эффекте смены знака коэффициента подъемной силы для затупленных конических тел.

5, Впервые разработан метод определения критического удлинения в эффекте смены знака коэффициента подъемной силы для тел вращения со степенной образующей,

6, Впервые разработан метод валидации в задаче определения критического удлинения для эффекта смены знака для степенных тел вращения с помощью квадратурных аналитических формул.

Практическая значимость

Полученные в данной работе результаты могут быть применены в системах предварительного проектирования космических аппаратов, Аппрокеиматоры на основе еверточных нейронных сетей глубокого обучения позволяют эффективно и практически мгновенно оценивать аэродинамические характеристики космических аппаратов по триангуляции аппарата созданной по изображению или схеме аппарата. Это может быть полезным в различных задачах оптимизации формы и компоновки космических аппаратов. Учет эффекта смены знака подъемной силы может оказаться существенным в процессе проектирования космических аппаратов.

Положения выносимые на защиту

1, Метод построения нейронных сетей типа многослойных персептронов для вычисления коэффициентов аэродинамических сил и моментов действующих на космический аппарат,

2, Метод отображения триангуляции поверхности космического аппарата в двумерное изображение путём сферической проекции,

3, Схема построения сверточной нейронной сети глубокого обучения для определения аэродинамических коэффициентов космических аппаратов,

4, Метод построения нейросетевого аппроксиматора для определения критического угла полураствора в эффекте смены знака коэффициента подъемной силы для затупленных конических тел,

5, Эффект изменения знака коэффициента подъемной силы для степенных тел вращения,

6, Метод валидации расчетов критического удлинения в эффекте смены знака коэффициента подъемной силы для степенных тел вращения с помощью применения аналитических квадратурных формул для коэффициентов аэродинамических сил осесимметричных тел.

Личный вклад соискателя в работах с соавторам

Все основные результаты, выносимые на защиту, представляют индивидуальный вклад автора в данной работе. Все программные коды разработаны автором, выполнены численные расчёты и обработаны данные расчетов. Все результаты показанные в данной диссертации

получены автором самостоятельно. Кроме того, автор также внес значительный вклад в подготовку всех тезисов, публикаций и материалов, представленных на научных конференциях.

Обоснованность и достоверность результатов и выводов

Достоверность полученных результатов обеспечивается применением хорошо разработанных методов динамики разреженного газа и многократно аппробированных методов обучения нейронных сетей. Кроме того, достоверность подтверждается путем сравнения различных численных методов к вычислению одних и тех же величин, а также сравнения с результатами решения задач, полученными другими авторами.

Степень достоверности и апробация результатов работы

Результаты работы докладывались на 62, 63, 64, и 65 всероссийских конференциях МФТИ (2019, 2020, 2021, 2023 гг, Жуковский), на международной конференции "Перспективная элементная база микро и наноэлектроники с использованием современных достижений теоретической физики", 2022 г, МГОУ, г, Москва, а также на семинаре С.М, Белоцерковского, 2025 г, Москва,

Публикации

Материалы диссертации опубликованы соискателем достаточно полно в 4 научных работах, ссылки на которые приведены в разделе Заключение, Все статьи были опубликованы в научных журналах, входящих в перечень ВАК, Автором было получено свидетельство о регистрации программ для ЭВМ,

Благодарности

Автор выражает глубокую признательность своему научному руководителю С,Л, Горелову за постановку задачи и неоценимую поддержку в течении тех лет, на протяжении которых были написаны бакалаврская ВКР, магистерская и кандидатская диссертации.

Глава 1 Обзор

Центральным объектом данной диссертации являются искусственные нейронные сети (ИНС), поэтому кажется уместным кратко описать биологические основы, которые послужили источником идей лежащих в основе ИНС, Мы уделим внимание одному из типов нейронных сетей, который очень популярен в современных приложениях, это многослойные переептроны (multylayer perceptron (MLP)) Опишем, детально, ключевой алгоритм— метод обратного распространения ошибки. Будут описаны, построенные на основе метода обратного распространения, градиентные методы обучения — алгоритм RProp (Resilient Propogation), алгоритм ADAM (ADAptive Moment Estimation), а также алгоритм компьютерной имитации отжига (Simulated annealing). При написании этой главы использовались материалы публикаций [13, 14].

1.1 Краткие сведения из нейрофизиологии

Физической основой интеллектуальных способностей мозга является его кора. Кора головного мозга это слой клеток толщиной от 2 до 3 миллиметров и площадью порядка 2500 кв.см. Клетки из которых состоит кора называются нейронами (от греческого neuron - нерв). Нейроны являются своеобразными биологическими процессорами (Рис. 1.1). Кора содержит астрономическое количество нейронов, порядка ~ 1011, и при этом каждый нейрон связан с несколькими тысячами других нейронов, так что общее число взаимосвязей имеет порядок 1014 — 1015, При этом нейроны являются достаточно медленными процессорами. Длительность событий в нейронах измеряется в милисекундах (10-3 сек) в то время в кремневых элементах в наносекундах (10-9 сек), так что современные кремневые логические элементы на 5-6 порядков быстрее реакции нейронов. Вместе с тем эта медлительность нейронов компенсируется их гигантским количеством связей меду ними. Таким образом, огромная по числу связей биологическая нейронная сеть и есть основа биокомпьютера мозга.

Нейрон содержит два типа древоподобных отростка: аксон (axon) и дендриты (dendrites), Важная функция нейрона, которая отличает его от других клеток — это способность преобразовывать информацию. Аксон, это длинный отросток, по которому могут распространяться импульсы, которые называются потенциалами действия, В конце аксон разветвляется на волокна заканчивающиеся синапсами. Импульс, пришедший на синапс, меняет общий потенциал клетки в сторону уменьшения или увеличения в зависимости от эффективности синапса. Эффективность синапса настраиваемая величина, поэтому синапсы могут обучаться с помощью происходящих с ними процессов. Таким образом, синапсы это

synapse

axon

cell body

dendrites

Рис. 1.1. Схема биологического нейрона

биологическая основа памяти живых организмов.

Биологические нейронные сети являются уникальной основой интеллектуальной

кремниевый компьютер. Поэтому представляется перспективным создать искусственные структуры, моделирующие биологический нейрокомпьютер. Искусственные нейроны, которые используются в настоящее время дня создания нейронных сетей, гораздо более просто устроены чем их биологические аналоги. Нейронные сети, будут примитивны но сравнению с корой головного мозга. Однако, несмотря на это, за последние два десятилетия произошел большой прорыв в области исследования и применения искусственных нейронных сетей,

1.2 Искусственные нейронные сети

В предыдущем пункте было кратко очерчено строение системы обеспечивающей высшую нервную деятельность человека. Очевидно, что эта система способна решать сложные интеллектуальные задачи, самой простой из которых можно назвать классификацию изображений. Возникает интерес создание искусственных систем способных решать подобные задачи.

Определение искусственного математического нейрона.

Искусственный нейрон это элементарный процессор, действие которого состоит во взвешенном суммировании входных сигналов нейрона, с последующим воздействием функции активации на превышение полученной суммы над заданным пороговым значением. В результате этого воздействия получается выходной сигнал, нейрона.

Здесь |жг}™=1 набор входных сигналов, {и>г}™=1 набор весовых коэффициентов нейрона, д -пороговое значение нейрона, ^(я) - функция активации нейрона, а у -выходной сигнал нейрона.

деятельности человека. При этом их устройство совсем не похоже на цифровой

Словесному описанию соответствует следующая простая формула:

(1.1)

Изначально, когда Уоррен МакКаллок и Уолтер Пнтте в 1943 году придумали искусственный нейрон [15], предполагалось, что он действует по принципу «все или ничего», то есть функция активации должна быть ступенчатой функцией:

| 1 если х > 0; 0(х) = о " ;

I 0 иначе.

Это было продиктовано аналогией с работой реального биологического нейрона, в котором выходной сигнал, распространяющийся по выходному отростку аксону, возникает только тогда, когда внутренний потенциал клетки превысит некоторый порог. Однако в теории искусственных нейронных сетей оказалось более удобным считать функцию активации непрерывной функцией и обычно в качестве ^(х) выбирается так называемая сигмоидпая функция а(х), Под еигмоидной функцией в широком смысле, мы будем понимать непрерывную, монотонно возрастающую функцию, с пределами: а(х) ^ а+ при х ^ и а(х) ^ а- при х ^ —то, где а± - некоторые фиксированные значения, которые чаще всего выбираются а+ = 1 и а- = 0 ,

Однако, как правило на практике используется сигмоидпая функциия в узком смысле, а именно а(х) это функция даваемая выражением:

а(х)

1 + е-х

Таким образом, нейрон задается числом входов и, набором весовых коэффициентов {и>г}™=1 , пороговым значением §, и функцией активации ^(х). Можно упростить обозначения и избавиться от особой роли порогового значения § в формуле (1,1) с помощью следующего приема. Добавим нейрону дополнительный входной канал с номером г = 0, будем считать, что входной сигнал по этому каналу всегда равен — 1. То ееть хо = —1. Примем, что весовой коэффициент этого канала равен §, то есть w0 = §, тогда

—§ = w0 (—1) = w0 х0

В таком случае можно переписать формулу (1.1) действия нейрона в виде:

у = Р (^Ь Wi х^ . (1-2)

Многослойный персептрон

Искусственная нейронная сеть представляет собой некоторую совокупность нейронов, связанных друг с другом таким образом, что выходные сигналы одних нейронов поступают на входы других. Кроме того, нейронная сеть, как правило, имеет некоторое количество входных узлов, на которые можно подавать входные сигналы извне, а также ряд нейронов объявляются выходными узлами сети и из выходных сигналов этих нейронов формируется выходной вектор сети. Таким образом, возникает некоторая «машинка», которая по входному вектору х вырабатывает выходной вектор у:

у = NN (х) 10

(1.3)

Рис. 1.2. Многослойный персептроп

Математически, нейронную сеть можно описать как направленный граф, вершинами которого являются либо нейроны, либо входные узлы, а ребрами являются связи между нейронами, характеризуемые весовыми коэффициентами. Направленность означает, что каждое ребро ориентировано и положительное направление это направление от выхода одного нейрона к входу другого. Заранее понятно, что свойства отображения у = NN(х) существенно зависит от топологии этого графа, а именно какие нейроны с какими связаны, есть ли у этого графа замкнутые петли и т.д.

Мы начнем с того, что рассмотрим нейронную сеть с топологией наиболее простого вида. Это так называемый многослойный пер септ,р он, общий вид которого, представлен на Рис. 1.2 ([14], стр 219). Многослойный персептрон это частный случай так называемых сетей прямого распространения (feedforward neural networks), которые характеризуются тем, что в этих сетях информация передается только «вперед». Это, в частности, означает, что у таких сетей отсутствуют замкнутые петли и все нейроны можно перенумеровать так, что каждый нейрон будет получать информацию только от нейронов с меньшими номерами. В многослойном персептроне выполняется еще более жесткое требование: нейроны разделены на слои и при этом каждый нейрон может получать сигналы только от нейронов предыдущего слоя, что собственно и изображено на Рис.1.2. Для описания реккурентных формул определяющих работу многослойного персептрона введем следующие обозначения.

yf1 - выходной сигнал i -го нейрона, расположенного в слое с номером l . При этом i = 0,..., Ni, где N - число нейронов в слое с номером l.

Индекс l пробегает значения от 0 до L - числа слоев в персептроне, при этом слой с номером

l=0

Поэтому yi0 = Xi, где х входной вектор сети, a N0 = n, оде n традиционно есть обозначение для размерности входного вектора.

l=L

передают свои сигналы другим нейронам, а формируют выходной вектор сети : yi0 = yi, при этом Nl = m, оде m размерность выходного вектора у.

uWij - j - ый весовой коэффициент i -го нейрона, расположенного в слое с номером l. Используя эти обозначения можно описать «работу» многослойного персептрона следующим набором уравнений:

,(1)

NI-

Е wíj) уГ;

(1.4)

(1.5)

]=0

где индекс I пробегает значения от 1 до Ь, Осталось заметить, что для всех I кроме I = Ь, у01) = —1 тем самым мы избавляемся от необходимости явно выписывать пороговые значения нейронов. Допускается, что функции активации нейронов в разных слоях могут быть различными, что отражено в первом уравнении посредством индекса I у функции активации. Заметим так же, что часто вместо Ь вводят параметр И = Ь — 1 - число, так называемых скрытых слоев многослойного персептрона.

Таким образом, чтобы полностью описать многослойный персептрон, нужно задать топологию:

Т = {Ь, N0 = и, N1, N2,..., = т}, вектор весовых коэффициентов:

IV = ^(1)

1]

и набор функций активации для каждого слоя:

{^ (1)(х),...,^ (1)(х)}

Мы будем символически обозначать это следующим образом

у = NN(х; {Т,Ж,Р}).

(1.6)

Обучение многослойного персептрона

Идея применения многослойных персептронов состоит в следующем. Пусть мы имеем дело с некоторым нетривиальным многомерным отображением:

Ф : Яп ^ Кт

или в обычных обозначениях у = Ф(х), Приведем возможные примеры таких отображений.

Пример 1. Зависимость аэродинамических характеристик самолета от геометрии его планера и от условий полета. Вектор х в этом случае задаются фиксированным набором параметров - число Маха, угол атаки, форма крыла в плане, форма фюзеляжа и т.д., а вектор у это аэродинамические коэффициенты Сх, Су и т.д.

Пример 2. Толщина наледи на дорожном покрытии как функция температуры воздуха в данной местности, влажности воздуха, скорости ветра, температуры точки росы и т.п..

Пример 3. Цепа фьючерса Б&Р в момент закрытия торгов па чикагской бирже СВОТ, как функция поведения рынка в течение всей торговой сессии.

Понятно, что в описанных примерах, зависимости нетривиальны, и чтобы получить их из первых принципов нужно в первых двух примерах решать сложные уравнения механики

сплошных сред, а в последнем примере с фьючерсом, таких уравнений просто не существует, и само существование зависимости можно подвергнуть сомнению, С другой стороны, быстрое и правильное вычисление таких зависимостей может быть крайне полезно в приложениях.

Суть «нейросетевом» подхода состоит в том, чтобы не эмалировать сложные зависимости из первых принципов, а попытаться найти подходящий многослойный персептрон, который бы с достаточной точностью воспроизводил искомую зависимость. Но как его найти? Идея состоит в использовании процедуры обучения на примерах. Опишем эту процедуру.

Пусть есть множество примеров действия изучаемого отображения

Рр = {х (к),1 (к)}Р=1

здесь Ь(к) = Ф(х(к)) для каждого ^аР - число примеров. Эти примеры могут быть получены «из эксперимента», (например, из аэродинамической трубы, в случае самолета), или с помощью сложной компьютерной программы.

Пусть теперь NN(х; {Т, Ш, Г}) обучаемый персептрон с правильными значениями и и т, тогда для каждого к мы можем по задан ному х(к) вычислить «ответ» переептрона:

у(к) = NN(х(к); {Т,Ш,Г})

(к) к

(к) = (к)

неосведомленности» переептрона с помощью подходящей функции ошибки Е(РР, {Т,Ш,Г}). Например

Р т

Е(Рр, {Т, Ш, Г}) = ЕЕ (уг(к) — 1г(к))2. к=1 1=1

Очевидно, что при таком выборе функции ошибки, чем точнее персептрон воспроизводит нужную зависимость, тем меньше значение функции ошибка Е , в идеале Е = 0, Поэтому,

Е

Е(Рр, {Т, }) ^ ш1п.

Если из каких-то соображений, мы можем заранее выбрать и зафиксировать топологию Т сети и набор функций активации Г, то задача построения подходящего многослойного переептрона сводится к минимизации функции

Е = Е (Ш).

Это функции фиксированного числа действительных переменных, и задаче её минимизации может решаться стандартными методами поиска экстремума функций, определенных в области Яп (градиентный спуск, метод сопряженного градиента и т.д.). Однако, на пути реализации этой программы мы можем натолкнуться на два «подводных камня», на две проблемы.

Проблема 1. С математической точки зрения, функциональная зависимость реализуемая многослойным персептроном достаточна проста. Несколько символически она описывается выражением:

NN(х) = Г(ь) (Е w(L)F(ь-1) (Е w(1-1)Г(ь-2) (...

...F(£w™*)))).

Это композиция одномерных отображений F(1)(x) с линейными преобразованиями, то есть е умножением на число и сложением. Это достаточно бедная структура. Математика знает гораздо более замысловатые отображения. Поэтому возникает вопрос: Любое ли многомерное непрерывное отображение Ф : Rn ^ Rm может быть с достаточной точностью приближено многослойным персептроном?

Проблема 2. Используя процедуру обучения, строим многослойный переептрон NN(х) по дискретному и конечному набору примеров:

pp = {х(k), t(k)}P=1

Поэтому возникает вопрос. Будет ли многослойный переептрон, построенный е помощью оптимизационной процедуры

E(Pp, {f,W,F}) ^ min

давать «правильные ответы» для тех входных векторов x в которых функция E ни разу не вычислялась?

Говоря другими словами, будет ли отображение NN(х) задаваемое многослойным персептроном обладать достаточной обобщающей способностью (generalization ability). Этот второй вопрос, не менее важен, так как вея идея использования нейронных сетей на практике основана на надежде, что нейронная сеть будет давать правильные ответы для входных векторов, которых нейронная сеть «не видела» при обучении. Давайте обсуждать эти проблемы.

Теорема Колмогорова. Многослойный переептрон^ универсальный

аппроксиматор

Первая проблема связана с 13 проблемой Гильберта, Проблемы Гильберта - это список из 23 кардинальных проблем математики представленный Давидом Гильбертом на II Международном Конгрессе математиков в 1900 году, (На данный момент решены 16 проблем из 23), К нашей теме имеет отношение 13 проблема, которая изначально формулировалась так:

Существует ли непрерывная функция трех переменных, которую нельзя,

представить в виде суперпозиции функций двух переменных?

В 1957 году В,И, Арнольд [16], ответил на этот вопрос отрицательно, доказав следующую теорему

Любая, заданная, на, единичном кубе E3 действительная, непрерывная функция

f (x1,x2,x3) может быть представлена в виде

33

f(xi,x2,x3) = hij [pij(xi,x2),x3)]

i=i j=i

где функции двух переменных hij , действительны и непрерывны.

Однако в том же году Л.11. Колмогоров существенно усилил результат Арнольда и доказал следующую теорему [17]. Теорема

Любая, определенная на единичном кубе En, непрерывная функция f (x^x2,...,xn) может быть представлена в виде

2n+1 / n \

f (X1,X2, . . . ,Xn) = E Xq E ^ (Xp) (1J)

q=1 \p=1 /

gcte (x) непрерывные действительные функции на, отрезках [0,1], не зависящие от f, a, xq(x) функции действительные и непрерывные на R.

Эта замечательная теорема показала, что непрерывные функции многих переменных устроены не так уж сложно и их всегда можно представить в виде суперпозиции функций одной переменной и суммирования. Но эту теорему нельзя усилить, например, она не верна для гладких функций с любой степенью гладкости и для аналитических функций, представляемых своим рядом Тейлора, тоже. Формулу (1.7) можно интерпретировать с помощью колмогоровекого переептрона. Этот переептрон имеет входной слой с n узлами, скрытый слой с 2n + 1 нейронами которые имеют функциями активации xq (x) и один тривиальный нейрон в выходном слое, который имеет весовые коэффициенты равные 1 и тривиальную функцию активации y = x. При этом, вместо умножения на весовой коэффициент каждый колмогоровский нейрон подвергает свои входные сигналы нелинейному нетривиальному преобразованию -0pq (x). Таким образом, теорему Колмогорова можно переформулировать следующим образом. Любое непрерывное отображение f : En ^ R может быть точно представлено колмогоровским персептроном. К сожалению, при всей своей математической силе и красоте теорема Колмогорова неприменима для практического построения нейронных сетей. Это связано с тем, что функции (x) негладкие и трудно вычислимые. Алгоритмов подбора xq (x) тоже нет.

Ситуация существенно меняется если ослабить требования и вместо точного представления функции f : En ^ R потребовать лишь приближенного описания с заданной точностью. Тогда оказывается верна следующая теорема, доказанная почти одновременно в 1989 году следующими авторами: Horniek, Stineheombe, White [18], Cvbenko [19], Funahashi [20].

Теорема (Многослойный переептрон - универсальный аппроксиматор)

Для, любой f (x1, x2,..., xn) непрерывной функции на, En и для, любого е > 0 найдется целое число H > 0 и набор действительных чисел W = wj1^ w(2), что функция

н / n \

NN(X1, X2, . . . , Xn) = E w(2) E wj1) Xj + wj2) (1.8)

i=1 \j=0 J

'такая, что |f (x1,x2,...,xn) — NN(x1,x2,... ,xn)| < е на, En. Здесь a(1)(x) = a(x) - фиксированная сигмоидная функция в широком смысле, а функция активации выходного нейрона тривиальна a(2»(x) = x.

1.3 Метод обратного распространения ошибки

После того как мы подвели теоретическую базу под применение нейронных сетей в задачах аппроксимации многомерных функций, перейдем к вопросу практического построения персептрона с нужными свойствами. Для этого необходимо найти такой набор параметров 9 = {Т, \¥, Р} персептрона, для которого ошибка обучения:

Р т

Е(Рр, {Т, Ш, Р}) = - £ - ¿г(к))2 (1.9)

на заданном обучающем множестве PP = {x(k), t(k)}p=1 достигала бы как можно меньшего значения. Мы превратим эту задачу в стандартную задачу оптимизации функции на Rn, если предположим, что топология нейронной сети и функции активации нейронов в слоях выбраны заранее из каких-то эвристических соображений и затем уже не меняются в процессе обучения. Тогда нам нужно минимизировать функцию ошибки, как функцию вектора весовых коэффициентов:

P m

E(W) = 2 EE(yi(k) - ti(k))2, k=1 i=1

где W = {w(1),...,w(L)}, Стандартный подход для поиска минимума функции это метод градиентного спуска (gradient descent method), суть которого состоит в том, чтобы в процессе итерационной процедуры использовать значение градиента функции, В нашем случае это означает, что адаптировать весовые коэффициенты мы будем по правилу:

wj (t +1) = wg^ + Aw^t), Awj(t) = -n (dE/dj + ^Д wj(t - 1)) .

Здесь t - номер шага итерации, a n и № некоторые настраиваемые коэффициенты, первый из которых n называется темпом обучения (learning rate) и выбирается достаточно малым ( 0, 001 — 0,1), а второй -«моментумом» (momentum) и этот коэффициент должен удовлетворять условию 0 < ^ < 1, Таким образом, для реализации обучения персептрона методом градиентного спуска, мы сталкиваемся с задачей вычисления градиента функции ошибки для многослойного персептрона. Оказывается существует замечательный алгоритм, позволяющий очень эффективно вычислять производные функции ошибки по веем весовым коэффициентом. Этот алгоритм был открыт в 1986 году Румельхартом, Хинтоном и Уильямсом [23, 24, 25] и получил название «метод обратного распространения ошибки» (Back Propagation Errors method).

Приведем формулы описывающие работу многослойного персептрона без детальной расшифровки символов

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Дорофеев Федор Евгеньевич, 2025 год

Литература

[1] E.A.Dorofeyev, V.V.Romanov, Yu.N.Sviridenko Application of Neural Networks Technology to Aerodynamic Problems, International Symposium on Aeronautical Sciences near Aviation Technologies of the XXI century, Flight Safety as a Pledge of Success, Zhukovsky, Russia, 17 - 22 August 1999,

[2] E.A.Dorofeyev, Yu.N.Sviridenko, The application of replicator neural networks to the problems of aerodynamic design of aircraft components. International Symposium on Aerospace Technologies of the XXI century: New Challenges in Aeronautics, Zhukovsky, Russia, 14 - 19 August 2001,

[3] Дорофеев E. А., Свириденко Ю. H. Применение искусственных нейронных сетей в задачах аэродинамического проектирования и определения характеристик летательных аппаратов // Труды ЦАГИ, - 2002. - Вып. 2655.

[4] Дорофеев Е. А., Свириденко Ю. Н. Введение в нейроинформатику// Труды ЦАГИ. — 2008.

— Вып. 2678.

[5] Галкин В. С., Гладков А. А. О подъемной силе при гиперзвуковых скоростях// IIMM. — 1961. - Т. 25. - Вып. 6. - С. 1138-1139.

[6] Галкин В. С. О подъемной силе в свободномолекулярном потоке// IIMM. — 1962. — Т. 26.

— Вып. 3, — С. 567.

[7] Горелов С. Л., Могорычная А. В. О подъемной силе в потоке разреженного газа // IIMM. 2022, - том 86. - № 2. - С. 196-202

[8] Гусев В. Н., Ерофеев А. И., Климова Т. В. Перепухов В. А. Рябов В. В., Толстых А. И. Теоретические и экспериментальные исследования обтекания тел простой формы гиперзвуковым потоком разреженного газа // Труды ЦАГИ. — 1977. — Вып. 1855. — С. 43.

[9] Галкин В. С., Ерофеев А. И., Толстых А. И. Приближенный метод расчета аэродинамических характеристик тел в гиперзвуковом разреженном газе // Труды ЦАГИ. - 1977. - Вып. 1833. - С. 6-10.

[10] Коган М. Н. Динамика разреженного газа. М,: Наука. 1967. 440 с.

[11] Гуревич А. В., Питаевский Л. П., Смирнова В. В. Ионосферная аэродинамика // Успехи физических наук. - 1969. - Т. 99. -Вып 1. -С. 3-49.

[12] Альперт Я. Л., Гуревич А. В., Питаевский Л. П. Об эффектах, вызываемым иекуетвенным спутником, быстро бвижущимея в ионосфере или межпланетной среде // Успехи физических наук, — 1963, — Т. 79, — Выи 1, — С, 23-79,

[13] Дорофеев Е. А., Свириденко Ю. Н., Введение в нейроинформатику,// Труды ЦАГИ, - 2008,

- вып. 2678 с,3-16,

[14] Хайкин С. Нейронные сети: полный курс, М,: ООО "И.Д. Вильяме", 2016 — 1104,

[15] МакКаллок У., Питтс У, Логические исчисления идей, относящихся к нервной деятельности. Автоматы, М,: ИЛ, 1956,

[16] Арнольд, В. И., О функциях трех переменных Доклады АН СССР, - 1957, - Т. 111. № 4,

- С. 679 - 681.; В. И. Арнольд, О представлении функций нескольких переменных в виде суперпозиции функций меньшего числа переменных, Мат. Просвещение, Сер. 2, вып. 3, (1958), 41-61. http://ilib.mccme.ru/djvu/mp2/mp2-3.htm

[17] А. Н. Колмогоров, О представлении непрерывных функций нескольких переменных в виде суперпозиций непрерывных функций одной переменной и сложения // ДАН СССР. — 1957.

- Т. 114, вып. 5. - С. 953-956.

[18] Hornik, К. , Stinchcombe, М. and White, Н. , "Multilayer feedforward networks are universal approximations", Neural Networks, vol.2, pp359-366 (1989).

[19] Cybenko, G., "Approximation by superpositions of a sigmodial function", Mathematics of Control. Signals and Systems, vol.2, pp303-314 (1989).

[20] Funahashi, К., "On the approximate realization of continuous mappings by neural networks", Neural Networks, vol. 2.3, pp. 183-191 (1989).

[21] Barron A.R., Universal approximation bounds for superpositions of a sigmoidal function. IEEE Transactions on Information Theory, 39, 930-945, 1993.

[22] Barron A.R., Approximation and estimation bounds for artificial neural networks. Machine Learning, 14, 115-133, 1994.

[23] Rumelhart David E., Hinton Geoffrey E., Williams Ronald J. "Learning representations by back-propagating errors". Nature. 323 (6088): 533-536, 1986.

[24] David E Rumelhart, Geoffrey E Hinton, Ronald J Williams, et al. Learning representations by backpropagating errors. Cognitive modeling, 5(3):1, 1988.

[25] Rumelhart D. E., Hinton G. E., Williams R. J. "Learning internal representations by errors propagation". Parellel Distributed Processing. Vol 1: Foundation, Cambridge, MA, USA: MIT Press, 1986.

[26] M. Riedmiller and H. Braun, "A direct adaptive method for faster backpropagation learning: The EPEOP algorithm," Proc. IEEE Int. Conf. On Neural Network, pp. 586-591, 1993.

[27] D. P. Kingma, J. L. Ba, "Adam: A Method for Stochastic Optimization". arXiv:1412.6980 2014

[28] Аврутский В. И. Алгоритм увеличения точности нейронных сетей и его приложения: дисс. ... канд. физ.-мат. наук: 05.13.18/ Аврутский Всеволод Игорьевич, — Долгопрудный, 2021.

- 118 с.

[29] Карась О. В., Ковалев В. Е., Свириденко Ю. Н. Определение аэродинамических характеристик магистрального пассажирского самолета на крейсерском режиме. // Труды ЦАГИ, - 2008,- Вып. 2678,- С.25

[30] Верпштейп A.B., Вышинский В.В., Кулешов А.П., Свириденко Ю.Н. Быстрый метод аэродинамического расчета для задач проектирования. // Труды ЦАГИ. —2008,— Вып. 2678.

- С. 35.

[31] Дорофеев Ф. Е. Применение нейронных сетей для определения аэродинамических характеристик малых космических аппаратов.//Труды 62-й Всероссийской научеой конференции МФТИ. Аэрокосмические технологии М.:МФТИ, 2019 — С. 245 - 247.

[32] Дорофеев Ф. Е., Дорофеев Е. А. Применение нейронных сетей для определения аэродинамических характеристик малых космических аппаратов.// Труды МФТИ,— 2020. Т. 12,- № 2, - С. 141 - 149.

[33] Василенко Д. А., Дорофеев Ф. Е., Дорофеев Е. А. Построение нейросетевого аппрокеиматора для определения критического угла полураствора в эффекте смены знака коэффициента подъемной силы для затупленных конических тел // Труды МАИ. — 2021. — Вып. 119.

[34] Горелав С. Л., Дорофеев Ф. Е. Эффект изменения знака подъемной силы для степенных тел вращения// Вестник Московского государственного областного университета. Серия: Физика-математика. —2022,—Выи 2. — С. 42-50.

[35] Дорофеев Ф. Е., Дорофеев Е. А. Применение формул Галкина для исследования эффекта смены знака коэффициента подъемной силы оеееимметричных тел// Труды 65-й Всероссийской научеой конференции МФТИ. Аэрокосмические технологии М.:МФТИ, 2023

- С. 265 - 267.

[36] Дорофеев Ф.Е., Дорофеев Е.А. Применение формул Галкина для исследования эффекта смены знака коэффициента подъемной силы оеееимметричных тел // Труды МФТИ. 2023. Том 15, № 4.

[37] Гурник В. В., Дорофеев Ф. Е. Применение нейронных сетей глубокого обучения для определения аэродинамических характеристик малых космических аппаратов// Труды 65-й Всероссийской научеой конференции МФТИ. Аэрокосмические технологии М.:МФТИ, 2023

- С. 251 - 252.

[38] Свид. 2023615373 Российская Федерация. Вычислитель аэродинамических характеристик тел по триангуляции методом локального давления/ заявители и правообладатели Дорофеев

E.A.(RU), Дорофеев O.E.(RU), Горелов С.. I.(ИГ). Жаров B.A.(RU). — №2023612633; заявл. 11,02,2023; опубл. 14,03,2023, Реестр программ для ЭВМ. — 1 с.

[39] А. В. Верпштейп, В. В. Вышинский, А. П. Кулешов, and Ю. Н. Свириденко. Быстрый метод аэродинамического расчета для задач проектирования. Труды ЦАГИ, (2678):35, 2008. 113

[40] А. В. Вернштейн, Е.В. Вурнаев, Е. А. Дорофеев, Ю. Н. Свириденко, and СС Чернова. Построение адаптивных суррогатных моделей сложных объектов на основе анализа данных, 2009.

[41] A Bernstein, Е Burnaev, S Chernova, Е Dorofeev, and Yu Sviridenko. On solving some data analysis problems encountered in the construction of adaptive surrogate models of complex objects. Artificial Intelligence, 4:40. 48, 2008.

[42] Ю. H. Свириденко. Применение искусственных нейронных сетей в задачах прикладной аэродинамики. Авиакосмическое приборостроение, (2):3-8, 2015.

[43] Е. А. Дорофеев, А. И. Дынников, А. В. Каргопольцев, Ю. Н. Свириденко, and А. С. Фадеев. Применение искус- ственных нейронных сетей для обработки и анализа данных аэродинамического эксперимента. Ученые записки ЦАГИ, 38(3-4), 2007

[44] VV Vyshinsky, YA Dorofeev, and Yu N Sviridenko. Fast aerodynamic design technologies. In 27th International Congress of the Aeronautical Sciences, 2010.

[45] E. А. Дорофеев and Свириденко Ю. H. Применение нейросетевых технологий в задачах аэродинамического проектирования и определения характеристик летательных аппаратов. In Модели и методы аэродинамики, pages 86-87, 2002.

[46] Peng W., Zhang Y. et al. Learning aerodynamics with neural network // Scientific Reports (12): 6779 (2022).

[47] Вышинский В. В., Кисловский А. О. Генератор компоновок малоразмерного летательного аппарата// Научный вестник МГТУ ГА. - 2016. - Т.19 -JV2 6 -С 95-101

[48] Catalani G., Agarwal S., Bertrand X. et al. Neural fields for rapid aircraft aerodynamics simulations. // Scientific Reports, 14, 25496 (2024).

[49] Мартынов А.К., "Экспериментальная аэродинамика", 1950

[50] LeCun Y., Bottou L., Bengio Y., Hajfner P. Gradient-Based Learning Applied to Document Recognition // Proc. of the IEEE. - 1998. - Vol. 86, No. 11. - P. 2278-2324.

[51] Simonyan K., Zisserman A. Very Deep Convolutional Networks for Large-Scale Image Recognition // arXiv preprint: 1409.1556 (2015).

[52] He K., Zhang X., Ren S., Sun J. Deep Residual Learning for Image Recognition. // Conference on Computer Vision and Pattern Recognition. arXiv:1512.03385. doi:10.1109/CVPR.2016.90 (2016).

[53] Ruder S. An Overview of Gradient Descent Optimization Algorithms // arXiv preprint arXiv: 1609.04747 (2016).

[54] Diederik K., Jimmy B. Adam: A Method for Stochastic Optimization // arXiv preprint: 1412.6980 (2014).

[55] Jiaqi H., Xiangwen L., Yiping W. DrivAer Transformer: A high-precision and fast prediction method for vehicle aerodynamic drag coefficient based on the DrivAerNet++ dataset // arXiv preprint arXiv: 2504.08217 (2025).

[56] Cao Z., Huang Q., Ramani K. 3D Object Classification via Spherical Projections. // Proc. of 3DV 2017, 201-210.

[57] Wang H., Quo Y., Wang Z. Face-Based CNN on Triangular Mesh with Arbitrary Connectivity. // Electronics, 11(15), 2466 (2022).

[58] Francs-Belda V., Solera-Rico A., Nieto-Centenero J. et al. Towards aerodynamic surrogate modeling based on ?-variational autoencoders. // arXiv: 2408.04969 (2024).

[59] Abueide-Armas A., Portal-Porras K., Fernandez-Gamiz U. et al. A Data Augmentation-Based Technique for Deep Learning Applied to CFD Simulations. // Mathematics, 9(16), 1843 (2021).

[60] Kuipers L., Niederreiter H. Uniform distribution of sequences, Dover Publications, p. 129, ISBN 0-486-45019-8 (2005).

[61] J. J. Hopfield , «Neural networks and physical systems with emergent collective computational abilities», Proceedings of National Academy of Sciences, vol. 79 no. 8 pp. 2554-2558, April 1982. PNAS Reprint (Abstract) PNAS Reprint (PDF)

[62] Daniel J. Amit, Hanoeh Gutfreund, H. Sompolinsky «Statistical mechanics of neural networks near saturation», Annals Physics Volume 173, Issue 1, January 1987, Pages 30-67

[63] С. Николенко, А. Кадурин, E. Архангельская , «Глубокое обучение», Издательство «Питер», СПб., 2019.

[64] R. К. Srivastova, К. Greff, J. Seh/midhuber, «Training Very Deep Networks», Proc. 28th NIPS, Cambridge, MA,USA: MIT Press, 2015., P. 2377-2385.

[65] C. Szegedy et al, «Going Deeper with Convolution», arXiv, 2014, vol.abs/1409.4842. Imp arxiv.org abh 1 109. 18 12

[66] K. Xe et al., Proc. 2016 CVPR, 2016,- P. 770-778

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.