Повышение эффективности методов генерации изображений мультимодальными нейронными сетями тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Воронов Антон Дмитриевич

  • Воронов Антон Дмитриевич
  • кандидат науккандидат наук
  • 2025, «Московский физико-технический институт (национальный исследовательский университет)»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 123
Воронов Антон Дмитриевич. Повышение эффективности методов генерации изображений мультимодальными нейронными сетями: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Московский физико-технический институт (национальный исследовательский университет)». 2025. 123 с.

Оглавление диссертации кандидат наук Воронов Антон Дмитриевич

Введение

Глава 1. Теоретические основы работы

1.1 Мультимодальные нейронные сети

1.2 Задача text-to-image

1.3 Диффузионные модели для генерации изображений

1.3.1 Диффузионный процесс с сохраняющейся дисперсией

1.3.2 Диффузионный процесс со взрывающейся дисперсией

1.3.3 Сопоставление потоков

1.3.4 Зоопарк диффузионных моделей

1.3.5 Classifier-free guidance

1.3.6 Практическое применение диффузионных моделей текст-картинка

1.4 Дистилляция диффузионных моделей

1.4.1 Прогрессивная дистилляция

1.4.2 Консистентная дистилляция

1.4.3 Состязательная дистилляция

1.4.4 Дистилляция с совпадением распределений

1.5 Авторегрессионные модели для генерации изображений

1.6 Способы представления изображений

1.6.1 Вариационный автокодировщик (VAE)

1.6.2 Автокодировщик с векторной квантизацией (VQ-VAE)

1.6.3 Автокодировщик с остаточной квантизацией (RQ-VAE)

Глава 2. Fusion Brain: новая мультимодальная архитектура и

датасет для сравнения мультимодальных моделей

2.1 Задачи и данные

2.1.1 Задача C2C. Машинный перевод между языками программирования

2.1.2 Задача ZsOD. Детекция объектов по произвольным текстовым описаниям

2.1.3 Задача ЫТЯ. Распознавание рукописного текста

2.1.4 Задача VQA. Ответ на вопрос по изображению

2.2 Архитектура решения

2.3 Эксперименты

2.3.1 Процедура обучения

2.4 Выводы по главе

Глава 3. Применение метода БРЕ для эффективного

представления изображений в мультимодальных

моделях

3.1 Метод

3.1.1 Преобразование изображений в текст

3.1.2 Эффективность кодирования

3.2 Эксперименты

3.2.1 Примеры сгенерированных изображений

3.2.2 Извлечение признаков из изображения для задач классификации

3.3 Выводы по главе

Глава 4. Создание модели для генерации изображений по текстовым описаниям методом авторегрессии по

масштабам

4.1 Метод

4.1.1 Базовая архитектура

4.1.2 Динамика обучения базовой архитектуры

4.1.3 Отказ от каузальной маски внимания в блоках Трансформера

4.1.4 Роль текстового обусловливания

4.2 Эксперименты

4.2.1 Данные и параметры обучения

4.2.2 Сравнение с существующими моделями

4.2.3 Эффективность генерации

4.2.4 Анализ архитектурных решений

4.3 Выводы по главе

Глава 5. Ускорение приложений диффузионных моделей для

задачи кастомизации изображений

5.1 Метод БУЛЯ

5.1.1 Анализ динамики обучения оригинальных методов

5.1.2 Исследование влияния случайных факторов на функцию потерь

5.1.3 Критерий остановки

5.2 Эксперименты

5.2.1 Модели и данные

5.2.2 Базовые методы

5.2.3 Результаты

5.2.4 Оценка людьми

5.2.5 Анализ и абляция

5.3 Выводы по главе

Заключение

Список сокращений и условных обозначений

Словарь терминов

Список литературы

Список рисунков

Список таблиц

Приложение А. Сопроводительные материалы для Главы

А.1 И-мера для задачи обнаружения объектов с описаниями на

естественном языке

А.2 Веса балансировщика для мультизадачного обучения

Приложение Б. Сопроводительные материалы для Главы

Б.1 Базовая архитектура

Б.2 Детали обучения для анализа

Б.3 Визуальное сравнение с другими генеративными моделями

Б.4 Сравнение эффективности для разрешения

Приложение В. Сопроводительные материалы для Главы

В.1 Индикаторы сходимости для других методов адаптации

В.2 Отслеживание сходимости методов для больших размеров батча

В.3 Пример кода для использования DVAR в обучении

В.4 Качественное сравнение

В.5 Анализ влияния интервала шагов диффузии для семплирования

на итоговые метрики

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Повышение эффективности методов генерации изображений мультимодальными нейронными сетями»

Данная работа посвящена повышению эффективности мультимодальных нейронных сетей, в частности сетей для генерации изображений по текстовым описаниям, с помощью новых подходов или улучшению текущих методов для решения этой задачи.

Актуальность темы исследований. Первые искусственные нейронные сети разрабатывались для обработки одного конкретного типа информации и для решения одной конкретной задачи. Однако с развитием этой научной области росло качество моделей, перед ними ставились всё более и более сложные задачи, требующие от нейросетей новых способностей, например возможность решать различные задачи или работать с различными типами представления информации (модальностями), такими как тексты, изображения, звуки, и т.д. Требование от искусственных нейронных сетей способности обрабатывать различные типы информации также подкрепляется сравнением с натуральным интеллектом, мультимодальным по своей природе. Воспроизведение такой способности в искусственном интеллекте приблизит его к интеллекту натуральному.

Одной из наиболее распространённых задач, требующих от нейросетей мультимодальности, в последнее время стала генерация изображений по текстовым описаниям (1ех1-1о-1ша§е). Эта область получила значительное внимание от научного сообщества в виду своей широкой практической значимости: качественная генерация по запросам (промптам) в свободной форме находит применение в дизайне, цифровом искусстве, сфере развлечений и маркетинга, а также в генерации и аугментации данных для других научных областей. Такая популярность привела к стремительному развитию данного направления, породив большое количество различных методов, наиболее продвинутые из которых достигают достаточно высокого качества в задаче 1ех14о-1ша§е.

В данной работе рассматриваются два наиболее успешных в последнее время подхода: авторегрессионая генерация (АР) и диффузионые модели (ДМ). Передовые модели из обоих семейств демонстрируют как превосходное визуальное качество так и высокое соответствие даже самым комплексным

промптам. Однако слабым местом обеих генеративных парадигм является их большая вычислительная сложность, в виду большого количества итераций генерации, на каждой из которых используются большие модели архитектуры Трансформер [1], размеры которых могут достигать порядка десяти миллиардов параметров.

Целью данной работы является повышение эффективности авторегрессионных и диффузионных нейронных сетей, предназначенных для решения задачи 1ех14о-:1ша§е, за счёт снижения как потребления памяти, так и количества шагов для генерации и/или обучения.

Для достижения поставленной цели необходимо было решить следующие задачи:

1. Исследовать актуальные мультимодальные архитектуры и методы генерации изображений и их приложения, чтобы выяснить потенциальные места для улучшений.

2. Разработать модификации авторегрессионных и диффузионных методов 1ех1-1о-1ша§е, сокращающие вычислительную стоимость их запуска.

3. Разработать модификацию метода дообучения диффузионных моделей, позволяющую снизить число итераций для сходимости.

4. Провести сравнительный анализ качества генерации предложенных модификаций с оригинальными методами и другими базовыми методами, чтобы убедиться, что эффективность удаётся повысить без потери в качестве.

5. Оценить и сравнить эффективность разработанных решений с исходными подходами.

6. Выложить в открытый доступ исходный код и веса моделей для воспроизведения изложенных результатов.

Научная новизна:

1. В работе [2] предлагается новый датасет для сравнения моделей и новая архитектура нейронной сети.

2. В работе [3] впервые показывается адаптация метода кодирования ВРЕ к визуальному домену и задаче генерации изображений.

3. В работе [4] проведено оригинальное исследование, выявляющие неэффективность в современных методах кастомизации

диффузионных генеративных моделей и предложен метод устраняющий её.

4. В работе [5] реализуется новая архитектура для задачи text-to-image, и впервые показывается авторегрессионная архитектура, сравнимая по качеству с диффузионными моделями, будучи гораздо эффективнее.

Научная значимость исследования состоит в системной проработке архитектурных и алгоритмических ограничений современных генеративных моделей. В работе предложены новые архитектурные подходы, обеспечивающие более эффективную генерацию изображений, адаптированы методы из других научных областей к специфике text-to-image моделей.

Практическая значимость работы заключается в снижении потребления памяти GPU, времени работы text-to-image моделей или времени их дообучения на задачу адаптации. Благодаря снижению требований к ресурсам и времени генерации или адаптации, полученные решения делают возможным использование современных генеративных технологий в реальных продуктах — от мобильных приложений до персонализированных креативных инструментов.

Методология и методы исследования. Для решения задач данного исследования использовались методы машинного обучения и глубокого обучения в областях естественной обработки языка и компьютерного зрения, анализ и оптимизация архитектур нейронных сетей на базе архитектуры Трансформер, методы сжатия и векторного представления данных, методы оценки качества генеративных моделей.

Основные положения, выносимые на защиту:

1. Предложена новая мультимодальная архитектура и датасет для оценки и сравнения мультимодальных нейронных сетей.

2. Предложена модификация метода пиксельной авторегрессионной генерации изображений по тексту на основе побайтового парного кодирования (Byte-Pair Encoding, BPE), ускоряющая обучение и генерацию без потери качества.

3. Предложена реализация новой архитектуры text-to-image модели, основанной на авторегрессии по масштабам (scale-wise), превосходящая по качеству другие АР модели, и сравнимая по качеству с диффузионными моделями, превосходя их по скорости в 4-7 раз.

4. Предложена модификация методов адаптации диффузионных моделей, позволяющая снизить время процедуры до 8 раз, без потери итогового качества и увеличивая обобщающую способность итоговой модели.

Степень достоверности результатов данной работы обеспечивается как численными экспериментами (подсчёт соответствующих метрик на валидационных датасетах), так и качественным анализом с помощью независимых разметчиков, получивших детальные инструкции для попарного сравнения методов.

Апробация работы. Основные результаты работы докладывались на следующих международных конференциях:

— Международная онлайн-конференция AI Journey, 2021, Москва, Россия.

— Workshop on Performance and Interpretability Evaluations of Multimodal, Multipurpose, Massive-Scale Models (MMMPIE), 2022, Gyeongju, Republic of Korea.

— The Thirty-Sixth Annual Conference on Neural Information Processing Systems, 2023, New Orleans, USA.

— The IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2025, Nashville, USA.

Основные результаты по теме диссертации изложены в 4 работах, 1 из которых готовится к публикации, 1 — издана в журнале из собственного перечня МФТИ, 2 — в тезисах докладов научных конференций по машинному и глубокому обучению.

Личный вклад. В работе [2] автор участвовал в постановке сравнительных экспериментов для обоснования выбора итоговой архитектуры и в проведении сравнения с базовыми методами. В работе [3] автор проводил сравнение эффективности генерации предложенным методом против базовых методов, а также занимался исследованием выразительности признаков моделей обученных предложенных методом. В работе [4] автор принимал лидирующее участие: провёл теоретический анализ исходных методов, обнаружив причины их неэффективности, предложил идею по их модификации, написал код для воспроизведения исходных методов и реализовал предложенную модификацию. В работе [5] автор принимал лидирующее участие: написал большую часть кода для обучения и запуска модели, выполнил все основные численные эксперименты, и сравнения

с базовыми методами как по визуальному качеству генерации, так и по эффективности запуска модели.

Объем и структура работы. Диссертация состоит из введения, пяти глав, заключения и приложений. Полный объем диссертации — 123 страниц текста с 23 рисунками и 14 таблицами. Список литературы содержит 109 наименований.

Одна из задач искусственных нейронных сетей — это репликация человеческих способностей к восприятию, обработке и передаче информации, то есть моделирование таких когнитивных функция как зрение, слух, осязание, речь, и др. Типы обрабатываемой информации называются модальностями. К распространённым модальностям относятся изображения, аудио, тексты и видео.

По мере развития методов машинного и глубокого обучения нейросети достигли высоких результатов в решении унимодальных задач. Следующим шагом для приближения искусственного интеллекта (ИИ) к человеческому разуму стало развитие мультимодальных систем, способных как и люди интегрировать информацию из различных модальностей для решения более сложных задач. Более того, совместное обучение на данных разных типов позволяет моделям извлекать более универсальные и обобщённые представления, что может улучшить качество решений и повысить эффективность обучения.

К мультимодальным задачам принято относить те, в которых:

— на вход подаются данные из более чем одной модальности (например, задача ответа на вопрос по изображению (VQA), где модель получая на вход изображение и текстовый вопрос, должна сгенерировать текстовый ответ);

— модальность входных данных отличается от модальности выходных (например, генерация изображения по текстовому описанию);

— одновременно присутствуют обе ситуации (например, распознавание эмоций по видео и аудио).

Современные достижения в области глубокого обучения во многом опираются на архитектуру Трансформер [1], основу которой составляет механизм внимания (Attention) [6]. Эта архитектура показала высокую эффективность в унимодальных задачах, позволяя получать качественные

представления за счёт способности внимания моделировать взаимосвязи между элементами входной последовательности. Поэтому подавляющее большинство современных мультимодальных моделей базируется на этих принципах и в общем виде может быть представлено в виде:

1. Унимодальные энкодеры — преобразуют данные каждой модальности в последовательности векторов (эмбеддингов). Чаще всего реализуются на основе трансформеров, предобученных на соответствующих унимодальных задачах.

2. Модуль слияния (fusion module) — осуществляет интеграцию информации из разных модальностей. На практике может быть реализован с помощью конкатенации эмбеддингов, кросс-модального внимания (cross-attention), либо более сложных архитектурных решений.

3. Задача-специфические декодеры — преобразуют объединённое мультимодальное представление в выходной формат, соответствующий конкретной задаче (например, генерация текста или изображения, классификация, предсказание координат, и т.д.).

Всевозможные комбинации различных способов реализовать каждый из этих трёх модулей приводит к многообразию всех мультимодальных архитектур. Для сравнения опишем несколько наиболее популярных архитектур.

CLIP [7] — обученная на ^400 миилионах пар «изображение-текст» модель, состоящая из двух отдельных энкодеров: ViT [8] или ResNet [9] для изображений и Трансформер для текста, приведённых в общее эмбеддинговое пространство с помощью контрастивной функции потерь. За счёт объединённого пространства для представлений изображений и текстов позволяет решать как задачи кросс-модального поиска, так и классификацию.

Flamingo [10] — мультимодальная архитектура, использующая замороженные визуальный энкодер и предобученную языковую модель, объединённые посредством обучаемых блоков взаимного внимания (cross-attention). Такой подход позволяет достичь высокого качества обучая лишь незначительную часть от общего числа параметров.

Perceiver [11—13] — класс архитектур, основанных на использовании латентных переменных, которые взаимодействуют со входными данными

различных модальностей через механизм взаимного внимания. Это позволяет снизить квадратичную сложность и эффективно масштабироваться на больших входах, таких как изображения высокой размерности или аудиопоследовательности.

В заключение отметим, что пространство возможных архитектурных решений в мультимодальном моделировании остаётся чрезвычайно широким. Разработчик может выбирать состав используемых модальностей, конкретные задачи, которые будет решать модель, способ обучения и дообучения, а также подходы к реализации каждого из трёх ключевых компонентов: унимодальных энкодеров, механизма слияния и задаче-специфических декодеров.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Заключение диссертации по теме «Другие cпециальности», Воронов Антон Дмитриевич

В данной работе мы предложили метод DVAR — простой и универсальный критерий ранней остановки для задач персонализации диффузионных моделей для генерации изображений по текстовым описаниям. Наш метод не требует промежуточного семплирования изображений и дополнительных метрик, что делает его вычислительно эффективным и легко применимым к различным архитектурам и сценариям.

Эксперименты на трёх популярных методах адаптации (Textual Inversion, DreamBooth-LoRA и Custom Diffusion) показали, что DVAR позволяет существенно сократить количество итераций и общее время обучения без ухудшения качества сгенерированных изображений. Более того, за счёт адаптивного выбора момента остановки он помогает снизить риск переобучения, тем самым повышая обобщающую способность адаптируемой модели.

Человеческая оценка подтвердила, что результаты, полученные с использованием DVAR, воспринимаются как сопоставимые или лучшие по сравнению с базовыми методами.

Таким образом, DVAR может служить практичным инструментом для ускорения и стабилизации адаптации диффузионных моделей под новые концепты, сохраняя при этом качество и снижая вычислительные затраты.

В диссертационной работе проведено комплексное исследование методов повышения эффективности мультимодальных нейронных сетей, ориентированных на задачу генерации изображений по текстовым описаниям. Основным достижением работы является существенное снижение вычислительной сложности и ускорение процедур генерации и адаптации моделей. Это было реализовано путём решения ряда задач: анализа современных архитектур для выявления «узких мест», разработки метода эффективного пиксельного представления, создания новой архитектуры с авторегрессией по масштабам, а также предложения критерия ранней остановки (БУЛИ,) для адаптации диффузионных моделей, что в совокупности обеспечило более эффективное обучение и выполнение моделей. Экспериментально подтверждено, что предложенные решения обладают преимуществами по сравнению с базовыми методами, что демонстрирует их практическую значимость, заключающуюся в снижении требований к вычислительным ресурсам и памяти.

На основе полученных результатов можно сформулировать рекомендации для последующих исследований и прикладных разработок. В задачах попиксельной генерации целесообразно использовать предложенный метод с ВРЕ-токенизацией для сокращения шагов генерации. При проектировании новых архитектур перспективным представляется принцип авторегрессии по масштабам, обеспечивающий баланс между качеством и скоростью. Для ускорения адаптации диффузионных моделей рекомендуется применять критерий БУЛИ для ранней остановки, что позволяет в несколько раз сократить время до сходимости.

Несмотря на достигнутые результаты, проведённое исследование имеет ряд ограничений, характерных для рассматриваемых методов. Предложенная адаптация метода ВРЕ для пиксельных представлений изображений, хотя и демонстрирует эффективность в сокращении длины последовательности, требует тщательного подбора размера словаря и стратегии слияния токенов, что может ограничивать его универсальное применение. Архитектура с авторегрессией по масштабам сохраняет фундаментальное

ограничение последовательной генерации, что создаёт узкие места при переходе к сверхвысоким разрешениям (1024x1024 и выше) по сравнению с однопроходными или диффузионными моделями. Критерий ранней остановки DVAR, несмотря на эффективность в ускорении адаптации, был валидирован на ограниченном наборе задач и архитектур, что требует дополнительных исследований его применимости для других методов адаптации. Архитектура Fusion Brain, являясь значительным шагом к универсальным мультимодальным системам, сталкивается с проблемами оптимизации и балансировки многозадачного обучения, что может ограничивать её производительность в специфических доменах. Эти ограничения задают направления для будущих исследований в области эффективных генеративных моделей.

Список литературы диссертационного исследования кандидат наук Воронов Антон Дмитриевич, 2025 год

1. Attention is all you need / A. Vaswani [et al.] // Advances in Neural Information Processing Systems 30. — 2017. — Vol. 1. — P. 5998-6008.

2. Many heads but one brain: FusionBrain-a single multimodal multitask architecture and a competition /B.D. Dmitrievna [et al.] // Computer Optics. — 2023. — Vol. 47, no. 1. — P. 185-195.

3. Pixel-Level BPE for Auto-Regressive Image Generation / A. Razzhigaev [et al.] // Proceedings of the First Workshop on Performance and Interpretability Evaluations of Multimodal, Multipurpose, Massive-Scale Models. — 2022. — Vol. 1, no. 1. — P. 26-30.

4. Is This Loss Informative? Faster Text-to-Image Customization by Tracking Objective Dynamics / A. Voronov [et al.] // Advances in Neural Information Processing Systems. — 2023. — Vol. 36, no. 1. — P. 37491-37510.

5. Switti: Designing scale-wise transformers for text-to-image synthesis / A. Voronov [et al.] // arXiv preprint. — 2024. — URL: https://arxiv.org/ abs/2412.01819 (visited on 10/10/2025).

6. Neural machine translation by jointly learning to align and translate / D. Bahdanau [et al.] // arXiv preprint. — 2014. — URL: https://arxiv.com/ abs/1409.0473 (visited on 10/10/2025).

7. Learning transferable visual models from natural language supervision / A. Radford [et al.] // International conference on machine learning. — PmLR. 2021. — P. 8748-8763.

8. An image is worth 16x16 words: Transformers for image recognition at scale / A. Dosovitskiy [et al.] // arXiv preprint. — 2020. — URL: https: //arxiv.com/abs/2010.11929 (visited on 10/10/2025).

9. Deep residual learning for image recognition / K. He [et al.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2016. — P. 770-778.

10. Flamingo: a visual language model for few-shot learning / J.-B. Alayrac [et al.] // Advances in Neural Information Processing Systems. — 2022. — Vol. 35. — P. 23716-23736.

11. Perceiver: General perception with iterative attention / A. Jaegle [et al.] // International conference on machine learning. — PMLR. 2021. — P. 4651-4664.

12. Perceiver io: A general architecture for structured inputs & outputs / A. Jaegle [et al.] // arXiv preprint. — 2021. —URL: https://arxiv.com/abs/ 2107.14795 (visited on 10/10/2025).

13. General-purpose, long-context autoregressive modeling with perceiver AR / C. Hawthorne [et al.] // International Conference on Machine Learning. — PMLR. 2022. — P. 8535-8558.

14. Denoising diffusion probabilistic models / J. Ho [et al.] // Advances in Neural Information Processing Systems 33. — 2020. — Vol. 9. — P. 6840-6851.

15. Generative modeling by estimating gradients of the data distribution / Y. Song [et al.] // Advances in Neural Information Processing Systems 32. —

2019. — Vol. 15. — P. 11886-11898.

16. Flow matching for generative modeling / Y. Lipman [et al.] // arXiv preprint. — 2022. — URL: https://arxiv.org/abs/2210.02747 (visited on 10/10/2025).

17. Photorealistic text-to-image diffusion models with deep language understanding / C. Saharia [et al.] // Advances in Neural Information Processing Systems. — 2022. — Vol. 35. — P. 36479-36494.

18. High-resolution image synthesis with latent diffusion models / R. Rombach [et al.] // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2022. — P. 10684-10695.

19. Denoising diffusion implicit models / J. Song [et al.] // arXiv preprint. —

2020. — URL: https://arxiv.com/abs/2010.02502 (visited on 10/10/2025).

20. Score-based generative modeling through stochastic differential equations / Y. Song [et al.] // arXiv preprint. — 2020. — URL: https://arxiv.com/ abs/2011.13456 (visited on 10/10/2025).

21. U-net: Convolutional networks for biomedical image segmentation / O. Ronneberger [et al.] // International Conference on Medical image computing and computer-assisted intervention. — 2015. — Vol. 9351. — P. 234-241.

22. Sdxl: Improving latent diffusion models for high-resolution image synthesis / D. Podell [et al.] // arXiv preprint. — 2023. — URL: https: //arxiv.com/abs/2307.01952 (visited on 10/10/2025).

23. Scalable diffusion models with transformers / W. Peebles [et al.] // Proceedings of the IEEE/CVF international conference on computer vision. — 2023. — P. 4195-4205.

24. FLUX. 1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space / S. Batifol [et al.] // arXiv preprint. — 2023. — URL: https://arxiv.com/abs/2506.15742 (visited on 10/10/2025).

25. Lumina-next: Making lumina-t2x stronger and faster with next-dit / L. Zhuo [et al.] // Advances in Neural Information Processing Systems. — 2024. — Vol. 37. — P. 131278-131315.

26. Scaling rectified flow transformers for high-resolution image synthesis / P. Esser [et al.] // Proceedings of the 41st International Conference on Machine Learning. — 2024. — P. 12606-12633.

27. Exploring the limits of transfer learning with a unified text-to-text transformer / C. Raffel [et al.] // Journal of machine learning research. — 2020. — Vol. 21, no. 140. — P. 1-67.

28. Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis / J. Chen [et al.] // arXiv preprint. — 2023. — URL: https://arxiv.com/abs/2310.00426 (visited on 10/10/2025).

29. Diffusion models beat gans on image synthesis / P. Dhariwal [et al.] // Advances in Neural Information Processing Systems. — 2021. — Vol. 34. — P. 8780-8794.

30. Classifier-free diffusion guidance / J. Ho [et al.] // arXiv preprint. — 2022. — URL: https://arxiv.com/abs/2207.12598 (visited on 10/10/2025).

31. An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion / R. Gal [et al.] // arXiv preprint. — 2022. — URL: https://arxiv.org/abs/2208.01618 (visited on 10/10/2025).

32. Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation / N. Ruiz [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2023. — P. 22500-22510.

33. Multi-concept customization of text-to-image diffusion / N. Kumari [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2023. — P. 1931-1941.

34. P+: Extended Textual Conditioning in Text-to-Image Generation / A. Voynov [et al.] // arXiv preprint. — 2023. — URL: https://arxiv.com/ abs/2303.09522 (visited on 10/10/2025).

35. SVDiff: Compact Parameter Space for Diffusion Fine-Tuning / L. Han [et al.] // arXiv preprint. — 2023. —URL: https://arxiv.com/abs/2303. 11305 (visited on 10/10/2025).

36. Imagic: Text-based real image editing with diffusion models / B. Kawar [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2023. — P. 6007-6017.

37. Gradient-Free Textual Inversion / Z. Fei [et al.] // arXiv preprint. — 2023. — URL: https://arxiv.com/abs/2304.05818 (visited on 10/10/2025).

38. Prompt-to-prompt image editing with cross attention control / A. Hertz [et al.] // arXiv preprint. — 2022. — URL: https://arxiv.com/abs/2208. 01626 (visited on 10/10/2025).

39. MagicMix: Semantic Mixing with Diffusion Models / J. H. Liew [et al.] // arXiv preprint. — 2022. — URL: https://arxiv.com/abs/2210.16056 (visited on 10/10/2025).

40. Null-text inversion for editing real images using guided diffusion models / R. Mokady [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2023. — P. 6038-6047.

41. Distilling the knowledge in a neural network / G. Hinton [et al.] // arXiv preprint. —2015. —URL: https://arxiv.com/abs/1503.02531 (visited on 10/10/2025).

42. Progressive distillation for fast sampling of diffusion models / T. Salimans [et al.] // arXiv preprint. — 2022. — URL: https://arxiv.com/abs/2202. 00512 (visited on 10/10/2025).

43. Consistency Models / Y. Song [et al.] // Proceedings of the 40th International Conference on Machine Learning. — 2023. — Vol. 202. — P. 32211-32252.

44. Adversarial diffusion distillation / A. Sauer [et al.] // European Conference on Computer Vision. — 2024. — P. 87-103.

45. Improved distribution matching distillation for fast image synthesis / T. Yin [et al.] // Advances in Neural Information Processing Systems. — 2024. — Vol. 37. — P. 47455-47487.

46. Bert: Pre-training of deep bidirectional transformers for language understanding / J. Devlin [et al.] // Proceedings of the 2019 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long and short papers). — 2019. — P. 4171-4186.

47. Language models are unsupervised multitask learners / A. Radford [et al.] // OpenAI blog. — 2019. — Vol. 1, no. 8. — P. 9.

48. Language models are few-shot learners / T. Brown [et al.] // Advances in Neural Information Processing Systems. — 2020. — Vol. 33. — P. 1877-1901.

49. Training language models to follow instructions with human feedback / L. Ouyang [et al.] // Advances in Neural Information Processing Systems. — 2022. — Vol. 35. — P. 27730-27744.

50. mT5: A massively multilingual pre-trained text-to-text transformer / L. Xue [et al.] // arXiv preprint. — 2020. — URL: https://arxiv.com/abs/ 2010.11934 (visited on 10/10/2025).

51. Byt5: Towards a token-free future with pre-trained byte-to-byte models / L. Xue [et al.] // Transactions of the Association for Computational Linguistics. — 2022. — Vol. 10. — P. 291-306.

52. Llama: Open and efficient foundation language models / H. Touvron [et al.] // arXiv preprint. — 2023. — URL: https://arxiv.com/abs/ 2302.13971 (visited on 10/10/2025).

53. Llama 2: Open foundation and fine-tuned chat models / H. Touvron [et al.] // arXiv preprint. — 2023. — URL: https://arxiv.com/abs/ 2307.09288 (visited on 10/10/2025).

54. The llama 3 herd of models / A. Grattafiori [et al.] // arXiv preprint. — 2024. — URL: https://arxiv.com/abs/2407.21783 (visited on 10/10/2025).

55. Generative pretraining from pixels / M. Chen [et al.] // Proceedings of the 37th International Conference on Machine Learning. — 2020. — Vol. 119. — P. 1691-1703.

56. Neural discrete representation learning / A. Van Den Oord, O. Vinyals, [et al.] // Advances in Neural Information Processing Systems 30. — 2017. — Vol. 1. — P. 6307-6316.

57. Vector-quantized image modeling with improved vqgan / J. Yu [et al.] // arXiv preprint. — 2021. — URL: https://arxiv.com/abs/2110.04627 (visited on 10/10/2025).

58. Zero-shot text-to-image generation / A. Ramesh [et al.] // Proceedings of the 38th International Conference on Machine Learning. — 2021. — Vol. 139. — P. 8821-8831.

59. Taming transformers for high-resolution image synthesis / P. Esser [et al.] // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2021. — P. 12873-12883.

60. Auto-Encoding Variational Bayes / D. P. Kingma [et al.] // 2nd International Conference on Learning Representations. — 2014. — P. 1-14.

61. Conditional image generation with pixelcnn decoders / A. Van den Oord [et al.] // Advances in Neural Information Processing Systems. — 2016. — Vol. 29. — P. 4790-4798.

62. Autoregressive image generation using residual quantization / D. Lee [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2022. — P. 11523-11532.

63. Avatar: A parallel corpus for java-python program translation / W. U. Ahmad [et al.] // arXiv preprint. — 2021. — URL: https://arxiv.com/ abs/2108.11590 (visited on 10/10/2025).

64. Codenet: A large-scale ai for code dataset for learning a diversity of coding tasks / R. Puri [et al.] // arXiv preprint. — 2021. — URL: https://arxiv. com/abs/2105.12655 (visited on 10/10/2025).

65. Codebleu: a method for automatic evaluation of code synthesis / S. Ren [et al.] // arXiv preprint. — 2020. —URL: https://arxiv.com/abs/2009. 10297 (visited on 10/10/2025).

66. Open-vocabulary object detection via vision and language knowledge distillation / X. Gu [et al.] // arXiv preprint. — 2021. — URL: https: //arxiv.com/abs/2104.13921 (visited on 10/10/2025).

67. Visual genome: Connecting language and vision using crowdsourced dense image annotations / R. Krishna [et al.] // International journal of computer vision. — 2017. — Vol. 123, no. 1. — P. 32-73.

68. Yfcc100m: The new data in multimedia research / B. Thomee [et al.] // Communications of the ACM. — 2016. — Vol. 59, no. 2. — P. 64-73.

69. The IAM-database: an English sentence database for offline handwriting recognition / U.-V. Marti [et al.] // International journal on document analysis and recognition. — 2002. — Vol. 5, no. 1. — P. 39-46.

70. Making the v in vqa matter: Elevating the role of image understanding in visual question answering / Y. Goyal [et al.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2017. — P. 6904-6913.

71. Frozen pretrained transformers as universal computation engines / K. Lu [et al.] // Proceedings of the AAAI conference on artificial intelligence. — 2022. — Vol. 36, no. 7. — P. 7628-7636.

72. Gpt-4 technical report / J. Achiam [et al.] // arXiv preprint. — 2023. — URL: https://arxiv.com/abs/2303.08774 (visited on 10/10/2025).

73. The cross-entropy method for combinatorial and continuous optimization / R. Rubinstein [et al.] // Methodology and computing in applied probability. — 1999. — Vol. 1, no. 2. — P. 127-190.

74. Long short-term memory / S. Hochreiter [et al.] // Neural computation. — 1997. — Vol. 9, no. 8. — P. 1735-1780.

75. Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks / A. Graves [et al.] // Proceedings of the 23rd international conference on Machine learning. — 2006. — P. 369-376.

76. ImageNet: A large-scale hierarchical image database / J. Deng [et al.] // 2009 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR 2009), 20-25 June 2009, Miami, Florida, USA. — 2009. — P. 248-255.

77. Deep Learning Face Attributes in the Wild / Z. Liu [et al.] // 2015 IEEE International Conference on Computer Vision, ICCV 2015, Santiago, Chile, December 7-13, 2015. — 2015. — P. 3730-3738.

78. How BPE Affects Memorization in Transformers / E. Kharitonov [et al.] // arxiv preprint. — 2021. — URL: https://arxiv.org/abs/2110.02782 (visited on 10/10/2025).

79. Visual autoregressive modeling: Scalable image generation via next-scale prediction / K. Tian [et al.] // Advances in Neural Information Processing Systems. — 2024. — Vol. 37. — P. 84839-84865.

80. OpenCLIP / G. Ilharco [et al.]. — Version 0.1. — 07/2021. — DOI: 10. 5281/zenodo.5143773. — URL: https://doi.org/10.5281/zenodo.5143773 (visited on 10/10/2025).

81. Understanding and improving layer normalization / J. Xu [et al.] // Advances in Neural Information Processing Systems. — 2019. — Vol. 32. — P. 4797-4805.

82. Layer normalization / J. L. Ba [et al.] // arXiv preprint. — 2016. — P. 12349-12360. — URL: https://arxiv.com/abs/1607.06450 (visited on 10/10/2025).

83. Root mean square layer normalization / B. Zhang [et al.] // Advances in Neural Information Processing Systems. — 2019. — Vol. 32.

84. Star: Scale-wise text-to-image generation via auto-regressive representations / X. Ma [et al.] // arXiv preprint. — 2024. — URL: https://arxiv.com/abs/2406.10797v1 (visited on 10/10/2025).

85. Rotary position embedding for vision transformer / B. Heo [et al.] // European Conference on Computer Vision. — 2024. — P. 289-305.

86. Gaussian error linear units (gelus) / D. Hendrycks [et al.] // arXiv preprint. — 2016. — URL: https://arxiv.com/abs/1606.08415 (visited on 10/10/2025).

87. Gans trained by a two time-scale update rule converge to a local nash equilibrium / M. Heusel [et al.] // Advances in Neural Information Processing Systems. — 2017. — Vol. 30. — P. 6629-6640.

88. Clipscore: A reference-free evaluation metric for image captioning / J. Hessel [et al.] // arXiv preprint. — 2021. — URL: https : / / arxiv. com/abs/2104.08718 (visited on 10/10/2025).

89. Imagereward: Learning and evaluating human preferences for text-to-image generation / J. Xu [et al.] // Advances in Neural Information Processing Systems. — 2023. — Vol. 36. — P. 15903-15935.

90. Pick-a-pic: An open dataset of user preferences for text-to-image generation / Y. Kirstain [et al.] // Advances in Neural Information Processing Systems. — 2023. — Vol. 36. — P. 36652-36663.

91. Cogview: Mastering text-to-image generation via transformers / M. Ding [et al.] // Advances in Neural Information Processing Systems. — 2021. — Vol. 34. — P. 19822-19835.

92. Glu variants improve transformer / N. Shazeer [et al.] // arXiv preprint. — 2020. — URL: https://arxiv.com/abs/2002.05202 (visited on 10/10/2025).

93. Applying guidance in a limited interval improves sample and distribution quality in diffusion models / T. Kynkaänniemi [et al.] // Advances in Neural Information Processing Systems. —2024. — Vol. 37. — P. 122458-122483.

94. Photo aesthetics ranking network with attributes and content adaptation / S. Kong [et al.] // European conference on computer vision. — 2016. — P. 662-679.

95. Rethinking Image Aesthetics Assessment: Models, Datasets and Benchmarks. / S. He [et al.] // IJCAI. — 2022. — P. 942-948.

96. Visual Instruction Tuning / H. Liu [et al.] // NeurIPS. — 2023.

97. The Unreasonable Effectiveness of Deep Features as a Perceptual Metric / R. Zhang [et al.] // 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). — 2018. — P. 586-595.

98. Photo-realistic single image super-resolution using a generative adversarial network / C. Ledig [et al.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2017. — P. 4681-4690.

99. Emu3: Next-token prediction is all you need / X. Wang [et al.] // arXiv preprint. — 2024. — URL: https://arxiv.com/abs/2409.18869 (visited on 10/10/2025).

100. Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining / D. Liu [et al.] // arXiv preprint. — 2024. — URL: https://arxiv.com/abs/2408.02657 (visited on 10/10/2025).

101. Autoregressive model beats diffusion: Llama for scalable image generation / P. Sun [et al.] // arXiv preprint. — 2024. — URL: https://arxiv.com/ abs/2406.06525 (visited on 10/10/2025).

102. Hart: Efficient visual generation with hybrid autoregressive transformer / H. Tang [et al.] // arXiv preprint. — 2024. — URL: https://arxiv.com/ abs/2410.10812 (visited on 10/10/2025).

103. Microsoft COCO: Common Objects in Context / T.-Y. Lin [et al.]. — 2015. — URL: https://arxiv.com/abs/1405.0312 (visited on 10/10/2025).

104. Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation / D. Li [et al.]. — 2024. — URL: https://arxiv. com/abs/2402.17245 (visited on 10/10/2025).

105. Scaling autoregressive models for content-rich text-to-image generation / J. Yu [et al.] // arXiv preprint. — 2022. — Vol. 2, no. 3. — P. 5. — URL: https://arxiv.com/abs/2206.10789 (visited on 10/10/2025).

106. GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models / A. Nichol [et al.] // arXiv preprint. —. — URL: https://arxiv.com/abs/2112.10741 (visited on 10/10/2025).

107. Diffusers: State-of-the-art diffusion models / P. von Platen [et al.] // GitHub repository. — 2022. —URL: https://github.com/huggingface/ diffusers (visited on 10/10/2025).

108. LoRA: Low-Rank Adaptation of Large Language Models / E. J. Hu [et al.] // International Conference on Learning Representations. — 2022. —URL: https://openreview.net/forum?id=nZeVKeeFYf9 (visited on 10/10/2025).

109. ediffi: Text-to-image diffusion models with an ensemble of expert denoisers / Y. Balaji [et al.] // arXiv preprint. — 2022. — URL: https://arxiv.com/ abs/2211.01324 (visited on 10/10/2025).

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.