Метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Люлява Даниил Вячеславович

  • Люлява Даниил Вячеславович
  • кандидат науккандидат наук
  • 2025, «МИРЭА - Российский технологический университет»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 175
Люлява Даниил Вячеславович. Метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением: дис. кандидат наук: 00.00.00 - Другие cпециальности. «МИРЭА - Российский технологический университет». 2025. 175 с.

Оглавление диссертации кандидат наук Люлява Даниил Вячеславович

Введение

Актуальность темы исследования

Цель диссертации

Задачи диссертации

Объект исследования

Предмет исследования

Теоретическая и практическая значимость работы

Методология и методы исследования

Соответствие паспорту специальности

Положения, выносимые на защиту

Апробация

Публикации

Личный вклад автора

Структура работы

1. Общие сведения о специализированных вычислителях. Задача построения топологического представления специализированного вычислителя

1.1. Маршрут проектирования специализированных вычислителей

1.1.1. Моделирование на системном уровне

1.1.2. Моделирование на уровне RTL

1.1.3. Моделирование на уровне топологии

1.1.4. Взаимодействие этапов маршрута проектирования. Прямые и обратные связи между уровнями проектирования

1.2. Варианты представлений специализированного вычислителя

1.3. Структура конвейерного вычислителя. Тракт обработки данных

1.4. Предварительная оценка временных характеристик специализированного вычислителя с конвейерной архитектурой

1.5. Задача построения топологического представления специализированного вычислителя с конвейерной архитектурой

1.6. Описание внутренней структуры кристалла ПЛИС

1.7. Оценка задачи построения топологического построения специализированного вычислителя с конвейерной архитектурой на кристалле ПЛИС

1.8. Обзор существующих алгоритмов построения топологического представления на базе ПЛИС. Особенности инструментов размещения в составе САПР ПЛИС

1.9. Выводы по главе

2. Метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением

2.1. Локализация области поиска решений. Метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением

2.2. Локализация области поиска решений. Методика управления топологическими ограничениями

2.3. Формирование логического и топологического представлений специализированного вычислителя с конвейерной архитектурой. Методика совместного проектирования специализированных вычислителей

2.4. Внедрение сведений о принадлежности элементов соответствующим стадиям конвейерного вычислителя

2.5. Внутренняя структура специализированного вычислителя с

конвейерной архитектурой

2.5.1. Описание интеграционных узлов специализированного вычислителя с конвейерной архитектурой

2.5.2. Описание тракта управления продвижением данных специализированного вычислителя с конвейерной архитектурой

2.6. Построение топологии конечного решения в рамках методики управления топологическими ограничениями

2.6.1. Выделение областей для размещения комбинационной логики стадий вычислений

2.6.2. Параметры размещения. Варианты топологий

2.6.3. Особенности формирования топологии размещения

2.7. Описание критериев оценки качества топологического представления конвейерного вычислителя

2.8. Выводы по главе

3. Экспериментальное окружение

3.1. Маршрут построения вариантов топологического представления

3.2. Маршрут построения одного варианта топологического представления специализированного вычислителя

3.3. Описание аппаратного обеспечения

3.4. Описание программного обеспечения для проектирования вычислителя на базе ПЛИС

3.4.1. Маршрут проектирования в рамках САПР Vivado

3.4.2. Внутренние алгоритмы оптимизации схемотехнического решения

3.4.3. Система проектных ограничений. Язык TCL

3.4.4. Инструменты оценки конечного решения

3.4.5. Описание программного обеспечения для анализа и визуализации данных

3.5. Экспериментальный макет специализированного вычислителя

3.5.1. Реализация тракта обработки данных для экспериментального макета

3.5.2. Описание реализации тракта управления продвижением данных для экспериментального макета

3.5.3. Описание реализации изолирующих буферов типа FIFO для экспериментального макета

3.5.4. Реализация преобразователей данных для экспериментального макета

3.5.5. Внедрение блока ресинхронизации для экспериментального макета

3.5.6. Конфигурация параметров экспериментального макета

3.6. Входные параметры формирования топологического представления вычислителя

3.7. Описание используемых алгоритмов для специализированных вычислителей

3.8. Выводы по главе

4. Оценка полученных решений

4.1. Перечень проводимых экспериментов

4.2. Оценка влияния взаимного расположения и дополнительного перекрытия стадий вычислителя на величину критической задержки

4.2.1. Результаты экспериментов для вычислителей с равноразмерными областями стадий вычислений

4.2.2. Результаты экспериментов для вычислителей с разноразмерными областями стадий вычислений

4.3. Оценка линейности зависимости критических задержек для различных представлений конвейерного вычислителя

4.4. Оценка топологического представления согласно критериям качества

4.5. Выводы по главе

Заключение

Список сокращений и условных обозначений

Список литературы

Список рисунков

Список таблиц

Приложение А. Структурная схема экспериментального макета

Приложение Б. Перечень проводимых экспериментов

Приложение В. Таблица результатов проведенных экспериментов

Приложение Г. Свидетельство о государственной регистрации программ

для ЭВМ

Приложение Д. Акт о внедрении (Кафедра вычислительной техники) .... 173 Приложение Е. Акт о внедрении (ПАО «ИНЭУМ им. И. С. Брука»)

Введение

Актуальность темы исследования

На сегодняшний день специализированные вычислительные системы (вычислители) широко применяются при решении прикладных задач обработки данных, где существует потребность в ускорении вычислительных процессов: криптография, телекоммуникации, сетевая инфраструктура, радиолокация, метрология, обработка графических данных и т.д. Высокая производительность такого рода систем достигается за счет адаптации архитектуры вычислителя для наиболее эффективного решения узкоспециализированного круга задач.

Специализированные вычислительные системы могут быть построены на базе различных вариантов архитектур, среди которых наиболее распространённым является конвейерный вариант архитектуры. Среди преимуществ конвейерного подхода можно выделить простую структуру организации вычислений, а также возможности повышения тактовой частоты работы вычислителя за счёт разбиения сложной вычислительной логики, формирующей длинные комбинационные линии, на отдельные операции, каждая из которых выполняется на соответствующей стадии конвейера. При этом распределение вычислительной логики может быть произведено с учётом временных задержек в рамках каждой арифметико-логической операции таким образом, что критические задержки на каждой стадии вычислений будут примерно равны. Это, в свою очередь, позволит достигнуть предельного показателя тактовой частоты с учётом характеристик компонентов целевой аппаратной платформы.

При переходе к топологическому представлению полученные временные характеристики вычислителя могут существенно отличаться от значений, определённых на этапе логического представления, поскольку размещение элементов схемы на кристалле определяет длину

трассировочных соединений, которые вносят дополнительную задержку. Количество возможных вариантов размещения специализированного вычислителя на кристалле интегральной микросхемы может быть настолько велико, что решение строго математической задачи поиска топологического представления может потребовать наличия объёмов вычислительных мощностей и времени реализации, превышающих допустимые ограничения в соответствии с техническим заданием. Исходя из этого, существует потребность в локализации области поиска варианта топологического представления, удовлетворяющего заданному набору ограничений.

Степень разработанности темы исследования

Вопросами, связанными с рассмотрением архитектур специализированных вычислителей, в том числе процессорных и конвейерных, занимаются научные сотрудники научно-исследовательского института многопроцессорных вычислительных систем (НИИ МВС) им. А.В. Каляева и Южного Федерального университета (ЮФУ) г. Таганрога, в частности, Каляев А.В. [10], Каляев И.А. [10-16], Левин И.И. [10-17], Дордопуло А.И. [13-16], Алексеев К. Н. [18-19], Сорокин Д. А. [18-19], Леонтьев А. Л. [18-19], Курейчик В.М. [20], Кулиев Э.В. [21], Лежебоков А.А. [21], Лебедев Б.К. [22], Лебедев О.Б. [22]. Помимо этого, в рамках проводимых научных исследований рассматриваются вопросы проектирования реконфигурируемых вычислительных систем на базе ПЛИС, высокоуровневого синтеза представлений специализированных вычислителей, генерации топологических ограничений при проектировании на базе ПЛИС и автоматизации процессов проектирования на основе языка программирования Colamo. Архитектурные подходы к построению специализированных вычислительных систем также описываются в работах зарубежных авторов, в том числе, Hennessy J.L. [23], Patterson D.A. [23], Nurmi J. [24], Makino J. [25].

В контексте научного направления, связанного с синтезом логического представления вычислителей, разрабатывалось несколько программных инструментов преобразования высокоуровневой модели вычислителя в представление на RTL-уровне с применением языков HDL. В частности, разработкой инструментов, работающих согласно принципу "C to HDL" занимались Page I. [26], Aynsley J. [27], Gupta R. [28], Gupta S. [28], Dutt N. [28], Nicolau A. [28], Decaluwe J. [29]. Вопросы, связанные с высокоуровневым синтезом логических представлений вычислительных систем, также были описаны в работах Камкина А.С. [30-31].

Вопросы, связанные с формированием топологии размещения схемы, а также трассировкой соединений на полупроводниковых кристаллах основываются на научных работах, рассматривающих задачи оптимизации на графовых структурах, в частности, в работах Дейкстры Э.В. [32], Беллмана Р. [33], Форда Л. [34], Фалкерсона Д.Р. [34]. Современные алгоритмы построения топологии освещены в работах научного коллектива Института проблем проектирования в микроэлектронике РАН (ИППМ РАН): основными авторами являются Гаврилов С.В. [35-37], Эннс В.И. [37], Железников Д.А. [35]. Вопросы автоматизации процессов размещения и трассировки были описаны в работах Соловьева Р.А. [38], Стемпковского А.Л. [38], Chen G. [39-40], Liang T. [40], Zhao J. [40], McMurchie L. [41], Ebeling C. [41].

Цель диссертации

Целью диссертационного исследования является повышение эффективности технической реализации специализированных вычислителей с конвейерной архитектурой за счёт управления топологическим представлением.

Задачи диссертации

1. Провести анализ основных вопросов проектирования специализированных вычислителей с конвейерной архитектурой.

2. Провести анализ причин несоответствия временных характеристик специализированного вычислителя с конвейерной архитектурой на логическом и топологическом вариантах представления.

3. Предложить и обосновать метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением.

4. Сформулировать методику управления топологическими ограничениями для размещения элементов специализированного вычислителя с конвейерной архитектурой.

5. Предложить и обосновать критерии оценки качества топологического представления специализированного вычислителя с конвейерной архитектурой на основе моментов генеральной совокупности задержек распространения сигналов.

Объект исследования

Специализированные вычислители с конвейерной архитектурой.

Предмет исследования

Структурные особенности специализированных вычислителей с конвейерной архитектурой, подходы к топологическому размещению компонентов специализированного вычислителя на кристалле ПЛИС.

Научная новизна

В рамках диссертационного исследования представлен впервые метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением.

В результате применения разработанного метода и описанной методики управления топологическими ограничениями для различных вариантов конвейерных вычислителей было достигнуто увеличение предельной тактовой частоты конечного решения в диапазоне от 1,04 до 1,62 раз, а также сокращено расхождение величин критических задержек

для логического и топологического представлений вычислителя, что, в свою очередь, способствовало повышению прогнозируемости временных характеристик вычислителя.

Для оценки полученных результатов были сформулированы критерии качества топологического представления специализированного вычислителя с конвейерной архитектурой на основе моментов генеральной совокупности задержек распространения сигналов.

Теоретическая и практическая значимость работы

1. Проведено экспериментальное исследование влияния управляющей схемы конвейера на задержку распространения сигнала. Сформированы рекомендации по организации схемы управления специализированного вычислителя с конвейерной архитектурой. Предложенный набор рекомендаций позволяет подобрать подходящий вариант управляющей схемы на основе требований, предъявляемых к формированию потоков передаваемых данных, тактовой частоте работы устройств, а также объёму аппаратных ресурсов на кристалле ПЛИС.

2. Сформированы рекомендации по организации интеграции специализированного вычислителя с конвейерной архитектурой в состав программно-аппаратных комплексов. Предложенное интеграционное окружение позволяет учитывать различные форматы входных и выходных пакетов данных, а также изолировать внутреннюю логику вычислителя от внешних узлов системы с целью сохранения предельной тактовой частоты.

3. Сформированы рекомендации по внедрению в RTL-модель вычислителя сведений о принадлежности элементов комбинационной и последовательностной логики к стадии вычислений.

Результаты диссертационного исследования были использованы при разработке алгоритмов размещения и трассировки специализированных вычислителей с конвейерной архитектурой и были внедрены в практическую деятельность кафедры вычислительной техники РТУ

МИРЭА и ПАО «ИНЭУМ им. И.С.Брука». что подтверждено актами о внедрении, приведёнными в Приложениях Д, Е.

Диссертационное исследование проводилось в рамках государственного задания Министерства науки и высшего образования Российской Федерации (тема № FSFZ-2022-0004 Архитектуры специализированных вычислительных комплексов, методики, алгоритмы и инструменты проектирования цифровых вычислительных устройств). По результатам выполнения задания были разработаны специализированные вычислители с конвейерной архитектурой на основе алгоритмов блочного шифрования Магма и Кузнечик с применением предлагаемого в рамках настоящего диссертационного исследования метода.

Результаты исследований были использованы при создании методики совместного проектирования специализированных вычислителей, а также формализации и стандартизации принципов взаимодействия между уровнями проектирования специализированных вычислителей с конвейерной архитектурой.

Методология и методы исследования

Для проведения исследований в рамках диссертационной работы применяются методы математического и компьютерного моделирования, макетирование на базе ПЛИС, экспериментальные исследования на стендовом оборудовании.

Соответствие паспорту специальности

Диссертационная работа соответствует паспорту научной специальности 2.3.2 по направлению исследования «Разработка научных подходов и методов, архитектурных и структурных решений, обеспечивающих эффективную техническую реализацию аппаратно-программных систем и комплексов за счет оптимизации применяемой электронной компонентной базы, элементов вычислительных систем и встраиваемого программного обеспечения».

Достоверность полученных результатов

Достоверность результатов исследования обеспечивается экспериментальными данными, полученными с помощью инструментальных средств технических САПР, а также при проведении измерений основных характеристик сигналов на аппаратной платформе.

Положения, выносимые на защиту

1. Метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением.

2. Методика управления топологическими ограничениями для размещения элементов специализированного вычислителя с конвейерной архитектурой с учётом особенностей совместного проектирования специализированных вычислителей и характеристик целевой аппаратной платформы.

3. Критерии оценки качества топологического представления специализированного вычислителя с конвейерной архитектурой на основе моментов генеральной совокупности задержек распространения сигналов.

Апробация

Результаты и положения диссертационной работы докладывались и обсуждались на 9 конференциях, среди которых: XII Международная научно-практическая конференция «Высокопроизводительные вычислительные системы и технологии в научных исследованиях, автоматизации управления и производства (ВВСТ-2022)»; XIII Международная научно-практическая конференция

«Высокопроизводительные вычислительные системы и технологии в научных исследованиях, автоматизации управления и производства (ВВСТ-2023)»; XII международная научная конференция ИТ-Стандарт 2023; VIII научно-техническая конференция студентов и аспирантов РТУ МИРЭА, 5th International Conference on Control Systems, Mathematical

Modeling, Automation and Energy Efficiency, November, 13-15 2023 Lipetsk, Russia; XXVIII Всероссийская научно-техническая конференция студентов, молодых ученых и специалистов. Рязанский государственный радиотехнический университет имени В.Ф. Уткина, 2023 г; XIII Международная научная конференция ИТ-Стандарт 2024; XXIX Всероссийская научно-техническая конференция студентов, молодых ученых и специалистов. Рязанский государственный радиотехнический университет имени В.Ф. Уткина, 2024 г; 6th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency, November, 13-15 2024 Lipetsk, Russia; XV Международная научно-практическая конференция «Высокопроизводительные вычислительные системы и технологии в научных исследованиях, автоматизации управления и производства (ВВСТ-2025)». Диссертация обсуждалась на кафедре вычислительной техники института информационных технологий РТУ МИРЭА.

Публикации

По результатам, полученным в ходе проведения диссертационного исследования, было опубликовано 14 печатных работ, в том числе: 5 статей в изданиях из перечня ведущих рецензируемых научных журналов и изданий ВАК; 3 публикации в изданиях, индексируемых Web of Science/Scopus; 3 опубликованных тезиса в сборниках трудов международных и всероссийских научных конференций, а также получено одно свидетельство о регистрации программы для ЭВМ в ФГБУ «Федеральный институт промышленной собственности» Федеральной службы по интеллектуальной собственности, патентам и товарным знакам (ФГБУ «ФИПС», РОСПАТЕНТ).

Личный вклад автора

Все результаты и научные положения, выносимые на защиту, получены автором лично.

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением»

Структура работы

Диссертационная работа включает в себя введение, 4 главы, заключение, список литературы (104 наименования) и 6 приложений. Объём текста диссертации составляет 175 страниц, содержит 5 таблиц и 111 рисунков.

1. Общие сведения о специализированных вычислителях. Задача построения топологического представления специализированного вычислителя

1.1. Маршрут проектирования специализированных вычислителей

Процесс проектирования вычислительных систем, как правило, разделен на несколько этапов, каждый из которых сопровождается построением соответствующей модели с разной степенью детализации. Характерной особенностью проектирования специализированных вычислителей является применение подходов, позволяющих, с одной стороны, не учитывать использование базового набора операций общего назначения, с другой стороны, повысить скорость выполнения комплексных операций, составляющих основу рассматриваемого в рамках исходного условия круга решаемых задач.

Маршрут проектирования специализированных вычислительных систем (рис. 1.1) включает в себя этапы моделирования на системном уровне, моделирования на уровне регистровых передач и моделирования на уровне топологии.

Системное моделирование

Моделирование на уроВне регистровых передач (РЛЬ-модель)

Моделирование на топологическом уровне

Рисунок 1.1 — Маршрут проектирования специализированных

вычислительных систем

1.1.1. Моделирование на системном уровне

При системном моделировании на основе определённого набора знаний, законов и правил из предметных областей, связанных с рассматриваемой задачей, формируется высокоуровневая модель вычислительной системы. В рамках модели описывается общее поведение системы, используемый набор компонентов, роль которых определяется их внутренним функционалом, а также организация взаимодействия между компонентами системы. Основным назначением моделирования на системном уровне является проработка функциональной части системы изолированно от аппаратных особенностей представления вычислительного устройства. Помимо этого, в процессе системного моделирования производится проверка функциональной корректности подходов к решению задачи, а также получение набора эталонных откликов системы на внешние воздействия для верификации системы на более низких уровнях проектирования.

Для построения модели на системном уровне может применяться подход, при котором функциональная логика работы вычислительной системы описывается при помощи набора транзакций (Transaction-Level Modeling, TLM) [43]. Транзакция представляет собой фиксированную группу действий, выполняемых над данными за определенный временной период. Все операции, включая изменение состояний, передачу данных и вычисления, которые выполняются в рамках компонента системы или между двумя компонентами, являются транзакциями. Для транзакции, в частности, может быть определено назначение, формат представления данных, принципы обработки данных и т.д.

Также, применительно к специализированным вычислительным системам на этапе системного моделирования могут быть разработаны предметно-ориентированные языки (Domain Specific Language, DSL [2]), определяющие сущности и их функциональное назначение в соответствии

с набором знаний о предметной области решаемой задачи. Сформированная модель решения, описанная на подобном языке, в свою очередь может выступать в качестве основы для построения предметно-ориентированной архитектуры (Domain Specific Architecture, DSA [2]).

Разработка системной модели может быть произведена с использованием высокоуровневых языков программирования. При этом детализация системной модели, с одной стороны, должна быть необходимой и достаточной для описания функциональной логики вычислительного устройства, с другой стороны, степень детализации модели может варьироваться в зависимости от особенностей решаемой задачи и процесса проектирования. В частности, логика вычислений, проводимых над данными, может быть описана в виде набора атомарных операций без подробной детализации их выполнения. Однако, если для решения задачи необходимо соблюдение определенных требований, предъявляемых к формату представления данных и точности вычислений над ними, в рамках системной модели может присутствовать реализация соответствующего алгоритма, удовлетворяющего поставленным требованиям. Схожая логика рассуждений может применена и к принципам коммуникации между компонентами системы, в частности, используемые протоколы обмена данными, с одной стороны, могут быть приведены без уточнения особенностей их работы, с другой стороны, они могут быть детализированы в рамках разрабатываемой модели.

1.1.2. Моделирование на уровне RTL

На уровне регистровых передач (Register Transfer Level, RTL) производится описание работы вычислительной системы с использованием регистровых элементов, элементов комбинационной логики и соединения между всеми элементами (межсоединений). Конечным результатом моделирования на уровне RTL является синтезированная модель [44],

представляющая собой набор соединений (netlist) между компонентами, определяемыми целевой аппаратной платформой. Для описания схемы устройства на уровне RTL, как правило, применяются блочный вариант описания (Block Design Description [44]) или языки описания аппаратуры [44], например, Verilog, VHDL, SystemVerilog и т.д.

Основной задачей, которая ставится в процессе разработки RTL-модели, является отражение архитектурных аспектов вычислительной системы и её компонентов с точки зрения их аппаратной реализации. Как следствие, в ходе построения модели функциональная логика компонентов декомпозируется в набор сложно-функциональных блоков (СФ-блоков), для каждого из которых формируется собственное аппаратное представление. С точки зрения специализированных вычислителей особое внимание уделяется выбору архитектурного паттерна, наиболее подходящего под решаемую задачу, а также внутренней реализации арифметико-логических операций, осуществляемых над потоком данных.

Важную роль в RTL-моделировании также играет реализация управляющей логики вычислительной системы, в частности, при построении модели рассматриваются вопросы синхронизации взаимодействия элементов схемы при помощи тактового синхросигнала, организации схемы сброса регистровых элементов или валидации данных для их продвижения по соответствующим путям распространения сигнала.

1.1.3. Моделирование на уровне топологии

На уровне топологии производится непосредственный перенос синтезированной модели вычислителя на целевую аппаратную платформу.

Как правило, в качестве аппаратной платформы, применяемой при проектировании специализированных вычислителей, используются микросхемы на основе полупроводниковых кристаллов [45]. При этом соответствующие микросхемы с точки зрения реализации могут быть

стандартными [42], полузаказными [42], если имеется первоначально заданная компонентная база, на основе которой разрабатывается вычислительное устройство, или заказными [42], если компонентный состав микросхемы определяется непосредственно в процессе изготовления.

Основным достоинством полузаказных микросхем выступает более низкая стоимость разработки в сравнении с заказными за счёт использования единой компонентной базы для каждого разрабатываемого вычислительного устройства. При необходимости внесения изменений в полузаказных микросхемах могут быть реализованы механизмы для модификации вычислительной логики путём реконфигурации задействованных компонентов кристалла; среди таких вариантов микросхем широкое распространение получили аппаратные платформы на базе программируемых логических интегральных схем (ПЛИС) [46].

В свою очередь, при проектировании заказных микросхем, в том числе на основе сверхбольших интегральных схем (СБИС) [47], могут быть достигнуты наиболее оптимальные выходные характеристики устройства, поскольку компонентный состав и топология схемы формируются в соответствии с особенностями рассматриваемой задачи, однако итоговая стоимость разработки заказной микросхемы будет существенно выше.

В зависимости от целевой аппаратной платформы форма представления топологической модели может отличаться. В частности, для аппаратной платформы ПЛИС используется конфигурационный файл [4748], содержащий информацию о задействованных аппаратных ресурсах и трассировочных линиях на кристалле, в то время как для СБИС форма представления топологической модели может иметь более комплексную структуру, в частности, промышленный стандарт GDSП [48] определяет набор технических сведений о всех используемых компонентах в рамках одного или нескольких топологических слоев кристалла.

С точки зрения процесса размещения важную роль играет взаимное расположение задействованных компонентов относительно друг друга, а также плотность их размещения, в зависимости от этого на последующем этапе производится выбор трассировочных линий, доступных для конфигурации на кристалле. Компонентный состав специализированного вычислителя, помимо основной вычислительной логики, может также включать в себя контроллеры интерфейсов приёма и передачи данных, расположение которых должно согласовываться с внутренней топологией кристалла. Перечень основных параметров, учитываемых в процессе размещения и трассировки более подробно рассмотрен в разделе 1.5.1 текста настоящей диссертации.

На основе сформированной топологической модели, как правило, со стороны САПР формируется набор отчётной документации, содержащей сведения о показателях работы схемы [46, 49], таких как мощность, энергопотребление, временные запасы на путях распространения сигнала (Slack), количесто задействованных аппаратных ресурсов и т.д. По результатам анализа полученных данных делается вывод о соответствии топологической модели вычислительного устройства первоначально заданным требованиям.

1.1.4. Взаимодействие этапов маршрута проектирования. Прямые и обратные связи между уровнями проектирования

Как правило, проектирование вычислительной системы производится по принципу каскадного подхода: от более абстрактного представления к более детализированному. При этом, как было ранее замечено, модель представления на каждом следующем этапе проектирования строится на основе моделей, реализованных на предыдущих этапах. Исходя из этого, имеет место взаимодействие между уровнями проектирования

(межуровневое взаимодействие), которое производится как в прямом, так и в обратном направлении.

На рисунке ниже (рис. 1.2) приведено описание прямых связей [49] в рамках маршрута проектирования. В состав набора сущностей, передаваемых от этапа системного моделирования, могут входить описание функциональной логики системы на уровне транзакций, высокоуровневая модель, а также набор эталонных откликов системы на внешние воздействия, со стороны уровня проектирования RTL передается синтезированная модель на основе компонентов аппаратной платформы. При этом, как можно заметить, набор требований, на основе которых устанавливаются ограничения характеристик устройства, должен учитываться на каждом из этапов проектирования.

Рисунок 1.2 — Прямые связи в маршруте проектирования специализированных вычислительных систем Помимо основного цикла разработки, существует также и обратное взаимодействие между уровнями проектирования (обратные связи [49]), которое в свою очередь направлено на согласование разрабатываемых

моделей, а также внесения корректив в случае выявления расхождений между ними. Ведение процесса обратного взаимодействия, как правило, строго не регламентируется в силу отсутствия стандартизированных подходов к организации обратных связей в рамках маршрута проектирования.

1.2. Варианты представлений специализированного вычислителя

Процесс проектирования специализированного вычислителя сводится к последовательному уточнению абстрактных моделей представления вычислителя вплоть до топологического уровня. На протяжении всего маршрута проектирования формируется несколько различных вариантов представлений специализированного вычислителя.

Логическое представление отражает структурные и поведенческие особенности проектируемого вычислителя. Создание соответствующих моделей для реализации логического представления вычислителя осуществляется на системном уровне и на уровне регистровых передач, при этом одной из ключевых задач, решаемых в процессе моделирования, является выбор архитектурного шаблона, на основе которого будет организована вычислительная логика устройства. Среди основных архитектурных подходов, которые применяются при проектировании специализированных вычислителей, можно выделить построение архитектуры вычислителя на базе конечного автомата, процессорного ядра, использование конвейерной архитектуры, систолической архитектуры и др. (рис. 1.3) [1, 50].

Топологическое представление вычислителя формируется на уровне топологии и, как следствие, учитывает особенности размещения схемы вычислителя на кристалле аппаратной платформы.

Рисунок 1.3 - Варианты архитектур специализированных вычислителей

Для реализации топологического представления используются специализированные системы автоматизированного проектирования (САПР) [46], в рамках которых применяется собственный локальный маршрут проектирования, результатом которого выступает конечное решение (топологическое представление вычислительного устройства с учётом особенностей целевой аппаратной платформы). В частности, для аппаратной платформы ПЛИС основными этапами маршрута являются ввод схемы с применением языков описания аппаратуры, синтез списка соединений (netlist), содержащего компоненты аппаратной платформы и соединения между ними, размещение компонентов схемы и трассировка межсоединений и прототипирование конечного решения.

Среди описанных ранее вариантов архитектурных шаблонов специализированных вычислителей широкое распространение получил конвейерный вариант архитектуры, поскольку он позволяет без необходимости использования комплексной управляющей логики существенно повысить тактовую частоту работы вычислительной системы путём сокращения длины критического пути распространения сигнала за счёт структурного разбиения комбинационной логики вычислений на отдельные стадии. Конвейерные вычислители могут использоваться в

качестве операционных узлов составных специализированных вычислителей, в частности, для выполнения арифметико-логических операций в процессорных системах, что в свою очередь даёт возможность рассмотреть смежные вопросы размещения применительно к другим архитектурам. Дальнейшее повествование в рамках настоящей диссертации будет сконцентрировано на исследовании выделенного подкласса решений для специализированных вычислителей с конвейерной архитектурой (конвейерных вычислителей).

1.3. Структура конвейерного вычислителя. Тракт обработки данных.

Тракт обработки данных конвейерного вычислителя (рис. 1.4) содержит комбинационную логику (CL) для выполнения вычислений над данными, а также конвейеризирующие регистры (REG), роль которых заключается в синхронизации процессов обмена данными между стадиями конвейера [62].

REG

Регистр донных

Рисунок 1.4 — Схемотехническое представление тракта обработки данных

конвейерного вычислителя

Число стадий конвейерного вычислителя (глубина конвейеризации) определяет количество необходимых конвейеризирующих регистров для стадий вычислений, которое в свою очередь влияет на латентность прохождения данных по тракту конвейера. От разбиения вычислений на стадии также зависит предельная тактовая частота работы конвейерного вычислителя, поскольку критический путь распространения данных определяется длиной комбинационной цепочки между стадиями конвейера. Предельная тактовая частота тракта обработки данных может быть

определена относительно критического периода распространения синхросигнала для конвейерной схемы следующим образом (формула 1.1) [51, 63]:

где N - количество стадий вычислителя;

кп - коэффициент неравномерности разбиения вычислительной логики на стадии вычислений фп > 1);

¿о - минимально необходимый интервал времени, в частности, связанной с неравномерностью трассировки;

I - периода распространения синхросигнала;

/ - тактовая частота работы вычислителя.

1.4. Предварительная оценка временных характеристик специализированного вычислителя с конвейерной архитектурой.

Как было ранее сказано, вычислительная логика в рамках каждой стадии вычислений определена набором арифметико-логических (атомарных) операций. Каждая атомарная операция может быть реализована в базисе соответствующего набора компонентов целевой аппаратной платформы, на базе которой проектируется вычислитель. Используя сведения о логических задержках (logic delay [59]) компонентов из технологической библиотеки целевой аппаратной платформы (PDK), можно определить предварительные величины задержек распространения сигнала между синхронными элементами схемы вычислителя.

На основе сформированного набора временных задержек возможно произвести балансировку вычислений между стадиями конвейера таким образом, чтобы критические (максимальные по величине) задержки на путях распространения сигнала в пределах каждой стадии • • • ¿п)

оказались приблизительно равны (¿ъ ■ ■ ■ tn < t, t\ ~ ¿2 ~ 1 *' ~ tn),

как показано на рис. 1.5-1.6. Такой подход позволяет минимизировать величину критической задержки в рамках общей схемы вычислителя, и, как следствие, повысить предельную тактовой частоты работы вычислителя.

Рисунок 1.5 — Структурная схема логического представления

вычислителя

Рисунок 1.6 — Структурная схема логического представления вычислителя с разбиением по стадиям конвейера

1.5. Задача построения топологического представления специализированного вычислителя с конвейерной архитектурой

При переходе от логического варианта представления вычислителя к топологическому выходные характеристики полученного решения, предоставляемые в отчётных материалах со стороны САПР, могут иметь различия с соответствующими величинами, определенными на этапе предварительной оценки. Причиной такого расхождения может выступать отсутствие на уровне логического представления сведений о конфигурации итогового размещения, согласно которому определяются непосредственное позиционирование элементов на кристалле и протяжённость трассировочных линий (рис. 1.7), формирующих дополнительную задержку (route delay [59]), что, в свою очередь, отражается на выходных значениях модели задержек распространения сигнала.

Рисунок 1.7 — Пример структуры размещения элементов топологического представления специализированного вычислителя с конвейерной

архитектурой

Для демонстрации описанного эффекта далее приводится пример расчёта временных характеристик распространения сигнала для логического и топологического представлений для конвейерного вычислителя с двумя стадиями вычислений.

На рис. 1.8 показана синтезированная схема рассматриваемого вычислителя, выступающая в качестве логического представления, на базе ПЛИС Xilinx серии Artix-7.

Рисунок 1. 8 — Пример синтезированной схемы конвейерного

вычислителя с двумя стадиями вычисления На схеме присутствуют два синхронных пути распространения сигнала: зелёным цветом обозначен выход источника сигнала, красным цветом - вход приёмника сигнала. Элементы, располагаемые в рамках

первого пути, обозначены синим цветом, в рамках второго пути -оранжевым. Узлы хранения данных реализованы в виде компонентов с именем FDRE, а вычислительная логика представлена компонентами LUT2. Более подробное описание аппаратной платформы ПЛИС, а также назначения задействованных компонентов приведено в пункте 1.6 настоящей диссертации.

На основе технических сведений о временных задержках на элементах целевой аппаратной платформы, представленных на рис. 1.8, возможно рассчитать суммарные задержки распространения сигнала для обоих синхронных путей и на основе полученных результатов определить величину критической задержки для логического представления (Logic Delay, рис. 1.9).

Рисунок 1.9 — Таблица расчёта временных задержек (Logic Delay)

В случае принудительной расстановки триггеров в неоптимальные положения (рис. 1.10) САПР демонстрирует существенную разницу во времени трассировки, что отображено в расчётной таблице на рис. 1.11 (2,152 для первого пути и 1,277 для второго пути), при том, что задержка на логических элементах примерно одинакова. Это показывает, что даже при равномерном распределении задержек на логических элементах важную роль играет этап размещения и трассировки, который может внести существенную неравномерность в распространение сигналов.

Рисунок 1.10 — Пример размещения элементов конвейерного вычислителя с двумя стадиями вычисления

Name Logic Delay ^ ' Net Delay Total Delay

Рисунок 1.11 — Таблица расчёта временных задержек (Logic Delay, Net

Delay и Total Delay) Для сохранения временных характеристик решения, закладываемых на этапе логического представления, и минимизации влияния трассировки схемы ставится задача поиска варианта топологического представления, удовлетворяющего предъявляемым требованиям, в общем виде (формула 1.2):

argmin(max(t1(x),t2(x)J ...,tk(x))\ (1.2)

где х - множество характеристик конечного решения, оказывающих влияние на величину задержки,

к - количество путей распространения сигнала,

- функция зависимости величины задержки от характеристик конечного решения.

Поставленная задача сводится к поиску среди всех возможных вариантов топологического представления конвейерного вычислителя такого конечного решения, для которого критическая задержка распространения сигнала будет минимальной.

В качестве целевой аппаратной платформы для реализации специализированных вычислителей рассматриваются программируемые логические интегральные схемы (ПЛИС), поскольку их применение позволяет дать более объективную оценку вклада вносимых изменений в конфигурацию размещения и трассировки схемы на кристалле, минимизируя влияние сторонних факторов, возникающих при проектировании микросхем на базе СБИС.

1.6. Описание внутренней структуры кристалла ПЛИС

На сегодняшний день основной архитектурой, которая применяется для аппаратной платформы ПЛИС, является архитектура FPGA (Field Programmable Gate Array, рис. 1.12) [53].

Рисунок 1.12 — Структурная схема компонентов кристалла ПЛИС В основе ПЛИС с архитектурой FPGA лежит матричная структура, содержащая однородный массив конфигурируемых логических блоков (КЛБ) [47, 53], равномерно распределённых по всей площади кристалла, а также набор специализированных блоков, для которых предусмотрены отдельные области размещения. Между всеми блоками ПЛИС проложены трассировочные линии для распространения внутренних сигналов. По границам кристалла располагаются блоки ввода/вывода для приёма и передачи данных со стороны внешних устройств.

В рамках конфигурируемого логического блока ПЛИС могут быть определены одна или несколько логических ячеек (рис. 1.13).

Компонентный состав ячейки, как правило, содержит набор комбинационных узлов для реализации вычислительной логики и последовательностных узлов для хранения или удерживания передаваемых данных.

Рисунок 1.13 — Внутренняя структура логической ячейки ПЛИС Основным комбинационным блоком логической ячейки, на базе которого реализуется вычислительная логика, является таблица поиска (LookUp Table, LUT [54]). Блоки LUT (рис. 1.14) используются для построения логических функций.

Рисунок 1.14 — Структура блоков LUT в логической ячейке В зависимости от размера внутренней памяти, применяемой для таблицы поиска, может варьироваться максимальное количество переменных, определяемое для задаваемой логической функции.

Актуальным стандартом для современных моделей ПЛИС является использование 6-входовых таблиц поиска [54]. Для увеличения возможного набора переменных функции в логической ячейке могут присутствовать дополнительные мультиплексирующие узлы (MUX [54]), позволяющие задействовать одновременно несколько таблиц поиска для реализации одной логической функции.

В некоторых моделях ПЛИС, в частности, разрабатываемых вендором Xilinx, таблицы поиска могут использоваться в качестве составных компонентов для организации структуры распределенной памяти (distributed memory [54]). Для этого в интерфейсе таблицы поиска предусматриваются дополнительные шины адреса и шины данных для выполнения операций чтения и записи (рис. 1.15).

Рисунок 1.15 — Интерфейс блока LUT, используемого для организации

структуры распределенной памяти Взаимодействие с памятью в таком ключе может осуществляться как поэлементно, при помощи прямого обращения к соответствующим таблицам поиска, так с применением многопортового интерфейса ввода/вывода. Распределенная память может использоваться в рамках стадий вычислений в различных случаях, в частности, для организации постоянного доступа к константным значениям.

Дополнительно в логической ячейке могут быть предусмотрены блоки быстрого переноса (CARRY [54]), применяемые для ускорения передачи одного или нескольких битов переноса между разрядами для операций сложения или вычитания (рис. 1.16). В зависимости от внутренней структуры блока количество передаваемых битов переноса может меняться: в актуальных моделях ПЛИС широко распространены блоки, позволяющие переносить до 4 битов переноса или до 8 битов переноса.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Люлява Даниил Вячеславович, 2025 год

Список литературы

1. Тарасов И.Е., Советов П.Н., Люлява Д.В., Мирзоян Д.И. Методика проектирования специализированных вычислительных систем на основе совместной оптимизации аппаратного и программного обеспечения // Russian Technological Journal. 2024. Т. 12, № 3. С. 37-45.

2. Hennessy, J.L.; Patterson, D.A. A new golden age for computer architecture: Domain-specific hardware/software co-design, enhanced security, open instruction sets, and agile chip development. In Proceedings of the 2018 ACM/IEEE 45th Annual International Symposium on Computer Architecture (ISCA), Los Angeles, CA, USA, 1-6 June 2018. doi:10.1109/ISCA.2018.00011.

3. «Закон Мура» // Большая российская энциклопедия: научно-образовательный портал - URL: https://bigenc.ru/c/zakon-mura-ea5ceb/?v=6514772 (дата обращения: 17.05.2025).

4. G. E. Moore, "Cramming more components onto integrated circuits, Reprinted from Electronics, volume 38, number 8, April 19, 1965, pp. 114 ff.," in IEEE Solid-State Circuits Society Newsletter, vol. 11, no. 3, pp. 33-35, Sept. 2006, doi: 10.1109/N-SSC.2006.4785860.

5. Макушин М. В. Масштабирование Деннарда // Большая российская энциклопедия: научно-образовательный портал - URL: https://bigenc.ru/c/masshtabirovanie-dennarda-b7a108/?v=6362430 (дата обращения: 17.05.2025).

6. H. Esmaeilzadeh, E. Blem, R. S. Amant, K. Sankaralingam and D. Burger, "Dark silicon and the end of multicore scaling," 2011 38th Annual International Symposium on Computer Architecture (ISCA), San Jose, CA, USA, 2011, pp. 365-376.

7. Орлов С.А. Организация ЭВМ и систем: Учебник для вузов. 4-е изд. — СПб.: Питер, 2018. — 688 с.: ил.

8. Gustafson, J.L. (2011). Amdahl's Law. In: Padua, D. (eds) Encyclopedia of Parallel Computing. Springer, Boston, MA. https://doi.org/10.1007/978-0-387-09766-4_77

9. Тарасов, И.Е. Вопросы проектирования специализированных СБИС с конвейерной архитектурой / И. Е. Тарасов // Высокопроизводительные вычислительные системы и технологии. - 2022.

- Т. 6, № 2. - С. 11-17.

10. Каляев А.В., Каляев И.А., Левин И.И. Многопроцессорные вычислительные системы с программируемой архитектурой на основе ПЛИС // Вестник Южного научного центра РАН. - 2004. - № S. - С. 24-33.

11. Каляев И.А., Левин И.И. Реконфигурируемые мультиконвейерные вычислительные системы для решения потоковых задач // Информационные технологии и вычислительные системы. - 2011.

- № 2. - С. 12-22.

12. Каляев И.А., Левин И.И., Семерников E.A., Шмойлов В.И. Реконфигурируемые мультиконвейерные вычислительные структуры // Ростов-на-Дону : Южный научный центр РАН, 2008. - 320 с. - ISBN 978-5902982-32-6.

13. Высокопроизводительная реконфигурируемая вычислительная система РВС-7 на основе ПЛИС VIRTEX-7 / И. И. Левин, И. А. Каляев, А. И. Дордопуло, Е. А. Семерников // Параллельные вычислительные технологии 2013 (ПаВТ'2013) : Труды международной научной конференции, Челябинск, 01-05 апреля 2013 года / Ответственные за выпуск: Л.Б. Соколинский, К.С. Пан. - Челябинск: Издательский центр ЮУрГУ, 2013. - С. 449-454.

14. Левин И.И., Дордопуло А.И., Каляев И.А., Доронченко Ю.И., Раскладкин М.К. Современные и перспективные высокопроизводительные вычислительные системы с реконфигурируемой архитектурой // Параллельные вычислительные технологии (ПаВТ'2015) : Труды

международной научной конференции, Екатеринбург, 31 марта - 02 2015 года / Редакторы: Л.Б. Соколинский, К.С. Пан. - Екатеринбург: Издательский центр ЮУрГУ, 2015. - С. 188-199.

15. Левин И.И., Дордопуло А.И., Каляев И.А., Гудков В.А. Высокопроизводительные реконфигурируемые вычислительные системы на основе ПЛИС Уп1ех-7 // Программная инженерия. - 2014. - № 6. - С. 37. - 001 http://novtex.ru/prin/full/articles/pi614_web-3-7.pdf. - БЭК БОУР/У.

16. Перспективные реконфигурируемые вычислительные системы на основе ПЛИС Уп1ех-6 и Уп1ех-7 / И. И. Левин, И. А. Каляев, А. И. Дордопуло, Е. А. Семерников // Научный сервис в сети Интернет: поиск новых решений : Труды Международной суперкомпьютерной конференции, Новороссийск, 17-22 сентября 2012 года. - Новороссийск: Издательство Московского государственного университета, 2012. - С. 338344.

17. Диченко А.А., Левин И.И., Сорокин Д.А. Принципы автоматизации процесса создания проектных ограничений программируемых логических интегральных схем при решении вычислительно-трудоёмких задач на реконфигурируемых вычислительных системах // Супервычисления и математическое моделирование : Тезисы XIX Международной конференции, Саров, 20-24 мая 2024 года. - Саров: Федеральное государственное унитарное предприятие "Российский Федеральный ядерный центр - Всероссийский научно-исследовательский институт экспериментальной физики", 2024. - С. 74-75.

18. Алексеев К.Н., Сорокин Д.А., Леонтьев А.Л. Методика создания проектных ограничений при высокой утилизации ресурсов ПЛИС // Известия ЮФУ. Технические науки. - 2022. - № 4(228). - С. 200-212. -Э01 10.18522/2311-3103-2022-4-201-213.

19. Алексеев К.Н., Сорокин Д.А., Леонтьев А.Л. Синтезатор проектных ограничений ПЛИС // Многопроцессорные вычислительные и

управляющие системы : материалы Всероссийской научно-технической конференции (МВУС-2022), Таганрог, 27-30 июня 2022 года. - Ростов-на-Дону: Южный федеральный университет, 2022. - С. 129-133.

20. Курейчик В.М., Кажаров А. А.. Использование роевого интеллекта в решении NP-трудных задач // Известия ЮФУ. Технические науки. - 2011. - № 7(120). - С. 30-36.

21. Кулиев Э.В., Лежебоков А.А. О гибридном алгоритме размещения компонентов СБИС // Известия ЮФУ. Технические науки. -2012. - № 11(136). - С. 188-192.

22. Б. К. Лебедев, О. Б. Лебедев, А. А. Жиглатый. Размещение элементов СБИС на основе моделей роевого интеллекта // Проблемы разработки перспективных микро- и наноэлектронных систем (МЭС). -2020. - № 4. - С. 118-126. - DOI 10.31114/2078-7707-2020-4-118-125.

23. Hennessy J L, Patterson D A 2017 Computer Architecture. 6th Edition. A Quantitative Approach (The Morgan Kaufmann Series in Computer Architecture and Design) 936 p.

24. Jari Nurmi. 2007. Processor Design: System-On-Chip Computing for ASICs and FPGAs (1st. ed.). Springer Publishing Company, Incorporated.

25. Makino, Junichiro. (2021). Principles of High-Performance Processor Design: For High Performance Computing, Deep Neural Networks and Data Science. 10.1007/978-3-030-76871-3.

26. I. Page, "Closing the gap between hardware and software: hardwaresoftware cosynthesis at Oxford," IEE Colloquium on Hardware-Software Cosynthesis for Reconfigurable Systems, Bristol, UK, 1996, pp. 2/1-211, doi: 10.1049/ic:19960221.

27. "IEEE Standard SystemC(R) Language Reference Manual," in IEEE Std 1666-2005 , vol., no., pp.1-423, 31 March 2006, doi: 10.1109/IEEESTD.2006.99475.

28. Sumit Gupta, Rajesh K. Gupta, Nikil D. Dutt, Alexandra Nicolau. SPARK: A Parallelizing Approach to the High-Level Synthesis of Digital Circuits. Springer, Boston, MA. https://doi.org/10.1007/1-4020-7838-2_1.

29. Jan Decaluwe. 2004. MyHDL: a python-based hardware description language. Linux J. 2004, 127 (November 2004), 5.

30. Сравнение инструментов высокоуровневого синтеза и конструирования цифровой аппаратуры / А. С. Камкин, М. М. Чупилко, М. С. Лебедев [и др.] // Труды Института системного программирования РАН. - 2022. - Т. 34, № 5. - С. 7-22. - DOI 10.15514/ISPRAS-2022-34(5)-1.

31. Камкин, А. С. Открытое промежуточное представление специализированных потоковых вычислителей, основанное на MLIR / А. С. Камкин, М. Ю. Литвинов, И. А. Григоров // Труды Института системного программирования РАН. - 2024. - Т. 36, № 5. - С. 31-46. - DOI 10.15514/ISPRAS-2024-36(5)-3.

32. Dijkstra, E.W. A note on two problems in connexion with graphs. Numer. Math. 1, 269-271 (1959). https://doi.org/10.1007/BF01386390.

33. Bellman, R. (1958). On a routing problem. Quarterly of Applied Mathematics, 16(1), 87-90. https://doi.org/10.1090/QAM/102435

34. D. R. Ford and D. R. Fulkerson. 2010. Flows in Networks. Princeton University Press, USA.

35. Гаврилов С.В., Железников Д.А., Чочаев Р.Ж. Разработка и сравнительный анализ методов решения задачи размещения для реконфигурируемых систем на кристалле / С. В. // Известия высших учебных заведений. Электроника. - 2020. - Т. 25, № 1. - С. 48-57. - DOI 10.24151/15615405-2020-25-1-48-57.

36. Шокарев Д.Б., Чочаев Р.Ж., Щелоков А.Н., Гаврилов С.В. Разработка алгоритма детального размещения на ПЛИС // Известия ЮФУ. Технические науки. - 2023. - № 5(235). - С. 48-57. - DOI 10.18522/2311-31032023-5-48-57.

37. Эннс В.И., Гаврилов С.В., Чочаев Р.Ж.. Автоматическая настройка программных средств размещения пользовательских схем на ПЛИС // Известия высших учебных заведений. Электроника. - 2021. - Т. 26, № 6. - С. 508-520. -DOI 10.24151/1561-5405-2021-26-6-508-520. - EDN QAWWJQ.

38. R. A. Solovyev et al, "PAGR: Accelerating Global Routing for VLSI Design Flow," in IEEE Access, vol. 13, pp. 6440-6450, 2025, doi: 10.1109/ACCESS.2025.3526722.

39. Chak-Wa Pui, Gengjie Chen, Wing-Kai Chow, Ka-Chun Lam, Jian Kuang, Peishan Tu, Hang Zhang, Evangeline F. Y. Young, and Bei Yu. 2016. RippleFPGA: A routability-driven placement for large-scale heterogeneous FPGAs. In 2016 IEEE/ACM International Conference on Computer-Aided Design (ICCAD). IEEE Press, 1-8. https://doi.org/10.1145/2966986.2980084

40. Tingyuan Liang, Gengjie Chen, Jieru Zhao, Sharad Sinha, and Wei Zhang. 2024. AMF-Placer 2.0: Open-Source Timing-Driven Analytical Mixed-Size Placer for Large-Scale Heterogeneous FPGA. Trans. Comp.-Aided Des. Integ. Cir. Sys. 43, 9 (Sept. 2024), 2769-2782. https://doi.org/10.1109/TCAD.2024.3373357.

41. Larry McMurchie and Carl Ebeling. 1995. PathFinder: a negotiation-based performance-driven router for FPGAs. In Proceedings of the 1995 ACM third international symposium on Field-programmable gate arrays (FPGA '95). Association for Computing Machinery, New York, NY, USA, 111-117. https://doi.org/10.1145/201310.201328

42. Тарасов И.Е. Схемотехника устройств компьютерных систем. Часть 2 [Электронный ресурс]: Учебное пособие / Тарасов И.Е. — М.: МИРЭА -Российский технологический университет, 2022.

43. Maillet-Contoz, L., Ghenassia, F. (2005). Transaction Level Modeling. In: Ghenassia, F. (eds) Transaction Level Modeling with SystemC. Springer, Boston, MA. https://doi.org/10.1007/0-387-26233-4_2.

44. Тарасов И.Е. ПЛИС Xilinx. Языки описания аппаратуры VHDL и Verilog, САПР, приемы проектирования. — М.: Горячая линия — Телеком, 2021. — 538 с.: ил.

45. Угрюмов Е. П. Цифровая схемотехника: учеб. пособие для вузов. — 3-еизд., перераб. и доп. — СПб.: БХВ-Петербург, 2010. — 816 с.: ил.

46. Основы проектирования цифровых устройств с использованием языка VERILOG. : учебное пособие / И. Е. Тарасов, Е. Ф. Певцов .— М. : МГТУ МИРЭА , 2011.

47. Рабаи, Жан М., Чандракасан, Ананта, Николич, Боривож. Цифровые интегральные схемы, 2-е издание.: Пер. с англ. М. : ООО "И.Д. Вильямс", 2007. 912 с. : ил.

48. Michael John Sebastian Smith. 2008. Application-Specific Integrated Circuits (1st. ed.). Addison-Wesley Professional.

49. Дуксин Н.А., Люлява Д.В. Исследование характеристик конвейеризированных структур // ИТ-Стандарт. - 2024. - № 4(41). - С. 68-82.

50. Тарасов И. Е. Проектирование ускорителей вычислений в составе программно-аппаратных комплексов. : монография / И. Е. Тарасов .— Москва : РТУ МИРЭА , 2024

51. Тарасов И.Е., Люлява Д.В., Дуксин Н.А. Проектирование конвейерного вычислительного узла в составе специализированной СБИС // ВЫСОКОПРОИЗВОДИТЕЛЬНЫЕ ВЫЧИСЛИТЕЛЬНЫЕ СИСТЕМЫ И ТЕХНОЛОГИИ В НАУЧНЫХ ИССЛЕДОВАНИЯХ, АВТОМАТИЗАЦИИ УПРАВЛЕНИЯ И ПРОИЗВОДСТВА - 2023 - Том 7, № 1 - с. 25-30.

52. Люлява Д.В, Дуксин Н.А., Дуксина И.И., ПОДХОДЫ К ПРОЕКТИРОВАНИЮ КОНВЕЙЕРНЫХ ВЫЧИСЛЕНИЙ // Новые информационные технологии в научных исследованиях: материалы XXVIII Всероссийской научно-технической конференции студентов, молодых ученых и специалистов. Рязанский государственный радиотехнический университет имени В.Ф. Уткина, 2023 г.

53. Ian Grout. 2008. Digital Systems Design with FPGAs and CPLDs. Newnes, USA.

54. 7 Series FPGAs Configurable Logic Block User Guide (UG474) // URL: https://docs.amd.com/r7en-US/ug474_7Series_CLB (дата обращения: 17.05.2025).

55. K. Shahookar and P. Mazumder. 1991. VLSI cell placement techniques. ACM Comput. Surv. 23, 2 (June 1991), 143-220. https://doi.org/10.1145/103724.103725.

56. Черников, Б. В. Анализ методов размещения элементов при проектировании специализированных бис / Б. В. Черников, А. В. Можжухина, Е. А. Черникова // Управление развитием крупномасштабных систем mlsd'2020 :

ТРУДЫ ТРИНАДЦАТОЙ МЕЖДУНАРОДНОЙ КОНФЕРЕНЦИИ, Москва, 2830 сентября 2020 года / Под общей редакцией С.Н. Васильева, А.Д. Цвиркуна. -Москва: Институт проблем управления им. В.А. Трапезникова РАН, 2020. - С. 792-798. - DOI 10.25728/mlsd.2020.0792.

57. Безгачев, Ф. В. Методы глобальной оптимизации на основе различных подходов оптимизации / Ф. В. Безгачев // E-Scio. - 2020. - № 12(51). -С. 470-476. - EDN HRFHTH.

58. Vivado Design Suite (WP416) // URL: https://docs.amd.com/Wu/en-US/wp416-Vivado-Design-Suite (дата обращения: 17.05.2025).

59. Design Implementation in the Xilinx Vivado Design Suite. // URL: https://www.allaboutcircuits.com/news/Xilinx-vivado-design-suite-design-implementation/ (дата обращения: 17.05.2025).

60. Xilinx's Vivado: An "All-Programmable" Toolset for Today and Tomorrow // URL: https://www.bdti.com/InsideDSP/2012/08/02/Xilinx (дата обращения: 17.05.2025).

61. Vivado Design Suite User Guide. Using Constraints // URL: https://www.xilinx.com/support/documents/sw_manuals/xilinx2022_1/ug903-vivado-using-constraints.pdf (дата обращения: 17.05.2025).

62. Тарасов И.Е., Люлява Д.В., Дуксин Н.А. Проектирование конвейерного вычислительного узла в составе специализированной СБИС // ВЫСОКОПРОИЗВОДИТЕЛЬНЫЕ ВЫЧИСЛИТЕЛЬНЫЕ СИСТЕМЫ И ТЕХНОЛОГИИ В НАУЧНЫХ ИССЛЕДОВАНИЯХ, АВТОМАТИЗАЦИИ УПРАВЛЕНИЯ И ПРОИЗВОДСТВА - 2023 - Том 7, № 1 - с. 25-30.

63. Tarasov, I., Lyulyava, D., Duksin, N., Duksina, I. (2024). Design of a Pipeline Computing Module as Part of a Specialized VLSI. In: Jordan, V., Tarasov, I., Shurina, E., Filimonov, N., Faerman, V.A. (eds) High-Performance Computing Systems and Technologies in Scientific Research, Automation of Control and Production. HPCST 2023. Communications in Computer and Information Science, vol 1986. Springer, Cham (SCOPUS).

64. Дуксин Н.А., Люлява Д.В., Долидзе И.И. Вопросы проектирования специализированных вычислителей конвейерного типа // Сборник трудов XII Международной научной конференции «ИТ - СТАНДАРТ 2023», с. 181-193.

65. Тарасов, И. Е.. Люлява Д.В., Дуксин Н.А. Проектирование конвейерных вычислительных устройств с учетом топологического представления // Вестник Рязанского государственного радиотехнического университета. - 2023. - № 86. - С. 86-95.

66. D. Lyulyava, N. Duksin, I. Duksina and D. Shchepukhin, "Impact of Optimization on a Specialized Pipelined Computing Device Across Multiple Design Levels," 2024 6th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2024, pp. 1102-1106, doi: 10.1109/SUMMA64428.2024.10803697.

67. Vivado Design Suite User Guide: Design Analysis and Closure Techniques (UG906) // URL: https://docs.amd.com/r/en-US/ug906-vivado-design-analysis (дата обращения: 17.05.2025)

68. D. Lyulyava, N. Duksin, I. Duksina and D. Shchepukhin, "Organization of an Automated Design Flow for FPGA and ASIC," 2024 6th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2024, pp. 1107-1110, doi: 10.1109/SUMMA64428.2024.10803753.

69. Carver Mead and Lynn Conway. 1979. Introduction to VLSI Systems. Addison-Wesley Longman Publishing Co., Inc., USA.

70. Советов, П. Н. Математическое и алгоритмическое обеспечение создания компиляторов предметно--ориентированных языков для специализированных вычислительных машин : специальность 05.13.11 "Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей" : диссертация на соискание ученой степени кандидата технических наук / Советов Петр Николаевич, 2020. - 126 с.

71. Введение в системы автоматизированного проектирования интегральных микросхем : учебно-методическое пособие / составители А. В. Тучин [и др.]. — Воронеж : ВГУ, 2017 — Часть 1 — 2017. — 111 с. — Текст :

электронный // Лань : электронно-библиотечная система. — URL: https://elanbook.com/book/154768 (дата обращения: 21.05.2025).

72. Sanjay Churiwala. 2016. Designing with Xilinx FPGAs: Using Vivado (1st. ed.). Springer Publishing Company, Incorporated.

73. UltraFast Design Methodology Guide for FPGAs and SoCs (UG949) // URL: https://docs.amd.com/r/en-US/ug949-vivado-design-methodology (дата обращения: 17.05.2025).

74. Andrew B. Kahng, Jens Lienig, Igor L. Markov, and Jin Hu. 2011. VLSI Physical Design: From Graph Partitioning to Timing Closure (1st. ed.). Springer Publishing Company, Incorporated.

75. Тарасов И.Е.., Потехин Д.С. Статистическая обработка данных в информационных системах [Электронный ресурс]: Монография — М.: МИРЭА -Российский технологический университет, 2023.

76. AMD FPGAs // URL: https://www.amd.com/en/products/adaptive-socs-and-fpgas/fpga.html (дата обращения: 22.05.2025).

77. 7 Series Product Tables and Product Selection Guide (XMP101) // URL: https://docs.amd.com/v/u/en-US/7-series-product-selection-guide (дата обращения: 22.05.2025).

78. 7 Series FPGAs Data Sheet: Overview (DS180) // URL: https://docs.amd.com/vZu/en-US/ds180_7 Series_Overview (дата обращения: 22.05.2025).

79. UltraScale FPGA Product Tables and Product Selection Guide (XMP102) // URL: https://docs.amd.com/v/u/en-US/ultrascale-fpga-product-selection-guide (дата обращения: 22.05.2025).

80. UltraScale Architecture and Product Data Sheet: Overview (DS890) // URL: https://docs.amd.com/v/u/en-US/ds890-ultrascale-overview (дата обращения: 22.05.2025).

81. 7 Series FPGAs Configurable Logic Block User Guide (UG474) // URL: https://docs.amd.com/r/en-US/ug474_7Series_CLB (дата обращения: 22.05.2025).

82. 7 Series FPGAs Memory Resources User Guide. (UG473) // URL: https://docs.amd.com/v/u/en-US/ug473_7Series_Memory_Resources (дата обращения: 22.05.2025).

83. 7 Series FPGAs Clocking Resources User Guide (UG472) // URL: https://docs.amd.com/v/u/en-US/ug472_7Series_Clocking (дата обращения: 22.05.2025).

84. Artix 7 FPGAs Data Sheet: DC and AC Switching Characteristics (DS181) // URL: https://docs.amd.com/v/u/en-US/ds181_Artix_7_Data_Sheet (дата обращения: 22.05.2025).

85. UltraScale Architecture Clocking Resources User Guide (UG572) // URL: https://docs.amd.com/r/en-US/ug572-ultrascale-clocking (дата обращения: 22.05.2025).

86. Kintex UltraScale FPGAs Data Sheet: DC and AC Switching Characteristics (DS892) // URL: https://docs.amd.com/v/u/en-US/ds892-kintex-ultrascale-data-sheet (дата обращения: 22.05.2025).

87. UltraScale Architecture Configurable Logic Block User Guide (UG574) // URL: https://docs.amd.com/r/en-US/ug574-ultrascale-clb (дата обращения: 22.05.2025).

88. Virtex UltraScale FPGAs Data Sheet: DC and AC Switching Characteristics (DS893) // URL: https://docs.amd.com/v/u/en-US/ds893-virtex-ultrascale-data-sheet (дата обращения: 22.05.2025).

89. UltraScale Architecture Memory Resources // URL: https://www.amd.com/content/dam/xilinx/support/documents/user_guides/ug573-ultrascale-memory-resources.pdf (дата обращения: 22.05.2025).

90. Vivado Design Suite Documentation // URL: https://docs.amd.com/r/en-US/ug896-vivado-ip/Vivado-Design-Suite-Documentation (дата обращения: 22.05.2025).

91. Vivado Design Suite User Guide: Synthesis (UG901) // URL: https://docs.amd.com/rZen-US/ug901-vivado-synthesis (дата обращения: 22.05.2025).

92. Vivado Design Suite User Guide: Implementation (UG904) // URL: https://docs.amd.com/r/en-US/ug904-vivado-implementation (дата обращения: 22.05.2025).

93. Vivado Design Suite Tutorial: Programming and Debugging (UG936) // URL: https://docs.amd.com/r/en-US/ug908-vivado-programming-debugging (дата обращения: 22.05.2025).

94. Sridhar Gangadharan and Sanjay Churiwala. 2015. Constraining Designs for Synthesis and Timing Analysis: A Practical Guide to Synopsys Design Constraints (SDC). Springer Publishing Company, Incorporated.

95. Vivado Design Suite Tcl Command Reference Guide (UG835) // URL: https://docs.amd.com/r/en-US/ug835-vivado-tcl-commands (дата обращения: 22.05.2025).

96. Vivado Design Suite Properties Reference Guide (UG912) // URL: https://docs.amd.com/r/en-US/ug912-vivado-properties (дата обращения: 22.05.2025).

97. Python.org // URL: https://www.python.org/ (дата обращения: 22.05.2025).

98. Matplotlib - Visualization with Python // URL: https://matplotlib.org/ (дата обращения: 22.05.2025).

99. ГОСТ 28147-89. Системы обработки информации. Защита криптографическая. Алгоритм криптографического преобразования.

100. Захаров A.B., Хачумов В.М. Алгоритмы CORDIC. Современное состояние и перспективы // Программные системы: теория и приложения, М.: Физматлит, май 2004, с. 353-372.

101. Дуксина И.И., Дуксин Н.А., Люлява Д.В. Подходы к проектированию верификационного окружения для специализированных вычислителей // Новые информационные технологии в научных исследованиях: материалы XXIX Всероссийской научно-технической конференции студентов, молодых ученых и специалистов, г. Рязань, РГРТУ, 2024, 208 с. - c. 90-91.

102. Тарасов, И. Е. Применение программно-аппаратного стенда на базе ПЛИС для прототипирования специализированных вычислительных модулей

сверхбольших интегральных схем / И. Е. Тарасов, Д. В. Люлява, Н. А. Дуксин // Высокопроизводительные вычислительные системы и технологии. - 2022. - Т. 6, № 2. - С. 18-23.

103. Дуксин, Н. А., Люлява Д.В. Применение подходов к размещению тракта обработки данных с целью повышения тактовой частоты работы специализированного вычислителя // Новые информационные технологии в научных исследованиях : Материалы XXIX Всероссийской научно-технической конференции студентов, молодых ученых и специалистов, Рязань, 27-29 ноября 2024 года. - Рязань: Рязанский государственный радиотехнический университет им. В.Ф. Уткина, 2024. - С. 88-89.

104. Люлява Д.В. Применение методики оптимизации физического представления специализированного вычислителя с конвейерной архитектурой. // Вестник Рязанского государственного радиотехнического университета (ВАК).

Список рисунков

Рисунок 1.1 — Маршрут проектирования специализированных вычислительных систем

..................................................................................................................................................16

Рисунок 1.2 — Прямые связи в маршруте проектирования специализированных

вычислительных систем........................................................................................................22

Рисунок 1.3 - Варианты архитектур специализированных вычислителей.......................24

Рисунок 1.4 — Схемотехническое представление тракта обработки данных

конвейерного вычислителя...................................................................................................25

Рисунок 1.5 — Структурная схема логического представления вычислителя................27

Рисунок 1.6 — Структурная схема логического представления вычислителя с

разбиением по стадиям конвейера.......................................................................................27

Рисунок 1.7 — Пример структуры размещения элементов топологического

представления специализированного вычислителя с конвейерной архитектурой.........28

Рисунок 1.8 — Пример синтезированной схемы конвейерного вычислителя с двумя

стадиями вычисления ............................................................................................................ 28

Рисунок 1.9 — Таблица расчёта временных задержек (Logic Delay)...............................29

Рисунок 1.10 — Пример размещения элементов конвейерного вычислителя с двумя

стадиями вычисления ............................................................................................................ 29

Рисунок 1.11 — Таблица расчёта временных задержек (Logic Delay, Net Delay и Total

Delay).......................................................................................................................................30

Рисунок 1.12 — Структурная схема компонентов кристалла ПЛИС...............................31

Рисунок 1.13 — Внутренняя структура логической ячейки ПЛИС..................................32

Рисунок 1.14 — Структура блоков LUT в логической ячейке..........................................32

Рисунок 1.15 — Интерфейс блока LUT, используемого для организации структуры

распределенной памяти ......................................................................................................... 33

Рисунок 1.16 — Структура блока типа CARRY в логической ячейке ПЛИС.................34

Рисунок 1.17 — Структура блоков FF/Latch в логической ячейке ПЛИС.......................35

Рисунок 1.18 — Структура блоков BRAM..........................................................................35

Рисунок 1.1 9 — Вертикальные соединения между блоками быстрого переноса на

кристалле ПЛИС....................................................................................................................36

Рисунок 1.20 — Пример разбиения кристалла ПЛИС на тактовые регионы (X0Y0, X0Y1, ..., X1Y3)................................................................................................................................37

Рисунок 1.21 — График изменения количества возможных вариантов решения относительно количества позиций размещения и количества элементов схемы

вычислителя............................................................................................................................38

Рисунок 1.22 — Визуализация процесса поиска конечного решения средствами САПР

Xilinx ISE Design Suite [58-59]..............................................................................................42

Рисунок 1.23 — График поверхности вариантов решений по трём параметрам: T — временные затраты (Timing Costs), W — длина проводов (Wire Length), С — степень

связности (Congestion Cost) [58-60].....................................................................................43

Рисунок 1.24 — График отношения времени поиска решения в соответствии с

приоритетными критериями для различных САПР ПЛИС [59-60]..................................43

Рисунок 2.1 — Пример размещения модулей с применением областей размещения

Pblock......................................................................................................................................45

Рисунок 2. 2 — Структурная схема организации размещения стадий вычислений на

кристалле ПЛИС....................................................................................................................46

Рисунок 2. 3 — Графическое представление методики совместного проектирования

специализированных вычислителей....................................................................................48

Рисунок 2. 4 — Структурная схема конвейерного вычислителя со входным и выходным

буферами FIFO.......................................................................................................................51

Рисунок 2. 5 — Структурная схема конвейерного вычислителя со входным и выходным

преобразователями данных...................................................................................................53

Рисунок 2.6 — Структурная схема конвейерного вычислителя с управлением стадиями

по сигналу заполненности выходного буфера....................................................................54

Рисунок 2. 7 — Визуализация принципа управления стадиями конвейерного

вычислителя при заполненности выходного буфера.........................................................55

Рисунок 2. 8 — Структурная схема конвейерного вычислителя с последовательным

вариантом валидационной цепочки.....................................................................................56

Рисунок 2. 9 — Структурная схема конвейерного вычислителя с параллельным

вариантом валидационной цепочки.....................................................................................57

Рисунок 2.10 — График изменения показателя WNS для вычислителей на основе

алгоритма Магма с переменной тактовой частотой...........................................................58

Рисунок 2.11 — График изменения показателя WNS для вычислителей на основе

алгоритма Магма с фиксированной тактовой частотой.....................................................58

Рисунок 2.12 — График изменения показателя WNS для набора конвейеров без вычислений с фиксированной тактовой частотой..............................................................59

Рисунок 2.13 — Структурная схема последовательной валидационной цепочки..........59

Рисунок 2.14 — Структурная схема параллельной валидационной цепочки..................60

Рисунок 2.15 — Структурная схема организации размещения стадий вычислений на кристалле ПЛИС с выделением областей для регистровой и комбинационной логики 62 Рисунок 2.16 — Расширение области стадии вычислений при переходе через зону

специализированных блоков................................................................................................63

Рисунок 2.17 — Структурная схема горизонтального расположения стадий.................65

Рисунок 2.18 — Структурная схема вертикального расположения стадий.....................65

Рисунок 2.19 — Структурная схема расположения стадий в виде полукольца..............66

Рисунок 2.20 — Варианты перекрытия стадий вычислений.............................................67

Рисунок 2.21 — Корректировка расположения стадий в ряду (вариант 1)......................67

Рисунок 2.22 — Корректировка расположения стадий в ряду (вариант 2)......................68

Рисунок 2.23 — Пример вертикальной связи, соединяющей элементы схемы и проходящей через области межсоединения (Interconnect) логических регионов (Super

Logic Region, SLR).................................................................................................................69

Рисунок 2.24 — Внешний вид Slack-гистограммы............................................................70

Рисунок 2.25— Примеры Slack-гистограмм для несбалансированного (а) и

сбалансированного (б) вариантов конвейерного вычислителя.........................................72

Рисунок 2.26 — Примеры Slack-гистограмм для исходного варианта размещения (а) с математическим ожиданием E[X0] и модифицированного варианта размещения (б) с

математическим ожиданием E[X1].......................................................................................73

Рисунок 2.27 — Отображение обратных связей в методике совместного проектирования

специализированных вычислителей....................................................................................74

Рисунок 3.1 — Маршрут построения вариантов топологического представления

специализированного вычислителя.....................................................................................77

Рисунок 3.2 — Маршрут анализа и визуализации полученных данных..........................78

Рисунок 3.3 — Маршрут построения одного варианта топологического представления

специализированного вычислителя.....................................................................................79

Рисунок 3.4 — Внутренняя структура блока CLB ПЛИС Artix-7.....................................84

Рисунок 3.5 — Внутренняя структура логической ячейки ПЛИС Artix-7.......................84

Рисунок 3.6 — Внутренняя структура блока RAMB36.....................................................85

Рисунок 3.7 — Внутренняя структура блока CLB ПЛИС Kintex UltraScale....................87

Рисунок 3.8 — Внутренняя структура логической ячейки ПЛИС Kintex UltraScale......88

Рисунок 3.9 — Расположение специализированных блоков на кристалле ПЛИС Kintex

UltraScale.................................................................................................................................89

Рисунок 3.10 — Расположение коммутационных шин типа LAGUNA на кристалле

ПЛИС Kintex UltraScale.........................................................................................................89

Рисунок 3.11 — Расположение специализированных блоков на кристалле ПЛИС Virtex

UltraScale.................................................................................................................................91

Рисунок 3.12 — Пример визуализации области Pblock в САПР Vivado..........................94

Рисунок 3.13 — Пример отображения таблицы временных показателей решения в САПР

Vivado......................................................................................................................................95

Рисунок 3.14 — Пример отображения Slack-гистограммы в САПР Vivado....................96

Рисунок 3.15 — Пример схемы тракта обработки данных................................................98

Рисунок 3.16 — Интерфейс ввода/вывода для тракта обработки данных.......................98

Рисунок 3.17 — Схема управления продвижением данных на основе сигнала о

заполненности выходного буфера......................................................................................100

Рисунок 3.18 — Интерфейс ввода/вывода тракта управления продвижением данных на

основе сигнала о заполненности выходного буфера........................................................100

Рисунок 3.19 — Схема управления продвижением данных на основе последовательной

валидационной цепочки......................................................................................................101

Рисунок 3.20 — Интерфейс ввода/вывода тракта управления продвижением данных на

основе последовательной валидационной цепочки.........................................................101

Рисунок 3.21 — Схема управления продвижением данных на основе параллельной

валидационной цепочки......................................................................................................102

Рисунок 3.22 — Интерфейс ввода/вывода буфера FIFO..................................................104

Рисунок 3.23 — Интерфейс последовательно-параллельного преобразователя...........105

Рисунок 3.24 — Интерфейс параллельно-последовательного преобразователя...........106

Рисунок 4.1 — Результат размещения схем вычислителей на кристалле (алгоритм

CORDIC, 16 бит, 16 стадий, 400 МГц, Artix-7).................................................................113

Рисунок 4.2 — Сравнение показателей Slack для различных вариантов размещений

(алгоритм CORDIC, 16 бит, 16 стадий, 400 МГц, Artix-7)...............................................114

Рисунок 4.3 — Результат размещения схем вычислителей на кристалле (алгоритм

CORDIC, 32 бита, 32 стадии, 850 МГц, Kintex US)..........................................................115

Рисунок 4.4 — Результат размещения схемы вычислителя на кристалле с применением автоматических средств САПР AMD Vivado (алгоритм CORDIC, 32 бита, 32 стадии, 850 МГц, Kintex US)...................................................................................................................116

Рисунок 4.5 — Сравнение показателей Slack для различных вариантов размещений

(алгоритм CORDIC, 32 бита, 32 стадии, 850 МГц, Kintex US)........................................117

Рисунок 4.6 — Результат размещения схем вычислителей на кристалле с различными тактовыми частотами: 850 МГц, 900 МГц, 1000 МГц (алгоритм CORDIC, 32 бита, 32

стадии, 1000 МГц, Virtex US).............................................................................................117

Рисунок 4.7 — Сравнение показателей Slack для различных вариантов размещений (алгоритм CORDIC, 32 бита, 32 стадии, 850 МГц, 900 МГц, 1000 МГц, Virtex US) .... 118 Рисунок 4.8 — Результат размещения схемы вычислителя на кристалле с применением автоматических средств САПР AMD Vivado (алгоритм CORDIC, 32 бита, 32 стадии,

1000 МГц, Virtex US)...........................................................................................................119

Рисунок 4.9 — Результат размещения схем вычислителей на кристалле (алгоритм

CORDIC, 32 бита, 32 стадии, 1000 МГц, Virtex US)........................................................120

Рисунок 4.10 — Сравнение показателей Slack для различных вариантов размещений

(алгоритм CORDIC, 32 бита, 32 стадии, 1000 МГц, Virtex US)......................................120

Рисунок 4.11 — Результат размещения схемы вычислителя на кристалле с применением автоматических средств САПР AMD Vivado (алгоритм CORDIC, 64 бита, 64 стадии, 600

МГц, Virtex US)....................................................................................................................121

Рисунок 4.12 — Таблица показателей Slack для решения, полученного с применением автоматических средств САПР AMD Vivado (алгоритм CORDIC, 64 бита, 64 стадии, 600

МГц, Virtex US)....................................................................................................................122

Рисунок 4.13 — Результат размещения схемы на кристалле с применением алгоритма управления топологическими ограничениями без учёта границ области SLR (алгоритм

CORDIC, 64 бита, 64 стадии, 600 МГц, Virtex US)..........................................................122

Рисунок 4.14 — Таблица показателей Slack для решения, полученного с применением алгоритма управления топологическими ограничениями без учёта области SLR

(алгоритм CORDIC, 64 бита, 64 стадии, 600 МГц, Virtex US)........................................123

Рисунок 4.15 — Результат размещения схемы вычислителя на кристалле с применением алгоритма управления топологическими ограничениями с учётом области SLR

(алгоритм CORDIC, 64 бита, 64 стадии, 600 МГц, Virtex US)........................................123

Рисунок 4.16 — Таблица показателей Slack для решения, полученного с применением алгоритма управления топологическими ограничениями с учётом области SLR

(алгоритм CORDIC, 64 бита, 64 стадии, 600 МГц, Virtex US)........................................124

Рисунок 4.17 — Результат размещения схем вычислителей на кристалле (алгоритм Магма, 32 стадии, 125 МГц, Artix-7)..................................................................................125

Рисунок 4.18 — Сравнение показателей Slack для различных вариантов размещений

(алгоритм Магма, 32 стадии, 125 МГц, Artix-7)...............................................................125

Рисунок 4.19 — Результат размещения схем вычислителей на кристалле (алгоритм

Кузнечик, 42 стадии, 125 МГц, Artix-7).............................................................................126

Рисунок 4.20 — Сравнение показателей Slack для различных вариантов размещений

(алгоритм Кузнечик, 42 стадии, 125 МГц, Artix-7)..........................................................127

Рисунок 4.21 — Результат размещения схем вычислителей на кристалле (алгоритм

Кузнечик, 42 стадии, 333 МГц, Virtex US)........................................................................127

Рисунок 4.22 — Сравнение показателей Slack для различных вариантов размещений

(алгоритм Кузнечик, 42 стадии, 333 МГц, Virtex US)......................................................128

Рисунок 4.23 — Результаты размещения схемы вычислителей на кристалле (алгоритм

Магма, 64 стадии, 333 МГц, Virtex US).............................................................................128

Рисунок 4.24 — Таблица показателей Slack для решения, полученного с применением

автоматических средств САПР AMD Vivado...................................................................129

Рисунок 4.25 — Таблица показателей Slack для решения, полученного с применением алгоритма управления топологическими ограничениями (алгоритм Магма, 64 стадии,

333 МГц, Virtex US).............................................................................................................129

Рисунок 4.26 — Демонстрация критической цепочки схемы вычислителя, состоящей из

блоков быстрого переноса..................................................................................................130

Рисунок 4.27 — Результат размещения схемы вычислителя с применением алгоритма управления топологическими ограничениями с учётом трассировки цепочки переноса

(алгоритм Магма, 64 стадии, 333 МГц, Virtex US)...........................................................130

Рисунок 4.28 — Демонстрация критической цепочки схемы вычислителя, состоящей из

блоков быстрого переноса, в рамках расширенной области стадии вычислений.........131

Рисунок 4.29 — Таблица показателей Slack для решения, полученного с применением алгоритма управления топологическими ограничениями с учётом трассировки цепочки

быстрого переноса (алгоритм Магма, 64 стадии, 333 МГц, Virtex US)..........................131

Рисунок 4.30 — График зависимости критических задержек для различных вариантов

представлений (набор вычислителей на базе алгоритма Магма)....................................134

Рисунок 4.31 — График зависимости критических задержек для различных вариантов представлений (набор схем, включающих два специализированных вычислителя на базе алгоритма CORDIC)............................................................................................................135

Рисунок 4.32 — График зависимости тактовых частот для различных вариантов представлений (набор схем, включающих два специализированных вычислителя на базе

алгоритма CORDIC)............................................................................................................136

Рисунок 4.33 — Графики изменения выходных показателей (алгоритм CORDIC, 32 бита,

тактовая частота 1 ГГц, ПЛИС xcvu440_CIV-flga2892-3-e)............................................138

Рисунок 4.34 — Таблица показателя Worst Pulse Width Slack (WPWS)........................138

Рисунок 4.35 — Графики изменения выходных показателей (алгоритм CORDIC, 64 бита,

тактовая частота 600 МГц, ПЛИС xcvu440_CIV-flga2892-3-e).......................................140

Рисунок 4.36 — Графики изменения выходных показателей (алгоритм Магма, тактовая частота 333 МГц, ПЛИС xcvu440_CIV-flga2892-3-e).......................................................141

Список таблиц

Таблица 3.1 — Основные характеристики Artix-7 xc7a100tcsg324-1...............................83

Таблица 3.2 — Основные характеристики Kintex UltraScale xcku115_CIV-flvf1924-3-e

..................................................................................................................................................86

Таблица 3.3 — Основные характеристики Virtex UltraScale xcku115_CIV-flvf1924-3-e 90 Таблица 4.1 — Выходные значения показателей (алгоритм CORDIC, 32 бита, тактовая

частота 1 ГГц, ПЛИС xcvu440_CIV-flga2892-3-e)............................................................137

Таблица 4.2 — Выходные значения показателей (алгоритм CORDIC, 64 бита, тактовая частота 600 МГц, ПЛИС xcvu440_CIV-flga2892-3-e).......................................................139

а

та s

о

CD

ЕС S

CD

Тракт обработки банных (Data Flow)

Системная шина

Системная шина

On 00

Тракт управления продвижением Эанных (Control Flow)

Г) н та

PS H

та

ЕС

M 33

Г5 X CD

M

ш PS

Г5

ЕЗ

CD

та s

CD

ЕЕ H M

6Г ЕЕ О

о

M

PS

CD H M

Приложение Б. Перечень проводимых экспериментов

Таблица Б.1 - Перечень проводимых экспериментов

№ Назначение эксперимента Характеристики вычислителя Аппаратная платформа Стратегии размещения

Оценка влияния взаимного расположения и дополнительного перекрытия стадий Алгоритм CORDIC 16 стадий, 16-битная шина данных, тактовая частота 400 МГц Xilinx Artix-7 xc7a100tcsg324-1 - Performance_Explore; - Performance_Explore, Pblock. (с применением топологических ограничений).

на величину критической задержки для вычислителей с равноразмерными стадиями Алгоритм CORDIC 32 стадий, 32-битная шина данных, тактовая частота 850 МГц Xilinx Kintex UltraScale xcku115 CIV-flvf1924-3-e - Performance_Explore; - Performance_Explore, Pblock. (с применением топологических ограничений).

1 вычислений Алгоритм CORDIC 32 стадии, 32-битная шина данных, тактовая частота 1 ГГц Xilinx Virtex UltraScale xcvu440 CIV-flga2892-3-e. - Performance_Explore; - Performance_Explore, Pblock. (с применением топологических ограничений, без перекрытия стадий) - Performance_Explore, Pblock Overlap (с применением топологических ограничений, с перекрытием стадий).

Алгоритм CORDIC 64 стадии, 64-битная шина данных, тактовая частота 600 МГц Xilinx Virtex UltraScale xcvu440 CIV-flga2892-3-e. - Performance_Explore; - Performance_Explore, Pblock. (с применением топологических ограничений).

Оценка влияния взаимного расположения и дополнительного Алгоритм Магма, 12 стадий, тактовая частота 125 МГц Xilinx Artix-7 xc7a100tcsg324-1 - Performance_Explore; - Performance_Explore, Pblock. (с применением топологических ограничений).

перекрытия стадий на величину критической задержки для вычислителей с разноразмерными стадиями вычислений Алгоритм Кузнечик, 42 стадии, тактовая частота 125 МГц Xilinx Artix-7 xc7a100tcsg324-1 - Performance_Explore; - Performance_Explore, Pblock. (с применением топологических ограничений).

2 Алгоритм Кузнечик, 42 стадии, тактовая частота 333 МГц Xilinx Virtex UltraScale xcvu440 CIV-flga2892-3-e. - Performance_Explore; - Performance_Explore, Pblock. (с применением топологических ограничений).

Алгоритм Магма, 64 стадии, тактовая частота 333 МГц Xilinx Artix-7 xc7a100tcsg324-1 - Performance_Explore; - Performance_Explore, Pblock. (с применением топологических ограничений). - Performance_Explore, Pblock Carry Aligned (с применением топологических ограничений, высота блока выровнена с учётом блоков CARRY).

Продолжение таблицы Б.1

3 Оценка характера зависимости величины критической задержки топологического представления вычислителя от критической задержки логического представления вычислителя Алгоритм CORDIC, набор решений с разными оценками предельной тактовой частоты Xilinx Virtex UltraScale xcvu440 CIV-flga2892-3-e. - РегГогтапсе_Ехр1оге; - РегГогтапсе_Ехр1оге, РЬ1оск. (с применением топологических ограничений).

Алгоритм Магма, набор решений с разными оценками предельной тактовой частоты Xilinx Artix-7 xc7a100tcsg324-1 - Рейогтапсе_Ехр1оге; - Рейогтапсе_Ехр1оге, РЬ1оск. (с применением топологических ограничений).

4 Оценка потенциальной возможности улучшения временных характеристик топологического представления на основе центральных моментов Алгоритм CORDIC, 32 стадии, 32-битная шина данных, тактовая частота 1 ГГц Xilinx Virtex UltraScale xcvu440 CIV-flga2892-3-e. - Рейогтапсе_Ехр1оге; - РегГогтапсе_Ехр1оге, РЬ1оск. (с применением топологических ограничений).

Алгоритм CORDIC 64 стадии, 64-битная шина данных, тактовая частота 600 МГц Xilinx Virtex UltraScale xcvu440 CIV-flga2892-3-e. - Рейогтапсе_Ехр1оге; - Рейогтапсе_Ехр1оге, РЬ1оск. (с применением топологических ограничений).

Алгоритм Магма, набор решений, с разными оценками предельной тактовой частоты Xilinx Artix-7 xc7a100tcsg324-1 - Рейогтапсе_Ехр1оге; - РегГогтапсе_Ехр1оге, РЬ1оск. (с применением топологических ограничений).

Приложение В. Таблица результатов проведенных экспериментов

Таблица В.1 - Результаты проведённых экспериментов

№ Описание экспериме нта Требуется До (Performance Explore) После (Performance Explore, Pblock)

FlImIt, МГц WNSsetup, нс TNSsetup, нс Flimit, МГц WNSsetup, нс TNSsetup , нс Flimit, МГц Рост Flimit, раз

1 сокшс, 16 стадий, Лгих-7 хс7а100г 400 -0.090 0.024 386 0.024 0.000 403 1.04

2 сокшс, 32 стадии, У1Иех Ш хоуи440 1000 -0.179 -45.105 848 0.104 0.000 1110 1.31

3 СОИОЮ, 32 стадии, КШех Ш хски115 850 -0.118 -4.988 758 0.104 0.000 910 1.20

4 СОИОЮ, 64 стадии, У1Иех Ш хсуи440 600 -0.770 -1322.924 421 0.005 0.000 601 1.43

5 Алгоритм Магма, 12 стадий, Лгйх-7 хс7а100г 125 -0.775 -45.310 114 0.455 0.000 132 1.16

6 Алгоритм Магма, 64 стадии, Лгйх-7 хс7а100г 333 -1.866 -1000.613 205 0.008 0.000 333 1.62

7 Алгоритм Кузнечик, 42 стадии, Лгйх-7 хс7а100г 125 -0.616 -30.843 116 0.377 0.000 131 1.12

8 Алгоритм Кузнечик, 42 стадии, У1Иех Ш хсуи440 333 -0.214 -12.131 311 0.104 0.000 345 1.12

Приложение Г. Свидетельство о государственной регистрации

программ для ЭВМ

Приложение Д. Акт о внедрении (Кафедра вычислительной техники)

3. Критерии оценки качества топологического представления конвейера на основе моментов генеральной совокупности задержек распространения сигналов.

Настоящим актом подтверждаются результаты пракгической апробации и использования основных результатов диссертационной работы «Метод повышения эффективности технической реализации специапизированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением» в учебный процесс кафедры вычислительной техники института информационных

технологий РТУ МИРЭА.

Полученные результаты используются в рамках преподавания дисциплин «Схемотехника устройств компьютерных систем», «Программирование нейропроцессоров», «Инструментальные средства программно-аппаратных комплексов».

Председатель комиссии, зав. кафедрой ВТ, к.т.н., доцент

Ученый секретарь кафедры ВТ, к.т.н., доцент

Члены комиссии:

Сорокин Л.Б.

Приложение Е. Акт о внедрении (ПАО «ИНЭУМ им. И. С. Брука»)

«ИНОТИ'УТ ЭЛЕКТРОННЫХ УПРАЗЛЯЮЩ/Х V.AÜ (ГАО </-!ЭУУ /м V С 5руча-

С- Брука-

Wft

Утверждаю

АКТ

о внедрении результатов диссертационной работы на соискание ученой степени кандидата технических наук Люлявы Даниила Вячеславовича на тему «Метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением»

Настоящим актом подтверждаются результаты практической апробации и использования основных результатов диссертационной работы «Метод повышения эффективности технической реализации специализированных вычислителей с конвейерной архитектурой на основе управления топологическим представлением» в ПАО «ИНЭУМ им. И.С. Брука».

Разработанный диссертантом метод основан на автоматизированном формировании топологических проектных ограничений, управляющих размещением компонентов на кристалле полупроводниковой микросхемы. Значимость такого подхода определяется увеличивающейся сложностью вычислительных устройств и необходимостью повышения эффективности их проектирования при реализации на базе ПЛИС или СБИС.

Метод позволяет повысить производительность и обеспечить предсказуемые характеристики энергопотребления специализированных вычислительных устройств с конвейерной архитектурой, которые могут использоваться в составе программно-аппаратных комплексов на базе процессоров «Эльбрус».

Руководитель управления, к.т.н. A.B. Глухов

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.