Разработка методов моделирования для оценки производительности суперкомпьютерных систем для параллельных приложений с однородным характером поведения тема диссертации и автореферата по ВАК РФ 05.13.11, кандидат технических наук Речистов, Григорий Сергеевич

  • Речистов, Григорий Сергеевич
  • кандидат технических науккандидат технических наук
  • 2013, Москва
  • Специальность ВАК РФ05.13.11
  • Количество страниц 156
Речистов, Григорий Сергеевич. Разработка методов моделирования для оценки производительности суперкомпьютерных систем для параллельных приложений с однородным характером поведения: дис. кандидат технических наук: 05.13.11 - Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей. Москва. 2013. 156 с.

Оглавление диссертации кандидат технических наук Речистов, Григорий Сергеевич

Оглавление

1. Обзор технологий моделирования и изучения производительности

1.1. Цель диссертационной работы

1.2. Научная новизна

1.3. Практическая ценность

1.4. Апробация

1.5. Публикации

1.6. Содержание работы

1.7. Обзор существующих подходов

1.8. Обзор аналитических моделей параллельных программ

1.9. Симуляторы ЭВМ

1.10. Метрики производительности

1.11. Постановка задачи исследования

2. Теоретические обоснования

2.1. Классический критерий виртуализуемости

2.2. Ограничения применимости критерия виртуализуемости

2.3. Статус поддержки в современных архитектурах

2.4. Практические аспекты возможности эффективной симуляции

2.5. Вывод о применимости симуляции

3. Компоненты модели

3.1. Моделирование кэшей

3.2. Реализация модели кэшей и памяти

3.3. Просмотр работы в реальном времени

3.4. Анализ MPI

3.5. Анализ составляющих CPI

3.6. Анализ с помощью Intel VTune

3.7. Учёт влияния технологии Intel HyperThreading

3.8. Распределённая модель

4. Результаты и их внедрение

4.1. Последовательность проведения исследований приложений

4.2. Gromacs

4.3. Amber

4.4. Масштабируемость и скорость симуляции

4.5. Однородность исследуемых приложений

4.6. Анализ MPI

4.7. Анализ приложений с учётом HyperThreading

4.8. Результаты измерения FLOPS

4.9. Заключение

Литература

Приложение

Рекомендованный список диссертаций по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК

Введение диссертации (часть автореферата) на тему «Разработка методов моделирования для оценки производительности суперкомпьютерных систем для параллельных приложений с однородным характером поведения»

1.1. Цель диссертационной работы

Целью диссертационной работы является разработка теоретических оснований, практическая реализация и апробация симуляционного1 подхода для изучения функциональности, поведения и производительности параллельных распределённых приложений. Класс изучаемых программ был ограничен, характеризовался однородностью проявляемого ими параллелизма и рассматривался на примере двух прикладных задач молекулярной динамики.

Для достижения поставленной цели в работе выполняются следующие этапы.

• Обзор существующих подходов к анализу поведения и производительности приложений при их работе на многоядерных вычислительных системах.

• Анализ применимости методов компьютерного имитационного моделирования для решения задач исследования с учётом достигаемой с их помощью скорости работы, точности результатов, а также масштабируемости самих подходов для больших и сверхбольших кластерных систем.

• Реализация комплекса для распределённой симуляции кластерных систем.

• Проведение исследования масштабируемости и производительности построенного симулятора, а также прикладных приложений.

хТо есть основанного на имитационном компьютерном моделировании.

1.2. Научная новизна

Решение поставленных в диссертационной работе задач определяет научную новизну исследования, содержащуюся в создании моделей подсистем компьютерного кластера и интеграции их в единый комплекс, используемый для симуляции большого числа узлов и исследования поведения и производительности параллельных приложений.

1.3. Практическая ценность

Практическая ценность работы заключена в разработке вышеозначенного комплекса для симуляции приложений и использование его для исследования поведения и производительности программ и вычислительных систем, используемых на практике рабочими группами лаборатории суперкомпьютерных технологий для биомедицины, фармакологии и малоразмерных структур факультета радиотехники и кибернетики Московского физико-технического института.

1.4. Апробация

Результаты работы докладывались на следующих конференциях и представлены в соответствующих сборниках трудов.

1) International Conference on Computational Science 2012, г. Омаха, шт. Небраска, США [73].

2) Международная конференция «Научный сервис в сети Интернет» в 2011 и 2012 гг., г. Новороссийск [100, 108].

3) «Разработка ПО 2011» CEE-SECR 2011 г., г. Москва [101]

4) Научная конференция МФТИ в 2010, 2011, 2012 гг., г. Москва, г. Долгопрудный [96, 103, 106, 109, 110].

1.5. Публикации

По теме диссертации опубликовано пять работ [98, 102, 104, 105, 107], из них три — в журналах, входящих в список ВАК.

1.6. Содержание работы

В главе 1 определяются цель, научная новизна, даются определения основных понятий, обзор литературы и производится постановка задачи диссертационной работы.

В главе 2 даются теоретические обоснования возможности симуляции и практические аспекты применимости метода для исследуемой системы и приложений. Делаются выводы о практической целесообразности и ограничениях масштабируемости симуляции для различных классов прикладных задач.

В главе 3 даётся описание основных компонент полной модели: кэшей, сети, — а также определяется метод компенсации недостаточной точности симуляции с помощью прямых измерений. Затем приводится используемая формула вычисления производительности параллельных приложений на многомашинных многоядерных системах. В конце главы рассматривается проблема организации распределения самого процесса симуляции на множество узлов физической системы.

В главе 4 приводится описание систем, на которых проводилось внедрение и модели которых были построены, а также прикладных приложений, изучение поведения которых на моделируемой системе представляло интерес. Затем даются результаты масштабируемости и производительности, полученные для созданной модели и изучаемых приложений.

Похожие диссертационные работы по специальности «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», 05.13.11 шифр ВАК

Заключение диссертации по теме «Математическое и программное обеспечение вычислительных машин, комплексов и компьютерных сетей», Речистов, Григорий Сергеевич

4.9. Заключение

Использование компьютерной симуляции для получения сведений о характере работы приложения на ещё не построенной вычислительной системе предоставляет исследователю выгодные компромиссы между временем конфигурации, скоростью измерений и количеством/точностью получаемых данных. Из-за масштаба задачи сам процесс моделирования не является тривиальным, однако современные программные решения позволяют выполнить его на доступном оборудовании.

В диссертационной работе рассмотрены вопросы теоретической возможности, целесообразности и практической реализации методов программной симуляции приложений молекулярной динамики для исследования вопросов их функциональности и производительности на вычислительных системах заранее до физической доступности аппаратуры.

Следует отметить, что достигнутая в работе скорость симуляции сравнима с опубликованными для подобных исследований результатами. Однако представленное в работе решение ориентировано на си-

стемы с процессорами IA-32, тогда как описанные в литературе параллельные симуляторы в основном нацелены на менее распространённые архитектуры или не ставят перед собой задач исследования производительности.

При выполнении диссертации были получены следующие основные результаты:

• Получены теоретические обоснования применимости разрабатываемого метода к различным классам прикладных приложений и выбран класс задач, на котором будет сфокусирована работа.

• Разработана подключаемая и конфигурируемая модель неоднородных иерархий памяти, позволяющая получить данные о влиянии задержек при обращении к памяти на скорость исполнения программ.

• Разработан инструмент mpi-tracer, предназначенный для исследования влияния коммуникаций MPI на производительность параллельных программ.

• Выработана теоретическая база и создана методика для определения производительности приложений через анализ встроенных в микропроцессоры Intel счётчиков производительности и инструмента Intel VTune Analyzer.

• Отдельные созданные компоненты объединены в единый комплекс на основе Wind River Simics, который был использован для симуляции приложений молекулярной динамики.

Проведенный в работе анализ показывает, что для большого класса практических задач симуляция позволяет получить базовые оценки параметров работы приложений без привлечения натурного эксперимента, зачастую невозможного из-за недоступности оборудования. Для программ с однородным параллелизмом показано, что такой анализ является эффективным.

В процессе исследований и в ходе решения поставленных задач были получены следующие результаты, выносимые на защиту:

• Создан инструмент для моделирования вычислительных систем производительностью до 60 TFLOPS на физическом оборудовании с собственной производительностью в десять раз меньшей.

• Изучена возможность измерения производительности приложений Gromacs и Amber при переходе от использования вычислительных комплексов предыдущего поколения к будущим, проектируемым, системам.

Представленные в диссертационной работе модели для описания производительности параллельных приложений, алгоритмы и реализация модели кэшей, общая схема цикла исследования, а также схема распределения симуляции разработаны и реализованы лично автором. Программа mpi-tracer для сбора трассы MPI-вызовов и анализатор собранных трасс созданы под руководством автора. Работы были выполнены в составе группы симуляции архитектур лаборатории суперкомпьютерных технологий для биомедицины, фармакологии и малоразмерных структур факультета радиотехники и кибернетики Московского физико-технического института, на аппаратуре вычислительного кластера лаборатории.

Важным результатом данной работы является создание комплексной модели вычислительного кластера, позволяющей исследовать различные факторы, влияющие на производительность. Модель являлась адекватной для анализа поведения программ и вычислительных систем, используемых на практике рабочими группами лаборатории и была нацелена на применимость к системам, которые планируется построить в ближайшем будущем. Опытная эксплуатация описанных решений в работе группы симуляции лаборатории суперкомпьютерных технологий для биомедицины, фармакологии и малоразмерных структур МФТИ позволила сделать вывод об их пригодности к практическому использованию для решения существующих

задач анализа и оптимизации существующих и будущих программно-аппаратных комплексов.

Список литературы диссертационного исследования кандидат технических наук Речистов, Григорий Сергеевич, 2013 год

Литература

1. A mechanistic performance model for superscalar out-of-order processors / Stijn Eyerman, Lieven Eeckhout, Tejas Karkhanis, James E. Smith // ACM Trans. Comput. Syst. — 2009. — Май. — Т. 27, вып. 2. — 3:1-3:37. — ISSN: 0734-2071. — DOI: 10.1145/ 1534909 . 1534910. — URL: http : //doi . acm . org/ 10 . 1145/ 1534909.1534910.

2. Agarwal Anant Performance Tradeoffs In Multithreaded Processors // IEEE TRANSACTIONS ON PARALLEL AND DISTRIBUTED SYSTEMS. — 1991. — T. 3. — 525-539.

3. Albrecht M. C. (Mike) Introduction to Discrete Event Simulation. — 2010. — URL: http : / /www . albrechts . com/ mike/DES/Introduction;toDES.pdf.

4. Amber 11 Users' Manual / D. A. Case [и др.]. — University of California, 2010.

5. AMD I/O Virtualization Technology (IOMMU) Specification. — Advanced Micro Devices. 2011. — URL: http : / /support . amd . com/us/Processor_TechDocs/48882.pdf.

6. Analytic Evaluation of Shared-Memory Architectures / Daniel J. Sorin, Jonathan L. Lemon, Derek L. Eager, Mary K. Vernon // IEEE Transaction on Parallel and Distributed Systems. — 2003. — T. 14. — C. 180.

7. Analytic evaluation of shared-memory systems with ILP processors / Daniel J. Sorin [и др.] // 25th annual International Symposium on Computer Architecture. — IEEE Computer Society, 1998. — 380-391.

8. ArchSim: a system-level parallel simulation platform for the architecture design of high performance computer / Yong-Qin Huang [и др.] //J. Comput. Sci. Technol. — 2009. — Сент. — Т. 24, вып. 5. — 901-912. — ISSN: 1000-9000. — DOI: 10.1007/ si 1390-009-9281 -9. — URL: http : //dx. doi . org/10 . 1007/ si1390-009-9281-9.

9. Bellard Fabrice QEMU, a Fast and Portable Dynamic Translator // FREENIX Track: 2005 USENIX Annual Technical Conference. — 2005. — URL: http://www.usenix.org/publications/library/ proceedings/usenix05/tech/freenix/full_papers/bellard/ bellard.pdf (дата обр. 15.02.2012).

10. Binary translation / Richard L. Sites [и др.] // Communications of the ACM. — 1993. — Фев. — Т. 36, № 2. — 69-81.

11. Bugnion Edouard, Devine Scott, Rosenblum Mendel Disco: Running commodity operating systems on scalable multiprocessors // ACM Transactions on Computer Systems. — 1997. — 143-156. — URL: http://www.cis.upenn.edu/~cis700-6/04f/papers/bugnion-disco.pdf.

12. Cain Harold W. Precise and Accurate Processor Simulation. — 2002. — URL: http : / /pages . cs . wise . edu/ ~cain/pubs / caecw2002_final.pdf.

13. Carlson Trevor E., Heirman Wim, Eeckhout Lieven Sniper: Exploring the Level of Abstraction for Scalable and Accurate Parallel Multi-Core Simulations // International Conference for High Performance Computing, Networking, Storage and Analysis

(SC). — Ноя. 2011. — URL: http://www.exascience.com/wp-content/uploads/201l/09/Sc2011carlson-final.pdf.

14. COREMU: a scalable and portable parallel full-system emulator / Zhaoguo Wang [и др.] // Proceedings of the 16th ACM symposium on Principles and practice of parallel programming. — San Antonio, TX, USA: ACM, 2011. — 213-222. — (PPoPP '11). — ISBN: 978-1-4503-0119-0. — DOI: 10.1145/1941553.1941583. — URL: http://doi.acm.org/10.1145/1941553.1941583.

15. CUDA Parallel Computing Platform. — NVIDIA Corporation. — URL: http : //www . nvidia . com/object /cuda_home_new . html (дата обр. 24.09.2012).

16. Dean J., Ghemawat S. MapReduce: Simplified Data Processing on Large Clusters // Proceedings of the 6th Conference on Symposium on Operating Systems Design and Implementation. — 2004. — T. 6. — C. 137—150.

17. Dongarra Jack J. Performance of Various Computers Using Standard Linear Equations Software //. — URL: ftp://netlib2. cs.utk.edu/benchmark/performance.pdf.

18. Dongarra Jack J., Luszczek Piotr, Petitet Antoine The LINPACK benchmark: Past, present, and future. // Concurrency and Computation: Practice and Experience. — 2003. — T. 15. — C. 20.

19. Doran Mark, Zimmer Vincent, Rothman Michael Beyond BIOS: Exploring the Many Dimensions of the Unified Extensible Firmware Interface // Intel Technology Journal. — 2011. — Окт. — T. 15, вып. 1. — С. 8—21. — ISSN: 1535-864X. — URL: http://www.intel.com/technology/itj/2011/vl5il/index. htm (дата обр. 02.07.2012).

20. Drepper Ulrich The Cost of Virtualization // ACM Queue. — 2008, — Янв. — 30-35. — URL: http://queue.acm.org/detail. cfm?id=1348591.

21. Drepper Ulrich What every programmer should know about memory //. — 2007. — Ноя. — URL: http : / /www . akkadia . org/drepper/cpumemory .pdf (дата обр. 20.06.2012).

22. Drepper Ulrich Что каждый программист должен знать о памяти / пер. С.В. Капустин, М.Ульянов, Н.Ромоданов. — Май 2012. — URL: http ://rus -linux.net/lib. php?name=/MyLDP/ hard/memory/memory.html (дата обр. 20.05.2012).

23. Eijkhout Victor A Theory of Data Movement in Parallel Computations // Procedia Computer Science. — 2012. — T. 9. — C. 236—245. — ISSN: 1877-0509. — DOI: 10.1016/j .procs. 2012. 04 . 025. — URL: http : / /www . sciencedirect . com/science/ article/pii/S1877050912001469.

24. Exploring the performance limits of simultaneous multithreading for memory intensive applications / Evangelia Athanasaki, Nikos Anastopoulos, Kornilios Kourtis, Nectarios Koziris // The Journal of Supercomputing. — 2008. — T. 44, № 1. — 64-97.

25. Fortune S., Wyllie J. Parallelism in Random Access Machines // Proceedings of the 10th ACM Symposium on Theory of Computing. — C. 114—118.

26. Fujimoto Richard M. Parallel discrete event simulation // Commun. ACM. — 1990. — Окт. — T. 33, № 10. — C. 30—53. — ISSN: 00010782. — DOI: 10 .1145/84537 .84545. — URL: http: //doi . acm. org/10.1145/84537.84545.

27. Genbrugge Davy, Eyerman Stijn, Eeckhout Lieven Interval Simulation: Raising the Level of Abstraction in Architectural Simulation // Proceedings of the 16th IEEE International Symposium on High-Performance Computer Architecture (HPCA). — Фев. 2010. — 307-318. — URL: http: //users. elis. ugent.be/~leeckhou/papers/hpcalO.pdf.

28. Graphite: A Distributed Parallel Simulator for Multicores / Jason E. Miller [и др.] // The 16th IEEE International Symposium on High-Performance Computer Architecture (HPCA). — 2010. — Янв.

29. GROMACS: Fast, flexible, and free / David Van Der Spoel [и др.] // Journal of Computational Chemistry. — 2005. — T. 26, № 16. — 1701-1718. — ISSN: 1096-987X. — DOI: 10.1002/jcc. 20291. — URL: http://dx.doi.org/10.1002/jcc.20291.

30. High performance Linpack benchmark. — Netlib. — URL: http: //www.netlib.org/linpack.

31. Hoare C. A. R. Communicating sequential processes // Commun. ACM. — 1978. — Авг. — Т. 21, № 8. — С. 666—677. — ISSN: 0001-0782. — DOI: 10 . 1145/359576 . 359585. — URL: http : // doi.acm.org/10.1145/359576.359585.

32. HOW to get the L1,L2 Cache Miss of an intel i5 Sandy Bridge. — URL: http : / /software . intel . com / en - us / forums/topic / 279983 (дата обр. 12.10.2012).

33. Hypervisor/Sun4v Reference Materials. — Oracle Corporation. — URL: http : / / kenai . com / projects / hypervisor / pages / ReferenceMaterials (дата обр. 31.01.2013).

34. IA-32 Execution Layer: a two-phase dynamic translator designed to support IA-32 applications on Itanium-based systems / Leonid Baraz [и др.] //In 36th International Symposium on Microarchitecture. — 2003. — 191-201.

35. Intel® 64 and IA-32 Architectures Software Developer's Manual. Volume 3B. — Intel Corporation.

36. Intel® Virtualization Technology / F. Leung [и др.] // Intel Technology Journal. — 2006. — Авг. — Т. 10, вып. 03. — ISSN: 1535-864X. — DOI: 10 . 1535 / it j . 1003 . 01. — URL: http :

//www . intel . com/technology/itj/2006/vl0i3/ (дата обр. 20.06.2012).

37. Intel® Virtualization Technology for Directed I/O / D. Abramson [и др.] // Intel Technology Journal. — 2006. — Авг. — URL: http: //www . intel . com/technology/it j/2006/vl0i3/ (дата обр. 13.10.2012).

38. Intel® VTune™ Amplifier XE. — Intel Corporation. — URL: http: / / software . intel . com / en - us / articles / intel - vtune -amplif ier-xe/ (дата обр. 02.07.2012).

39. J. Dongarra J. The MPI Profiling Interface. — URL: http://www. netlib.org/utk/papers/mpi-book/nodel82.html (дата обр. 16.04.2012).

40. Karloff Howard, Suri Siddharth, Vassilvitskii Sergei A model of computation for MapReduce // Proceedings of the Twenty-First Annual ACM-SIAM Symposium on Discrete Algorithms. — Austin, Texas: Society for Industrial, Applied Mathematics, 2010. — C. 938—948. — (SODA '10). — ISBN: 978-0-898716-986. — URL: http ://dl. acm . org/citation . cfm?id= 1873601 . 1873677.

41. KVM wiki. — URL: http : //www . linux-kvm . org/page/Main_ Page.

42. Leopold Claudia Parallel and Distributed Computing: A Survey of Models, Paradigms, and Approaches. — John Wiley and Sons, 2001. — ISBN: 0-471-358312-2.

43. Li X, Malek Miroslaw Analysis of Speedup and Communication/Computation Ratio in Multiprocessor Systems // IEEE Real-Time Systems Symposium. — IEEE Computer Society, 1988. — 282-288.

44. Li X., Malek Miroslaw Analysis of Speedup and Communication/Computation Ratio in Multiprocessor Systems // IEEE Real-Time Systems Symposium. — 1988. — 282-288.

45. Liu Jason Parallel Discrete-Event Simulation. — 2009. — URL: http : / / www . eis . f iu . edu/ ~liux/ research /papers /pdes -eorms09.pdf (дата обр. 26.03.2012).

46. LogP: A practical Model of Parallel Computation / D.E. Culler [и др.] // Communications of the ACM. — 1996. — Ноя. — Т. 39, вып. 11. — С. 78—85.

47. Megiddo Nimrod, Modha Dharmendra S. Outperforming LRU with an Adaptive Replacement Cache Algorithm // IEEE Computer. — 2004. — T. 37, № 4. — 58-65.

48. Mellor-Crummey John Models for Understanding Parallel Performance. — Rice University, anp. 2005. — URL: http : / / www . es . rice . edu / ~johnmc / comp528 / lecture - notes / Lecture24.pdf.

49. Mihoka Darek, Shwartsman Stanislav Virtualization Without Direct Execution or Jitting: Designing a Portable Virtual Machine Infrastructure // ISCA-35 Proceedings of the 1st Workshop on Architectural and Microarchitectural Support for Binary Translation. — URL: http : / / bochs . sourceforge . net / Virtualization _ Without _ Hardware _ Final . pdf (дата обр. 05.05.2012).

50. Misra Jayadev Distributed discrete-event simulation // ACM Computing Surveys. — 1986. — T. 18. — 39-65. — URL: http: //www.eis.udel.edu/~cshen/861/papers/p39-misra.pdf.

51. Mosberger David Memory Consistency Models. — 1993. — URL: http://citeseerx.ist.psu.edu/viewdoc/download;?doi=10. 1.1.44.5376.

52. MPI: A Message-Passing Interface Standard. Version 2.2. — Message Passing Interface Forum. Сент. 2009. — URL: http:// www.mpi-forum.org/docs/docs.html.

53. MPICH: high performance and widely portable MPI implementation. — Argonne national laboratory. — URL: http://www.mcs.anl.gov/mpi/mpich.

54. N. Tuck D. M. Tullsen Initial Observations of the Simultaneous Multithreading Pentium 4 Processor / / Proceedings of the 12th International Conference on Parallel Architectures and Compilation Techniques. — 2003. — C. 26—30.

55. N. Zimmermann, G. Jung The three-dimensional solution structure of the lantibiotic murein- biosynthesis-inhibitor actagardine determined by NMR //. — 1997. — C. 809—819.

56. Open Directory - Computers: Emulators: Intel x86 Architecture. — Netscape, 2010. — URL: http : / /www . dmoz . org/Computers/ Emulators/Intel_x86_Architecture (дата обр. 02.03.2012).

57. OpenACC Home. — URL: http://www.openacc-standard.org/ (дата обр. 24.09.2012).

58. OpenCL - The open standard for parallel programming of heterogeneous systems. — Khronos Group. — URL: http: //www. khronos.org/opencl/ (дата обр. 24.09.2012).

59. Pace Matthew Felice BSP vs MapReduce // Procedia Computer Science. — 2012. — T. 9. — C. 246—255. — ISSN: 18770509. — DOI: 10 . 1016 / j . procs . 2012 . 04 . 026. — URL: http : / / www . sciencedirect . com / science / article / pii / S1877050912001470.

60. Performance Prediction and Calibration for a Class of Multiprocessors / Dalibor F. Vrsalovic, Daniel P. Siewiorek,

Zary Segall, Edward F. Gehringer // IEEE Trans. Computers. — 1988. — T. 37, № 11. — 1353-1365.

61. Perumalla Kalyan S. Scaling Time Warp-based discrete event execution to 104 processors on a Blue Gene supercomputer //in Proceedings of the ACM Computing Frontiers. — 2007. — C. 69— 76. — URL: http : / / www . ornl . gov / ~2ip / doc / perumalla -timewarp-bluegene-cf07.pdf (дата обр. 26.03.2012).

62. Pin — a dynamic binary instrumentation tool. — URL: http: / / www.pintool.org.

63. Pin: building customized program analysis tools with dynamic instrumentation / Chi-Keung Luk [и др.] // SIGPLAN Not. — 2005. — Июн. — Т. 40, вып. 6. — 190-200. — ISSN: 0362-1340. — DOI: 10 .1145/1064978 .1065034. — URL: http: //doi . acm. org/ 10.1145/1064978.1065034.

64. Popek Gerald J., Goldberg Robert P. Formal requirements for virtualizable third generation architectures // Communications of the ACM. T. 17. Вып. 7. — Июл. 1974.

65. Prakash Sundeep, Bagrodia Rajive L. MPI-SIM: using parallel simulation to evaluate MPI programs // Winter Simulation Conference. — 1998. — 467-474. — URL: http : //citeseerx . ist. psu . edu/viewdoc/download?doi = 10 . 1 . 1 . 52 . 2590&rep= repl&type=pdf.

66. Pratt Ian Xen and the art of virtualization. — 2006. — URL: http: //www.cl.cam.ac.uk/netos/papers/2006-xen-ols.pdf.

67. Rajwar Ravi Speculation-based techniques for transactional lockfree execution of lock-based programs. — Докт. дисс. University of Wisconsin - Madison, 2002.

68. Ray Anton Chemo ff, Hookway Ray DIGITAL FX! 32 Running 32-Bit x86 Applications on Alpha NT // in Proceedings of the USENIX Windows NT Workshop, USENIX Association. — 1997. — 37-42.

69. Riesen Rolf A Hybrid MPI Simulator // CLUSTER. — 2006. — 1-9.

70. Simics: A Full System Simulation Platform / Peter S. Magnusson [и др.] // Computer. — 2002. — Фев. — Т. 35, вып. 2. — 5058. — ISSN: 0018-9162. — DOl: 10.1109/2.982916. — URL: http: //portal.acm.org/citation.cfm?id=619072.621909.

71. Simics Model Builder Guide 4.6. — Wind River, 2011.

72. Simonson Lucanus J., He Lei Micro-architecture Performance Estimation by Formula // SAMOS'05. — 2005. — 192-201.

73. Simulation and Performance Study of Large Scale Computer Cluster Configuration: Combined Multi-level Approach / G.S. Rechistov, A.A. Ivanov, P.L. Shishpor, V.M. Pentkovski // Procedia Computer Science. — 2012. — T. 9. — C. 774—783. — ISSN: 1877-0509. — DOl: 10 . 1016/j . procs . 2012 . 04 . 083. — URL: http : //www. sciencedirect. com/science/article/pii/ SI877050912002049 ; Proceedings of the International Conference on Computational Science, ICCS 2012.

74. Single Node On-Line Simulation of MPI Applications with SMPI / Pierre-Nicolas Clauss [и др.] // International Parallel Sz Distributed Processing Symposium. — IEEE. Anchorange (AK), États-Unis, май 2011. — URL: http : //hal. inria . fr/inria-00527150/en.

75. SLURM - Simple Linux Resource Management System. — URL: https : / / computing . llnl . gov / linux / slurm/ (дата обр. 10.10.2012).

76. Smith James E., Nair Ravi Virtual machines - Versatile Platforms for Systems and Processes. — Elsevier, 2005. — ISBN: 978-1-55860910-5.

77. SoftSDV: A Presilicon Software Development Environment for the IA-64 Architecture / Richard Uhlig [и др.] // Intel Technology Journal. — 1999. — 112-126.

78. Southern Gabriel Analysis of SMP VM CPU Scheduling //. — 2008. — URL: http://cs.gmu.edu/~hfoxwell/cs671projects/ southern_vl2n.pdf (дата обр. 29.02.2013).

79. System V Application Binary Interface. AMD64 Architecture Processor Supplement. — AMD Corporation. — URL: http : / / www . x86 - 64 . org / documentation / abi . pdf (дата обр. 14.02.2012).

80. The Graph 500 List. — URL: http : / /www . graph500 . org (дата обр. 20.02.2013).

81. The Influence of Parallel Decomposition Strategies on the Performance of Multiprocessor Systems / Dalibor F. Vrsalovic, Edward F. Gehringer, Zary Segall, Daniel P. Siewiorek // ISCA. — 1985. — 396-405.

82. The mode of action of the lantibiotic lacticin 3147 - a complex mechanism involving specific interaction of two peptides and the cell wall precursor lipid II / Wiedemann I. [и др.] //. — Июл. 2006. — С. 285—296.

83. Time warp operating system / D. Jefferson [и др.] / / Proceedings of the eleventh ACM Symposium on Operating systems principles. — Austin, Texas, USA: ACM, 1987. — C. 77— 93. — (SOSP '87). — ISBN: 0-89791-242-X. — DOI: 10 . 1145/ 41457.37508. — URL: http://doi.acm.org/10.1145/41457. 37508.

84. Topham Nigel, Jones Daniel High speed CPU simulation using JIT binary translation // mobs. — 2007. — URL: http://homepages. inf.ed.ac.uk/npt/pubs/mobs-07.pdf.

85. Trace-driven simulation of multithreaded applications / Alejandro Rico [и др.] // ISPASS. — IEEE Computer Society, 2011. — 8796. — ISBN: 978-1-61284-367-4. — URL: http : //ispass . org/ ispass2011/slides/3_l .pdf (дата обр. 01.05.2012).

86. Two-phase trace-driven simulation (TPTS): a fast multicore processor architecture simulation approach / Hyunjin Lee [и др.] // Software - Practice and Experience. — 2010. — T. 40, № 3. — 239-258. — URL: http://www.cs.pitt.edu/cast/papers/lee-spelO.pdf.

87. Using Communication-to-Computation Ratio in Parallel Program Design and Performance Prediction / Mark Crovella [и др.] // Proceeedings of the Fourth IEEE Symposium on Parallel and Distributed Processing. — Дек. 1992.

88. Using Cycle Stacks to Understand Scaling Bottlenecks in MultiThreaded Workloads / Wim Heirman [и др.] // International Symposium on Workload Characterization (IISWC). — Ноя. 2011. — URL: http : / /www . exascience . com/wp- content / uploads/201l/09/iiswc201lheirman.pdf.

89. Valiant L.G. A Bridging Model for parallel computation 11 Communications of the ACM. — 1990. — Авг. — Т. 33(8). — С. 103—111.

90. VirtualBox architecture. — Oracle Corporation. — URL: http : //www. virtualbox. org/wiki/VirtualBox_architecture (дата обр. 25.09.2010).

91. VMware ESXi info page. — VMWare. — URL: http : / /www . vmware.com/products/vsphere/esxi-and-esx/index.html.

92. Write Combining Memory Implementation Guidelines. — Intel Corporation, дек. 1998. — URL: http : //download. intel. com/ de s i gn/pent iumi i/applnot s/24442201.pdf.

93. YANG Rongzhen Virtual Translation Lookaside Buffer. — Patent Application US 2008/0282055 A1 (US). — 13 ноя. 2008. — URL: http : / /www . patent lens . net/patent lens/patent /US _ 2008 _ 0282055_Al/en/.

94. Yourst Matt T. PTLsim User's Guide and Reference: The Anatomy of an x86-64 Out of Order Superscalar Microprocessor. — 2007. — URL: http: //www . ptlsim. org/Documentation/PTLsimManual. pdf.

95. Zheng Gengbin, Kakulapati Gunavardhan, Kale Laxmikant V. BigSim: A Parallel Simulator for Performance Prediction of Extremely Large Parallel Machines // Parallel and Distributed Processing Symposium, International. — 2004. — Т. 1. — 78b. — DOI: 10.1109/IPDPS.2004.1303013. — URL: http://charm.cs. uiuc.edu/research/bigsim.

96. Анализ производительности системы при выполнении программы Gromacs / Н.Н. Щелкунов, Д.А. Гаврилов, Г.С. Речистов, А.А. Абдухаликов // Труды 55-й научной конференции МФТИ «Проблемы фундаментальных и прикладных естественных и технических наук в современном информационном обществе». Т. 01. — Москва-Долгопрудный-Жуковский, 2012. — С. 14— 15. — ISBN: 978-5-7417-0481-3.

97. Глинский Б.М., Родионов А.С., Марченко М.А. Об агентно-ори-ентированном подходе к имитационному моделированию суперЭВМ экзафлопсной производительности // Труды международной суперкомпьютерной конференции и конференции молодых учёных «Научный сервис в сети Интернет. Экзафлопсное будущее». — 2011. — 159-165. — ISBN: 978-5-211-06229-0.

98. Изучение производительности приложений на вычислительных кластерах с помощью компьютерного моделирования. Методология и руководство к применению / Речистов Г.С. [и др.]. — Спутник+, 2012. — ISBN: 978-5-7417-0469-1.

99. Использование имитационного моделирования для настройки параметров масштабируемых алгоритмов при высокопроизводительных вычислениях / Б.М. Глинский [и др.] // Труды международной суперкомпьютерной конференции и конференции молодых учёных «Научный сервис в сети Интернет. Поиск новых решений». — Издательство Московского университета, 2012. — 93-98. — ISBN: 978-5-211-06394-5. — URL: http: //agora.guru.ru/abrau2012.

100. Моделирование и исследование архитектуры многопроцессорной системы с использованием распределённой моделирующей среды Graphite / Г.С. Речистов, A.A. Иванов, П.Л. Шишпор,

B.М. Пентковский // Труды международной суперкомпьютерной конференции и конференции молодых учёных «Научный сервис в сети Интернет. Экзафлопсное будущее». — 2011. —

C. 143—146. — ISBN: 978-5-211-06229-0. — URL: http-.//agora, guru.ru/abrau2011.

101. Моделирование компьютерного кластера на распределённом симуляторе. Верификация моделей вычислительных узлов и сети кластера. / Г.С. Речистов, A.A. Иванов, П.Л. Шишпор, В.М. Пентковский // Труды конференции «Разработка ПО 2011» CEE-SECR 2011. — 2011. — URL: http: //2011 . seer . ru/lang/ru-ru/talks/modeliiig-of-a-computer-cluster- oil -a-distributed-simulator.

102. Моделирование компьютерного кластера на распределённом симуляторе. Верификация моделей вычислительных узлов и сети кластера / Г.С. Речистов, A.A. Иванов, П.Л. Шишпор,

В.М. Пентковский // Программная инженерия. — 2012. — № 6. — С. 24—29. — ISSN: 2220-3397. — URL: http://novtex.ru/ pi .html.

103. Опыт подготовки студентов в учебно-исследовательской лаборатории МФТИ-«Интел» / Речистов Г. С. [и др.] // Труды МФТИ. т. 3. — 2011. — С. 168—170.

104. Основы программного моделирования ЭВМ. Учебное пособие / Речистов Г.С. [и др.]. — Издательство МФТИ, дек. 2012. — ISBN: 978-5-7417-0469-1. — URL: http : //iscalare . mipt . ru/ materials/course_materials (дата обр. 10.12.2012).

105. Реализация инструментария для исследования сетевой производительности MPI-приложений на распределённом симу-ляторе / Н.С. Поливанов, Г.С. Речистов, A.A. Абдухаликов, В.М. Пентковский // Информационные технологии. — 2013. — Янв. — № 1. — С. 46—50.

106. Речистов Г. С. Бенчмарк LINPACK для архитектуры Intel IA-32: существующие варианты, сравнительный анализ возможностей и демонстрируемой производительности // Труды 54-й научной конференции МФТИ «Проблемы фундаментальных и прикладных естественных и технических наук в современном информационном обществе». Т. 01. — 71-72. — ISBN: 9785-7417-0396-0.

107. Речистов Г. С. Использование полноплатформенного имитационного моделирования суперкомпьютерной системы для определения производительности счётных приложений // Информационные технологии. — 2013. — Map. — № 3. — С. 29—32.

108. Речистов Г.С. О верхних и нижних границах оценок производительности многомашинных многопроцессорных комплексов на научных приложениях // Труды международной суперкомпьютерной конференции и конференции молодых учёных

«Научный сервис в сети Интернет. Поиск новых решений». — Издательство МГУ, 2012. — С. 671—675. — ISBN: 978-5-21106394-5. — URL: http ://agora. guru. ru/display . php?conf = abrau2012&page=item011 (дата обр. 26.12.2012).

109. Симуляционный подход для нахождения производительности параллельных MPI-приложений на вычислительном кластере / Г.С. Речистов, A.A. Иванов, П.Л. Шишпор, В.М. Пент-ковский // Труды 54-й научной конференции МФТИ «Проблемы фундаментальных и прикладных естественных и технических наук в современном информационном обществе». Т. 01. — Москва-Долгопрудный-Жуковский, 2011. — 82-83. — ISBN: 978-5-7417-0396-0.

110. Юлюгин Е.А., Речистов Г.С., Иванов A.A. Моделирование нагрузки на сетевое оборудование // Труды 55-й научной конференции МФТИ «Проблемы фундаментальных и прикладных естественных и технических наук в современном информационном обществе». Т. 01. — Москва-Долгопрудный-Жуковский, 2012. — С. 81—82. — ISBN: 978-5-7417-0481-3.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.