Поиск
Реализация проекта по созданию вычислительного комплекса для российского банка ТОП-10
Новости 24.07.2026

«Е-Флопс» совместно с партнером «АМДтехнологии» реализовали проект по созданию вычислительного комплекса для Банка Топ 10, выступающего в качестве заказчика.

Вычислительный комплекс состоит из 22 вычислительных узлов, базирующихся на высокопроизводительных графических ускорителях NVIDIA H100 80GB и центральных процессорах архитектуры х86 был спроектирован под требования заказчика, внедрен и ожидает расширения вычислительных мощностей. Производительность ВК составила более 11 Пфлопс (FP64 – двойной точности) для научных расчетов и более 700 Пфлопс (FP8/INT8) для задач ИИ.

Нами было проведено обследование площадки, затем предложена архитектура ВК и произведено проектирование решения. Основной этап внедрения включал в себя монтажные и коммутационные работы. Далее следовали пуско-наладочные работы, включающие функциональное и нагрузочное тестирование, приемо-сдаточные испытания, отдельно ПСИ по информационной безопасности. В заключении ИТ-командой Е-Флопс было проведено обучение инженеров заказчика пользованию ВК, который был сдан в эксплуатацию и поставлен на обслуживание.

В проект, по требованию заказчика, была заложена возможность дальнейшего увеличения количества вычислительных узлов до 42, а также наращивание сетевой инфраструктуры.


ВК (суперкомпьютер) в цифрах

•        700+ активных пользователей;

•        22 вычислительных узла;

•        11 792 Tflops (FP64);

•        700 PFlops (FP8/INT8);

•        4224 процессорных ядер;

•        33 792 ГБ оперативной памяти вычислительных узлов;

•        14 080 ГБ оперативной памяти GPU;

•        2 973 696 CUDA ядер;

•        92 928 тензорных ядер;

•        200 Гб/с сеть Infiniband HDR;

•        61 ТБ объем СХД для горячих данных;

•        2 ПБ объем СХД для холодных данных.  


Назначение ВК

Поскольку заказчиком выступал Банк Топ 10, назначением системы было выполнение прикладных задач, требующих больших объёмов вычислений, а именно: обучение больших языковых моделей в рамках MLOps конвейера, внедрение и сопровождение модельных сервисов; обеспечение сотрудникам банка возможности работы c большими языковыми моделями (LLM), вайбкодинг. Основным требованием ВК было выполнение сложных вычислительных задач в параллельном режиме.


Описание ВК

Архитектура вычислительного комплекса — гибридная кластерная. Вычислительный комплекс создан из двух частей: внутреннего и внешнего сегментов. Внутренний сегмент, предназначенный для использования исключительно банковскими приложениями, размещен внутри безопасного периметра банка без выхода в интернет. Внешний сегмент находится вне периметра информационной инфраструктуры банка и предназначен для подключения и использования внешними заказчиками банка. Каждый сегмент содержит часть вычислительных узлов, имеющих возможность физического переключения между двумя сегментами по мере необходимости для балансировки вычислительных ресурсов ВК. Внутренний сегмент ориентирован исключительно на решения задач ИИ и широко использует технологии контейнеризации и оркестрации контейнеров, а внешний сегмент универсальный, включающий поддержку HPC нагрузок. Внутренний и внешний сегменты поддерживают возможность создания гиперковергентной среды, когда все узлы могут выполнять как вычислительную функцию, так и функцию хранения данных. Управляющие узлы внутреннего сегмента таже располагаются на виртуальных машинах внутри общих вычислительны узлов. Структура внешнего сегмента помимо вычислительных узлов содержит 3 выделенных сервера управления и 2 СХД.

Несмотря на различную структуру внешнего и внутреннего сегментов ВК, в качестве вычислительных узлов были выбраны серверные платформы одной модели и конфигурации. Такой выбор обеспечил как соответствие требованиям заказчика относительно использования во внутреннем сегменте: в требуемой производительности, размещении необходимого количества контейнеров компиляции и доступа, обеспечивающих функции мониторинга, управления, защиты, распределения нагрузок и другие сервисные функции, а также в объеме, производительности, доступности, объектной системы хранения данных; так и относительно использования во внешнем сегменте, где вычислительные узлы использовались как для нагрузок ИИ, так и для классических HPC, требующих вычислений с двойной точностью. 

Конфигурация и топология вычислительного комплекса является коммерческой тайной, поэтому кратко можем сообщить о некоторых основных его элементах:

•       Вычислительные и вспомогательные узлы

Использованы двухпроцессорные серверы с процессорами архитектуры х86 с 96 ядрами на сокет, GPU-ускорители Nvidia H100 в количестве 8 шт. на сервер, SSD NVMe накопители. Управляющие узлы внешнего сегмента, а также серверы хранения данных построены на двухпроцессорных серверах с процессорами архитектуры х86 с 64 ядрами на сокет.

•       Сетевая инфраструктура

Для высокоскоростной передачи данных между вычислительными узлами в составе вычислительного комплекса был выбран интерфейс InfiniBand HDR, обеспечивающий скорость передачи данных 200 Гб/с от каждого GPU-ускорителя, что в итоге составило не менее 1600 Гбит/с от узла к узлу в одном направлении с неблокируемым доступом. Этот же интерфейс используется для подключения выделенной СХД внешнего сегмента. Выбранная топология вычислительной сети — Fat Tree (толстое дерево).

Для подключения к локальной сети инфраструктуры заказчика был использован 25 Гб/с Ethernet, а в качестве интерфейса сети управления использовался 10 Гб/с Ethernet.

Также создана сеть хранения данных для подключения внутреннего сегмента ВК к объектному хранилищу заказчика, построенная с использованием интерфейса Fibre Channel (FC) 32 Гб/с.

Все 3 сети, вычислительная, локальная и сеть управления физически разделены для внутреннего и внешнего сегмента с возможностью физической перекоммутации вычислительных узлов из внешнего сегмента во внутренний и наоборот. Сеть хранения данных развернута только во внутреннем сегменте.

•       Подсистема хранения данных

В соответствии с требованиями заказчика реализованы две независимых подсистемы хранения данных: внутреннего и внешнего сегмента. Также реализовано подключение вычислительных узлов внутреннего сегмента к объектному хранилищу заказчика (уже имеющегося в инфраструктуре).

Во внешнем контуре ВК организована выделенная СХД, которая по требованию заказчика должна поддерживать технологию иерархического хранения данных. СХД была реализована с использованием 2 серверов с подключенными к каждому серверу JBOD на 60 накопителей форм-фактора 3,5” с интерфейсом SAS 12 Гб/с. Общий «сырой» объем СХД для хранения холодных данных составил 2 ПБ. Также были использованы SSD накопители с интерфейсом SAS, установленные в сами серверы хранения, для организации хранения горячих данных с общим «сырым» объемом в 61 ТБ. СХД предназначено для постоянного хранения пользовательских данных, временных данных на время расчетов, а также конфигурационных данных, системных журналов, статистики т.д.

Во внутреннем контуре ВК организована распределенная СХД, использующая ресурсы вычислительных узлов. Эта гиперконвергентная архитектура объединяет вычислительные ресурсы (compute) и ресурсы хранения (store) на каждом узле ВК. Такая архитектура позволяет линейно масштабировать ресурсы системы хранения пропорционально вычислительным ресурсам с увеличением количества узлов.

•       Инфраструктура ЦОД

Все серверы, коммутаторы, СХД внешнего сегмента, патч-панели размещены в 16 серверных шкафах с использованием воздушного охлаждения и организацией холодного и горячего коридора.

Можно отметить, что все оборудование размещено в серверных шкафах к каждому из которых установлен доступ с помощью индивидуального цифрового кода, а весь сектор с серверными стойками имеет ограничение физического доступа, находясь в современном ЦОД одного из крупнейших провайдеров.

•      Информационная безопасность

Одним из важнейших условий реализации проекта было соблюдение требований заказчика к информационной безопасности и средствам защиты информации. К внешнему и внутреннему сегменту вычислительного комплекса предъявлялись строгие требования ИБ, особенно к внутреннему сегменту.

       Программная среда

ВК включает в себя системное программное обеспечение, а также средства компиляции и отладки программ пользователей, таких как средства сборки, отладчики, профилировщики и др. Интерфейсы для возможности дистанционного использования вычислительного поля, и состоит из набора программных пакетов, которые обеспечивают мониторинг работоспособности и эффективное управление и использование аппаратных вычислительных возможностей кластера, таких, как высокоскоростная низколатентная сеть Infiniband, центральные процессоры и графические ускорители вычислительных узлов:

     Система мониторинга и управления (включая метрики загрузки ресурсов ВК, производительности), а также системы сбора и обработки статистики, журналирования реализована с помощью свободно распространяемых пакетов мониторинга, визуализации и анализа данных, а также с помощью свободно распространяемого ПО NVIDIA DCGM, специально предназначенного для мониторинга работы графических ускорителей NVIDIA.

   Подсистема управления ресурсами использует платформу управления, развертывания и масштабирования контейнеризованных приложений Kubernetes (K8s) с модулями Multus CNI и Cilium CNI. Во внешнем сегменте поддерживается возможность использования планировщика задач с открытым исходным кодом Slurm Workload Manager. Управляющие серверы запущены в виртуальной среде под управлением системы виртуализации Proxmox.