«Е-Флопс» и «АМДтехнологи» создали суперкомпьютер для ИИ-задач
NVIDIA
Российские компании «Е-Флопс» и «АМДтехнологи» совместно разработали суперкомпьютер для ресурсоёмких ИИ-задач, включая обучение больших языковых моделей (LLM). В основе комплекса — 22 узла на базе ускорителей Nvidia H100, обеспечивающие пиковую производительность до 700 Пфлопс для ИИ. Суперкомпьютер уже введён в эксплуатацию в одном из топ-10 российских банков.
Компания «Е-Флопс» совместно с партнёром «АМДтехнологи» разработала высокопроизводительный вычислительный комплекс (суперкомпьютер) для задач искусственного интеллекта, ориентированный на ресурсоёмкие прикладные задачи бизнеса, включая обучение больших языковых моделей (LLM) в рамках MLOps-конвейера, запуск LLM-сервисов и предоставление доступа к инструментам вайбкодинга. Комплекс включает 22 узла на базе графических ускорителей Nvidia H100 80GB и x86-процессоров, обеспечивая пиковую мощность свыше 11 Пфлопс (FP64) для научных расчётов и более 700 Пфлопс (FP8/INT8) для задач ИИ, а также содержит более 4200 процессорных ядер, почти 34 ТБ оперативной памяти и около 14 ТБ памяти GPU. Архитектура комплекса гибридная: созданы два физически изолированных сегмента — внутренний (без доступа в интернет) и внешний (доступный сторонним пользователям), использующие одинаковые серверные платформы для гибкого переключения узлов. Внутренний сегмент оптимизирован под ИИ-задачи с контейнеризацией Kubernetes и гиперконвергентным хранилищем, внешний — универсален, поддерживает как ИИ, так и классические HPC-расчёты с выделенными системами хранения и планировщиком Slurm. Сетевая инфраструктура использует InfiniBand HDR (200 Гбит/с на GPU) с неблокируемой топологией Fat Tree, а также Ethernet 25/10 Гбит/с и Fibre Channel 32 Гбит/с для хранения. Подсистема хранения включает выделенную СХД с SSD (61 ТБ) и HDD (2 ПБ) во внешнем сегменте и распределённое гиперконвергентное хранилище во внутреннем. ПО включает мониторинг (включая Nvidia DCGM), платформу оркестрации Kubernetes с Multus и Cilium, а для внешнего сегмента — Slurm и виртуализацию Proxmox. Оба сегмента соответствуют строгим требованиям безопасности, размещены в сертифицированном ЦОДе. Суперкомпьютер уже введён в эксплуатацию в одном из топ-10 российских банков.
- Сокращения
- LLM = Large Language Model — большая языковая модель
- MLOps = Machine Learning Operations — операции машинного обучения
- GPU = Graphics Processing Unit — графический процессор
- CUDA = Compute Unified Device Architecture — архитектура унифицированных вычислительных устройств
- HPC = High-Performance Computing — высокопроизводительные вычисления
- FP64 = Floating Point 64-bit — числа с плавающей точкой 64-бит
- FP8 = Floating Point 8-bit — числа с плавающей точкой 8-бит
- INT8 = Integer 8-bit — целые числа 8-бит
- ТБ — терабайт
- ПБ — петабайт
- HDR = High Data Rate — высокая скорость передачи данных
- DCGM = Data Center GPU Manager — менеджер GPU для дата-центров
- SSD = Solid State Drive — твердотельный накопитель
- HDD = Hard Disk Drive — жёсткий диск
Источник: CNews —
оригинал
