NVIDIA раскрыла детали архитектуры Blackwell Ultra: новый формат NVFP4 и отказ от FP64
NVIDIA
NVIDIA представила подробности об ускорителе Blackwell Ultra, который состоит из двух кристаллов с 208 млрд транзисторов, изготовленных по техпроцессу TSMC 4NP. Ключевые нововведения: 4-битный формат NVFP4 с производительностью 15 Пфлопс, 288 Гбайт HBM3e и улучшенная подсистема внимания, при этом компания отказалась от развития FP64.
NVIDIA опубликовала детали архитектуры ускорителя Blackwell Ultra — улучшенной версии NVIDIA Blackwell. Чип состоит из двух кристаллов, соединённых интерфейсом NV-HBI с пропускной способностью 10 Тбайт/с, и насчитывает 208 млрд транзисторов (техпроцесс TSMC 4NP). Ускоритель содержит 160 потоковых мультипроцессоров с 640 тензорными ядрами пятого поколения, которые обеспечивают производительность 15 Пфлопс в новом 4-битном формате NVFP4. NVIDIA внедрила этот формат для ИИ-инференса: он сочетает микроблочное масштабирование FP8 и масштабирование FP32, что даёт точность, близкую к FP8 (разница менее 1 %), при снижении потребления памяти в 1,8 раза по сравнению с FP4 и до 3,5 раза по сравнению с FP16. При этом компания практически отказалась от развития FP64. В Blackwell Ultra удвоена пропускная способность SFU для инструкций в слое внимания (attention layer), что ускоряет softmax-этап в рассуждающих моделях. Подсистема памяти включает 288 Гбайт HBM3e (против 192 Гбайт у Blackwell) с пропускной способностью 8 Тбайт/с. Интерконнект представлен NVLink 5 (1,8 Тбайт/с, до 576 GPU в домене), PCIe 6.0 x16 и NVLink-C2C. Суперчип Grace Blackwell Ultra объединяет один Arm-процессор Grace с двумя ускорителями Blackwell Ultra, обеспечивая до 40 Пфлопс с разреженностью в NVFP4. На его основе строится стоечная система GB300 NVL72, объединяющая 36 суперчипов (1,1 Эфлопс в FP4 без разреженности).
- Сокращения
- NV-HBI = NVIDIA High-Bandwidth Interface — высокопроизводительный интерфейс NVIDIA
- SM = Streaming Multiprocessor — потоковый мультипроцессор
- GPC = Graphics Processing Cluster — кластер графической обработки
- TMEM = Tensor Memory — тензорная память
- SFU = Special Function Unit — специализированный функциональный блок
- HBM3e = High Bandwidth Memory 3e — высокопроизводительная память третьего поколения с расширенными возможностями
- NVLink = NVIDIA Link — связь NVIDIA
Источник: ServerNews —
оригинал
