Глубокое погружение в архитектуру AMD RDNA 4: Монолитная конструкция на 64 процессора с всесторонними улучшениями в вычислениях, кодировании-декодировании мультимедиа, трассировке лучей и искусственном интеллекте

Компания AMD предложила взгляд украдкой на выставке CES 2025 компания AMD продемонстрировала RDNA 4 и подтвердила появление Radeon RX 9070 XT и RX 9070, но во время основной презентации не сделала даже мимолетного замечания о новой архитектуре.
Однако компания заявила, что больше информации о RDNA 4 и новых графических процессорах Radeon появится в ближайшее время, и вот мы здесь.
Сегодня AMD рассказывает о RDNA 4 и новых графических процессорах серии Radeon RX 9070. Серия RX 9070 будет официально доступна в розничных магазинах с 6 марта, а обзоры производительности появятся за день до этого.
AMD RDNA 4: Возвращение к монолитному дизайну
RDNA 4 развивает цели, которые AMD поставила перед собой в RDNA 3. По словам AMD, RDNA 4 предназначена для более тяжелых игровых нагрузок с упором на повышение производительности и эффективности растровой графики.
Кроме того, как обычно, улучшаются конвейеры трассировки лучей, а также уделяется больше внимания возможностям искусственного интеллекта и кодированию/декодированию мультимедиа.
В RDNA 3 появился чиплетный дизайн для графических процессоров, вдохновленный процессорами Ryzen. Здесь мы увидели отделение матриц кэш-памяти (MCD) от графической вычислительной матрицы (GCD).
Однако в RDNA 4 компания AMD возвращается к традиционному монолитному дизайну. Компоненты, по сути, те же самые, но нет никаких межсоединений MCD-GCD, поскольку память и вычисления теперь напрямую связаны между собой кэшем Infinity Cache.
Графический процессор RDNA 4, в данном случае Radeon RX 9070 XT, имеет четыре шейдерных движка с восемью процессорами рабочих групп (WGP) в каждом. Каждый WGP состоит из восьми вычислительных блоков (CU), что в общей сложности составляет 64 CU.
AMD утверждает, что новые вычислительные блоки теперь более производительны, чем когда-либо, обеспечивая улучшенную трассировку лучей, удвоенную пиковую пропускную способность, поддержку новейших возможностей матричного ускорения и более широкую поддержку числовых форматов.
Новинкой в RDNA 4 CU, которую мы уже видели в ядрах Tensor в архитектуре Ampere от Nvidia, является поддержка структурированной разреженности, которая позволяет ускорить операции с матрицами, особенно в случаях, когда многие веса равны нулю.
Мы также видим улучшения в подсистеме памяти. Кэш L2 увеличен с 6 МБ в RDNA 3 до 8 МБ в RDNA 4, а кэш Infinity Cache обновлен до 3-го поколения, но его объем уменьшен до 64 МБ с 96 МБ в RDNA 3.
AMD продолжает полагаться на память GDDR6 в новом поколении. И RX 9070 XT, и RX 9070 предлагают 384-битный интерфейс памяти GDDR6 объемом 16 ГБ, работающий на тактовой частоте 20 Гбит/с, что обеспечивает эффективную пропускную способность 640 ГБ/с. Это намного меньше, чем пропускная способность 960 ГБ/с, которую предлагала RDNA 3, но AMD утверждает, что спецификации видеопамяти RDNA 4 были тщательно подобраны для поддержки текущих и будущих игр.
Улучшенная поддержка медиа-движка и аппаратного учета перелистывания
Кодирование видео было одной из главных проблем в RDNA 3, и AMD обещает значительные улучшения в этом отношении. Компания обещает значительные улучшения в кодировании H.264 и AV1 и меньшее количество блокирующих артефактов при том же объеме данных.
Улучшения распространяются и на декодирование видео: снижается энергопотребление и повышается производительность при декодировании таких форматов, как AV1 и VP9.
Система Radiance Display Engine теперь потребляет гораздо меньше энергии в двухмониторных конфигурациях FreeSync. Новым также является поддержка аппаратной очереди перелистывания в Windows Display Driver Model (WDDM) 3.0 для воспроизведения видео.
Это позволяет высвободить ресурсы CPU за счет разгрузки планирования кадров на GPU. Технология генерации нескольких кадров (MFG) в графических процессорах Nvidia Blackwell также опирается на аппаратный учет переворотов.
Взгляд на вычислительный блок RDNA 4
С самого начала структура CU RDNA 4 не сильно отличается от той, что мы видели в RDNA 3. Однако в каждом из компонентов CU есть улучшения в плане производительности и эффективности.
Операции WMMA (Wave Matrix Multiply Accumulate) были улучшены, чтобы соответствовать требованиям нового оборудования. Блоки масштабирования получили обновления для работы с операциями Float32. Планировщик может разделить и обработать большую вычислительную нагрузку на разделенные и именованные барьеры.
AMD заявила, что RDNA 4 создана с учетом новых техник рендеринга, которые разработчики используют в современных играх. Несмотря на то, что масштабирование уже давно в моде, эффективная трассировка траектории требует ускорения ML как части самого процесса рендеринга, а не в качестве "послесловия".
Ускорители лучей в RDNA 4
RDNA 4 предлагает 64 ускорителя лучей третьего поколения в RX 9070 XT. Структура ускорителя лучей в RDNA 4 аналогична структуре ускорителя лучей в RDNA 3, но включает дополнительный механизм пересечения для в 2 раза большего количества блоков лучевых коробок и лучевых треугольников.
Также имеется специальное аппаратное преобразование лучей, которое избавляет от необходимости использовать шейдерные инструкции для выполнения этой работы, тем самым минимизируя накладные расходы на обход лучей. Память объемом 128 КБ в каждом двойном CU помогает хранить стек лучей для эффективного выполнения операций push и sort.
В RDNA 4 введена концепция ориентированных ограничительных коробок (OBBs), которая выравнивает ограничительные коробки BVH по геометрии, тем самым минимизируя ложные взаимодействия лучей в том, что в противном случае является просто пустым пространством в коробке. AMD утверждает, что такой подход может повысить производительность обхода лучей на целых 10%.
Новинкой также стала поддержка расслабленных внепорядковых запросов к памяти, которая эффективно сокращает время ожидания для волн, не попавших в кэш высокого уровня раньше времени. Это улучшает не только трассировку лучей, но и другие рабочие нагрузки.
В RDNA 4 шейдеры могут динамически распределять регистры, что позволяет разместить больше волн в полете с улучшенной задержкой памяти.
Трассировка пути с помощью RDNA 4
Карты AMD испытывали трудности с трассировкой лучей в целом, поэтому трассировка контура казалась невостребованной даже в топовых картах RDNA 3. RDNA 4 призвана изменить эту ситуацию благодаря поддержке кэширования нейронного сияния, а также новой модели нейронной суперсэмплинга и денуазинга.
AMD не предоставила точных цифр производительности для игр с поддержкой трассировки пути, но мы должны получить представление об этом в ходе обзора этих карт.
Возможности искусственного интеллекта, созданные на базе Radeon и Instinct
AMD заявила, что в RDNA 4 предусмотрены специальные математические конвейеры для ускорения ML, ориентированные на высокую производительность при использовании более узких типов данных. Новым в RDNA 4 является поддержка FP8 и BF8 для высокопроизводительных и высокоточных выводов.
Демонстрируя генерацию изображений SDXL 1.5, AMD показала, как Radeon RX 9070 XT на базе RDNA 4 обеспечивает вдвое большую производительность FP16 на CU по сравнению с RDNA 3 на базе RX 7900 XT.
Новые возможности ИИ в RDNA 4 используются в FSR 4, который представляет собой сквозной конвейер, обученный на графических процессорах AMD. FSR 4 использует FP8 для оптимального использования пропускной способности, производительности и мощности.
AMD продемонстрировала до 3,7-кратного повышения частоты кадров в секунду с помощью FSR 4 в сочетании с интерполяцией кадров и Radeon Anti-Lag при сохранении высокого качества изображения.
Источник(и)
Краткая информация для прессы AMD

































