Пропуск RAM через PCIe: масштабирование серверной памяти с помощью CXL

Прокомментировать Просмотры: 8

Нередко сервер исчерпывает ресурс оперативной памяти задолго до того, как будут полностью задействованы все вычислительные ядра процессора. Современные облачные процессоры уже в базовой комплектации предлагают от 64 ядер на сокет, тогда как физических слотов для модулей DDR5 катастрофически не хватает. В результате рабочие нагрузки приходится распределять по дополнительным серверам, хотя процессорный потенциал еще далеко не исчерпан. Не стоит забывать и о резервировании части хостовой памяти под отказоустойчивость на случай аварий или планового обслуживания инфраструктуры. Ситуацию усугубляет высокая стоимость серверной памяти, и предпосылок к ее удешевлению или росту доступности на рынке пока не наблюдается.

Одним из эффективных способов преодолеть дефицит ОЗУ становится внедрение технологии CXL (Compute Express Link). Она позволяет нарастить емкость доступной хосту памяти за счет подключения дополнительных модулей DDR4 через интерфейс PCI-E. Давайте разберем архитектуру подобных систем, ключевые отличия дополнительной памяти от основной, а также причины, по которым бизнес уже активно интегрирует CXL в свои дата-центры.

Как CXL решает проблему дефицита памяти

При проектировании серверных систем критически важны не только общая емкость ОЗУ, но и скорость ее работы вместе с задержками доступа (latency). Далее мы сфокусируемся именно на проблеме нехватки объема и на том, как технология CXL помогает ее нивелировать.

Справедливости ради отметим, что для систем на базе процессоров AMD Epyc или Intel Xeon с числом ядер до 64 на сокет проблема острой нехватки памяти стоит не столь остро — даже с учетом того, что стоимость модулей за последние годы выросла в пять раз, причем пропорционально их емкости.

Оптимальный способ обойти ограничения физических слотов и процессорных каналов памяти — вынести часть ОЗУ за пределы стандартных шин DDR, задействовав интерфейс CXL. Такой подход обеспечивает независимое масштабирование оперативной памяти от вычислительных модулей, позволяя выжать максимум эффективности из имеющихся процессорных мощностей.

Принцип работы CXL-памяти

Интерфейс CXL дает возможность расширить серверную память в обход традиционных каналов DDR процессора. Интеграция в систему происходит посредством шины PCIe 5.0 с использованием специализированных контроллеров, таких как Vistara. Операционная система распознает этот массив как полноценную оперативную память: приложения могут обращаться к нему наряду с локальной DRAM, избегая сценариев работы с медленными накопителями. Ядро Linux успешно распознает такой ресурс в качестве системного ОЗУ. Тем не менее, аппаратная платформа сервера в обязательном порядке должна иметь нативную поддержку CXL, что пока сужает сферу массового применения технологии.

Рассмотрим конкретный пример на базе серверной платформы MemServer. Конфигурация включает 768 ГБ локальной памяти DDR5 и дополнительные 256 ГБ DDR4, подключенные по протоколу CXL, что в сумме дает 1 ТБ ОЗУ на сервер. Масштабирование реализовано через два контроллера Vistara, а соотношение локальной и CXL-памяти составляет 3 к 1.

Выбор в пользу DDR4 обусловлен не только экономической выгодой. Инженеры применяют практику вторичного использования исправных модулей из выводимых из эксплуатации серверов. К слову, аналогичный подход уже практикуют в собственных дата-центрах инженеры Google, ставя во главу угла общий объем памяти, а не предельную скорость.

Как правило, планки DRAM сохраняют полную работоспособность на протяжении 7 и более лет, в то время как стандартный жизненный цикл сервера ограничивается 5 годами. Причиной замены оборудования чаще всего служит не деградация компонентов, а возможность оптимизации: стойку из 8 старых серверов заменяют 2–4 современными машинами, что кардинально улучшает показатели энергоэффективности всего дата-центра. Контроллеры Vistara позволяют органично объединять демонтированную DDR4 со свежими серверными платформами на базе DDR5, используя старые модули в качестве дополнительного яруса памяти.

Разумеется, подобное архитектурное решение имеет обратную сторону — CXL-память уступает по скорости локальной. В протестированной конфигурации пропускная способность основной DDR5 достигает 614 ГБ/с, тогда как CXL-модули (DDR4-2400) выдают около 58 ГБ/с (с пиковым значением в 76 ГБ/с). И хотя спецификация DDR4-2400 морально устарела, переход на DDR4-2933 способен поднять производительность на 20%.

Временные затраты на доступ к данным также возрастают. Исследователи связывают дополнительные задержки главным образом с прохождением запросов через CXL-контроллер и работой памяти DDR4 на стороне Vistara на частоте 2400 МТ/с.

Концепция реутилизации DDR4 получила дальнейшее развитие в аппаратных контроллерах Astera Labs нового поколения. Анонсированные 15 сентября 2026 года чипы Leo 2 поддерживают стандарты PCIe 6 и CXL 3.2, а со стороны памяти предлагают четыре канала с поддержкой стандартов DDR4 или DDR5. Для памяти DDR4 реализована конфигурация 3DPC: по три модуля DIMM на канал, что в сумме дает до 12 планок на одну плату расширения. Это существенно увеличивает емкость, однако физические четыре канала не трансформируются в двенадцать — модули, висящие на одной линии, делят общую пропускную способность.

Leo-X Astera Labs
Leo-X Astera Labs

Устройства Astera Labs серии E задействуют интерфейс PCIe 6 x16, в то время как серия P оснащается двумя портами x8 и поддерживает организацию пулов памяти с динамическим перераспределением емкости между виртуализированными хостами. Дополнительно задействованы встроенные алгоритмы мониторинга и аппаратного тестирования памяти на предмет возникновения ошибок. На данном этапе решения от Astera Labs проходят тестовую эксплуатацию и внедрение у крупнейших гиперскейлеров.

Снижение скорости работы с лихвой окупается финансовой выгодой и низким энергопотреблением: блок CXL-памяти емкостью 256 ГБ потребляет порядка 30 Вт против 132 Вт у массива локальной памяти на 768 ГБ. В пересчете на один гигабайт энергопотребление составляет около 70% от показателей традиционной DRAM, а затраты на приобретение — всего 13%. Впрочем, столь впечатляющий разрыв в случае с Vistara достигается именно за счет повторного использования старых модулей DDR4, поэтому экстраполировать эти цифры на любые другие CXL-системы не стоит.

Иными словами, производители не пытаются подменить сверхбыструю DDR5 медленными аналогами. Они формируют многоуровневую архитектуру, грамотно распределяя потоки данных так, чтобы нивелировать влияние разницы в скоростях на конечный софт. Такой подход позволяет нарастить объем оперативной памяти на сервере без расширения стандартных процессорных каналов DDR, что в конечном итоге повышает коэффициент полезного использования вычислительных ресурсов.

Концептуально это очень напоминает классическое тирирование (tiering) в системах хранения данных (СХД), где внутри одного массива параллельно уживаются медленные диски NL SAS и высокопроизводительные SSD.

Практические результаты применения CXL

Новую конфигурацию протестировали на широком спектре реальных рабочих нагрузок — от контуров разработки и CI/CD до систем машинного обучения и тяжелой аналитики. Во всех сценариях технология успешно справлялась с ключевой задачей: позволяла консолидировать больше задач на единице серверного оборудования, снижая общую потребность в закупке новых машин.

При этом возросшие задержки CXL-памяти не стали критичным фактором. Подсистема памяти ОС Linux автоматически удерживает горячие (часто запрашиваемые) данные в быстрой локальной DDR5, вытесняя редко используемые массивы в дополнительный пул. В результате большинство приложений получают в свое распоряжение больший объем RAM без деградации производительности, а накладные расходы на миграцию данных между уровнями памяти не превышают 0,5%.

Весьма любопытные эксперименты, наглядно показывающие, как можно бюджетно расширить оперативную память сервера 🙂

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов