CXL и петабайт на двух накопителях: как индустрия хранения данных адаптируется под запросы ИИ

Прокомментировать Просмотры: 3

С 4 по 6 августа Санта-Клара принимала отраслевую конференцию Flash Memory Summit, ознаменовавшуюся серией знаковых премьер. В реалиях 2026 года глобальный спрос на серверные накопители и оперативную память бьет рекорды. Разработчикам приходится решать сложную инженерную дилемму: как добиться максимальной плотности размещения ресурсов в стойках без неконтролируемого роста затрат. О ключевых анонсах выставки рассказываем ниже.

DapuStor R6060: рекордные полпетабайта в одном накопителе

Главной технологической сенсацией стал официальный анонс от компании DapuStor. Производитель представил флагманский SSD серии R6060 емкостью 512 ТБ в форм-факторе E2, позиционируя его как самый емкий накопитель данного типоразмера на мировом рынке. Для контекста: прежнее лидерство удерживал Micron 6600 ION на 245,76 ТБ, а собственные решения DapuStor не превышали планку в 245 ТБ. Двукратный скачок характеристик позволяет организовать массив на 1 ПБ силами всего двух дисковых слотов.

Параметры устройства:

  • массив ячеек QLC NAND;

  • интерфейс передачи данных PCIe 5.0;

  • типоразмеры E2 и E3.L.

Шасси с поддержкой 32 накопителей обеспечивает суммарную плотность хранения до 16 ПБ.

DapuStor R6060 512T E2 NVMe SSD. Источник.
DapuStor R6060 512T E2 NVMe SSD. Источник.

Детальные скоростные показатели 512-терабайтного накопителя пока держатся в секрете — на стенде демонстрировался лишь видеоролик синтетического тестирования. Для сравнения, модификация на 122,88 ТБ развивает скорость последовательного чтения порядка 14 ГБ/с. Диск базируется на протоколе NVMe 2.0 с аппаратной поддержкой FDP (Flexible Data Placement). Эта схема дает хост-системе прямой контроль над размещением данных в структуре кристаллов, нивелируя паразитный коэффициент усиления записи (Write Amplification), типичный для памяти QLC.

Вместе с флагманом компания показала еще три новинки, оптимизированные под задачи машинного обучения:

  • SSD серии R6 в формате E1.S на 8 ТБ, оснащенный теплосъемной пластиной для контуров жидкостного охлаждения. Решение ориентировано на компактные серверы с высокой плотностью GPU, где традиционный воздушный обдув не справляется.

  • Двухпортовые накопители R6 в исполнении E3.S: до 30,72 ТБ на TLC-памяти и до 61,44 ТБ на базе QLC. Дополнительный порт обеспечивает аппаратное резервирование каналов в отказоустойчивых архитектурах.

  • Линейку J5060 (PCIe Gen4) с гибридным SLC/QLC-пулом. Диск динамически перераспределяет данные между скоростным буфером и емким массивом, балансируя задержки и полезный объем в зависимости от профиля рабочей нагрузки.

Ценообразование и сроки начала поставок 512-терабайтной модели вендор не озвучил, однако на фоне текущих котировок на кремниевые пластины NAND стоимость терабайта едва ли будет бюджетной.

Четыре подхода к экосистеме CXL: Marvell, Synopsys, Montage Technology и Kioxia

Наращивание емкости решает вопрос хранения, но в инфраструктуре искусственного интеллекта не менее важна скорость доставки данных вычислителям. Универсальным ответом индустрии выступает стандарт CXL (Compute Express Link). Развернутый поверх шины PCIe, он обеспечивает когерентный доступ к памяти между CPU, ускорителями и пулами ОЗУ, объединяя их в прозрачное общее адресное пространство. На саммите ведущие разработчики продемонстрировали зрелость этой архитектуры.

Линейка Marvell Structera™: дифференцированные CXL-решения

Линейка процессоров Marvell Structera™. Источник.
Линейка процессоров Marvell Structera™. Источник.

Marvell представила масштабное расширение семейства Structera™, выделив в нем три функциональных направления: экспандеры памяти (серия X), коммутационные матрицы (серия S) и специализированные ускорители (серия A).

Контроллеры Structera™ X служат мостом интеграции стандартных модулей DDR в общую CXL-топологию:

  • Structera™ X 2404 работает с DDR4 и агрегирует до 12 модулей (по 3 планки на канал);

  • Structera™ X 2504 оптимизирован под высокоскоростную DDR5 с подключением до 8 модулей (по 2 на канал).

Практический смысл очевиден: продлить жизненный цикл уже закупленных парков памяти DDR4, интегрировав их в виде недорогого пула расширения. По данным производителя, эти контроллеры уже поставляются крупнейшим гиперскейлерам.

CXL-коммутатор Structera™ S30260 (стандарт 3.x) связывает до 16 или 32 вычислительных узлов (CPU/GPU) в распределенный кластер памяти емкостью до 48 ТБ с пиковой пропускной способностью 4 ТБ/с, поддерживая планки DDR4 и DDR5.

Согласно внутренним тестам Marvell, пулинг памяти GPU на базе Structera™ увеличивает производительность инференса до 4,8 раза и на 82,7% уменьшает время генерации первого токена (TTFT). Впрочем, независимых валидаций этих показателей пока нет.

Инженерный интерес представляет сопроцессор Structera™ A2504:

  • 16 вычислительных ядер Arm Neoverse V2 с частотой до 3,2 ГГц;

  • адресация до 4 ТБ ОЗУ с пропускной способностью до 200 ГБ/с;

  • блоки аппаратного сжатия LZ4 и сквозного шифрования XTS-AES (256 бит).

Чип разгружает центральные процессоры от фоновых операций — векторного поиска, обслуживания рекомендательных систем (DLRM) и задач инференса. Интеграция одного такого ускорителя в 64-ядерную конфигурацию увеличивает полезный вычислительный ресурс на 25%, а пропускную способность подсистемы памяти — на 50%.

Montage Technology: контроллер-транслятор 3.2 MXC

Архитектура пула памяти CXL со сквозным подключением хостов и ускорителей (xPU) через CXL-коммутатор. Источник.
Архитектура пула памяти CXL со сквозным подключением хостов и ускорителей (xPU) через CXL-коммутатор. Источник.

Китайский разработчик Montage Technology выпустил пилотную партию контроллеров CXL 3.2 MXC (Memory eXpander Controller). В отличие от комбайнов Marvell, MXC — это узкоспециализированный преобразователь: он не производит расчетов, а на лету транслирует протокольные запросы CXL в стандартные инструкции DDR5, делая внешний пул неотличимым от локального ОЗУ.

Устройство относится к классу CXL Type 3 (память без встроенных вычислителей) и работает поверх интерфейса PCIe 6.x со скоростью 64 ГТ/с. Это надежный базис для коммерческих модулей, готовых к внедрению прямо сейчас.
Показательно, что контроллер MXC уже внедряют в свои продукты прямые конкуренты на рынке DRAM — Samsung и SK hynix. Чип получил подтвержденную совместимость с серверными процессорами Intel® Xeon® и AMD® EPYC™, что критично для практического развертывания CXL-инфраструктуры.

Synopsys: комплексный стек IP для стандарта CXL 4.0

Архитектура полного стека IP-решений Synopsys для CXL 4.0. Источник.
Архитектура полного стека IP-решений Synopsys для CXL 4.0. Источник.

Если производители чипов предлагают конечные интегральные схемы, то Synopsys поставляет интеллектуальную собственность (IP-блоки) для создания таких микросхем.

Компания представила первый в индустрии готовый программно-аппаратный пакет для спецификации CXL 4.0:

  • системный контроллер;

  • криптографические блоки IDE;

  • физический уровень (PHY);

  • инструменты верификации.

Единая лицензия обеспечивает обратную совместимость вплоть до CXL 1.x и гарантирует переход на грядущий интерфейс PCIe 7.0 без дополнительных лицензионных выплат.

Ключевое преимущество CXL 4.0 — удвоение пропускной способности до 128 ГТ/с, что соответствует нормам PCIe 7.0. При объединении портов (Bundled Ports) связка из четырех линий x16 пропускает свыше 2 ТБ/с, а восемь линий преодолевают рубеж в 4 ТБ/с без ощутимого роста латентности.

Анализ Synopsys показывает: выгрузка промежуточных контекстных данных инференса (KV-кэша) в память CXL вместо твердотельных накопителей ускоряет выполнение задач в 3–6 раз. Задержка доступа к CXL.mem остается в пределах 200 нс, размер единого пула стойки превышает 100 ТБ, а суммарные затраты на инференс падают на 50%.

ТехноДень — 8 октября

Флагманская конференция про технологии и бизнес. 20+ докладов, воркшопов и дискуссий, 20 интерактивных стендов, мерч и афтепати. Участие бесплатное: нужна только регистрация.

Зарегистрироваться →

Актуальность этих разработок подтверждается оценками Goldman Sachs: к 2030 году потребление токенов генеративными моделями вырастет в 24 раза. В масштабах таких вычислительных нагрузок оптимизация инфраструктуры даже на доли процента конвертируется в колоссальную экономию.

Kioxia XL1: гибридизация флеш-памяти и оперативного пространства

Модуль расширения памяти серии Kioxia XL1. Источник.
Модуль расширения памяти серии Kioxia XL1. Источник.

Kioxia продемонстрировала модуль памяти XL1, использующий фирменную энергонезависимую технологию XL-Flash. Это представитель класса Storage-Class Memory (SCM) на базе 3D NAND BiCS Flash. Модуль подключается через CXL и компонуется кристаллами SLC (128 Гбит) либо MLC (256 Гбит) в конфигурациях по 2, 4 или 8 слоев.

Концепция XL1 ориентирована на разгрузку сверхдорогой DRAM: «холодные» данные перемещаются на CXL-модуль, освобождая скоростное ОЗУ под активные контексты. Промежуточный уровень между классическими SSD и DRAM устраняет узкие места при работе с большими языковыми моделями. Например, для нейросети на 70B параметров с контекстным окном в 1 миллион токенов персональный KV-кэш пользователя может достигать 320 ГБ, что превышает суммарный объем HBM-памяти одного ускорителя NVIDIA® B300. Разместить такой объем целиком в DRAM экономически нецелесообразно, что и делает архитектуры уровня XL1 безальтернативными.

Точные технические параметры XL1 производитель пока не раскрывает. Инженерные образцы направлены стратегическим партнерам для лабораторного тестирования в августе 2026 года.

Итоги

Экспозиция FMS 2026 четко обозначила два магистральных вектора развития индустрии. Первый — гонка физической емкости: альянс производителей SSD (DapuStor, Samsung, SK hynix, Micron) форсирует переход на плотные кремниевые кристаллы. Второй — борьба за скорость выборки: экосистема CXL в исполнении Marvell, Synopsys и Kioxia выстраивает гибкие дезагрегированные пулы памяти, обеспечивая процессорам и GPU мгновенный доступ к гигантским объемам данных.

Если ранее CXL оставался перспективным стандартом на бумаге, то сегодня мы наблюдаем фазу зрелой коммерциализации. Технологический барьер преодолен: отгрузки реальных контроллеров уже идут, а индустрия готовится к внедрению CXL 4.0. Теперь успех игроков будет определяться способностью предоставить рынку сбалансированные по стоимости и надежности законченные платформы.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов