Как на берегу Жемчужной реки возвели и уничтожили Memory Wall

Прокомментировать Просмотры: 2

В конце сентября Шэньчжэнь принимал масштабную конференцию GMIF 2026, сфокусированную на трендах развития искусственного интеллекта и инфраструктуры хранения данных. Поскольку я профессионально занимаюсь проектированием ИИ-систем для автоматизации бизнес-процессов в IT, пропустить столь значимое событие было просто невозможно. Тем более что повестка обещала быть крайне насыщенной: влияние подсистем памяти на экономику токенов, пересмотр дата-центров под углом ИИ-нагрузок, а также глобальная перестройка производственных цепочек с упором на управление данными, синергию и устойчивость поставок.

Каковы особенности профильных IT-конференций в Китае, чем они способны удивить искушенного специалиста, почему ключевыми фокусом стали SSD, NAND и KV Cache, насколько важен китайский язык для комфортного погружения и, наконец, в чем суть пресловутой «стены памяти» (Memory Wall) и путях ее преодоления — читайте в этом обзоре.


Несколько вводных слов об организации и формате. Мероприятие проводится уже в пятый раз силами Shenzhen Memory Industry Association и Школы интегральных схем Пекинского университета. Поначалу эти структуры могут показаться малознакомыми, однако меня жжал первый приятный сюрприз: масштаб и уровень организации ни в чем не уступали ведущим технологическим форумам технологических гигантов вроде Сбера или Яндекса, а заявленные спикеры присутствовали лично.

Программа GMIF растянулась на несколько дней. Старт был отдан закрытым сессиям для инвесторов и корпоративного сектора. Второй день посвятили пленарным докладам, чествованию инноваций в сфере систем хранения и нетворкинг-активностям. Завершилось всё традиционным турниром по гольфу. Помимо размаха события, впечатлили выставочные стенды. В отличие от привычных нам экспозиций с единичными прототипами, здесь развернулись полноценные торговые площадки. Посетители могли изучить спецификации актуальной продукции, узнать точные прайсы, согласовать объемы и сразу договориться о сроках поставки партий.

Тем не менее, смысловым фундаментом GMIF оставались доклады. Открыл деловую программу (после приветствия организаторов) Дэниел Йен (Daniel Yen), исполнительный директор Morgan Stanley. Он задал ключевой тон всей конференции, подняв проблему Memory Wall. Впоследствии этот термин так или иначе затрагивали и другие эксперты, однако именно Йен сформулировал его как критический разрыв между ростом вычислительных мощностей и пропускной способностью памяти. В качестве наглядной иллюстрации он привел ускоритель Nvidia B200: GPU обрабатывает информацию примерно в 20 000 раз быстрее, чем ее способны доставлять модули HBM3/HBM4. При этом угрозы Memory Wall носят не только технический, но и глубокий экономический характер:

  1. Взрывной рост капекса. Расходы глобальных облачных гигантов стремительно растут и к 2027 году могут достичь $1,2 трлн. Примечательно, что доля подсистем памяти в этой структуре уже сейчас составляет порядка 48%, а к указанному сроку способна подняться до 53%.

  2. Структурный дефицит памяти. Спрос на DRAM уже на 15% опережает производственные возможности вендоров, а нехватка NAND держится около отметки в 10%. Напряжение наблюдается и в сегменте HBM, где к 2027 году прогнозируется колоссальный объем рынка в $44 млрд.

  3. Память становится главным драйвером стоимости железа. По данным Morgan Stanley, на нее приходится до 73% себестоимости CPU-сервера, 41% цены ноутбука и около 39% стоимости современного смартфона.

  4. Технологические барьеры литографии. Например, выпуск HBM критически зависит от передовой 2.5D-упаковки CoWoS от TSMC. Несмотря на планы тайваньского гиганта удвоить мощности к 2028 году, дефицит сохранится, даже с учетом альтернативных производственных площадок.

Как преодолеть эту преграду? По мнению топ-менеджера Morgan Stanley, индустрии необходима эволюция техпроцессов, принципиально новый дизайн кристаллов, а также передовые методы корпусирования. Именно эти направления и стали красной нитью большинства выступлений.

Презентации транслировались преимущественно на китайском языке, сопровождаясь англоязычными субтитрами сомнительного качества. На этот случай пригодится практический лайфхак: чтобы не выпадать из контекста из-за погрешностей перевода, садитесь ближе к акустическим колонкам. Это позволит беспрепятственно использовать мобильные переводчики по аудиопотоку. Если же удалиться вглубь зала, автоматика начнет цеплять посторонние реплики соседей. К слову, уровень владения английским в китайской IT-среде оказался сопоставим с российским. Более того, редкие доклады на английском с китайскими титрами неизменно вызывали в зале оживление, далеко не всегда продиктованное исключительно темой выступления.

Одним из англоязычных спикеров выступил Кевин Юн (Kevin Yoon) из Samsung. В своем докладе он детально разобрал следующие риски современной инфраструктуры:

  1. Экспоненциальное раздувание KV Cache. Проблема кроется не столько в увеличении параметров самих моделей, сколько в изменении характера нагрузок. Многошаговые рассуждения, длинный контекст и автономные циклы ИИ-агентов превращают кэш в важнейший актив, требующий принципиально иного уровня организации, нежели рядовой буфер.

  2. В понимании Samsung «стена памяти» — это триединая проблема. Пропускная способность катастрофически отстает от флопсов, а энергопотребление неумолимо приближается к фундаментальным физическим лимитам.

  3. Безудержное наращивание емкости HBM и DRAM упирается в экономику. Линейное масштабирование становится экономически нецелесообразным для массового внедрения.

В качестве противоядия Юн предложил концепцию гетерогенной архитектуры, где нагрузка распределяется по уровням памяти в зависимости от коэффициента обращения (температуры данных). Для воплощения этой стратегии южнокорейский гигант презентовал фирменную разработку Z-NAND — высокоскоростную энергонезависимую память, призванную занять нишу между традиционными DRAM и SSD. Ее предполагается задействовать для хранения преимущественно статических весов моделей, что позволит удешевить готовое устройство примерно вчетчетверо по сравнению с чисто DRAM-подходом. Параллельно Samsung развивает стандарты Compute Express Link (CXL) для масштабирования памяти и GDDR7 для графических подсистем, анонсируя скорый релиз контроллеров CXL 3.1/PCIe 6.0 CMM-D в 2026 году.

Не менее амбициозным выглядело выступление Цай Имао (Cai Yimao), декана Школы интегральных схем Пекинского университета. Он презентовал концепт High Bandwidth Flash (HBF) — промежуточный класс решений на стыке HBM и SSD. Суть идеи заключается в интеграции пропускной способности HBM с емкостью NAND-памяти. Вместо классических DRAM-кристаллов предлагается использовать 3D NAND, сохранив при этом привычную вертикальную компоновку и кремниевые сквозные отверстия (TSV). По расчетам авторов, подобный гибрид обеспечит до 512 ГБ памяти на стек при пропускной способности от 0,4 до 3,0 ТБ/с.

В свою очередь, делегаты от Solidigm и Sandisk акцентировали внимание на технологии Quad-Level Cell (QLC), позволяющей достичь рекордной плотности записи на NAND и формировать максимально доступные по цене пулы для хранения KV Cache.

Отдельного упоминания заслуживает совместный проект компаний Infplane и Maxio, представивших специализированный ИИ-накопитель (AI SSD) с интеллектуальными алгоритмами предварительной выборки, планирования и менеджмента данных на уровне самого устройства. Главная цель разработки — динамическая балансировка весов и KV Cache между быстрой оперативной памятью и SSD. И хотя до полноценного конвейерного выпуска продукт еще не дошел, он отлично иллюстрирует текущий вектор индустрии.

Подавляющее большинство остальных докладов так или иначе крутилось вокруг преодоления Memory Wall. Общим знаменателем для всех инженеров стал подход Memory Offloading. Консенсус экспертного сообщества сводится к тому, что ИИ-инференс должен оптимизироваться за счет вытеснения некритичных данных с дорогих высокоскоростных уровней (DRAM/HBM) на более емкие и дешевые накопители вплоть до SSD. При этом речь идет не о банальном кэшировании, а о переосмыслении всей архитектуры памяти и осознанном перераспределении данных с учетом паттернов их использования.


Подводя итог под поездкой, можно констатировать: роль памяти в экосистеме искусственного интеллекта кардинально трансформируется. Распределяя весовые коэффициенты моделей и KV Cache по различным иерархическим уровням, разработчики получают инструмент для частичной разгрузки GPU и удешевления инференса. Безусловно, спикеры GMIF честно признавали отсутствие серебряной пули — каждое архитектурное решение влечет за собой определенные компромиссы и издержки. Разумеется, часть представленных надей останется лишь маркетинговыми декларациями, но очевидно одно: проектирование ИИ-приложений вступило в новую эру, где создание эффективной иерархии памяти становится важнейшей инженерной задачей.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов