Память с самообработкой данных: устройство LPDDR5X-PIM

Прокомментировать Просмотры: 8

В ряде вычислительных сценариев узким местом становится вовсе не чистая производительность процессора, а пропускная способность подсистемы памяти. Нивелировать этот недостаток позволяет концепция вычислений прямо в накопителе (Processing-in-Memory). Ярким примером выступает разработка Samsung — чип LPDDR5X-PIM, в архитектуру которого интегрированы специализированные микросхемы для обработки данных на уровне банков DRAM. Это избавляет систему от необходимости постоянно транслировать массивы информации к центральному процессору или GPU. Давайте разберем принципы работы этой технологии, спектр доступных ей задач и ее результативность в бенчмарках с нейросетью Llama 3.1 8B.

Почему обмен данными между RAM и CPU превратился в критический барьер

Классическая архитектура подразумевает постоянную миграцию информации: процессор или ускоритель непрерывно запрашивает данные из оперативной памяти, производит расчеты и отправляет результат обратно. Когда вычислительные ядра начинают опережать пропускную способность интерфейса памяти, возникает закономерный простои.

Особенно остро данная проблема проявляется в сфере искусственного интеллекта. Для инференса языковых моделей GPU вынужден непрерывно выкачивать колоссальные объемы весов и промежуточных тензоров. Чем масштабнее модель, тем больше колоссальных затрат времени и энергии уходит на транспортировку байтов по шине. Простое наращивание «сырой» вычислительной мощности в таких условиях уже не гарантирует пропорционального прироста быстродействия.

Кардинально ускорить этот процесс призвана технология PIM (Processing-in-Memory). Ее суть заключается в наделении кристаллов памяти не только емкостью для хранения, но и базовым математическим функционалом.

Как инженерам удалось внедрить вычисления в чип LPDDR5X

Специалисты Samsung разместили миниатюрные логические блоки внутри каждого из 16 независимых банков памяти LPDDR5X-PIM. Они функционируют параллельно непосредственно над хранимым массивом данных, оперируя с форматами FP8, INT8 и INT4. В частности, аппаратная часть способна эффективно выполнять матрично-векторные умножения — фундаментальную операцию для современных нейросетей. Общий объем представленного полупроводникового решения составляет 16 ГБ.

Архитектура LPDDR5X-PIM Samsung: в 16 банках DRAM размещены вычислительные PIM-блоки, которые могут параллельно выполнять операции над находящимися рядом данными.
Архитектура LPDDR5X-PIM Samsung: в 16 банках DRAM размещены вычислительные PIM-блоки, которые могут параллельно выполнять операции над находящимися рядом данными.

Подобный подход радикально трансформирует логику перемещения данных. В стандартной памяти информацию необходимо транслировать по внешнему интерфейсу к процессору, производить расчеты и отправлять ответный сигнал назад. Концепция PIM переносит львиную долю рутинных вычислений внутрь кремниевой подложки: наружу транслируется исключительно готовый результат, что многократно снижает нагрузку на межкомпонентные шины.

Отсюда вытекает колоссальное превосходство в пропускной способности. Если стандартный внешний интерфейс LPDDR5X в конфигурации Samsung обеспечивает около 76,8 ГБ/с, то совокупный внутренний потенциал PIM-модулей достигает внушительных 614 ГБ/с. Разница составляет порядка восьми раз.

Разумеется, этот колоссальный внутренний ресурс задействован исключительно для локальных операций. Итоговое ускорение всей системы напрямую зависит от того, какой удельный вес алгоритмов удается делегировать непосредственно памяти.

Что продемонстрировали комплексные тесты на базе Llama 3.1 8B

Для оценки реальной эффективности инновации южнокорейский гигант сопоставил стандартную память LPDDR5X и ее PIM-модификацию в задаче инференса популярной LLM Llama 3.1 8B. Тестирование проводилось на идентичном ИИ-ускорителе с фиксированной длиной контекста в 320 токенов.

Итоги оказались весьма впечатляющими. Традиционная память выдавала скорость генерации на уровне 27 токенов в секунду, тогда как LPDDR5X-PIM демонстрировала уже 81,3 токена в секунду. Таким образом, быстродействие возросло ровно втрое, а общая продолжительность тестовой сессии сократилась с 12,3 до 5,4 секунды.

Результаты теста Llama 3.1 8B: LPDDR5X-PIM увеличил скорость генерации с 27 токенов/с до 81,3 токена/с, а время выполнения сократилось с 12,3 до 5,4 секунды.
Результаты теста Llama 3.1 8B: LPDDR5X-PIM увеличил скорость генерации с 27 токенов/с до 81,3 токена/с, а время выполнения сократилось с 12,3 до 5,4 секунды.

Стоит отметить, что 561-контактный форм-фактор чипа полностью соответствует спецификациям JEDEC. Это означает механическую совместимость с существующими спецификапциями LPDDR5X, позволяя внедрять подобные микросхемы в актуальные аппаратные платформы без глубокого перепроектирования систем.

Потенциальные сценарии применения LPDDR5X-PIM охватывают сферы, где ключевую роль играет интенсивное чтение массивов информации с последующей относительно несложной обработкой. В первую очередь это инференс массивных нейросетевых моделей, реляционные базы данных, задачи компьютерного зрения и криптографические вычисления.

На текущем этапе проект остается технологическим демонстратором передовых возможностей полупроводниковой индустрии, до коммерческого релиза и появления серийных устройств пройдет еще немало времени.

А как вы оцениваете перспективы внедрения PIM-архитектуры в реальный продакшн, или предпочтете классические аппаратные решения?

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов