Собственный ИИ-чип Jalapeno от OpenAI превзошел ускорители Nvidia по энергоэффективности

Прокомментировать Просмотры: 3

Фото SemiAnalysis (X)

Компания OpenAI раскрыла свежие технические подробности о собственном ИИ-ускорителе Jalapeno, созданном в сотрудничестве с Broadcom и Celestica и анонсированном пару месяцев назад. На этот раз разработчики поделились конкретными метриками быстродействия, которые демонстрируют превосходство их кремния над решениями от Nvidia.

В основе Jalapeno лежит единый вычислительный кристалл предельного размера (reticle limit), изготовленный по техпроцессу TSMC N3P. Он объединен на общей подложке с чиплетом ввода-вывода и стеками передовой памяти HBM4, обеспечивающими колоссальную пропускную способность в 15,4 ТБ/с на стек.

При этом вычислительные кластеры и подсистема памяти строго сегментированы: каждый блок ядер имеет прямое локальное сопряжение с минимальными задержками к закрепленному за ним сегменту HBM.

Вместо традиционных 16- или 8-битных стандартов Jalapeno задействует форматы микроскейлинга MXFP, которые оптимизируют математические вычисления нейросетей за счет сжатия данных — вплоть до 4 бит в случае MXFP4. В матричном движке процессора реализована систолическая матрица с фиксированными весами. В классических чипах непрерывный цикл чтения данных из памяти, вычислений и обратной записи создает узкое место архитектуры. Систолическая же матрица исключает эти простои: входящие потоки непрерывно передаются внутри взаимосвязанной сетки вычислительных ячеек от одной к другой без регулярных обращений к внешней памяти.

OpenAI завершила предварительное обучение модели Bel с более чем 10 трлн параметров

Судя по результатам внутренних тестов, Jalapeno стал рекордсменом по энергоэффективности в задачах инференса. В бенчмарке InferenceX при тестировании на моделях OpenAI GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T новинка превзошла связки Nvidia GB200/GB300 в 1,5–1,9 раза по производительности на ватт при пиковой нагрузке и показала в 1,7–3,6 раза меньшие сквозные задержки. Заявленный TDP устройства составляет 700 Вт, однако на практике реальное потребление чипа в рабочих сценариях чаще всего не превышает 550 Вт.

Существенным преимуществом является и то, что процессор не ограничен рамками конкретной архитектуры и обладает универсальной поддержкой любых современных нейросетевых моделей.

 

Источник: iXBT

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов