Два новых китайских GPU, которые стоит покупать в комплекте

Прокомментировать Просмотры: 5

Буквально с разницей в несколько дней технологические гиганты Huawei и Alibaba презентовали новое аппаратное обеспечение для нейросетей. Корпорация Huawei продемонстрировала свои разработки 17 сентября на конференции HUAWEI CONNECT 2026 в Шанхае, тогда как Alibaba показала свои новинки 22 сентября в Ханчжоу на площадке Apsara Conference. Несмотря на различия в бизнес-моделях и подходах, оба анонса отражают общую тенденцию: в условиях технологических ограничений местная GPU-индустрия не пытается слепо копировать архитектуру американского конкурента. Вместо этого разработчики находят собственные инженерные пути для эффективного объединения тысяч чипов в единую систему. Привет! На связи Сергей Ковалёв, продакт-менеджер в Selectel, и все подробности — далее в статье.

Что анонсировали Huawei

Источник.
Источник.

Ключевой премьерой стал Atlas 960E SuperPoD — пионер среди SuperPoD-решений на базе технологии NPO (near-packaged optics). По сути, SuperPoD представляет собой мощнейший массив из тысяч ускорителей (NPU и GPU), объединенных высокоскоростным интерконнектом. Все эти элементы функционируют как единая вычислительная машина с общей адресной памятью, что жизненно важно для тренировки масштабных ИИ-моделей. Сама Huawei пока не раскрывает точное количество шкафов в Atlas 960E, но если проводить аналогии с прошлым поколением Atlas 950 SuperPoD, включавшим 8192 NPU на базе 160 стоек (где 128 отводилось под вычисления, а 32 — под коммутацию UnifiedBus):

  • 128 вычислительных стоек с процессорами и ускорителями,

  • 32 коммутационных модуля на базе протокола UnifiedBus.

Логично предположить, что новый Atlas 960E SuperPoD стал компактнее примерно вдвое и насчитывает около 80 стоек.

Технические параметры Atlas 960E впечатляют: до 4096 NPU в рамках одного модуля, производительность на уровне 8 EFLOPS для формата FP8 и 16 EFLOPS для FP4. С помощью технологий UnifiedBus и RoCE несколько таких SuperPoD объединяются в гигантский SuperCluster, способный вместить до 512 тысяч NPU в clos-топологии (а при использовании многоканальных схем — до миллиона единиц). Фундаментом системы выступает оптический трансивер Hi-ONE, обеспечивающий пропускную способность 7,2 Тбит/с на узел со встроенной подсветкой. Замена традиционных 48 тысяч дискретных 800G-модулей на 5,5 тысячи оптических чипов Hi-ONE, смонтированных вплотную к процессору, дала колоссальную экономию энергии (более 550 кВт на систему) и повысила отказоустойчивость до 99,8%. Аппаратной базой служат чипы Ascend 960, разделенные на две специализированные линейки:

  • 960DT — создана для обучения нейросетей: выдает до 2 PFLOPS для FP8 и 4 PFLOPS для FP4, укомплектована 288 ГБ памяти HBM с пропускной способностью 9,6 ТБ/с (релиз в первом квартале 2027 года);

  • 960PR — оптимизирована под инференс: обеспечивает до 8 PFLOPS в режиме FP4 при 192 ГБ памяти с пропускной способностью 2,4 ТБ/с (выход намечен на третий квартал 2027 года).

Отдельного упоминания заслуживает модернизация серверных стоек TaiShan 950 SuperPoD под универсальные CPU. Архитектура объединяет до 4096 узлов в единое виртуальное пространство объемом 256 ТБ. Дополняет картину хранилище OceanStor M900 петабайтного масштаба, предназначенное для работы с KV-кэшем. Этот массив образует так называемый слой L3.5 — промежуточный буфер контекстной памяти между быстрой памятью ускорителей и традиционными накопителями.

Третьей важной новостью стал перевод программного обеспечения CANN для линейки Ascend в статус open-source проектов с открытым исходным кодом. Фактически это признание того, что проприетарный стек ранее не поспевал за развитием экосистем vLLM и PyTorch.

Что анонсировали Alibaba

Источник.
Источник.

Специалисты подразделения T-Head Semiconductor (Alibaba) презентовали флагманский ИИ-процессор Zhenwu V900. По утверждению разработчиков, это самый производительный специализированный чип искусственного интеллекта китайской разработки на сегодняшний день. Новинка превосходит предшественника Zhenwu M890 втрое, однако абсолютные показатели FLOPS компания благоразумно оставила в секрете.

Из подтвержденных спецификаций известны следующие параметры:

  • наличие 216 ГБ памяти HBM,

  • поддержка различных типов данных — от FP32 до FP4,

  • модернизированные тензорные ядра, оптимизированные под форматы FP8 и FP4,

  • скорость межчипового взаимодействия на уровне 1,2 ТБ/с.

Ключевая особенность чипа — гибкая настройка блоков для форматов MXFP8 и MXFP4. Данное решение стабилизирует производительность при масштабировании кластеров под задачи обучения и генерации, предотвращая падение эффективности по мере добавления новых графических карт. Узлы на bazie V900 объединяются через фирменные коммутаторы ICN Switch в сети емкостью до 500 тысяч ускорителей, чего, по заверениям инженеров, достаточно для работы с моделями на 5–10 триллионов параметров. Запуск серийного выпуска намечен на первые три месяца 2027 года.

ИИ‑роутер — доступ к 300+ моделям из одной панели

Подключите OpenAI‑совместимый шлюз по единому API‑ключу. Настраивайте сквозную аналитику, отслеживайте лимиты и квотируйте ресурсы.

Запустить ИИ‑роутер →

В этот же период ожидается дебют суперускорителя Panjiu, объединяющего кремний Zhenwu V900, коммутаторы ICN Switch, сетевые адаптеры Panmai и контроллеры Zhenyue в единый автономный узел. Кроме того, специалисты T-Head приоткрыли завесу тайны над будущим поколением процессоров Zhenwu J900 с собственной архитектурой параллельных вычислений, релиз которого запланирован на вторую половину 2028 года.

Параллельно был обнародован долгосрочный план развития центральных процессоров: семейства Yitian 720 и Yitian 730, ориентированные на автономные ИИ-агенты. Примечательно, что Yitian 730 будут базироваться на открытой архитектуре RISC-V, что станет для T-Head переходом от использования лицензированных ядер ARM в пользу полностью суверенных разработок. Генеральный директор компании У Юнмин емко охарактеризовал текущий вектор развития формулой: «Модели, чипы, облако». Он подтвердил, что T-Head замкнула цикл производства собственной серверной логики: ускорители Zhenwu, процессоры Yitian, сетевые интерфейсы Panmai и межблочные соединения ICN сформировали полноценный проприетарный стек для тяжелых нагрузок.

На уровне программного обеспечения стоит отметить решения Agent Context и AgentCore, созданные для эффективного управления контекстом на уровне «L3.5». Интересно, что к аналогичному выводу пришла и Huawei со своим хранилищем OceanStor M900: современные агентные сценарии упираются не столько в терафлопсы вычислительной мощности, сколько в скорость и стоимость работы с оперативной памятью, что заставляет гигантов создавать для этого специализированное «железо».

Кого еще мы встречали: MTT S5000 и DF1000

Источник.
Источник.

Помимо признанных лидеров вроде Huawei и Alibaba, на китайском рынке появляются и другие заметные игроки.

Moore Threads представила ускоритель MTT S5000 — универсальный графический чип на микроархитектуре PingHu. Устройство поддерживает квантование от FP8 до FP64 и гарантирует изначальную совместимость с фреймворками vLLM, PyTorch и SGLang без необходимости переписывать программный код. Демонстрируя возможности системы на примере модели DeepSeek V3, производитель смело сопоставляет свои решения с архитектурой Hopper® от NVIDIA®, выбирая классический экстенсивный путь копирования экосистемы CUDA.

Совсем иной подход демонстрирует Dongfang Suanxin с моделью DF1000. Чип выпускается по относительно простому 14-нм техпроцессу и полностью обходится без дорогой HBM-памяти. Вместо этого применяется 3D-компоновка по принципу near-memory. Разработчики заявляют производительность на уровне 520 TFLOPS для BF16 при пропускной способности интерфейса scale-up в 900 ГБ/с и пропускной памяти 6,4 ТБ/с (что даже выше показателей флагманского ускорителя NVIDIA® H200). Инженеры попытались компенсировать ограничения литографии и дефицит памяти за счет архитектурных ухищрений. Впрочем, компания честно признает, что соперничать с актуальными западными аналогами придется уже следующему поколению чипов — DF2000, в то время как точный объем памяти текущего решения пока не разглашается.

Разумеется, этот перечень далеко не полон и отражает лишь те продукты, по которым имеется открытая техническая документация.

Сравнение с лидерами

Для объективной картины сопоставим представленные анонсы с продукцией признанных мировых лидеров, разделив устройства на отдельные чипы и готовые стоечные комплексы.

Уровень чипа

Параметр

Ascend 960DT

Zhenwu V900

NVIDIA® R100 (Vera Rubin™)

NVIDIA® B300

AMD MI355X

HBM

288 ГБ

216 ГБ

288 ГБ HBM4

288 ГБ HBM3e

288 ГБ HBM3e

Пропускная способность памяти

9,6 ТБ/с

Не раскрыто

до 22 ТБ/с

8 ТБ/с

8 ТБ/с

Межчиповый интерконнект

2,2 ТБ/с

1,2 ТБ/с

NVLink 6, 3,6 ТБ/с

NVLink 5, 1,8 ТБ/с

Infinity Fabric (точные цифры не публикуются)

FP8 (dense)

2 PFLOPS

Не раскрыто

17.5 PFLOPS

5 PFLOPS

4.6 PFLOPS

FP4 (dense)

4 PFLOPS

Не раскрыто

50 PFLOPS

15 PFLOPS

9.2 PFLOPS

TDP

Не раскрыто

Не раскрыто

~2 300 Вт

1 400 Вт

1 400 Вт

Доступность

Q1 2027

Q1 2027

Q4 2026

Уже поставляется (с января 2026)

Уже поставляется

Анализ сроков и заявленных характеристик показывает, что китайские решения находятся преимущественно в статусе перспективных дорожных карт. В то же время AMD и NVIDIA предлагают готовые, серийно поставляемые продукты.

Арендуйте GPU за 1 рубль!

Выберите нужную конфигурацию в панели управления Selectel. Подробнее →

Стоечные решения

Параметр

Atlas 960E SuperPoD

Panjiu (Alibaba, на V900)

NVL72® (Vera Rubin™)

AMD Helios™ (, 72 × MI455X)

Число ускорителей

4 096 NPU

Не раскрыто на уровне одной стойки*

72 GPU

72 GPU

Суммарная HBM

До 1 ПБ

Не раскрыто

~21 ТБ

~31 ТБ

FP8 

8 EFLOPS

Не раскрыто

~1.26 EFLOPS

1.4 EFLOPS

FP4

16 EFLOPS

Не раскрыто

2.5–3.6 EFLOPS

2.9 EFLOPS

Интерконнект

Hi-ONE (5 500 модулей) + UnifiedBus

ICN Switch

NVLink 6, 260 ТБ/с агрегат на стойку

Infinity Fabric / масштабируемая связь

Макс. масштаб кластера

До 512 000 NPU (до 1 млн c multi-rail)

До 500 000 карт (через ICN Switch)

NVL72 — базовая единица масштабирования

Кластеры из нескольких Helios-стоек

Доступность

~Q3 2027

Q1 2027

Уже поставляется

Уже анонсирован (октябрь 2026)

* Прошлый комплекс Panjiu AL128 базировался на стойках с 128 чипами M890. Для новой версии на базе V900 количество чипов на стойку не уточняется, известна лишь предельная емкость всего кластера в 500 000 карт.

Здесь четко прослеживаются концептуальные расхождения: одна стойка NVL72® выдает производительность, сопоставимую с шестой частью гигантского кластера Huawei из 4096 NPU (занимающего порядка 80 шкафов). Однако линейное горизонтальное масштабирование систем NVIDIA — задача крайне сложная, и в ряде сценариев они могут уступать специализированной SuperPoD-архитектуре Huawei.

Наш тест Zhenwu 810E

Источник.
Источник.

Команда Selectel уже успела протестировать серверную конфигурацию на базе процессоров Zhenwu 810E — предшественников свежего чипа V900 (подробный разбор мы опубликуем в ближайшее время). Главные трудности, с которыми мы столкнулись, крылись не столько в физическом исполнении чипов, сколько в топологии связей и сырости программного окружения.

На аппаратном уровне пропускная способность шины ICN оказалась неоднородной: часть ядер обменивалась данными по двум линиям, другие — по одной, а часть трафика и вовсе уходила через медленный интерфейс SYS (около 14 ГБ/с). Суммарная пропускная способность операций All-to-All на 16 PPU составила примерно 1,2 ТБ/с, что ниже показателей системы HGX™ H200 с меньшим количеством чипов, не говоря уже о B300 (где этот показатель достигает 5,1 ТБ/с). Квантование ограничивалось форматами BF16/FP32 и W8A8/AWQ/GPTQ, в то время как востребованные FP8 и фирменный стандарт NVIDIA Blackwell™ NVFP4 на тот момент не поддерживались. Фактически отставание по возможностям обработки составляло два поколения.

Эксплуатационные нюансы тоже дают о себе знать: в системе отсутствуют прямые аналоги nvidia-container-toolkit и стандартных утилит мониторинга уровня DCGM. Веса моделей на платформе ModelScope.cn выкладывают с задержкой, а вся техническая документация доступна преимущественно на китайском языке. Заявленные для V900 216 ГБ памяти и 1200 ГБ/с интерконнекта выглядят серьезным шагом вперед по сравнению с 810E. Тем не менее перенос фреймворка CANN в open-source и обещания нативной поддержки от Alibaba пока остаются на уровне деклараций. Пока индустрия не увидит независимых тестов Atlas 960E и V900 на реальных нагрузках, любые показатели из презентаций стоит воспринимать с известной долей скепсиса.

Итог

Обе премьеры вовсе не означают, что китайская микроэлектроника мгновенно догнала продукцию NVIDIA по чистой производительности (на данный момент это пока не так). Эти анонсы демонстрируют другое: местная инженерная школа находит нестандартные обходные пути — будь то оптимизация топологии интерконнекта у Huawei, глубокая вертикальная интеграция у Alibaba, поиск новых архитектур памяти у Dongfang Suanxin или ориентация на совместимость со стандартным софтом у Moore Threads. В реальных же боевых условиях критерий истины прежний: насколько стабильно работает программный стек под конкретные задачи и какую реальную скорость генерации токенов в секунду удается получить, а не то, что написано в рекламных буклетах.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов