Tensordyne Napier: новая альтернатива традиционным GPU для инференса

Tensordyne Napier: новая альтернатива традиционным GPU для инференса

Прокомментировать Просмотры: 18

Модульная ИИ-платформа TDN. Источник.

Мир высокопроизводительного оборудования для ИИ обновляется стремительно: едва ли не каждый месяц новые игроки анонсируют «революционные» решения для инференса и обучения моделей. И хотя до реального внедрения в дата-центры добираются единицы, мы продолжаем пристально изучать каждый такой проект в надежде найти технологию, способную перевернуть рынок. На связи Сергей Ковалёв, продакт-менеджер Selectel, и сегодня мы детально разберем перспективную аппаратную новинку.

Что нового на горизонте

ИИ-процессор Tensordyne TDN AIP. Источник.
ИИ-процессор Tensordyne TDN AIP. Источник.

Стартап Tensordyne презентовал чип Napier™ и комплексное серверное решение на его базе.

Проект реализуется в тесном партнерстве с индустриальными гигантами: Broadcom отвечает за проектирование кремния, а HPE® и Juniper Networks® — за сетевую инфраструктуру. Чипы производятся по передовому 3-нм техпроцессу TSMC, и, что важно, стадия проектирования (tape-out) уже успешно завершена.

Фундаментальная идея архитектуры заключается в использовании логарифмических вычислений, позволяющих заменить ресурсоемкие операции умножения простым сложением. Это решение делает вычислительные блоки компактнее и энергоэффективнее, высвобождая пространство на кристалле для увеличения объема SRAM.

По заявлениям разработчиков, чип оснащен в пять раз большим объемом SRAM по сравнению с NVIDIA® Blackwell™.

SRAM (статическая оперативная память) — это сверхбыстрая память, размещенная непосредственно на кристалле процессора. В отличие от внешней HBM, она работает значительно быстрее, обеспечивая минимальные задержки при доступе. Однако из-за высокой стоимости и занимаемой площади ее объем традиционно ограничен. Для задач инференса, где модель постоянно обращается к весам и KV-кэшу, близость памяти к вычислительным ядрам критически важна для роста реальной пропускной способности.

Технические спецификации

Стоечный модуль ИИ-инференса Tensordyne TDN72 Pod. Источник.
Стоечный модуль ИИ-инференса Tensordyne TDN72 Pod. Источник.

Параметры чипа:

  • 138 млрд транзисторов;

  • производительность: 2,1 петафлопс (FP8);

  • память: 144 ГБ HBM3E и 256 МБ встроенной SRAM;

  • энергопотребление — 300 Вт (против 1 200 Вт у NVIDIA® B300).

Базовый узел (1U) объединяет девять таких чипов, 40-ядерный процессор Intel® Xeon® и 8 ТБ NVMe-накопитель. Восемь подобных узлов образуют кластер TDN72.

Tensordyne Napier Rack. Источник.
Tensordyne Napier Rack. Источник.

Полноценная стойка (52 юнита) состоит из четырех таких кластеров:

  • суммарная мощность: 608 петафлопс (FP8);

  • объем памяти: 42 ТБ HBM, 74 ГБ SRAM;

  • потребление: 120 кВт;

  • охлаждение: воздушное, без необходимости в жидкостном контуре.

Интерконнект TDN Link. Источник.
Интерконнект TDN Link. Источник.

Высокоскоростная передача данных между чипами реализована через проприетарный интерконнект TDNLink™ с задержками менее 1 мкс и пропускной способностью 1 ТБ/с.

Исторический контекст

Команда Tensordyne ранее была известна под брендом Recogni, специализируясь на решениях для автомобильных систем компьютерного зрения. Смена фокуса на инфраструктуру дата-центров сопровождалась ребрендингом.

Хотя концепция логарифмических вычислений в нейросетях обсуждается с 70-х годов, довести её до коммерческого воплощения удалось впервые. Разработки в этом направлении компания начала в 2019 году, создав систему Pareto. Последующий чип Scorpio (7 нм) стал «пробой пера», а Napier™ — уже полноценным коммерческим продуктом для масштабных задач.

Новые GPU в облаке Selectel от 132,18 ₽/час

Производительные решения для сложнейших вычислений — NVIDIA® H200, RTX™ 6000 Pro.

Узнать больше →

В этом ключе вспоминается недавний анонс Bolt Graphics™ Zeus™. Подобные стартапы часто предлагают многообещающие решения, которые могли бы изменить индустрию. Мы искренне желаем им успеха в реализации амбициозных планов.

Бенчмарки и рыночные перспективы

Сравнение производительности и энергоэффективности Tensordyne и NVIDIA® NVL72 GB300 на модели DeepSeek-R1. Источник.
Сравнение производительности и энергоэффективности Tensordyne и NVIDIA® NVL72 GB300 на модели DeepSeek-R1. Источник.

Для меня, как для специалиста по выбору инфраструктуры, ключевой метрикой остается соотношение цены и производительности. Пока доступные данные носят декларативный характер — независимых тестов еще нет.

Превосходство Tensordyne над NVIDIA® NVL72 GB300 в инференсе DeepSeek-R1. Источник.
Превосходство Tensordyne над NVIDIA® NVL72 GB300 в инференсе DeepSeek-R1. Источник.

Согласно внутренним тестам на DeepSeek-R1, одна стойка Tensordyne обеспечивает 363 000 токенов в секунду против 27 400 у NVIDIA® GB300 NVL72. Заявленный перевес — 13-кратный по пропускной способности и 17-кратный по энергоэффективности.

Значимым риском остается отход от стандартной арифметики с плавающей запятой в пользу логарифмических вычислений. Это потенциально влияет на точность, однако компания уверяет, что программная среда нивелирует эту разницу без необходимости дообучения моделей. Мы сможем убедиться в этом лишь после появления первых серийных образцов.

Прогноз годовой выручки со стойки: Tensordyne против NVIDIA® NVL72 GB300. Источник.
Прогноз годовой выручки со стойки: Tensordyne против NVIDIA® NVL72 GB300. Источник.

Tensordyne позиционирует свое решение как «экономическую эффективность», обещая стоимость 11 $ за миллион токенов (против 150 $ у NVIDIA). Реальная коммерческая доступность ожидается не раньше конца 2026 года.

Конкурентная среда

  • Cerebras — с их чипами-гигантами CS-3™ для сверхбыстрого инференса.

  • Groq® — специализируются на LPU, задавая тренд для задач декодирования.

  • Tenstorrent — развивают универсальные ускорители на базе архитектуры RISC-V под руководством Джима Келлера.

  • SambaNova — продвигают архитектуру SN50™ для агентных ИИ-задач.

  • Positron — фокусируются на экстремально низких задержках.

  • Majestic Labs Prometheus — делают ставку на колоссальный объем памяти (до 128 ТБ LPDDR6 на сервер).

  • Lumai Iris — экспериментируют с оптическими вычислениями, обещая 90% экономию энергии за счет обработки данных светом.

Итоги

Tensordyne делает ставку на принципиально новую математическую модель и оригинальную архитектуру. Успешный tape-out и наличие инвестиций — это весомый задел, но путь от прототипа до рынка полон трудностей, которые уже поглотили множество игроков, таких как Graphcore или стартапы, купленные гигантами индустрии.

Основная интрига заключается в том, насколько логарифмические вычисления приживутся в реальных задачах и не потребуют ли они сложной адаптации всего стека разработки. Хотя компания заявляет о поддержке PyTorch и Triton, доминирование CUDA как экосистемы остается серьезным барьером для любого нового игрока. Мы с интересом будем наблюдать за прогрессом Tensordyne, ведь рынок инференса остро нуждается в альтернативных решениях и здоровой конкуренции.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов