Как я объединил четыре Mac Studio в систему с 1,5 ТБ памяти для запуска тяжелых ИИ-моделей

Компания Apple предоставила мне этот стек Mac Studio для тестирования технологии RDMA через Thunderbolt — инновационного функционала в macOS 26.2. Наиболее эффективно оценить его потенциал позволяет Exo 1.0 — инструмент с открытым исходным кодом, предназначенный для распределения задач ИИ между узлами локальной сети. Благодаря RDMA маки объединяют свою унифицированную память в единый массив, что обеспечивает колоссальный прирост при выполнении ресурсоемких нейросетевых вычислений.
Стоимость такой «стопки» с суммарным объемом памяти 1,5 ТБ составляет внушительные 40 000 долларов, однако для данных испытаний Apple любезно предоставила оборудование во временное пользование. Также выражаю признательность команде DeskPi за предоставленную компактную мини-стойку, куда идеально вписался мой вычислительный кластер.
В последний раз Apple проявляла столь серьезные амбиции в сегменте высокопроизводительных вычислений (HPC) на заре 2000-х, представив культовые серверные системы Xserve.

В ту эпоху купертиновцы пытались продвигать проприетарную кластерную технологию Xgrid, однако она не увенчалась успехом. Несмотря на энтузиазм нескольких университетов, построивших на этой базе свои учебные установки, широкого распространения решение не получило. Сегодня Xserve и Xgrid остались лишь достоянием истории.
Случайно ли это вышло или стало результатом долгосрочного планирования, но Mac Studio на чипе M3 Ultra оказался феноменальным инструментом для локального инференса. Теперь, благодаря RDMA, задержки при доступе к памяти сократились с 300 мкс до впечатляющих < 50 мкс. Это наконец-то позволяет превратить объединение нескольких машин в реальную высокопроизводительную систему, необходимую для работы с массивными языковыми моделями.
Помимо всего прочего, эти устройства великолепно справляются с креативными задачами и сложными научными расчетами, потребляя менее 250 Вт и работая практически бесшумно.
Два нижних юнита в стойке располагают 512 ГБ унифицированной памяти и 32 процессорными ядрами (стоимость каждого $11 699). Верхние модели имеют вдвое меньший объем памяти и стоят по $8 099.
Учитывая недавние релизы конкурентов, вроде систем Nvidia DGX Spark или решений на базе AMD AI Max+ 395, где объем памяти ограничен 128 ГБ (в четыре раза меньше!), мой интерес к тестированию этого терабайтного кластера был вполне оправдан.
❯ Настольный дата-центр в миниатюре
Буквально перед доставкой компьютеров от Apple я получил от DeskPi новую открытую мини-стойку TL1.

Мой Project MINI RACK, запущенный ранее в этом году, нацелен на адаптацию преимуществ серверного оборудования для обычных пользователей в компактном настольном форм-факторе.
На данный момент рынок почти не предлагает готовых решений для установки Mac Studio в 10-дюймовые стойки, за исключением энтузиастских проектов для 3D-печати. В итоге я выбрал простое решение — обычные 10-дюймовые полки.
Главный нюанс при монтаже «гражданских» Mac в серверные стойки — доступ к кнопке питания, которая расположена сзади на скругленной грани корпуса. Открытая конструкция стойки облегчает эту задачу: можно придерживать устройство одной рукой, а другой нащупать кнопку.
При этом порты на фронтальной панели — огромное преимущество при необходимости оперативного подключения периферии:

Безусловный плюс Apple — интегрированный блок питания. Большинство компактных ПК грешат «внешними кирпичами», тогда как Apple сохранила чистоту дизайна. Однако возникла проблема с фирменными кабелями, отличными от стандартных C13: найти шнуры идеальной длины для эстетичного кабель-менеджмента — та еще головная боль.

В сетевых возможностях Nvidia DGX Spark превосходит решение Apple, используя надежные и удобные разъемы QSFP. В экосистеме Mac Studio высокоскоростной интерконнект (50–60 Гбит/с) целиком опирается на Thunderbolt. Но даже дорогие кабели Apple не внушают стопроцентной уверенности: в условиях сервера такая «гирлянда» на USB-C может легко отсоединиться.
Существуют фиксаторы вроде ThunderLok-A, но сверлить отверстия в предоставленных на тест устройствах я, разумеется, не стал.
Более того, на текущий момент коммутаторов с поддержкой Thunderbolt 5 не существует. Приходится использовать прямое соединение «каждый с каждым», что порождает беспорядок в проводах. Формально можно объединить до четырех машин, хотя заявленная поддержка RDMA на всех пяти портах Thunderbolt 5 оставляет задел на будущее.
Впрочем, остается вопрос целесообразности такого кластера: даже один такой девайс — это монстр, превосходящий по мощности квартет систем DGX Spark или AI Max+ 395.
❯ Сравниваем мускулы: M3 Ultra лицом к лицу с конкурентами
Для объективной оценки я провел серию тестов, результаты которых доступны в репозитории sbc-reviews.
Сравнение проводилось с:
-
Dell Pro Max (чип GB10);
-
Framework Desktop (чип AMD AI Max+ 395).

В Geekbench M3 Ultra оставляет конкурентов далеко позади как в однопоточных, так и в многопоточных задачах.

В тесте двойной точности FP64 (HPL) Mac Studio стал первым компактным ПК, преодолевшим отметку в 1 терафлопс, опередив решения Nvidia и AMD.

Энергоэффективность также на высоте: в простое система потребляет всего 10 Вт.

Для работы нейросетей M3 Ultra — универсальное и мощное решение.


Масштабное доминирование Mac Studio очевидно даже в сравнении с кластерами на базе других платформ, потребляя при этом вдвое меньше энергии.
❯ Маленькая стопка — большие хлопоты?
Администрирование кластера из нескольких маков — задача нетривиальная. Будучи фанатом автоматизации и автором популярного Ansible-плейбука для macOS, я подтверждаю: Linux в серверных сценариях остается вне конкуренции. Обновление ОС без графического интерфейса — по-прежнему невозможная задача, что вынуждает прибегать к удаленному управлению через «Общий экран».
❯ HPL и Llama.cpp на практике
Тестирование показало прирост производительности при масштабировании, хотя и не линейный. Thunderbolt 5 демонстрирует гораздо меньшие задержки по сравнению с 2.5GbE, что критично для производительности нейросетей.


❯ Заводим RDMA на маках
Для активации RDMA в Exo 1.0 требуется выполнение команды rdma_ctl enable в режиме восстановления. Это открывает возможность запуска огромных моделей, таких как Kimi K2 Thinking (более 600 ГБ).

Exo демонстрирует значительное преимущество в эффективности распределения вычислений по сравнению с RPC-методами в других библиотеках. При работе с моделью DeepSeek V3.1 (671 млрд параметров) кластер показывает стабильную и достойную скорость.
❯ Вопросы стабильности
Стоит отметить, что технология RDMA через Thunderbolt находится в стадии ранней разработки. Стабильность оставляет желать лучшего, что вполне ожидаемо для предрелизного ПО, однако потенциал технологии впечатляет.

❯ Заключение
Mac Studio — это мощная и надежная рабочая станция, даже без учета всех экспериментов с кластеризацией. Thunderbolt 5 является сдерживающим фактором, но как компромисс для профессионалов он работает. Возможно, в будущем Apple представит версию с портами QSFP, что позволило бы собирать настоящие промышленные кластеры.
Может быть интересно:

Новости, обзоры продуктов и конкурсы от команды Timeweb.Cloud — в нашем Telegram-канале ↩
Энтузиасты запустили видеокарту GeForce RTX 4060 на 24-ядерном ARM-процессоре Huawei Kunpeng 920
Полный список из более 40 смартфонов Xiaomi, Redmi и Poco с июльским обновлением HyperOS
HP Star Desk S03: компактный компьютер с клавиатурой и мышью в комплекте
Дагестанская Новолакская ВЭС признана крупнейшим ветропарком в России
Для Raspberry Pi выпустили 10-дюймовый сенсорный экран за 80 долларов
Бывший топ-менеджер TSMC обвинен в краже технологий для Китая по новому закону о нацбезопасности Тайваня
Стал известен первый российский оператор, готовый к запуску 5G
В поиске Google обнаружили индексацию личных чатов пользователей DeepSeek