Бюджетный домашний вычислительный сервер на двух CPU и шести RTX 3080

Прокомментировать Просмотры: 5

Я инженер, и у меня есть своего рода профессиональная деформация: мне необходимо, чтобы критически важные системы находились под моим полным контролем. Я предпочитаю локальные решения на «железе», которое можно изучить осциллографом, подвергнуть экстремальной нагрузке и, в случае отказа, оперативно починить с помощью паяльника. Когда годами работаешь с низкоуровневыми схемами, сигналами и системами питания, становится не по себе делегировать вычисления «в никуда», слепо полагаясь на надежность внешних облаков.

Облачные сервисы кажутся привлекательными на начальном этапе: быстро развернул — получил профит. Однако со временем проявляются подводные камни: сервис работает нестабильно, тарифы растут, а у вас нет доступа к глубокой диагностике — вы не видите, что происходит с памятью, где возникают узкие места или как нагружается шина.

Самый яркий пример — концепция «умного дома». Утром вы нажимаете выключатель, но свет загорается с задержкой, потому что команда проходит через облачный сервер. Если интернет «лагает», система становится непредсказуемой: датчики движения не срабатывают, а голосовой помощник докладывает об ошибках сети. Обновление прошивки у производителя может сломать API, и привычные сценарии начинают сбоить. Физически устройства исправны, но логика вынесена за пределы вашего дома, поэтому работоспособность системы зависит не от вас, а от стороннего провайдера.

С API та же история. Вы строите проект с критической зависимостью от внешнего сервиса, а на следующий день он меняет формат ответов или вводит жесткие лимиты. Ваш код остается прежним, но система начинает сыпаться, и отладка превращается в безнадежную попытку угадать, что изменилось на стороне вендора.

Кроме того, у меня (как и у многих) стойкое отторжение вызывает модель подписочных сервисов. Платить за токены? Спасибо, обойдусь.

Локальный вычислительный узел устраняет этот класс проблем. Вся инфраструктура находится под рукой, зависимости прозрачны, а любую аномалию можно диагностировать на месте. Я решил собрать мощный узел на базе CPU и GPU, чтобы систематизировать свой опыт и поделиться найденными решениями.

В моих планах — задачи следующего спектра:

  • Обработка данных: работа с огромными логами, проведение симуляций, построение моделей и выявление аномалий. Здесь критически важны пропускная способность памяти и вычислительная мощность.

  • Компьютерное зрение: потоковая обработка видео в реальном времени, детекция и трекинг объектов. Задержки в сети недопустимы — локальная обработка позволяет минимизировать отклик.

  • Обработка видео: апскейлинг, шумоподавление и транскодирование. Это задачи, идеально подходящие для GPU, позволяющие избавиться от очередей и ограничений сторонних сервисов.

  • Моделирование: тепловые расчеты, физические процессы, симуляция электрических схем. Чем выше вычислительный ресурс, тем быстрее сходятся итеративные модели.

  • Рендеринг и генерация: работа с 3D-графикой и нейросетями для создания контента. Несколько GPU в связке позволяют параллельно обрабатывать тяжелые сцены.

  • Автоматизация и локальные сервисы: хостинг нейросетей, чат-ботов, баз знаний и управляющих серверов для «умного дома». Все внутри одной сети.

  • Экспериментальная среда: возможность запускать любые вычисления без оглядки на стоимость каждого запуска, что позволяет смело менять параметры и пробовать новое.

В качестве основы была выбрана любопытная плата с AliExpress — Jingsha X99 Dual Plus, поддерживающая два процессора и шесть видеокарт. Это решение избавляет от необходимости собирать «гирлянды» из райзеров, умещая всё в один корпус. У платы два сокета 2011-3, 6 слотов PCI-E (4×16, 2×8) и 4 слота DDR4 на каждый процессор.

Jingsha x99 dual plus
Jingsha x99 dual plus

На процессорах останавливаться не буду: связка Xeon суммарно на 48 ядер дает избыточную для моих задач параллельность. Куда интереснее видеокарты, так как именно они определяют предел производительности системы.

Начинал я с NVIDIA P104-100 — это специализированные майнинговые решения на архитектуре Pascal, по сути — лишенные видеовыходов GTX 1070. Обладая 8 ГБ GDDR5 и производительностью около 6.5 TFLOPS FP32, они неплохо справляются с классическими CUDA-задачами. Плюс их в доступности на вторичном рынке.

 P104-100 и ее цена
P104-100 и ее цена

Однако современные нейросетевые задачи быстро упираются в архитектурные ограничения Pascal. Отсутствие специализированных блоков для матричных вычислений заставляет выполнять все операции через универсальные CUDA-ядра, что крайне неэффективно. Также есть проблемы с поддержкой FP16 и INT8, что критично для ускорения нейросетей.

Следующим логичным шагом стала линейка CMP HX на базе архитектуры Ampere. Здесь уже есть тензорные ядра, заточенные под матричные операции, что дает колоссальный прирост скорости и энергоэффективности при работе с FP16 и INT8.

CMP 90HX, топовая карта линейки, оснащена чипом G102-100 (аналог RTX 3080) и 10 ГБ видеопамяти. Разница в производительности по сравнению с P104 при работе с тензорными ядрами — кратная. Учитывая стоимость около 5 тысяч рублей за штуку, это бескомпромиссное решение по соотношению «цена/вычисления».

Карты после покупки обязательно надо обслужить - охладить VRM, память и GPU.
Карты после покупки обязательно надо обслужить — охладить VRM, память и GPU.

В ходе сборки я столкнулся с рядом нюансов:

Оперативная память. Обычные UDIMM модули вызывали зависание на POST-коде 79. Выяснилось, что серверная платформа требовательна к ECC-памяти. После замены модулей на DDR4 ECC UDIMM система заработала стабильно. Итог: для серверных плат лучше сразу использовать ECC — это экономит нервы и время на диагностику.

Шум. Майнинговый БП на 1800 Вт выл на пределе, поэтому я заменил его на более сбалансированное решение, добавив в корпус тихие 120-мм вентиляторы для обдува видеокарт.

Диагностика GPU. Одна из карт проходила все тесты памяти, но при реальной нагрузке зависала без роста температуры. Вывод: если GPU кажется «живым», но падает под вычислительной нагрузкой — скорее всего, деградировали исполнительные блоки, которые не затрагиваются стандартными тестами памяти.

PCIe модификация. Видеокарты работали в режиме x4, хотя поддерживали x16. На плате отсутствовали разделительные конденсаторы на TX-линиях. Допаяв их, я расширил пропускную способность до x8, что существенно ускорило обмен данными.

Пары кондеров, от которых идут дорожки к разъему - разделительные на TX пары pci-e
Пары кондеров, от которых идут дорожки к разъему — разделительные на TX пары pci-e
Поставил 220нФ, до х8
Поставил 220нФ, до х8

Энергопотребление. В простое карты «ели» по 100 Вт, так как постоянно находились в P0-state. Решением стала принудительная фиксация частоты памяти на 405 МГц, что перевело карты в энергосберегающий режим P8. Теперь потребление в простое минимально.

Итоговая стоимость системы — около 69 000 рублей. При текущей оптимизации ежемесячные затраты на электроэнергию в режиме простоя составляют всего 1500 рублей.

Промежуточный шаг сборки
Промежуточный шаг сборки

Система полностью рабочая, я открыт к предложениям и критике. О результатах тестов производительности напишу отдельно.

Пажилой терминатор на страже вычислительного кластера.
Пажилой терминатор на страже вычислительного кластера.
 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов