Бюджетный домашний вычислительный сервер на двух CPU и шести RTX 3080
Я инженер, и у меня есть своего рода профессиональная деформация: мне необходимо, чтобы критически важные системы находились под моим полным контролем. Я предпочитаю локальные решения на «железе», которое можно изучить осциллографом, подвергнуть экстремальной нагрузке и, в случае отказа, оперативно починить с помощью паяльника. Когда годами работаешь с низкоуровневыми схемами, сигналами и системами питания, становится не по себе делегировать вычисления «в никуда», слепо полагаясь на надежность внешних облаков.
Облачные сервисы кажутся привлекательными на начальном этапе: быстро развернул — получил профит. Однако со временем проявляются подводные камни: сервис работает нестабильно, тарифы растут, а у вас нет доступа к глубокой диагностике — вы не видите, что происходит с памятью, где возникают узкие места или как нагружается шина.
Самый яркий пример — концепция «умного дома». Утром вы нажимаете выключатель, но свет загорается с задержкой, потому что команда проходит через облачный сервер. Если интернет «лагает», система становится непредсказуемой: датчики движения не срабатывают, а голосовой помощник докладывает об ошибках сети. Обновление прошивки у производителя может сломать API, и привычные сценарии начинают сбоить. Физически устройства исправны, но логика вынесена за пределы вашего дома, поэтому работоспособность системы зависит не от вас, а от стороннего провайдера.
С API та же история. Вы строите проект с критической зависимостью от внешнего сервиса, а на следующий день он меняет формат ответов или вводит жесткие лимиты. Ваш код остается прежним, но система начинает сыпаться, и отладка превращается в безнадежную попытку угадать, что изменилось на стороне вендора.
Кроме того, у меня (как и у многих) стойкое отторжение вызывает модель подписочных сервисов. Платить за токены? Спасибо, обойдусь.
Локальный вычислительный узел устраняет этот класс проблем. Вся инфраструктура находится под рукой, зависимости прозрачны, а любую аномалию можно диагностировать на месте. Я решил собрать мощный узел на базе CPU и GPU, чтобы систематизировать свой опыт и поделиться найденными решениями.
В моих планах — задачи следующего спектра:
-
Обработка данных: работа с огромными логами, проведение симуляций, построение моделей и выявление аномалий. Здесь критически важны пропускная способность памяти и вычислительная мощность.
-
Компьютерное зрение: потоковая обработка видео в реальном времени, детекция и трекинг объектов. Задержки в сети недопустимы — локальная обработка позволяет минимизировать отклик.
-
Обработка видео: апскейлинг, шумоподавление и транскодирование. Это задачи, идеально подходящие для GPU, позволяющие избавиться от очередей и ограничений сторонних сервисов.
-
Моделирование: тепловые расчеты, физические процессы, симуляция электрических схем. Чем выше вычислительный ресурс, тем быстрее сходятся итеративные модели.
-
Рендеринг и генерация: работа с 3D-графикой и нейросетями для создания контента. Несколько GPU в связке позволяют параллельно обрабатывать тяжелые сцены.
-
Автоматизация и локальные сервисы: хостинг нейросетей, чат-ботов, баз знаний и управляющих серверов для «умного дома». Все внутри одной сети.
-
Экспериментальная среда: возможность запускать любые вычисления без оглядки на стоимость каждого запуска, что позволяет смело менять параметры и пробовать новое.
В качестве основы была выбрана любопытная плата с AliExpress — Jingsha X99 Dual Plus, поддерживающая два процессора и шесть видеокарт. Это решение избавляет от необходимости собирать «гирлянды» из райзеров, умещая всё в один корпус. У платы два сокета 2011-3, 6 слотов PCI-E (4×16, 2×8) и 4 слота DDR4 на каждый процессор.

На процессорах останавливаться не буду: связка Xeon суммарно на 48 ядер дает избыточную для моих задач параллельность. Куда интереснее видеокарты, так как именно они определяют предел производительности системы.
Начинал я с NVIDIA P104-100 — это специализированные майнинговые решения на архитектуре Pascal, по сути — лишенные видеовыходов GTX 1070. Обладая 8 ГБ GDDR5 и производительностью около 6.5 TFLOPS FP32, они неплохо справляются с классическими CUDA-задачами. Плюс их в доступности на вторичном рынке.

Однако современные нейросетевые задачи быстро упираются в архитектурные ограничения Pascal. Отсутствие специализированных блоков для матричных вычислений заставляет выполнять все операции через универсальные CUDA-ядра, что крайне неэффективно. Также есть проблемы с поддержкой FP16 и INT8, что критично для ускорения нейросетей.
Следующим логичным шагом стала линейка CMP HX на базе архитектуры Ampere. Здесь уже есть тензорные ядра, заточенные под матричные операции, что дает колоссальный прирост скорости и энергоэффективности при работе с FP16 и INT8.

CMP 90HX, топовая карта линейки, оснащена чипом G102-100 (аналог RTX 3080) и 10 ГБ видеопамяти. Разница в производительности по сравнению с P104 при работе с тензорными ядрами — кратная. Учитывая стоимость около 5 тысяч рублей за штуку, это бескомпромиссное решение по соотношению «цена/вычисления».

В ходе сборки я столкнулся с рядом нюансов:
Оперативная память. Обычные UDIMM модули вызывали зависание на POST-коде 79. Выяснилось, что серверная платформа требовательна к ECC-памяти. После замены модулей на DDR4 ECC UDIMM система заработала стабильно. Итог: для серверных плат лучше сразу использовать ECC — это экономит нервы и время на диагностику.
Шум. Майнинговый БП на 1800 Вт выл на пределе, поэтому я заменил его на более сбалансированное решение, добавив в корпус тихие 120-мм вентиляторы для обдува видеокарт.

Диагностика GPU. Одна из карт проходила все тесты памяти, но при реальной нагрузке зависала без роста температуры. Вывод: если GPU кажется «живым», но падает под вычислительной нагрузкой — скорее всего, деградировали исполнительные блоки, которые не затрагиваются стандартными тестами памяти.
PCIe модификация. Видеокарты работали в режиме x4, хотя поддерживали x16. На плате отсутствовали разделительные конденсаторы на TX-линиях. Допаяв их, я расширил пропускную способность до x8, что существенно ускорило обмен данными.


Энергопотребление. В простое карты «ели» по 100 Вт, так как постоянно находились в P0-state. Решением стала принудительная фиксация частоты памяти на 405 МГц, что перевело карты в энергосберегающий режим P8. Теперь потребление в простое минимально.
Итоговая стоимость системы — около 69 000 рублей. При текущей оптимизации ежемесячные затраты на электроэнергию в режиме простоя составляют всего 1500 рублей.

Система полностью рабочая, я открыт к предложениям и критике. О результатах тестов производительности напишу отдельно.

Стартовали предзаказы на Xiaomi 18 Pro: топовая камера Lofic и процессор Snapdragon с частотой выше 5 ГГц
ИИ GPT-6 Astra прошел Portal автономно, потратив почти сутки и $571
Windows 11 будет отлично работать и с 8 ГБ оперативной памяти
«Аэрофлот» закупает отечественные аналоги Boeing и Airbus: поставки МС-21 начнутся в 2029 году
Первые МС-21 на замену Boeing и Airbus: «Аэрофлот» озвучил сроки поставки
На Бетельгейзе обнаружили стабильное горячее пятно, превышающее температуру звезды на 800 градусов
Количество жалоб на «обезумевших ИИ-агентов» выросло почти вдвое за месяц
Китай сократил до восьми число возможных мест посадки аппарата «Тяньвэнь-3» для поиска следов жизни на Марсе