Запуск локальных LLM на Mac mini с помощью OpenClaw: тест производительности

Локальный запуск нейросетевых моделей традиционно ассоциируется с громоздкими рабочими станциями, оснащенными массивами видеокарт (часто с использованием SLI/NVLink) и мощными блоками питания. Основным узким местом таких систем неизменно остаются объем видеопамяти и ее пропускная способность.
В условиях растущего интереса к локальному инференсу LLM, Mac miniTM стал крайне востребованным решением. Это объясняется архитектурой унифицированной памяти (UMA): почти весь её объем доступен для загрузки весов модели, а пропускная способность значительно превосходит показатели DDR5. Кроме того, современный инструментарий позволяет развернуть окружение для работы с ИИ буквально за считанные минуты.
Учитывая это, Mac miniTM с 24 или 48 ГБ ОЗУ превращается в элегантную альтернативу классическим десктопам. Объединяя локальную LLM среднего размера с платформой OpenClaw, можно создавать гибкие сценарии для работы персональных ИИ-агентов. В данной статье мы протестируем производительность нескольких моделей на этой платформе и выясним, насколько оправданы высокие ожидания от Mac miniTM.
Насколько ресурсоемок OpenClaw
OpenClaw — это не сама модель, а полноценный ИИ-ассистент или «умный» агент, работающий поверх LLM. Система поддерживает интеграцию с популярными платформами, включая Discord, Google Chat, iMessage® и Matrix. В официальной документации OpenClaw позиционируется как self-hosted шлюз для автоматизации и интеграции LLM-агентов с мессенджерами.
Для минимальной конфигурации (персональный бот на Raspberry Pi® или бюджетном облачном VPS) требования скромны: одно ядро CPU, 512 МБ ОЗУ и 1 ГБ дискового пространства.
Однако для задач промышленного уровня (production-grade) или сложных мультиагентных систем требования возрастают: 2-4 и более ядер CPU, 8-16 ГБ ОЗУ и стабильный канал связи. Важно помнить, что эти спецификации не включают в себя вычислительные затраты на саму LLM.
Наш тестовый стенд на базе Mac miniTM с чипом M4 Pro, 48 ГБ ОЗУ и накопителем 2 ТБ легко справляется с самыми требовательными сценариями OpenClaw. Благодаря архитектуре UMA, где память общая для CPU и GPU, выбор модели становится компромиссом: чем объемнее модель, тем меньше ресурсов остается под нужды операционной системы и агента.
Развертывание OpenClaw и настройка локального инференса
Для экспериментов нам потребуется локальная LLM с поддержкой OpenAI-совместимого API. Оптимальный выбор — LM Studio, которая предоставляет удобный графический интерфейс для поиска, скачивания и запуска моделей с возможностью создания локальных эндпоинтов.
Конечно, существуют и другие инструменты вроде llama.cpp, Ollama или vLLM, однако LM Studio выигрывает за счет простоты (GUI + готовый каталог), что экономит время на конфигурации. Утилита доступна как в варианте с GUI для десктопа, так и в headless-режиме для удаленного деплоя, например, на выделенном сервере.
Процесс прост: после загрузки модели в разделе Model Search нужно перейти во вкладку Developer и запустить локальный сервер. LM Studio корректно определяет возможности Mac miniTM, предлагая оптимальные веса моделей исходя из объема доступной памяти.

Убедившись в работоспособности API-эндпоинта, переходим к установке самого OpenClaw.
Важно: команда установки, использующая прямое выполнение скриптов через `curl | sh` с правами root, несет риски безопасности. В рабочих средах всегда предпочтительнее ручная установка из проверенных репозиториев.
curl -fsSL https://openclaw.ai/install.sh
Скрипт развернет все зависимости, после чего можно запустить мастер настройки. Финальный этап — проверка состояния системы через дашборд (Check system health).

Система готова к тестированию.
Тестирование OpenClaw с бэкендом LM Studio
Для тестов мы отобрали три модели: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b и google/gemma-4-31b. Некоторые модели отсеялись из-за чрезмерного времени отклика или сбоев в работе.
Пинг агента
Замерим время отклика (ping) с «чистой» системой и контекстом 64k.
|
Модель |
Квантизация |
Формат |
Время, с |
|
google/gemma-4-26b-a4b-qat |
4bit |
MLX |
4 |
|
qwen/qwen3.6-35b-a3b |
Q4_K_M |
GGUF |
3 |
|
google/gemma-4-31b |
Q4_K_M |
GGUF |
12 |

Каталог готовых ИИ-моделей
Сервис для запуска и управления LLM в облаке Selectel. Выберите подходящую модель, конфигурацию и получите готовый API-эндпоинт.
Информационный запрос
Запросим у моделей новости о компании Selectel за последний квартал.
qwen/qwen3.6-35b-a3b
Результаты: модель предоставила структурированный обзор, хотя допустила неточность в датах сделок. Генерация заняла 60 секунд.
google/gemma-4-26b-a4b-qat
Результаты: точно, по существу, без фактических ошибок. Генерация заняла 60 секунд.
google/gemma-4-31b
Результаты: кратко, но время генерации составило 300 секунд, что делает модель менее пригодной для интерактивного диалога.
Синтетические бенчмарки
Для оценки производительности используем утилиту Anubis, специализированную для Apple Silicon. Усредненные показатели по 20 запускам:
|
Модель |
Токенов в секунду |
Джоулей на токен |
TTFT, мс |
Задержка (мс) |
|
google/gemma-4-26b-a4b-qat |
59 |
0,38 |
237 |
17 |
|
qwen/qwen3.6-35b-a3b |
50 |
0,45 |
96 |
20 |
|
google/gemma-4-31b |
10 |
2,73 |
1 217 |
97 |
Ключевые выводы:
- Архитектуры MoE (Mixture of Experts) демонстрируют значительно лучшую пропускную способность и энергоэффективность по сравнению с плотными моделями.
- Нагрузка ложится преимущественно на графический блок процессора, загружая его до 99%, что подтверждает эффективность использования аппаратного ускорения Apple Silicon.
- Модель gemma-4-26b-a4b-qat показывает отличный баланс между детализацией ответов и скоростью работы.
Заключение
Тестирование показало, что Mac miniTM — вполне зрелая платформа для локального инференса. Связка с OpenClaw позволяет построить полноценный частный ИИ-ассистент, полностью независимый от облачных API-провайдеров. Приобрести или арендовать Mac miniTM можно в разделе выделенных серверов Selectel.
Для задач, требующих работы с особо крупными моделями, мы рекомендуем обратить внимание на серверы с профессиональными GPU, включая NVIDIA® H300.
Автономная камера Xiaomi с 3K-сенсором, солнечной панелью и аккумулятором 9900 мА•ч вышла в продажу
Закат эпохи x86: как Apple совершила революцию в мире вычислений
Новый облик SberPay и карт: в «СберБанк Онлайн» появился маркетплейс с дизайнерскими коллекциями
Мобильный трафик в России падает: в ряде регионов показатели снизились на 40% к 2026 году
Топ самых популярных смартфонов на AliExpress в России за первое полугодие 2026 года
Apple обновит Mac mini в 2026 году: мощные чипы M5 Pro и M6 и отказ от накопителей на 256 ГБ
Маск: Tesla AI6 станет самым мощным чипом в мире, и я первым поздравлю того, кто сделает лучше
Показан гигантский завод Gigabay, где планируют собирать по тысяче Starship в год