Запуск локальных LLM на Mac mini с помощью OpenClaw: тест производительности

Запуск локальных LLM на Mac mini с помощью OpenClaw: тест производительности

Прокомментировать Просмотры: 2

Локальный запуск нейросетевых моделей традиционно ассоциируется с громоздкими рабочими станциями, оснащенными массивами видеокарт (часто с использованием SLI/NVLink) и мощными блоками питания. Основным узким местом таких систем неизменно остаются объем видеопамяти и ее пропускная способность.

В условиях растущего интереса к локальному инференсу LLM, Mac miniTM стал крайне востребованным решением. Это объясняется архитектурой унифицированной памяти (UMA): почти весь её объем доступен для загрузки весов модели, а пропускная способность значительно превосходит показатели DDR5. Кроме того, современный инструментарий позволяет развернуть окружение для работы с ИИ буквально за считанные минуты.

Учитывая это, Mac miniTM с 24 или 48 ГБ ОЗУ превращается в элегантную альтернативу классическим десктопам. Объединяя локальную LLM среднего размера с платформой OpenClaw, можно создавать гибкие сценарии для работы персональных ИИ-агентов. В данной статье мы протестируем производительность нескольких моделей на этой платформе и выясним, насколько оправданы высокие ожидания от Mac miniTM.

Насколько ресурсоемок OpenClaw

OpenClaw — это не сама модель, а полноценный ИИ-ассистент или «умный» агент, работающий поверх LLM. Система поддерживает интеграцию с популярными платформами, включая Discord, Google Chat, iMessage® и Matrix. В официальной документации OpenClaw позиционируется как self-hosted шлюз для автоматизации и интеграции LLM-агентов с мессенджерами.

Для минимальной конфигурации (персональный бот на Raspberry Pi® или бюджетном облачном VPS) требования скромны: одно ядро CPU, 512 МБ ОЗУ и 1 ГБ дискового пространства.

Однако для задач промышленного уровня (production-grade) или сложных мультиагентных систем требования возрастают: 2-4 и более ядер CPU, 8-16 ГБ ОЗУ и стабильный канал связи. Важно помнить, что эти спецификации не включают в себя вычислительные затраты на саму LLM.

Наш тестовый стенд на базе Mac miniTM с чипом M4 Pro, 48 ГБ ОЗУ и накопителем 2 ТБ легко справляется с самыми требовательными сценариями OpenClaw. Благодаря архитектуре UMA, где память общая для CPU и GPU, выбор модели становится компромиссом: чем объемнее модель, тем меньше ресурсов остается под нужды операционной системы и агента.

Развертывание OpenClaw и настройка локального инференса

Для экспериментов нам потребуется локальная LLM с поддержкой OpenAI-совместимого API. Оптимальный выбор — LM Studio, которая предоставляет удобный графический интерфейс для поиска, скачивания и запуска моделей с возможностью создания локальных эндпоинтов.

Конечно, существуют и другие инструменты вроде llama.cpp, Ollama или vLLM, однако LM Studio выигрывает за счет простоты (GUI + готовый каталог), что экономит время на конфигурации. Утилита доступна как в варианте с GUI для десктопа, так и в headless-режиме для удаленного деплоя, например, на выделенном сервере.

Процесс прост: после загрузки модели в разделе Model Search нужно перейти во вкладку Developer и запустить локальный сервер. LM Studio корректно определяет возможности Mac miniTM, предлагая оптимальные веса моделей исходя из объема доступной памяти.

Предложение моделей в LM Studio на момент написания статьи.
Предложение моделей в LM Studio на момент написания статьи.

Убедившись в работоспособности API-эндпоинта, переходим к установке самого OpenClaw.

Важно: команда установки, использующая прямое выполнение скриптов через `curl | sh` с правами root, несет риски безопасности. В рабочих средах всегда предпочтительнее ручная установка из проверенных репозиториев.

curl -fsSL https://openclaw.ai/install.sh

Скрипт развернет все зависимости, после чего можно запустить мастер настройки. Финальный этап — проверка состояния системы через дашборд (Check system health).

Агент ответил, информацию о себе рассказал.
Агент ответил, информацию о себе рассказал.

Система готова к тестированию.

Тестирование OpenClaw с бэкендом LM Studio

Для тестов мы отобрали три модели: google/gemma-4-26b-a4b-qat, qwen/qwen3.6-35b-a3b и google/gemma-4-31b. Некоторые модели отсеялись из-за чрезмерного времени отклика или сбоев в работе.

Пинг агента

Замерим время отклика (ping) с «чистой» системой и контекстом 64k.

Модель

Квантизация

Формат

Время, с

google/gemma-4-26b-a4b-qat

4bit

MLX

4

qwen/qwen3.6-35b-a3b

Q4_K_M

GGUF

3

google/gemma-4-31b

Q4_K_M

GGUF

12

Каталог готовых ИИ-моделей

Сервис для запуска и управления LLM в облаке Selectel. Выберите подходящую модель, конфигурацию и получите готовый API-эндпоинт.

Узнать больше →

Информационный запрос

Запросим у моделей новости о компании Selectel за последний квартал.

qwen/qwen3.6-35b-a3b

Результаты: модель предоставила структурированный обзор, хотя допустила неточность в датах сделок. Генерация заняла 60 секунд.

google/gemma-4-26b-a4b-qat

Результаты: точно, по существу, без фактических ошибок. Генерация заняла 60 секунд.

google/gemma-4-31b

Результаты: кратко, но время генерации составило 300 секунд, что делает модель менее пригодной для интерактивного диалога.

Синтетические бенчмарки

Для оценки производительности используем утилиту Anubis, специализированную для Apple Silicon. Усредненные показатели по 20 запускам:

Модель

Токенов в секунду

Джоулей на токен

TTFT, мс

Задержка (мс)

google/gemma-4-26b-a4b-qat

59

0,38

237

17

qwen/qwen3.6-35b-a3b

50

0,45

96

20

google/gemma-4-31b

10

2,73

1 217

97

Ключевые выводы:

  • Архитектуры MoE (Mixture of Experts) демонстрируют значительно лучшую пропускную способность и энергоэффективность по сравнению с плотными моделями.
  • Нагрузка ложится преимущественно на графический блок процессора, загружая его до 99%, что подтверждает эффективность использования аппаратного ускорения Apple Silicon.
  • Модель gemma-4-26b-a4b-qat показывает отличный баланс между детализацией ответов и скоростью работы.

Заключение

Тестирование показало, что Mac miniTM — вполне зрелая платформа для локального инференса. Связка с OpenClaw позволяет построить полноценный частный ИИ-ассистент, полностью независимый от облачных API-провайдеров. Приобрести или арендовать Mac miniTM можно в разделе выделенных серверов Selectel.

Для задач, требующих работы с особо крупными моделями, мы рекомендуем обратить внимание на серверы с профессиональными GPU, включая NVIDIA® H300.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов