Скорость генерации токенов на новых Mac mini с M6 и M5 Pro: ранний прогноз до релиза железа

Прокомментировать Просмотры: 7

Дисклеймер. Я управляюсь с сервисом аренды компьютеров Mac, располагаю парком одинаковых Mac mini и регулярно их тестирую. Свежие устройства на базе M6 и M5 Pro попадут к нам сразу после старта продаж, после чего выйдет вторая часть с реальными бенчмарками. Единственная ссылка в тексте ведет на открытый датасет.

Зачем делать прогнозы, если можно дождаться тестов

Уже через несколько дней магазины начнут рассылать новые Mac mini (M6/M5 Pro) и Mac Studio (M5 Max/M5 Ultra). Первое время все станут задавать один и тот же вопрос о производительности железа в локальных нейросетях, однако точных ответов пока ни у кого нет, поскольку компьютеры еще не добрались до пользователей.

Тем не менее, кое-какие расчеты можно выполнить заранее. В предыдущем материале я протестировал шесть конфигураций на базовом чипе M4 и вывел простую закономерность, которая отлично подтвердилась на практике. Теперь я применю ее к новейшим процессорам и опубликую расчетные цифры до появления реальных тестов. Позже я проверю их на практике и покажу, где именно ошибся.

Подобным мало кто занимается из-за страха ошибиться публично. По моему мнению, все обстоит иначе. Прогноз без последующей верификации — это пустое гадание, а проверка без предварительных расчетов — всего лишь сухая таблица. Только в комплексе они позволяют оценить надежность методики, которой все пользуются для оценки производительности.

Базовые принципы расчетов

Скорость генерации токенов на чипах Apple Silicon ограничена пропускной способностью памяти (ПСП), а вовсе не вычислительной мощностью. При создании каждого нового токена модель заново считывает все свои параметры, поэтому именно скорость извлечения данных из памяти задает верхний предел производительности.

Отсюда вытекает формула оценки: делим пропускную способность памяти на объем весов модели и получаем теоретический предел токенов в секунду. Затем вводим поправочный коэффициент на сопутствующие издержки, поскольку выйти на абсолютный пик ПСП на практике невозможно.

Этот коэффициент я взял не «из головы», а на основе личных тестов чипа M4. Вот результаты для четырех моделей с квантованием Q4_K_M через Ollama 0.31.2 (три запуска на каждую модель, разброс не превышал 0.1%).

Модель

Вес, ГБ

Теория при 120 ГБ/с

Факт на M4

КПД

Llama 3.2 3B

2.0

60

46.7

0.78

Mistral 7B

4.4

27

22.8

0.84

Llama 3.1 8B

4.9

24

21.2

0.87

Qwen 2.5 14B

8.5

14

11.7

0.83

Средний КПД составил 0.83 при разбросе от 0.78 до 0.87. Примечательно, что у самой компактной модели эффективность оказалась ниже, и к этому мы еще вернемся.

Проверка на точность: если применить расчетное правило с коэффициентом 0.83 к Qwen 2.5 14B, мы получим 11.9 токена/сек. Реальный тест показал 11.7. Погрешность менее двух процентов — отличный результат для инженерных прикидок.

Характеристики новых процессоров

Согласно презентации Apple от 25 августа, пропускная способность памяти у чипов M6 варьируется в зависимости от общего объема ОЗУ — этот нюанс важно учитывать при покупке.

Чип

Память

Полоса памяти

M4, наш эталон

16 ГБ

120 ГБ/с

M6

16 ГБ

153 ГБ/с

M6

24 и 32 ГБ

170 ГБ/с

M5 Pro

до 64 ГБ

307 ГБ/с

M5 Max

36 ГБ

460 ГБ/с

M5 Max

48, 64 и 128 ГБ

614 ГБ/с

M5 Ultra

до 512 ГБ

1.2 ТБ/с

Обратите внимание на младшие модификации. У 16-гигабайтной версии M6 скорость ПСП составляет 153 ГБ/с вместо 170 ГБ/с из-за задействования не всех каналов памяти. У M5 Max на 36 ГБ с 32 графическими ядрами полоса равна 460 ГБ/с, тогда как старшая вариация с 40 ядрами и объемом от 48 ГБ выдает 614 ГБ/с. Разница составляет 11% и 25% соответственно, что напрямую отразится на скорости генерации. В дальнейших прогнозах для M5 Max задействованы показатели топовой модификации.

Прогнозируемые показатели

Расчеты базируются на КПД 0.83. Модель считается подходящей, если ее объем оставляет 20-процентный запас под системные нужды и кэш контекста.

Модель

Вес, ГБ

M4 16

M6 16

M6 32

M5 Pro 64

M5 Max 128

M5 Ultra 512

Llama 3.2 3B

2.0

46.7 замер

64

71

127

255

498

Llama 3.1 8B

4.9

21.2 замер

26

29

52

104

203

Qwen 2.5 14B

8.5

11.7 замер

15

17

30

60

117

Qwen 2.5 32B

19

нет

нет

7.4

13

27

52

Llama 3.3 70B

40

нет

нет

нет

6.4

13

25

Qwen 2.5 72B

41

нет

нет

нет

6.2

12

24

DeepSeek V3 671B

380

нет

нет

нет

нет

нет

2.6

Все значения отражают количество токенов в секунду в режиме генерации (формат Q4_K_M, среда Ollama). Отметка «нет» означает нехватку оперативной памяти.

Основные выводы

Чип M6 не принесет революции для локального запуска ИИ. Прирост скорости относительно M4 составит от 25% до 40% в зависимости от объема памяти. Комфортным пределом по-прежнему остаются 8-миллиардные модели. Вариант 14B на 16 ГБ останется слишком медленным. При покупке M6 ради нейросетей имеет смысл смотреть исключительно на модификации с 32 ГБ, хотя и в этом случае выигрыш окажется скромным.

M5 Pro открывает линейку mini для работы с 32B. Скорость в 13 токенов/сек для Qwen 2.5 32B уже вполне пригодна для продуктивной работы, а модели на 8B демонстрируют впечатляющие 52 токена/сек. Кроме того, объем в 64 ГБ впервые позволяет запускать 70-миллиардные модели (пусть и на скорости 6 токенов/сек, чего хватает лишь для фоновых задач, но не для интерактивного диалога).

M5 Max переводит производительность в совершенно другую весовую категорию. Скорость 70B на уровне 13 токенов/сек обеспечивает полный комфорт, а 8B выдают более ста токенов, что превосходит любые человеческие потребности. Для агентских сценариев с одновременными запросами по API ширина шины памяти критически важна.

M5 Ultra создан ради одной узкой задачи. Запуска моделей емкостью от 200B параметров и выше. Скорость DeepSeek V3 в 2.6 токена/сек невелика, однако это единственное устройство в потребительской линейке, способное вместить подобную систему целиком.

Где мои расчеты могут не оправдаться

Сразу обозначу уязвимые места собственной таблицы.

Маленькие веса на высокопроизводительных чипах. Показателя в 498 токенов/сек для модели 3B на чипе Ultra мы не увидим. Для компактных моделей бутылочным горлышком становится не пропускная способность памяти, а вычислительные ресурсы процессора и накладные расходы самого софта. Низкий КПД (0.78) модели 3B на M4 уже на это намекает. Скорее всего, реальный потолок 3B на Max и Ultra окажется существенно ниже прогноза. Это станет первой гипотезой, которую я проверю.

Крупные нейросети на Ultra. Формула предполагает единую шину, но архитектура Ultra состоит из двух кристаллов, объединенных межчиповым интерфейсом. Как именно модель на 400 ГБ распределится между ними и во что упрется производительность, из официальных спецификаций понять невозможно.

Скорость обработки контекста (промптов). Прогнозировалась исключительно генерация текста. Обработка входных данных не так сильно зависит от ПСП памяти, и в прошлых тестах показатели моделей одинакового размера могли отличаться вдвое. На новом железе этот параметр может продемонстрировать скачок.

Версия движка Ollama. Тесты на M4 проводились на версии 0.31.2. К моменту выхода второй части появится более свежий софт, поэтому часть прироста скорости будет обусловлена оптимизациями программного обеспечения. Постараюсь протестировать обе версии.

Планы на будущее

Как только новые компьютеры поступят в наше распоряжение, я повторю тесты по той же методике и выпущу вторую статью. В ней появится итоговая таблица «прогноз против факта» с подробным разбором расхождений.

Если кто-то обзаведется новыми устройствами раньше и выделит немного времени, методика находится в открытом доступе. Все скрипты, параметры и промпты опубликованы на странице с данными — запускайте тесты и делитесь результатами в комментариях, я сведу их в общую таблицу до выхода продолжения.

Ознакомиться с методикой и датасетом можно по ссылке https://macyou.co/ru/benchmarks

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов