Скорость генерации токенов на новых Mac mini с M6 и M5 Pro: ранний прогноз до релиза железа
Дисклеймер. Я управляюсь с сервисом аренды компьютеров Mac, располагаю парком одинаковых Mac mini и регулярно их тестирую. Свежие устройства на базе M6 и M5 Pro попадут к нам сразу после старта продаж, после чего выйдет вторая часть с реальными бенчмарками. Единственная ссылка в тексте ведет на открытый датасет.
Зачем делать прогнозы, если можно дождаться тестов
Уже через несколько дней магазины начнут рассылать новые Mac mini (M6/M5 Pro) и Mac Studio (M5 Max/M5 Ultra). Первое время все станут задавать один и тот же вопрос о производительности железа в локальных нейросетях, однако точных ответов пока ни у кого нет, поскольку компьютеры еще не добрались до пользователей.
Тем не менее, кое-какие расчеты можно выполнить заранее. В предыдущем материале я протестировал шесть конфигураций на базовом чипе M4 и вывел простую закономерность, которая отлично подтвердилась на практике. Теперь я применю ее к новейшим процессорам и опубликую расчетные цифры до появления реальных тестов. Позже я проверю их на практике и покажу, где именно ошибся.
Подобным мало кто занимается из-за страха ошибиться публично. По моему мнению, все обстоит иначе. Прогноз без последующей верификации — это пустое гадание, а проверка без предварительных расчетов — всего лишь сухая таблица. Только в комплексе они позволяют оценить надежность методики, которой все пользуются для оценки производительности.
Базовые принципы расчетов
Скорость генерации токенов на чипах Apple Silicon ограничена пропускной способностью памяти (ПСП), а вовсе не вычислительной мощностью. При создании каждого нового токена модель заново считывает все свои параметры, поэтому именно скорость извлечения данных из памяти задает верхний предел производительности.
Отсюда вытекает формула оценки: делим пропускную способность памяти на объем весов модели и получаем теоретический предел токенов в секунду. Затем вводим поправочный коэффициент на сопутствующие издержки, поскольку выйти на абсолютный пик ПСП на практике невозможно.
Этот коэффициент я взял не «из головы», а на основе личных тестов чипа M4. Вот результаты для четырех моделей с квантованием Q4_K_M через Ollama 0.31.2 (три запуска на каждую модель, разброс не превышал 0.1%).
|
Модель |
Вес, ГБ |
Теория при 120 ГБ/с |
Факт на M4 |
КПД |
|---|---|---|---|---|
|
Llama 3.2 3B |
2.0 |
60 |
46.7 |
0.78 |
|
Mistral 7B |
4.4 |
27 |
22.8 |
0.84 |
|
Llama 3.1 8B |
4.9 |
24 |
21.2 |
0.87 |
|
Qwen 2.5 14B |
8.5 |
14 |
11.7 |
0.83 |
Средний КПД составил 0.83 при разбросе от 0.78 до 0.87. Примечательно, что у самой компактной модели эффективность оказалась ниже, и к этому мы еще вернемся.
Проверка на точность: если применить расчетное правило с коэффициентом 0.83 к Qwen 2.5 14B, мы получим 11.9 токена/сек. Реальный тест показал 11.7. Погрешность менее двух процентов — отличный результат для инженерных прикидок.
Характеристики новых процессоров
Согласно презентации Apple от 25 августа, пропускная способность памяти у чипов M6 варьируется в зависимости от общего объема ОЗУ — этот нюанс важно учитывать при покупке.
|
Чип |
Память |
Полоса памяти |
|---|---|---|
|
M4, наш эталон |
16 ГБ |
120 ГБ/с |
|
M6 |
16 ГБ |
153 ГБ/с |
|
M6 |
24 и 32 ГБ |
170 ГБ/с |
|
M5 Pro |
до 64 ГБ |
307 ГБ/с |
|
M5 Max |
36 ГБ |
460 ГБ/с |
|
M5 Max |
48, 64 и 128 ГБ |
614 ГБ/с |
|
M5 Ultra |
до 512 ГБ |
1.2 ТБ/с |
Обратите внимание на младшие модификации. У 16-гигабайтной версии M6 скорость ПСП составляет 153 ГБ/с вместо 170 ГБ/с из-за задействования не всех каналов памяти. У M5 Max на 36 ГБ с 32 графическими ядрами полоса равна 460 ГБ/с, тогда как старшая вариация с 40 ядрами и объемом от 48 ГБ выдает 614 ГБ/с. Разница составляет 11% и 25% соответственно, что напрямую отразится на скорости генерации. В дальнейших прогнозах для M5 Max задействованы показатели топовой модификации.
Прогнозируемые показатели
Расчеты базируются на КПД 0.83. Модель считается подходящей, если ее объем оставляет 20-процентный запас под системные нужды и кэш контекста.
|
Модель |
Вес, ГБ |
M4 16 |
M6 16 |
M6 32 |
M5 Pro 64 |
M5 Max 128 |
M5 Ultra 512 |
|---|---|---|---|---|---|---|---|
|
Llama 3.2 3B |
2.0 |
46.7 замер |
64 |
71 |
127 |
255 |
498 |
|
Llama 3.1 8B |
4.9 |
21.2 замер |
26 |
29 |
52 |
104 |
203 |
|
Qwen 2.5 14B |
8.5 |
11.7 замер |
15 |
17 |
30 |
60 |
117 |
|
Qwen 2.5 32B |
19 |
нет |
нет |
7.4 |
13 |
27 |
52 |
|
Llama 3.3 70B |
40 |
нет |
нет |
нет |
6.4 |
13 |
25 |
|
Qwen 2.5 72B |
41 |
нет |
нет |
нет |
6.2 |
12 |
24 |
|
DeepSeek V3 671B |
380 |
нет |
нет |
нет |
нет |
нет |
2.6 |
Все значения отражают количество токенов в секунду в режиме генерации (формат Q4_K_M, среда Ollama). Отметка «нет» означает нехватку оперативной памяти.
Основные выводы
Чип M6 не принесет революции для локального запуска ИИ. Прирост скорости относительно M4 составит от 25% до 40% в зависимости от объема памяти. Комфортным пределом по-прежнему остаются 8-миллиардные модели. Вариант 14B на 16 ГБ останется слишком медленным. При покупке M6 ради нейросетей имеет смысл смотреть исключительно на модификации с 32 ГБ, хотя и в этом случае выигрыш окажется скромным.
M5 Pro открывает линейку mini для работы с 32B. Скорость в 13 токенов/сек для Qwen 2.5 32B уже вполне пригодна для продуктивной работы, а модели на 8B демонстрируют впечатляющие 52 токена/сек. Кроме того, объем в 64 ГБ впервые позволяет запускать 70-миллиардные модели (пусть и на скорости 6 токенов/сек, чего хватает лишь для фоновых задач, но не для интерактивного диалога).
M5 Max переводит производительность в совершенно другую весовую категорию. Скорость 70B на уровне 13 токенов/сек обеспечивает полный комфорт, а 8B выдают более ста токенов, что превосходит любые человеческие потребности. Для агентских сценариев с одновременными запросами по API ширина шины памяти критически важна.
M5 Ultra создан ради одной узкой задачи. Запуска моделей емкостью от 200B параметров и выше. Скорость DeepSeek V3 в 2.6 токена/сек невелика, однако это единственное устройство в потребительской линейке, способное вместить подобную систему целиком.
Где мои расчеты могут не оправдаться
Сразу обозначу уязвимые места собственной таблицы.
Маленькие веса на высокопроизводительных чипах. Показателя в 498 токенов/сек для модели 3B на чипе Ultra мы не увидим. Для компактных моделей бутылочным горлышком становится не пропускная способность памяти, а вычислительные ресурсы процессора и накладные расходы самого софта. Низкий КПД (0.78) модели 3B на M4 уже на это намекает. Скорее всего, реальный потолок 3B на Max и Ultra окажется существенно ниже прогноза. Это станет первой гипотезой, которую я проверю.
Крупные нейросети на Ultra. Формула предполагает единую шину, но архитектура Ultra состоит из двух кристаллов, объединенных межчиповым интерфейсом. Как именно модель на 400 ГБ распределится между ними и во что упрется производительность, из официальных спецификаций понять невозможно.
Скорость обработки контекста (промптов). Прогнозировалась исключительно генерация текста. Обработка входных данных не так сильно зависит от ПСП памяти, и в прошлых тестах показатели моделей одинакового размера могли отличаться вдвое. На новом железе этот параметр может продемонстрировать скачок.
Версия движка Ollama. Тесты на M4 проводились на версии 0.31.2. К моменту выхода второй части появится более свежий софт, поэтому часть прироста скорости будет обусловлена оптимизациями программного обеспечения. Постараюсь протестировать обе версии.
Планы на будущее
Как только новые компьютеры поступят в наше распоряжение, я повторю тесты по той же методике и выпущу вторую статью. В ней появится итоговая таблица «прогноз против факта» с подробным разбором расхождений.
Если кто-то обзаведется новыми устройствами раньше и выделит немного времени, методика находится в открытом доступе. Все скрипты, параметры и промпты опубликованы на странице с данными — запускайте тесты и делитесь результатами в комментариях, я сведу их в общую таблицу до выхода продолжения.
Ознакомиться с методикой и датасетом можно по ссылке https://macyou.co/ru/benchmarks
SoftBank привлек заем на $11,87 млрд для инвестирования в OpenAI
В Китае поступил в продажу двухместный летающий «НЛО»-амфибия за $120 000
Игроки смогут сами на лету создавать ремастеры старых игр с помощью нейросетей: представлен проект Uncanny
Создатели системы посадки Falcon 9 из SpaceX удостоены первой в истории премии Нила Армстронга
Аудитория ColorOS превысила 770 млн человек: скоро выйдет обновление ColorOS 17 для Oppo, OnePlus и Realme
Новый фильм Resident Evil стал триумфом и одной из лучших игровых адаптаций в истории с 97% на Rotten Tomatoes
ChatGPT попрощается с GPT-5.5 уже 14 октября
Опубликовано первое сравнение камер iPhone 18 Pro Max и Samsung Galaxy S26 Ultra