От 12 до 38 токенов в секунду: как и почему ускорился M3 Ultra
Всё стартовало с тривиальной, казалось бы, задумки. Стояла цель развернуть локальную версию Qwen3.8–27B без потери точности — строго в формате BF16. Речь шла не о запуске стандартного чекпоинта PyTorch через прослойки совместимости, а об использовании mlx-community/Qwen3.8-27B-bf16 — сборки, изначально оптимизированной под экосистему Apple Silicon на базе фреймворка MLX. Вся коллекция Qwen3.8 от mlx‑community создавалась специально для архитектуры чипов Apple. Иными словами, нейросеть уже имела нативную адаптацию под Mac. Я сознательно отказался...








