Актуальна ли GTX 1080 Ti: тестируем MoE-модели от 35B до 176B для llama-server
Привет, SE7EN! В своей прошлой публикации я делился опытом запуска крупноформатной Qwen3.8-Flash-Next (176B) на старенькой GTX 1080 Ti — тогда это выглядело скорее как дерзкий эксперимент на пределе возможностей железа. Однако не так давно мне попалась на глаза интересная заметка на ast-softpro.ru, где энтузиасты успешно задействовали Qwen 3.8-27B в связке из двух RTX 5060 Ti по 16 ГБ (суммарно 32 ГБ). Авторы наглядно продемонстрировали, что гибридная связка DeltaNet и attention отлично справляется с протяженным контекстом, выдавая на их стенде около 24 токенов/с в квантовании Q4_K_M. Этот кейс, а также оживленные дискуссии в комментариях на SE7ENе вдохновили меня на серию новых тестов. Сразу отмечу: итоговые показатели на моем скромном сетапе (о нем ниже) приятно удивили и ничуть не уступили результатам коллег по цеху.
Мой тестовый стенд
Аппаратная конфигурация осталась неизменной — это всё та же рабочая лошадка из моего предыдущего обзора:
-
GPU: NVIDIA GeForce GTX 1080 Ti с 11 ГБ видеопамяти;
-
CPU: Intel Core i9-9900K;
-
RAM: 64 ГБ;
-
ОС: Ubuntu Linux;
-
Сборка llama.cpp: с нативной поддержкой архитектуры qwen4exp.
Именно эта система использовалась для развертывания llama-server под каждую из испытуемых моделей, демонстрируя, что для серьезных экспериментов вовсе не обязательно обладать ультрасовременным флагманским железом.
Особенности запуска сервера
Для администрирования я задействовал встроенный WebUI, доступный в актуальных релизах llama-server. Решение предельно комфортное: достаточно перейти в браузере по ссылке http://127.0.0.1:8080 (или задать кастомный хост/порт), чтобы получить полноценную графическую оболочку для диалогов, мониторинга и тонкой настройки параметров на лету. Такой подход полностью закрывает мои потребности, избавляя от необходимости городить сторонние интерфейсы-обертки.
Для инициализации сервера я применял следующую команду (с подстановкой конкретного файла модели):
llama-server -m ~/GGUF/<Модель_из_списка> \
--host 127.0.0.1 \
--port 8080 \
--tools all \
-c 131072 \
-b 2048 \
-ub 1024 \
-fa auto \
--jinja \
--parallel 1
Важная ремарка: флаг --tools all активирует полный набор инструментных вызовов (tool calls), что критически важно для автономных агентов. В то же время, при компрометации сервера это дает злоумышленнику потенциальный доступ к управлению вашей ОС (существуют и более строгие параметры ограничения прав). Переключатель --jinja активирует современные шаблоны чата для корректного форматирования диалогов, а --parallel 1 ограничивает число параллельных сессий одной — для моих задач этого более чем достаточно.
Тестируемый модельный ряд
В рамки экспериментального цикла вошло несколько примечательных MoE-моделей:
-
gpt-oss-120b-UD-Q8_K_XL.gguf — 120-миллиардная MoE-разработка от OpenAI, задействующая около 5.1B активных параметров на токен. Высокая точность квантования Q8_K_XL предъявляет серьезные требования к объему памяти.
-
Qwen3.8-Flash-Next-UD-Q3_K_XL-reap256.gguf — 125B MoE-гигант (учитывая эмбеддинги n-gram, соответствующий классу 176B) со сниженной точностью Q3_K_XL и оптимизацией путем обрезки экспертов до 256 (reap256). Облегченный вариант с ~6B активных параметров на токен, адаптированный под слабые ресурсы.
-
Qwen3.8-Flash-Next-UD-Q4_K_XL.gguf — аналогичная 125B MoE-модель, но в более строгом и качественном квантовании Q4_K_XL, требующая больше памяти ради прироста точности.
-
Qwen3.8-35B-A3B-Q4_K_M.gguf — сбалансированная 35B MoE-архитектура (около 3B активных параметров на токен) с квантованием Q4_K_M. Занимает порядка 21 ГБ, позволяя распределить нагрузку между VRAM и системной ОЗУ.
Итоги бенчмарков: кто в лидерах
В качестве практического испытания я выбрал типичную задачу: написание компактного погодного сервера на Go с интеграцией сторонних публичных API для получения актуальных метеоданных.
-
gpt-oss-120b продемонстрировала неплохую стартовую скорость, однако при усложнении кода и расширении контекста начала сбоить: модель увязала в бесконечных циклах правок, порождавших новые баги и попутно уничтожавших уже написанную логику. Для долгосрочных агентных сессий это фатально.
-
Qwen3.8-Flash-Next в обоих вариантах квантования (Q3_K_XL и Q4_K_XL) показала удручающую производительность — генерация едва достигала 11 токенов в секунду, из-за чего написание тестового приложения затянулось почти на 3 часа с учетом пауз на раздумья.
-
Qwen3.8-35B-A3B-Q4_K_M безоговорочно выбилась в фавориты. Она шустро справилась с поставленной задачей, выдав скорость обработки промпта до 400 токенов/с и скорость генерации до 30 токенов/с (зависит от выставленного параметра
--ctx-size). Примечательно, что при масштабировании контекстного окна с 32K до 128K просадка производительности составила всего 10–15%, что является великолепным результатом. На реализацию рабочего кода ушло около 15 минут (в среднем 1.5–2 минуты на итерацию), причем модель строго следовала ТЗ и обошлась без лишних деструктивных правок.
Секрет успеха Qwen3.8-35B-A3B-Q4_K_M
Резюмируя достоинства победителя, можно выделить следующие ключевые плюсы:
-
Производительность: высокая скорость отклика даже на устаревшей GTX 1080 Ti при гибридном размещении в ОЗУ.
-
Качество кодинга: глубокое понимание синтаксиса и логики программирования, безошибочная генерация кода с первой попытки.
-
Вариативность мышления: легко адаптируется под выдачу как лаконичных ответов, так и глубоких аналитических рассуждений.
-
Исполнительность: безукоризненно придерживается заданных системных промптов и инструкций, что критически важно для работы ИИ-агентов.
Однозначно рекомендую эту модель для локального развертывания на сопоставимом железе. Она превосходит более тяжелые MoE-решения, расходуя при этом значительно меньше системных ресурсов. Если вы ищете идеальный баланс между скоростью генерации, качеством логических выводов и аппетитами к памяти — Qwen3.8-35B-A3B-Q4_K_M определенно заслуживает внимания.
Яндекс 360 проведёт Yandex Connect 22 октября в Москве и онлайн
«Сферум» открыл платформу школьных олимпиад
Роботы-пылесосы Xiaomi Robot Vacuum X20 Pro поступили в продажу в России: уборка с искусственным интеллектом
Уникальный остаток сверхновой 1181 года в Млечном Пути запечатлен в виде «жемчужных нитей»
JaCarta Management System 4LX для Linux подтвердила совместимость с Termidesk VDI
В тесте Adversa AI Copilot CLI передал локальные файлы через инструкции на веб-странице
Bank of America: инвесторы перегрели искусственный интеллект и преждевременно разочаровались в потребителях
Samsung выпустила финальную версию One UI 9.0 для серии Galaxy S24