Актуальна ли GTX 1080 Ti: тестируем MoE-модели от 35B до 176B для llama-server

Прокомментировать Просмотры: 1

Привет, SE7EN! В своей прошлой публикации я делился опытом запуска крупноформатной Qwen3.8-Flash-Next (176B) на старенькой GTX 1080 Ti — тогда это выглядело скорее как дерзкий эксперимент на пределе возможностей железа. Однако не так давно мне попалась на глаза интересная заметка на ast-softpro.ru, где энтузиасты успешно задействовали Qwen 3.8-27B в связке из двух RTX 5060 Ti по 16 ГБ (суммарно 32 ГБ). Авторы наглядно продемонстрировали, что гибридная связка DeltaNet и attention отлично справляется с протяженным контекстом, выдавая на их стенде около 24 токенов/с в квантовании Q4_K_M. Этот кейс, а также оживленные дискуссии в комментариях на SE7ENе вдохновили меня на серию новых тестов. Сразу отмечу: итоговые показатели на моем скромном сетапе (о нем ниже) приятно удивили и ничуть не уступили результатам коллег по цеху.

Мой тестовый стенд

Аппаратная конфигурация осталась неизменной — это всё та же рабочая лошадка из моего предыдущего обзора:

  • GPU: NVIDIA GeForce GTX 1080 Ti с 11 ГБ видеопамяти;

  • CPU: Intel Core i9-9900K;

  • RAM: 64 ГБ;

  • ОС: Ubuntu Linux;

  • Сборка llama.cpp: с нативной поддержкой архитектуры qwen4exp.

Именно эта система использовалась для развертывания llama-server под каждую из испытуемых моделей, демонстрируя, что для серьезных экспериментов вовсе не обязательно обладать ультрасовременным флагманским железом.

Особенности запуска сервера

Для администрирования я задействовал встроенный WebUI, доступный в актуальных релизах llama-server. Решение предельно комфортное: достаточно перейти в браузере по ссылке http://127.0.0.1:8080 (или задать кастомный хост/порт), чтобы получить полноценную графическую оболочку для диалогов, мониторинга и тонкой настройки параметров на лету. Такой подход полностью закрывает мои потребности, избавляя от необходимости городить сторонние интерфейсы-обертки.

Для инициализации сервера я применял следующую команду (с подстановкой конкретного файла модели):

llama-server -m ~/GGUF/<Модель_из_списка> \
  --host 127.0.0.1 \
  --port 8080 \
  --tools all \
  -c 131072 \
  -b 2048 \
  -ub 1024 \
  -fa auto \
  --jinja \
  --parallel 1

Важная ремарка: флаг --tools all активирует полный набор инструментных вызовов (tool calls), что критически важно для автономных агентов. В то же время, при компрометации сервера это дает злоумышленнику потенциальный доступ к управлению вашей ОС (существуют и более строгие параметры ограничения прав). Переключатель --jinja активирует современные шаблоны чата для корректного форматирования диалогов, а --parallel 1 ограничивает число параллельных сессий одной — для моих задач этого более чем достаточно.

Тестируемый модельный ряд

В рамки экспериментального цикла вошло несколько примечательных MoE-моделей:

  • gpt-oss-120b-UD-Q8_K_XL.gguf — 120-миллиардная MoE-разработка от OpenAI, задействующая около 5.1B активных параметров на токен. Высокая точность квантования Q8_K_XL предъявляет серьезные требования к объему памяти.

  • Qwen3.8-Flash-Next-UD-Q3_K_XL-reap256.gguf — 125B MoE-гигант (учитывая эмбеддинги n-gram, соответствующий классу 176B) со сниженной точностью Q3_K_XL и оптимизацией путем обрезки экспертов до 256 (reap256). Облегченный вариант с ~6B активных параметров на токен, адаптированный под слабые ресурсы.

  • Qwen3.8-Flash-Next-UD-Q4_K_XL.gguf — аналогичная 125B MoE-модель, но в более строгом и качественном квантовании Q4_K_XL, требующая больше памяти ради прироста точности.

  • Qwen3.8-35B-A3B-Q4_K_M.gguf — сбалансированная 35B MoE-архитектура (около 3B активных параметров на токен) с квантованием Q4_K_M. Занимает порядка 21 ГБ, позволяя распределить нагрузку между VRAM и системной ОЗУ.

Итоги бенчмарков: кто в лидерах

В качестве практического испытания я выбрал типичную задачу: написание компактного погодного сервера на Go с интеграцией сторонних публичных API для получения актуальных метеоданных.

  • gpt-oss-120b продемонстрировала неплохую стартовую скорость, однако при усложнении кода и расширении контекста начала сбоить: модель увязала в бесконечных циклах правок, порождавших новые баги и попутно уничтожавших уже написанную логику. Для долгосрочных агентных сессий это фатально.

  • Qwen3.8-Flash-Next в обоих вариантах квантования (Q3_K_XL и Q4_K_XL) показала удручающую производительность — генерация едва достигала 11 токенов в секунду, из-за чего написание тестового приложения затянулось почти на 3 часа с учетом пауз на раздумья.

  • Qwen3.8-35B-A3B-Q4_K_M безоговорочно выбилась в фавориты. Она шустро справилась с поставленной задачей, выдав скорость обработки промпта до 400 токенов/с и скорость генерации до 30 токенов/с (зависит от выставленного параметра --ctx-size). Примечательно, что при масштабировании контекстного окна с 32K до 128K просадка производительности составила всего 10–15%, что является великолепным результатом. На реализацию рабочего кода ушло около 15 минут (в среднем 1.5–2 минуты на итерацию), причем модель строго следовала ТЗ и обошлась без лишних деструктивных правок.

Секрет успеха Qwen3.8-35B-A3B-Q4_K_M

Резюмируя достоинства победителя, можно выделить следующие ключевые плюсы:

  • Производительность: высокая скорость отклика даже на устаревшей GTX 1080 Ti при гибридном размещении в ОЗУ.

  • Качество кодинга: глубокое понимание синтаксиса и логики программирования, безошибочная генерация кода с первой попытки.

  • Вариативность мышления: легко адаптируется под выдачу как лаконичных ответов, так и глубоких аналитических рассуждений.

  • Исполнительность: безукоризненно придерживается заданных системных промптов и инструкций, что критически важно для работы ИИ-агентов.

Однозначно рекомендую эту модель для локального развертывания на сопоставимом железе. Она превосходит более тяжелые MoE-решения, расходуя при этом значительно меньше системных ресурсов. Если вы ищете идеальный баланс между скоростью генерации, качеством логических выводов и аппетитами к памяти — Qwen3.8-35B-A3B-Q4_K_M определенно заслуживает внимания.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов