Тест нейросетей Qwen3.5 9b, Gemma 4 12b и Bonsai 27b на легендарной видеокарте GTX 1080 Ti

Прокомментировать Просмотры: 6

Изначально у меня не было задачи создавать очередной бенчмарк. Мне потребовалось развернуть локальный конвейер для обработки объемных подкастов: выгружать расшифровку, отыскивать в ней любопытные моменты, отбирать самые яркие эпизоды и уже из них монтировать короткие вертикальные ролики.

Облачные сервисы справляются с этим неплохо, однако постоянно отправлять туда длинные тексты не хотелось. К тому же было любопытно проверить, на что сейчас способно имеющееся «железо».

Под рукой оказалась старая добрая GTX 1080 Ti с 11 ГБ памяти — видеокарта 2017 года на архитектуре Pascal, где нет и в помине никаких тензорных ядер.

Так из прикладной потребности постепенно сформировался небольшой тестовый стенд. Я протестировал три модели в идентичных условиях, отдельно исследовал работу с обширным контекстом, а затем разработал собственный набор логических задач, сопоставив результаты с активированным режимом размышлений и без него. Итоги оказались весьма неожиданными.

Кого тестировал

Модель

Вариант

Qwen3.5

9B Q4_K_M

Gemma 4

12B Q4_0

Bonsai

27B Q1_0

Основной средой для тестирования выступала LM Studio. Для контроля скорости дополнительно задействовались Ollama и llama.cpp. Все испытания проводились на единственной рабочей машине.

GPU: NVIDIA GeForce GTX 1080 Ti
VRAM: 11 GB
RAM: 32 GB
OS: Windows
NVIDIA Driver: 582.66

Первая преграда: дело оказалось не в модели, а в драйвере

Прежде чем приступить к серьезным тестам, я изрядно повозился с банальной проблемой. Модель Qwen3.5 9B раньше стабильно выдавала порядка 40 токенов в секунду, но в один прекрасный момент скорость внезапно рухнула до 7 токенов в секунду.

После апдейта драйвера до версии 582.66 интерфейс CUDA заработал корректно, и Qwen выдала привычные 42 токена/с.

Тест 1. Обширный контекст

Сперва хотелось выяснить банальную вещь: способна ли нейросеть действительно удерживать в памяти огромный массив данных или впечатляющие цифры в характеристиках созданы исключительно для маркетинга.

Я написал простенький скрипт на Python по методике Needle‑in‑a-Haystack. Он заполняет контекст нейтральным повествованием и внедряет пять контрольных фактов в разные части документа. Задача модели — отыскать их все.

Оценивалась не только точность ответов, но и реальный объем входных токенов, время до первого токена (TTFT), темп генерации и общая длительность запроса.

Qwen3.5 9B

Input tokens

Результат

TTFT

Generation

31 581

10/10

48.1 с

37.9 tok/s

62 868

10/10

125.5 с

31.6 tok/s

98 037

10/10

246.9 с

29.7 tok/s

125 394

10/10

366.0 с

28.5 tok/s

Даже на рубеже в 125 тысяч токенов Qwen безошибочно вытащила все маркеры.

При этом «бутылочным горлышком» стал вовсе не декодинг, а префилл. Скорость генерации снижалась плавно, в то время как задержка перед выдачей первого токена росла лавинообразно. При обработке 125k входящих токенов нейросети потребовалось примерно шесть минут на обдумывание промпта, прежде чем она соизволила начать ответ.

Для сценариев, где массивный документ анализируется фоново один раз, это приемлемо. Для интерактивного диалога с контекстом в 100k — уже совершенно неприемлемо.

Gemma 4 12B QAT

Input tokens

Результат

TTFT

Generation

30 711

10/10

110.0 с

24.8 tok/s

61 116

10/10

317.0 с

22.1 tok/s

Gemma тоже справилась с поиском фактов, но переваривала массивный вход значительно тяжелее. Если для 32k токенов Qwen тратила на старт около 48 секунд, то Gemma раздумывала почти 110 секунд.

Иными словами, в задачах поиска информации обе модели проявили себя достойно, но в качестве скоростного аналитика длинных стенограмм Qwen оказалась предпочтительнее.

Bonsai 27B Q1

Эту модель я добавил скорее из порции здорового скепсиса. Речь идет о решении на 27B с экстремальной однобитной квантизацией.

Input tokens

Результат

TTFT

Generation

4 222

10/10

14.5 с

28.0 tok/s

31 581

10/10

141.9 с

22.5 tok/s

Она действительно функционирует, причем выдавая далеко не жалкие 1–2 токена в секунду. Однако этап предварительной обработки контекста дался ей тяжелее остальных: на ~32k входящих токенов старта пришлось ждать порядка 142 секунд.

Поискового теста оказалось недостаточно

На данном этапе обнаружилась новая сложность: все три участника легко набрали максимум баллов. Подобные проверки отлично отвечают на вопрос, сумела ли система обнаружить искомую песчинку в стоге сена, но никак не отражают ее способность к глубоким умозаключениям.

Поэтому я подготовил второй бенчмарк. Он не претендует на академическую точность и не заменяет собой MMLU, представляя собой сугубо прикладной набор кейсов, который удобно прогонять локально через API LM Studio.

Финальная версия включила 25 кейсов стоимостью по 4 балла, разбитых на пять категорий:

Блок

Количество

Логика и дедукция

5

Business reasoning

5

Multi‑hop по документам

5

Причинность, противоречия, ловушки

5

Анализ на контексте примерно до 10k

5

Режим без размышлений: стремительные ответы оказались слишком наивными

Первый цикл тестов проводился с деактивированными механизмами рассуждений. Картина вышла следующей:

Модель

Score

Avg TTFT

Generation

Полное время

Gemma 4 12B

68/100

3.98 с

33.68 tok/s

115.1 с

Bonsai 27B

48/100

6.91 с

32.59 tok/s

184.4 с

Qwen3.5 9B

44/100

2.33 с

47.97 tok/s

64.9 с

Сначала мне показалось, что скрипт оценки дал сбой. Но детальный разбор сырых ответов подтвердил: ошибки были самыми настоящими.

Так, Qwen прокалывалась на элементарной математике: насчитала 7.5 месяца вместо 3.6 в задачке на окупаемость, выдала 133 вместо 200 в расчете точки безубыточности и путала цифры при оценке загрузки персонала.

Зато в задачах на многоуровневый поиск (multi-hop) она смотрелась куда увереннее. Сложилось впечатление, что без внутреннего диалога модель попродуху цепляется за первую попавшуюся правдоподобную формулировку, пренебрегая самопроверкой.

Куда интереснее было повторить прогон, дав моделям возможность «подумать».

Режим с размышлениями: кардинальная смена позиций

Параметры зафиксировали на одном уровне: контекст 16 384, нулевая температура, функция reasoning активна, лимит токенов на вывод и внутренний монолог — 2048.

Итоги изменились радикально:

Модель

Score

Avg TTFT

Generation

Полное время

Bonsai 27B

100/100

6.73 с

27.66 tok/s

1072.0 с

Gemma 4 12B

100/100

3.93 с

29.75 tok/s

633.2 с

Qwen3.5 9B

96/100

2.33 с

40.63 tok/s

609.3 с

Qwen оступилась лишь в одном логическом вопросе из 25. Gemma и Bonsai отработали безупречно.

Категория

Qwen

Gemma

Bonsai

Logic

80%

100%

100%

Business

100%

100%

100%

Multi‑hop

100%

100%

100%

Causal / traps

100%

100%

100%

Analysis до 10k

100%

100%

100%

Показатели Qwen взлетели с 44/100 до 96/100, а Bonsai — с 48/100 до заветной сотни. И всё это на том же наборе заданий, том же движке и том же железе.

Для меня это стало главным открытием серии экспериментов: наличие этапа рассуждений влияет на практическую ценность результатов сильнее, чем выбор конкретной архитектуры.

Gemma в качестве фаворита

До начала замеров расклад казался банальным: Qwen быстрая, Bonsai — самая умная, а Gemma занимает промежуточную нишу.

Реальность оказалась интереснее. Bonsai заслуженно получила высший балл, но Gemma добилась аналогичного результата, затратив заметно меньше времени.

Gemma: 633.2 с
Bonsai: 1072.0 с

На выполнение работы Bonsai потребовалось примерно на 69% больше времени.

Qwen завершила тесты за 609.3 секунды, опередив соперницу всего на 4% по суммарному времени. Этот факт особенно забавен, если взглянуть на чистую скорость генерации: 40.6 токена в секунду у Qwen против 29.8 у Gemma.

Секрет кроется в том, что скорость декодинга отражает лишь часть картины. В режиме размышлений критически важны скорость префилла, объем скрытых служебных токенов и продолжительность внутреннего контроля.

Судя по логам, Gemma сгенерировала около 15 тысяч служебных токенов на весь массив задач. Она редко упиралась в лимиты: на элементарных вопросах расходовала считанные сотни токенов, а на сложных аналитических цепочках доходила до тысячи.

Bonsai размышляла дольше, в то время как Qwen действовала оперативнее. Следовательно, оценивать рассуждающие модели исключительно по скорости вывода бессмысленно — куда честнее замерять время ожидания полноценного правильного ответа.

Итоговый выбор

По завершении тестов роли каждой из моделей выстроились довольно четко.

Qwen3.5 9B отлично подходит для быстрого сканирования объемных текстов. Она быстрее конкурентов обрабатывает массивные промпты, адекватно держит гигантский контекст и в режиме рассуждений почти не уступает более тяжелым аналогам.

Gemma 4 12B QAT заслужила звание главного фаворита для задач, требующих вынесения вердикта по уже отобранным материалам. Она показала безупречный результат при общем времени выполнения, сопоставимом с Qwen.

Bonsai 27B Q1 — самый экзотический претендент. Запустить 27-миллиардную модель на GTX 1080 Ti, получить нормальную скорость отклика и стопроцентную точность — само по себе достижение. Однако преимуществ перед Gemma на данном наборе задач я не увидел, а времени ушло значительно больше.

Как это применимо к реальной задаче с подкастами

Моя первоочередная цель — не решение абстрактных головоломок, а нарезка удачных фрагментов из длинных записей. Опираясь на тесты, я бы выстроил двухступенчатый конвейер.

Полный транскрипт
|
v
Qwen3.5 9B, reasoning OFF
 быстро пробегает выпуск и намечает 15–20 претендентов
|
v
Gemma 4 12B, reasoning ON
производит глубокий анализ отобранных фрагментов
|
v
TOP-6 клипов

Таким образом удается избежать отправки всей стенограммы тяжелой модели. Qwen выполняет рутинную предварительную фильтрацию, а Gemma подключается на финальном этапе для точной оценки.

Разумеется, схему нельзя назвать окончательной. В дальнейшем стоит протестировать ее на реальных подкастах, сравнив машинный отбор с эталонной человеческой разметкой.

Насколько объективен этот бенчмарк

Стоит остудить излишний энтузиазм. Выборка из 25 задач невелика. Это не научное исследование и точно не повод короновать какую-либо модель как безусловного лидера.

Итоги зависят от шаблона чата, типа квантизации, программной среды, выделенного бюджета на размышления, объема контекста, видеодрайверов и формулировок. Я уже успел отловить пару багов в собственных скриптах, поэтому к абсолютным результатам отношусь сдержанно.

Тем не менее, у подобного домашнего тестирования есть весомый плюс: все участники проверяются на едином оборудовании, в одинаковых условиях и с одинаковыми вводными. При подборе инструмента под конкретную рабочую станцию это порой полезнее публичных таблиц лидеров, собранных на абстрактных серверных мощностях.

Развивая проект дальше, я бы не тал сочинять новые вопросы, а интегрировал стандартизированные наборы вроде MERA, RULER или lm‑evaluation‑harness, чтобы проверить устойчивость результатов.

Пример кода

Вся логика завязана на локальный API LM Studio. Базовый запрос выглядит следующим образом:

payload = {
“model”: model_id,
“input”: prompt,
“system_prompt”: system_prompt,
“temperature”: 0.0,
“max_output_tokens”: 2048,
“reasoning”: “on”,
“context_length”: 16384,
“stream”: False,
}

Каждое задание требует лаконичного ответа формата:

{“answer”:“B”}

Далее скрипт самостоятельно сопоставляет ожидаемый и реальный ответы, фиксирует объем входящих и служебных токенов, TTFT, темп генерации и общее время выполнения. Для сравнения возможностей этого оказалось вполне достаточно.

Сухой остаток

Я затевал эксперимент ради простого вопроса: годится ли GTX 1080 Ti в качестве рабочей лошадки для локальных нейросетей в 2026 году, или это лишь игрушка для энтузиастов.

Мой вердикт — вполне годится, если адекватно оценивать возможности оборудования.

Qwen3.5 9B
 — примерно 40–48 tok/s
 — стабильный контекст как минимум до ~125k
 — 96/100 в тестах на рассуждение

Gemma 4 12B QAT
 — 100/100 в логических задачах
 — сопоставимое с Qwen общее время выполнения
 — оптимальный баланс производительности и скорости в моих тестах

Bonsai 27B Q1 
 — полноценная крупная модель в рамках 11 GB VRAM
 — 100/100 
 — ощутимо более долгая обработка по сравнению с Gemma

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов