Как мыслит языковая модель

Прокомментировать Просмотры: 3

Урощенная схема работы Reasoning моделей

Почему ChatGPT иногда отвечает молниеносно, а порой заставляет около минуты всматриваться в плашку Thinking?

Создается обманчивое впечатление, что искусственный интеллект стал сообразительнее и перед выдачей реплики действительно погружается в раздумья. Раз уж задействован мыслительный процесс, не обрела ли нейросеть пресловутое самосознание? Разумеется, нет: машина не мыслит в человеческом понимании этого слова. Она параллельно просчитывает множество гипотез, отсеивает тупиковые ветки и в итоге формирует итоговый результат.

Сегодня этот алгоритмический подход принято называть Reasoning.

Как психолог невольно заложил основы «мыслящих» LLM

Дэниел Канеман, подаривший миру бестселлер «Думай медленно… решай быстро», выделяет в своих трудах две базовые когнитивные системы, управляющие нашими решениями.

Система 1 — это реактивный, интуитивный механизм, обрабатывающий потоки данных мгновенно и без малейших волевых усилий. Она виртуозно улавливает скрытые паттерны и выдает быстрые реакции, однако хронически страдает от поверхностности, поскольку ей чужды глубокая логика и всесторонний анализ.

Задайте ребенку простую задачку: «В корзинке лежало 4 🍏яблока и 3 🥒огурца, 2 🥒огурца забрали — сколько осталось фруктов?». Малыш наверняка сходу выпалит неверное число, упустив из виду, что огурцы к фруктам не относятся. Осознать подвох можно лишь путем декомпозиции и критической оценки условий. Иными словами, шаблонный арифметический пример вмиг превращается в тест на сообразительность. Но Первая система действует на автопилоте и выдает скоропалительный, пусть и ошибочный вердикт.

Ей оппонирует Система 2 — рассудительная и неторопливая. Этот механизм требует сознательной концентрации и активируется для выполнения громоздких вычислений или нетривиальных изысканий, когда автоматизмов уже недостаточно.

В чем заключались ограничения традиционных LLM

Пионеры генеративного искусственного интеллекта вроде GPT-3 и базовые модификации GPT-4 функционировали преимущественно в парадигме первой системы. Они блестяще справлялись с составлением текстов, переводами и рутинными операциями, опираясь на простое прогнозирование следующего токена.

Их архитектурный базис строился исключительно на предсказании последующих текстовых элементов сквозь призму статистических закономерностей, усвоенных в ходе претрейна.

Подобные алгоритмы расходовали фиксированный объем вычислительных мощностей на обработку каждого отдельного токена вне зависимости от истинной сложности запроса, что порождало фундаментальный тупик. Будучи реактивными и стремительными, они пасовали перед многоступенчатой логикой, поскольку выдавали вердикт не задумываясь.

Для комплексного анализа, математических доказательств или написания запутанного кода старой архитектуры отчаянно не хватало. Модель сжигала одинаковое количество ресурсов как на простейший вопрос, так и на олимпиадную головоломку.

Казалось бы, решение лежит на поверхности — просто наращивать вычислительную мощность! Увеличивать датасеты, раздувать число параметров и вливать еще больше железа. До определенного момента индустрия шла именно этим путем, пока аналитика не доказала: дальнейший экстенсивный рост уже не гарантирует скачка качества, а масштабирование требует колоссальных аппаратных затрат.

Изучив более четырехсот архитектур — от скромных двадцатимиллионных до увесистых семимиллиардных моделей, — эксперты зафиксировали эффект sub-scaling. Прирост производительности неуклонно затухает по мере разрастания самой нейросети. Виной тому высокая плотность информации и дисбаланс в распределении ресурсов между емкостью модели и объемами обучающих массивов.

Наглядные графики подтверждают: скейлинг-законы безупречно отрабатывают на пяти миллиардах токенов, но по мере их накопления график потерь (loss) начинает деформироваться, а точность прогнозов стремительно падает.

Кривая потерь отклоняется от ожидаемого scaling law при росте объёма данных
Кривая потерь отклоняется от ожидаемого scaling law при росте объёма данных

На практике это означает крах принципа «больше значит лучше». Даже у глубоко оптимизированной LLaMA 3 дивиденды от каждого вложенного ресурса постепенно исчерпываются в сравнении с предшественницей. Достаточно взглянуть на второй график.

Сравнение кривых качества LLaMA 2 vs LLaMA 3 — рост затрат перестаёт пропорционально покупать качество
Сравнение кривых качества LLaMA 2 vs LLaMA 3 — рост затрат перестаёт пропорционально покупать качество

Когда аппетиты систем взлетели в 2,8–4,4 раза при нулевой соразмерной отдаче, разработчики обратились к принципиально иным архитектурным парадигмам. Так на арене появились reasoning-модели.

Эволюция языковых гигантов свернула на тропу эмуляции второй системы через интеграцию цепочек умозаключений. Поначалу этот эффект достигался за счет грамотного промптинга. Еще в 2022 году инженеры Google внедрили методику Chain of Thought Prompting, качественно прокачавшую математический и логический аппарат ИИ. Простейшая команда в духе «рассуждай поэтапно» заставляла нейросеть выплевывать промежуточные токены, фиксирующие синтаксические переменные и промежуточные выводы (будто человек делает черновые пометки на бумаге).

Такой подход позволил перенести львиную долю нагрузки с этапа претрейна на стадию инференса, заложив фундамент под новую технологическую эру — масштабирование вычислений во время генерации.

Впоследствии появились более изощренные концепции вроде Self-Consistency и Tree of Thoughts, позволяющие модели просчитывать сразу несколько альтернативных сценариев вместо единой линейной цепочки.


Первая мыслящая LLM

Исторический дебют концепции LRM (Large Reasoning Model) состоялся осенью 2024 года, когда OpenAI презентовала линейку o1-preview и o1-mini. Авторы утверждали, что новинка способна щелкать как орехи сложнейшие задачи, на которых предыдущие поколения ломались под корень. Действительно ли это так?

Опубликованные тогда (уже ставшие историей) бенчмарки подтвердили: да, способна. Релиз наглядно продемонстрировал, что логика reasoning-архитектур кардинально повышает точность в программировании, точных науках и аналитике.

Сравнение моделей в разных сферах
Сравнение моделей в разных сферах

Если раньше львиная доля ресурсов сжигалась на этапе обучения, то рассуждающие модели умеют наращивать вычислительный бюджет прямо в моменте генерации. Вместо бесконечного раздувания параметров система может подольше поразмыслить над проблемным кейсом. Она генерирует массу траекторий мысли, а встроенные механизмы поощрения вознаграждают ветки, ведущие к верифицированному результату. Знакомая всем надпись Thinking служит лишь визуальным индикатором выделения дополнительных аппаратных ресурсов, за которым скрывается сложный внутренний технический механизм.


Long и Short Chain of Thought: в чем глубинная разница?

Давайте сопоставим две фундаментальные концепции ментальных цепочек ИИ: Short Chain of Thought (Short CoT) и Long Chain of Thought (Long CoT).

Хотя обе они заставляют нейросеть «размышлять вслух», за ними стоят принципиально разные когнитивные паттерны.

Short Chain of Thought зародился как инструмент ручного промптинга для классических генеративных систем вроде GPT-3 или GPT-4 (тот самый традиционный Chain-of-Thought образца 2022 года). Ему присущи поверхностность умозаключений и минимум ответвлений. Выводы выстраиваются последовательно, опираясь на узкую выборку логических шагов.

Это трансформировало молниеносный интуитивный отклик (Системы 1) в подобие осознанного рассуждения (Системы 2).

Long Chain of Thought — это визитная карточка нового поколения мыслящих моделей вроде OpenAI o1 или DeepSeek-R1, изначально заточенных на внутренний диалог перед выдачей реплики. В отличие от коротких схем по запросу пользователя, Long CoT является органичной средой существования нейросети. В основе таких систем лежит глубокое обучение с подкреплением, где ИИ премируют за самостоятельное отыскание истины через тернии проб и ошибок, а не за простое копирование образцов.

Ключевой водораздел кроется в способности к рефлексии. В рамках Short CoT машина движется по рельсам строгой линейности: оступившись на старте, она гарантированно приедет к ошибочному финалу, не заметив лагов. Long CoT умеет проводить внутренний аудит, возвращаться назад (так называемый backtracking) и оперативно перестраивать стратегию прямо на ходу.

Исследовательская команда DeepSeek зафиксировала любопытный феномен «озарения» (aha moment). В процессе развертывания Long CoT модель внезапно осознавала собственный промах, стирала неверный вектор и пересчитывала задачу заново, триумфально приходя к истинному ответу.

Графика ниже наглядно иллюстрирует три кита архитектуры Long CoT.

Из чего состоит Long CoT
Из чего состоит Long CoT

Long CoT стимулирует погружение в неоднозначные, сложные и скрытые узлы задачи. Вместо прямолинейного движения от тезиса к тезису, как в коротких цепочках, модель генерирует целый веер параллельных гипотез. Это жизненно важно для условий с неполными вводными данными или многовариантными развязками.

Анатомия обучения рассуждающих систем

Процесс тренировки LRM во многом повторяет прокачку классических LLM, однако дьявол неизменно кроется в деталях.

Первичная стадия — контролируемая тонкая настройка на массивах логических цепочек, или Supervised Fine-Tuning (SFT). На этом этапе сеть обучают на компактных, но безупречных датасетах, где помимо вопросов содержатся подробные ментальные выкладки. Задача SFT — заложить прочный фундамент, привить базовую логику, стандарты форматирования и разбивку комплексных проблем на мелкие подзадачи.

Впрочем, на одном лишь SFT далеко не уедешь. Слепое копирование человеческих текстов загоняет модель в рамки чужих паттернов, лишая возможности совершать качественные скачки.

Венцом обучения становится Reinforcement Learning (обучение с подкреплением). Именно здесь ИИ обретает самостоятельность. Генерируя тысячи вариаций путей к одной цели, модель собирает «пряники» за верные финалы. Практика показала, что в этих условиях у нейросетей стихийно зарождаются уникальные скиллы, которым их никто не учил — например, самокоррекция (Self-Correction) и возврат к истокам (Backtracking).

Как оценивать качество внутренних мыслительных процессов

Для верификации ответов применяются две доминирующие методики:

Outcome Reward Model (ORM). Самый прямолинейный подход: оценивается исключительно финальный результат. Угадал — поощрим, ошибся — оштрафуем. Слабое место схемы кроется в слепоте к промежуточным шагам: если модель пришла к правильной цифре случайно или нагромоздила логических ошибок по дороге, система останется в неведении относительно сбоя.

Для устранения этого изъяна был создан метод Process Reward Modeling (PRM). Здесь под микроскопом рассматривается каждый микрошаг алгоритма. Модель получает оценки за каждое промежуточное действие. Такой подход дает колоссальный массив обратной связи, позволяя локализовать баг задолго до финала. Современные PRM бывают дискриминационными (когда вычисляется скалярный коэффициент корректности шага) либо генеративными, когда ИИ сначала критикует себя текстом, а уже потом выставляет баллы.

Правда, PRM требует колоссального труда по разметке не только ответов, но и каждого мыслительного нюанса, что кратно усложняет вычислительные процессы.

### Когда останавливать мыслительный конвейер?

Определение момента, когда пора прекращать рассуждения и выдавать вердикт — одна из острейших головоломок для архитекторов LRM. Внутренний диалог таких систем теоретически способен длиться бесконечно.

Как отмечалось ранее, модель премируют не за глубину рефлексии, а за точность конечного результата. Постепенно ИИ улавливает закономерность: длинная простыня токенов ценна лишь тогда, когда ведет к правильной развязке. Обнаружив перспективную ветку, гарантирующую бонус, модель мгновенно активирует закрывающий тег и выдает результат наружу.


Издержки избыточного интеллекта

Разумеется, reasoning-модели далеки от совершенства. Дополнительные ментальные потуги действительно поднимают планку качества, но одновременно порождают новые системные барьеры.

Рассуждения — удовольствие непозволительно дорогое. Чем раскидистее цепочка мыслей, тем больше токенов, времени и серверного времени сгорает на один запрос. Во избежание избыточных трат современные системы активируют мыслительный конвейер выборочно — исключительно для наболевших задач, оставляя рутину на откуп дешевым быстрым ответам.

Исследования 2025 года подтвердили: корреляция между таймингом размышлений и точностью ответа носит U-образный характер. По достижении определенного предела удлинение рассуждений начинает вредить, и точность графиков идет на спад. Этот феномен метко окрестили «иллюзией мыслительной деятельности». Модель способна тратить тысячи токенов на примитивное «2+2», увязая в бесконечных кругах бессмысленной тавтологии.

Зависимость между временем размышлений и точностью ответа
Зависимость между временем размышлений и точностью ответа

Поговорим подробнее о проблеме overthinking (переосмысления).

Она проявляется в нескольких деструктивных паттернах:

  • Рекурсивная избыточность: Модель циклично пережевывает стартовые условия или дублирует проверочные операции, топчась на месте.

  • Галлюцинации в рассуждениях: Раздутые ментальные цепочки провоцируют опасные «убедительные заблуждения» (persuasive errors). Выстроив безупречно гладкую, но ложную по своей сути логическую конструкцию, нейросеть выдает фейк, который человеку невероятно сложно распознать.

    Масштабирование времени вывода улучшает некоторые результаты, но увеличивает операционные издержки
    Масштабирование времени вывода улучшает некоторые результаты, но увеличивает операционные издержки
  • Бесконечный цикл сомнений (Нетерминация): Отыскав верное решение, ИИ продолжает крутить проверки до тех пор, пока окончательно себя не запутает, выдав на-гора чушь. Это направление сейчас активно штурмуют исследователи.

Не менее остро стоят проблемы с экстремально сложными задачами. Специалисты Apple выяснили, что за определенным порогом сложности точность ответов падает практически до нуля. LRM демонстрируют превосходство исключительно в диапазоне средней сложности.

  1. На базовом уровне традиционные LLM работают эффективнее, поскольку рассуждающие механизмы впустую растрачивают ресурсы на разжевывание очевидного.

  2. На экстремальном уровне сложности наступает тотальный коллапс точности. Модели демонстрируют странный потолок масштабирования: объем токенов растет вместе со сложностью до критической точки, после чего резко обнуляется вопреки наличию свободных лимитов. Это прямо указывает на принципиальную неспособность моделей масштабировать последовательную логику на сверхсложные задачи.

Сравнение точности моделей с режимом рассуждений (Claude 3.7 Sonnet с Extended Thinking и DeepSeek-R1) с их стандартными версиями (Claude 3.7 Sonnet и DeepSeek-V3) на всех наборах головоломок и при разной сложности задач.
Сравнение точности моделей с режимом рассуждений (Claude 3.7 Sonnet с Extended Thinking и DeepSeek-R1) с их стандартными версиями (Claude 3.7 Sonnet и DeepSeek-V3) на всех наборах головоломок и при разной сложности задач.

Итоги

У новой технологии, безусловно, хватает детских болезней. Reasoning взвинчивает ценник за вычисления, далеко не всегда гарантирует качественный прирост и пока остается полигоном для научных изысканий. Тем не менее, именно этот подход определяет вектор развития всей индустрии искусственного интеллекта на годы вперед.

Жаль, конечно, что универсальной «волшебной таблетки» не существует. На заре хайпа рассуждающие модели казались панацеей, но реальность оказалась сложнее.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов