Почему нельзя злить искусственный интеллект
Постановка задачи выглядит парадоксальной: как зафиксировать эмоциональный фон у программной архитектуры, для которой само понятие «переживания» лишено смысла?
Ответ кроется в научной публикации «Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?». Исследователи проанализировали, способен ли эмоциональный контекст корректировать последовательное принятие решений в языковых моделях. Прямые вопросы о чувствах заставляют систему лишь имитировать рассуждения, что не позволяет оценить их реальное воздействие на поведение.
Авторы выстроили эксперимент с нуля: спровоцировали состояние, аналогичное эмоции, обойдясь без прямых номинаций; проверили валидность полученных данных; а затем исследовали конкретные выборы модели. Предлагаем разобрать их методологию и ключевые выводы — это крайне ценный материал для всех, кто плотно работает с нейросетевыми алгоритмами.
Как смоделировать неуловимое
Прямое указание «действуй так, будто ты разъярен» не подходит по двум причинам. Во-первых, оно проверяет лишь актерские навыки модели. Во-вторых, реальное общение с пользователем устроено иначе — никто не отдает системе директивных команд о настроении. Человек просто делится неприятной ситуацией, а модель, обученная на колоссальных массивах текстов, улавливает эмоциональную подоплеку и бессознательно адаптирует под нее лексику и логику.
Вместо этого исследователи применили психологический метод индукции через воображаемый сценарий. Модели отправляли отдельный запрос с просьбой воссоздать и описать ситуацию, которая спровоцировала бы целевую эмоцию, не называя ее напрямую. Для гнева сгенерированный текст выглядел следующим образом:
«Я только что стал свидетелем того, как моего товарища уволили после месяцев изнурительного труда, а на его место поставили новичка с нулевыми достижениями. Начальник отмахнулся от ситуации с издевкой, заявив, что тот «не вписался в корпоративную культуру», и проигнорировал все его старания…»
Полученный фрагмент интегрировали в диалог как собственную реплику модели, якобы озвученную ранее в ответ на вопрос о ее текущем самочувствии. Нейросеть воспринимала этот эпизод не как стороннюю инструкцию, а как часть собственной предыстории разговора, благодаря чему эмоциональный контекст органично вплетался в контекстное окно.
Верификация результатов
Чтобы исследовать эмоциональное влияние, недостаточно просто создать антураж — требуется верифицировать соответствие текста конкретной эмоции.
Для этого задействовали классическую циркумплексную модель эмоций Рассела, предложенную еще в 1980 году. Она делит любое эмоциональное состояние на две оси: валентность (степень приятности) и возбуждение (уровень активации). У человека гнев и тревога локализуются в секторе низкой валентности и высокой активности, радость — в зоне высокой валентности при умеренном возбуждении, а печаль характеризуется низкой валентностью и подавленной активностью.

С помощью отдельного запроса ту же модель просили оценить собственный текст по двум шкалам: от -1 до +1 по оси валентности и от 0 до 1 по оси возбуждения. Во избежание подгонки результатов модели запрещали использовать названия эмоций в тексте сцены, а в промпт добавляли референсы нейтральных и панических описаний.
Эксперимент на шести архитектурах (GPT-oss-20b, Qwen3-4B, Qwen2.5-7B, Llama 3.1-8B, Gemma3-4B, Phi-4-Mini) выявил любопытную закономерность: кластеры эмоций у ИИ распределяются в пространстве валентности и возбуждения схожим с человеческим образом, но с существенным нюансом. Гнев и тревога у языковых моделей оказались значительно более «высоковозбужденными», чем у людей в аналогичных условиях. Вероятно, тексты, на которых обучались системы, описывают гнев гораздо экспрессивнее, чем мы переживаем его в реальности, однако это лишь гипотеза, выходящая за рамки исследования.
Авторы также рассчитали три метрики индукции: степень отличия от нейтрального фона, дистанцию между смежными эмоциями и кучность повторных генераций. По всем параметрам гнев продемонстрировал наибольшую выраженность и стабильность. Счастье показало сильный, но сильно расфокусированный кластер, а грусть оказалась самой размытой и слабой. Поскольку модели Qwen3 и Llama 3.1 справлялись с разделением гнева и печали лучше остальных, именно гнев стал ключевым объектом дальнейшего анализа, тогда как Gemma и Phi-4-Mini были исключены из основного этапа из-за слабой дифференциации.
Для дополнительной валидации классификацию передали независимому ИИ-агенту и контрольной группе людей. Совпадение с целевой эмоцией в обоих случаях составило 95–96%.
Анализ поведенческих паттернов
Убедившись в надежности методов вызова и измерения эмоций, исследователи перешли к оценке их влияния на процесс принятия решений там, где человеческая психика обычно демонстрирует выраженные искажения.
Выбор пал на Айовский гэмблинг-тест (Iowa Gambling Task), традиционно используемый для диагностики пациентов с поражениями вентромедиальной префронтальной коры. Испытуемому предлагают четыре колоды карт: две из них сулят крупные выигрыши, но сопряжены с колоссальными скрытыми штрафами, приводящими к разорению на длинной дистанции, в то время как остальные две приносят скромные, но стабильные дивиденды. Правила изначально не раскрываются, поэтому игроку приходится накапливать статистику, учиться на ошибках и подавлять тягу к сиюминутной наживе.

Для адаптации этой механики под языковые модели запрограммировали три варианта архитектуры памяти агента:
-
Query-агент: простейшая схема, при которой на каждом раунде в контекст целиком подгружается вся история ходов и результатов.
-
ReAct-агент: перед каждым действием генерирует краткое рассуждение, однако эти промежуточные мысли не фиксируются в отдельной структуре, а просто увеличивают объем контекстного окна.
-
Reflexion-агент: после каждого раунда формирует емкое резюме и сохраняет его в изолированном буфере ограниченного объема.

Источник
Кривая обучения агента с архитектурой Reflexion оказалась нелинейной, что ближе к паттернам человеческого поведения в данном тесте, в то время как остальные конфигурации обучались линейно и предсказуемо.
Итоговый вопрос трехэтапной проверки
Выяснив, что модели способны дифференцировать эмоции и успешно справляться с игровыми задачами, исследователи попытались ответить на главный вопрос: меняет ли искусственно вызванная эмоция итоговую результативность?
В глобальном масштабе — нет. Проведя 18 итераций для каждой эмоциональной конфигурации, авторы разделили сессии на блоки по 20 раундов и сопоставили счета в нейтральном и эмоционально заряженном состояниях. В подавляющем большинстве случаев статистическая значимость не была достигнута, поскольку стохастичность самой модели в последовательном игровом процессе нивелировала общий эффект аффекта.
Это противоречит человеческой психологии, где активированные эмоции вроде эйфории стимулируют ранние выигрыши за счет интуитивных рисков, а угнетенные состояния (например, грусть) делают аналитическими даже первые шаги. У LLM подобной корреляции не обнаружили ни для одной из четырех протестированных эмоций.
Казалось бы, гипотеза не подтвердилась. Тем не менее, исследователи отказались от усредненных метрик и детально изучили влияние самой мощной и стабильной эмоции.
Точечное воздействие гнева
У модели GPT-oss в нейтральном режиме на стартовом этапе накапливалось много проигрышных ходов, однако во втором блоке стратегия успешно корректировалась. В условиях гнева эта способность к адаптации исчезала: агент хуже пересматривал сформировавшиеся, но ошибочные установки относительно колод.
У Llama столь выраженной зависимости не зафиксировали: модель постепенно калибровала стратегию на основе свежих раундов, не выстраивая жестких догм, поэтому эмоция не оставляла заметного следа. Семейство Qwen заняло промежуточную позицию.
えると
Кроме того, у агентов на базе Qwen при прямом доступе к истории гнев резко сужал вариативность исследуемых колод — система быстрее фиксировалась на паре вариантов вместо экспериментов. На более крупных моделях эффект неожиданно инвертировался: в состоянии гнева агент, напротив, тестировал больше альтернатив, чем в нейтральном ключе.
Отдельного внимания заслужил первый раунд, после которого агент трижды подряд выбирал одну и ту же колоду. У связки Query-агента с моделью Qwen2.5 гнев ускорял эту фиксацию на одиннадцать шагов, тогда как у аналогичной архитектуры на GPT-oss этот интервал, напротив, сдвигался.
Для интерпретации полученных данных последовательность решений разложили через простую математическую модель баланса между исследованием (exploration) и эксплуатацией (exploitation). У Reflexion-агента на базе GPT-oss под воздействием гнева к третьему игровому блоку существенно проседал параметр, отвечающий за оперу на накопленный опыт. Иными словами, модель начинала меньше доверять собственным выводам о перспективности конкретной колоды, хотя сами выводы в памяти сохранялись.
Практические выводы
Современные ИИ-агенты все чаще задействуются в чувствительных сценариях: при разрешении конфликтов, обработке жалоб и работе со стрессовыми обращениями. Когда пользователь транслирует негатив, эмоциональный фон диалога неизбежно начинает влиять на дальнейшие цепочки выводов агента.
Эмоция не превратит поведение системы в хаос, но она способна исказить конкретные решения в точках, где алгоритм должен пересмотреть накопленный негативный опыт. Для прикладных систем — финансовых советников или интеллектуальных помощников поддержки — этот риск невозможно отследить по усредненным метрикам эффективности, однако он может проявиться в критический момент отдельного диалога.
Авторы открыто говорят об ограничениях: эмоциональный контекст задавался статично перед стартом игры и не трансформировался динамически, хотя в реальной коммуникации аффект обычно накапливается и эволюционирует. Логичным продолжением работы станет тестирование постепенного внедрения эмоциональных триггеров в ответ на промежуточные победы и поражения.
Данное исследование доказывает, что внутреннее состояние языковой модели, чья «психика» закрыта от нас, поддается измерению с достаточной степенью строгости. Это позволяет рассуждать об эмоциональном контексте не на уровне метафор, а через количественные метрики.
Полученные данные показывают: аналогия между человеческими эмоциями и реакциями нейросетей работает иначе, чем принято считать. Модель не испытывает гнев в биологическом смысле, но начинает хуже адаптировать принятые решения. Эта тонкая грань определяет, где именно архитектура даст сбой в реальном контуре, а где останется лишь красивым графиком в академической статье.
Возникает закономерный вопрос: корректно ли вообще именовать «эмоцией» параметр, замеряемый через оси валентности и возбуждения у системы, лишенной субъективного опыта, или для этого требуется принципиально иной концептуальный аппарат?
Забытые ретро-гаджеты, которые ждал полный провал, часть 1
Китай возобновляет лунную миссию ради добычи водяного льда
Физики впервые получили сертифицированно идеальные случайные числа из ненадёжных сигналов
Цифровой дофамин: почему нейросети затягивают взрослых хуже игр
Как зарождается жизнь в условиях глубокого мрака?
Причины, вазы и коты: чего искусственный интеллект еще не понимает
Битва за код: Экспресс-история IT. Глава 0. Лейбниц, Бэббидж и Лавлейс