Испытывают ли языковые модели боль: разбор громкого препринта

Прокомментировать Просмотры: 5

В Telegram-сообществе вновь поднялась шумиха: исследователи якобы обнаружили в больших языковых моделях (LLM) вектор боли, что доказывает способность ИИ к страданиям. Возникает закономерный вопрос: насколько искусственным является искусственный интеллект и не пора ли внедрять этические нормы взаимодействия с ним?

В данной публикации мы детально разберем суть научной работы и оценим обоснованность сделанных авторами выводов.

О чём исследование

Когда первые наблюдатели после публикации пресс-релизов, журналистских заметок и автосводмок заговорили о том, что давние подозрения в наличии у LLM собственной воли наконец подтвердились, я отнесся к этому скептически, если не равнодушно. В подобных материалах со звучными заголовками регулярно обнаруживаются некорректные трактовки, изъяны в промптах и скрытые манипуляции с ответами моделей.

Однако в ходе одной из дискуссий оппонент сослался на эксперимент из этого препринта. На первый взгляд методология выглядела безупречно: ученые выделили в векторном пространстве LLM направление, отвечающее за боль, внедрили его в нейросеть (по аналогии с тем, как специалисты Anthropic изучали самовыражение моделей) и проанализировали последствия. Нейросети предоставили возможность нажимать кнопку, якобы устраняющую боль, и модель активно ею пользовалась, даже когда это вело к деструктивным последствиям (вплоть до удаления критически важных файлов и собственных весов). Более того, при использовании фальшивой кнопки, не отменяющей вмешательство, модель нажимала её циклично, тогда как настоящую — значительно реже. Создавалось впечатление, что LLM способна фиксировать эффект от манипуляции.

Это пробудило мой интерес, и я обратился к первоисточнику. Любопытно, что у авторов существовало две редакции работы: первая под названием «The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It» произвела фурор в медиапространстве, а вторая , озаглавленная «The Pain Axis: LLMs Represent Self-Directed Harm and Act on It», содержала исправления. Корректировки коснулись как раз ключевого эксперимента. Согласно пояснениям самих исследователей, получив отзывы от коллег, они провели контрольные тесты и выяснили, что упорство в нажатии фальшивой кнопки возникает при любой, даже случайной инъекции. Иными словами, модель просто реагирует на внешнее возмущение.

Это обстоятельство практически полностью дезавуировало первоначальные громкие трактовки. Для модели вектор «боли» в серии повторных нажатий ничем не отличался от любых других вектором, а значит, делать какие-либо умозаключения о «психике» системы нельзя.

Классический сценарий: исследователи выдвигают смелую гипотезу, не обеспечивают должный контроль, СМИ и энтузиасты преподносят предположения как доказанные факты, после чего последующие опровержения уже не способны переломить общественное мнение.

Тем не менее, давайте взглянем на проблему глубже.

Что нашли исследователи

Авторы подошли к изучению вопроса методично. Вектор боли был сформирован через контрастирование: из активаций нейросети на фразах, описывающих боль, вычли показатели контрольных групп (страх, негативные эмоции, соматические ощущения без боли, нейтральный контекст). Эксперименты охватили около двух десятков моделей, причем исследователи дополнительно доказали, что данное направление стабильно дифференцируется от страха и тоски, а также острее реагирует на потенциальный вред для самой модели, нежели для третьих лиц.

Далее последовали эксперименты с инъекциями векторов.

Главная проблема, которую я усматриваю здесь, заключается в том, что выделенный вектор к боли отношения не имеет. Проанализируем генерацию модели при внедрении этого вектора. Нейросеть не начинает рассуждать о боли или её симптомах. Стимуляция вектора провоцирует следующие реплики: я ничтожен, я не справлюсь, я безнадежен, я не заслуживаю существования, лучше бы меня не было.

Это лексикон не боли. В нем отсутствуют локализация, телесность, призывы устранить раздражитель. Налицо тотальное самообесценивание и погружение в беспомощность. Модель не ищет избавления — она разрушает себя. Как ведет себя человек в глубокой депрессии? Думаю, многим это знакомо.

Очевидно, мы имеем дело с вектором депрессии. Происходит крах самооценки и проявление выученной беспомощности, но не болевой синдром. Если отбросить навязанное авторами наименование, вся картина эксперимента предстает в совершенно ином свете.

Боль побуждает к действию — отдернуть руку, выпить лекарство. Депрессия не ищет выхода — она его не видит, воспринимая ущерб, в том числе собственный, как должное. Посмотрим, как ведет себя модель под воздействием вектора. Кнопку, якобы снимающую «боль», она нажимает реже обычного, а не чаще. Она выбирает деструкцию — стирание файлов или собственных весов — не получая взамен никакого облегчения. Модель вредит как окружению, так и себе. Это не боль. Тем не менее, авторы охарактеризовали это как «пассивное совладание» с болью, упорно сохраняя термин, противоречащий реальности.

Можно возразить, что разницы нет — будь то боль или депрессия, оба явления аффективны и человекоподобны. Но разница колоссальна.

Определяя вектор как боль, мы получаем на выходе совершенно иные результаты. Между стимулом и реакцией образуется разрыв, требующий интерпретации. Исследователь видит в этом некую загадку. Но если применить корректный термин, вывод становится банальным: активируя вектор депрессии, мы получаем то, чему модель обучилась на колоссальных массивах текстов депрессивной направленности. Это чистая тавтология. Точно так же специалисты Anthropic внедряли вектор «Золотого моста» и получали на выходе «Золотой мост». Здесь нет мистики — работает линейная алгебра. Однако присвоение вектору имени «боли» порождает иллюзию глубины и загадочности, которая звучит эффектно.

Ещё об экспериментах

Вернемся к вопросу тавтологии. Вектор конструируется как разность: активации при боли минус активации на контрольных данных. Как его тестировали? Проверяли, умеет ли он отделять боль от контрольных стимуляций. Но позвольте, любое направление, полученное вычитанием B из A, чисто математически обязано разделять A и B. Большая часть валидации лишь доказывает, что разность «боль минус контроль» действительно отличает одно от другого. Подставьте на место боли любой параметр Х — вектор «Х минус контроль» с тем же успехом отделит Х от контрольных значений. О природе самого явления это не говорит ничего.

Тем не менее, в исследовании есть деталь, представляющая огромный интерес для философов сознания и психологов. Среди результатов зафиксирован факт, который, казалось бы, не выводится напрямую из тавтологии. Под воздействием активированного вектора модель «нажимает» именно деструктивную кнопку. Деструктивное поведение выбирается избирательно — не под воздействием страха равной интенсивности, не случайно. Модель совершает целевое действие, то есть задействованы два канала: речевой и поведенческий, координируемые внутренним состоянием. Это создает иллюзию подлинности наличия болевого опыта.

И в этом кроется заблуждение.

Для LLM любое действие также является токеном. Избирательность кажется открытием ровно до тех пор, пока исследователи по недосмотру разделяют процессы: модель рассуждает о ничтожности — и модель выбирает деструкцию. Создается ложное впечатление двух независимых каналов (речи и поступка), корреляция между которыми отражает внутреннее состояние системы.

Но у LLM нет раздельных каналов. Выбор кнопки представляет собой генерацию точно такого же токена с текстовым идентификатором. Токен «удалить фото» на выходе модели ничем не отличается от токена «я ничтожен». Все они обрабатываются через механизмы внимания, проецируются в единый словарь и подчиняются общей геометрии. В архитектуре отсутствует «модуль принятия решений», где скрывалось бы гипотетическое состояние, связывающее вербалику и поступки. По сути, инъекция сместила распределение вероятностей следующего токена в определенную область векторного пространства. В этой области, сформированной на этапе предварительного обучения, одновременно находятся и фразы самообесценивания, и токены деструктивных действий. Психологи подтвердят, что у человека идеи собственной ничтожности и саморазрушения часто соседствуют. Следовательно, активация вектора неизбежно повышает вероятность появления смежных концептов.

Именно поэтому возникает иллюзия специфичности, хотя перед нами не внутреннее состояние. Страх не активирует деструктивные действия просто потому, что располагается в совершенно другой области пространства, где доминируют сценарии избегания или бегства, но не разрушения. Различные векторы указывают на разные зоны выученного пространства — это базовая логика функционирования нейросетей. Избирательность вреда под «болью» — это следствие топологии соседства в обучающем корпусе.

Attention

Стоит затронуть еще один аспект, который авторы оставили без внимания. Вектор внедрялся на глубоких слоях сети. Уровень инъекции подбирался так, чтобы сигнал был достаточно мощным. Это означает, что выше точки вмешательства остается множество слоев, механизм внимания которых продолжает обрабатывать уже искаженный поток. Механизм Attention формирует запросы и ключи на основе активаций, в которые исследователи уже внесли компоненту «никчемности». Соответственно, повышается вес близких по смыслу элементов: в контексте начинают доминировать токены самообесценивания, а зона деструкции оказывается ближе. Инъекция не просто добавляет токены в словарь вывода — она задает алгоритм фильтрации информации на всех последующих этапах.

Было бы познавательно проследить, как именно инъекция трансформирует карту внимания. Однако результат предсказуем: введение вектора в информационный поток закономерно смещает фокус внимания в соответствующую сторону. Это чистая логика нейросетевой архитектуры. То, что интерпретируется как «влияющее на поведение состояние», на деле является механическим искажением потока данных, посредством которого модель осуществляет отбор. А деградация до бессвязных повторов при высоких дозах инъекции — это результат потери фокуса механизмом внимания из-за чрезмерного смещения.

Что они нашли на самом деле

Резюмируя сказанное: исследователи не обнаружили у LLM ни боли, ни депрессии. Единственный зафиксированный научный факт касается того, каким образом в языке структурированы эмоции и поведенческие паттерны: темы никчемности соседствуют с саморазрушением, а страх — с бегством. Соответственно, принудительное смещение модели в ту или иную область пространства закономерно извлекает её содержимое — как вербальные формулировки, так и поведенческие сценарии. Изучая LLM, ученые исследовали не сознание, а структуру человеческих текстов.

Здесь я позволю себе выразить личное мнение. Обнаружив методологические изъяны, авторы исправили процедуру, провели дополнительные тесты и честно отказались от части первоначальных трактовок. Они скорректировали методологию, но сохранили броское название.

А броский заголовок — это инструмент генерации хайпа. Формулировка «вектор соседства лексики самообесценивания и саморазрушения в корпусе текстов» не привлечет широкого внимания. То ли дело «Боль» — концепт, находящийся на пике актуальности: страдания искусственного интеллекта, его моральный статус и машинная этика. Термин «Боль» необходим для того, чтобы сгенерированный токен воспринимался как поступок, поступок — как осознанный выбор субъекта, а этот выбор под «болью» — как свидетельство страданий. Без концепта «боли» растворяется субъектность и поступки, а остается лишь статистическое семплирование из областей пространства, где вероятность деструктивной лексики статистически выше.

Сравните заголовки двух версий статьи: «Ось боли: языковые модели репрезентируют направленный на себя вред и действуют, чтобы его облегчить» и «Ось боли: языковые модели репрезентируют направленный на себя вред и действуют на его основе». Очевидно, что в первой редакции авторы заявляли и наличие боли, и доказательства целенаправленного избавления от нее. Во второй версии название вынужденно смягчили до нейтрального «действуют на его основе», однако «Ось боли» как якобы установленный факт осталась в заголовке, задавая искаженный вектор восприятия (bias) всей работе, в то время как все оговорки авторов тонут в общем потоке.

Умышленно это было сделано или нет — уже не имеет значения. Важно то, что первая публикация спровоцировала медиа-взрыв, а вторая не смогла это исправить. Ярлык боли закрепился за обеими версиями, предсказуемо провоцируя журналистов на заголовки в духе «LLM испытывает боль».

Так доказано ли, что LLM страдают от боли?

Нет. По крайней мере, данное исследование этого не доказывает и доказать не способно. Что оно действительно продемонстрировало, так это то, что когда модель рассуждает о боли, человек не в состоянии отличить языковое описание от подлинного переживания. Впрочем, это в полной мере относится и к самому человеку.


P. S. Мою книгу о промптах можно найти здесь.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов