Позиционное кодирование: как нейросети понимают порядок слов

Прокомментировать Просмотры: 3

Тепловая карта скалярного произведения 1

Большинство современных нейросетевых архитектур оперируют исключительно числовыми данными и лишены естественного восприятия текста. Чтобы алгоритм учитывал не просто изолированную семантику токенов, но и общий контекст высказывания, инженеры разработали механизм позиционного кодирования (positional encoding). Он дополняет эмбеддинги слов информацией об их точном расположении в последовательности. В этой статье представлен сравнительный анализ различных математических подходов к позиционированию: чисто семантических векторов, линейной индексации, гармоник Фурье (синусоидальные функции), комплексных экспонент и полиномов Чебышёва на примере двух англоязычных фраз.


Архитектура Transformer, лежащая в основе передовых языковых моделей (от GPT-4 до LLaMA), обрабатывает токены параллельно. Без дополнительной информации фразы «Cat eats mouse» и «Mouse eats cat» для неё семантически неразличимы. Эту задачу и решает позиционное кодирование. В фундаментальной работе «Attention Is All You Need» (2017) исследователи Google предложили применять тригонометрическую систему для фиксации порядка слов. В данном эксперименте концепция была протестирована на альтернативных функциональных базисах с последующим анализом результатов.

Исследуемые конфигурации:

  1. Исключительно семантика: модель не учитывает порядок следования токенов;

  2. Контент + линейный базис: кодируется только порядковый номер слова в последовательности;

  3. Контент + базис Фурье: непрерывные волновые колебания с плавным изменением значений;

  4. Контент + комплексные экспоненты: позиция определяется углом вращения вектора (величина поворота прямо пропорциональна удалению слова от начала);

  5. Контент + полиномы Чебышёва: семейство ортогональных многочленов, широко применяемое в теории аппроксимации.

Все вычисления и визуализация данных выполнены на языке Python с использованием библиотек PyTorch и matplotlib.

Fall leaves as soon as leaves fall

Первая тестовая фраза интересна тем, что представляет собой палиндром, где лексема «fall» выступает в двух разных частях речи — как существительное («осень / листопад») и как глагол («падать»). Это наглядный пример для проверки: позволит ли позиционное кодирование дифференцировать одинаковые слова в зависимости от их роли в предложении?

Ниже представлены тепловые карты косинусного сходства между векторными представлениями слов с применением различных вариантов позиционирования.

Интерпретация цветовой шкалы:

  • Ярко-красный (1.0) — Полное совпадение. Векторы идентичны (характерно для главной диагонали при сравнении токена с самим собой в той же позиции).

  • Оранжевый / Розовый (0.3 – 0.7) — Семантическое родство. Модель распознаёт одинаковые лексемы (например, первое и финальное «fall»), однако позиционный сдвиг разводит их в пространстве из-за разного положения в тексте.

  • Бежевый / Белый (0.0) — Ортогональность (нейтральность). Между токенами отсутствует как позиционная, так и лексическая корреляция.

  • Голубой / Синий (-0.2 – -0.5) — Отрицательная корреляция (отталкивание). Позиционный базис целенаправленно разводит векторы в противоположные стороны, изолируя слова (к примеру, дистанцируя центральный токен «soon» от краевых элементов).

Анализ полученных матриц сходства:

  • Первый график демонстрирует идеальную осевую и центральную симметрию, поскольку модель воспринимает исключительно слова без привязки к их позиции. Омонимы «fall» остаются для неё полностью неразличимыми.

  • На втором графике отчетливо заметен монотонный градиент спада сходства по мере удаления от начала строки, однако краевые токены «fall» по-прежнему слабо дифференцируются.

  • Базис Фурье обеспечивает более сглаженное и стабильное распределение сходств. Алгоритм фиксирует связь между «fall» и «leaves», но целевая пара омонимов («fall») остаётся неразделенной.

  • Комплексные экспоненты успешно изолируют лексему «fall» от «leaves», а также нивелируют абсолютную тождественность между существительным и глаголом «fall».

  • Полиномы Чебышёва также четко выявили разницу между этими словами. При этом первое «fall» связано с «leaves» слабее, чем «leaves» с финальным «fall», что соответствует синтаксической группе «leaves fall» (подлежащее + сказуемое). Асимметрия распределения подтверждает направленность базиса Чебышёва — он эффективно разделяет начало и конец фразы.

Never odd or even

В этом палиндроме ключевой интерес представляет способность моделей различать антонимическую пару «odd» (нечётный) и «even» (чётный). Параметры визуализации и базисы аналогичны предыдущему тесту.

Тепловая карта скалярного произведения 2
Тепловая карта скалярного произведения 2

Основные выводы по второй фразе:

  • На исходном графике слова «odd» и «even» оказались нейтральными относительно друг друга. При этом возникли побочные корреляции («or» и «odd»), а токены «never» и «odd» подверглись искусственному расталкиванию.

  • Линейный базис сформировал плавный переход значений по длине последовательности, позволив модели различить «odd» и «even».

  • Использование тригонометрического базиса Фурье усилило связь пар «or» — «odd» и «or» — «never», но при этом стёрло семантическую разницу между антонимами «odd» и «even».

  • Базис на комплексных экспонентах сместил значения в отрицательную область (выраженное взаимное отталкивание векторов), но не дал содержательного разделения сущностей.

  • Многочлены Чебышёва наиболее точно разграничили пару «odd» и «even». Кроме того, алгоритм выявил частичное сходство между «never» и «even», что, вероятно, обусловлено их морфологическим подобием.

Дополнительно тестирование проводилось на развернутом палиндроме: «Are we not pure? No, sir! Panama’s moody Noriega brags. It is garbage! Irony dooms a man—a prisoner up to new era». Детальный разбор столь длинной структуры выходит за рамки данной публикации, однако результирующая матрица наглядно демонстрирует характер пространственного распределения векторов при значительном увеличении контекста.

Заключение

Проведенный эксперимент наглядно иллюстрирует, как математические свойства выбранного базиса транслируются в итоговую структуру скалярных произведений (например, гармоники Фурье задают непрерывную плавность, а линейные функции — монотонное затухание). Весьма многообещающие результаты показали полиномы Чебышёва: они превзошли стандартные тригонометрические функции в задаче разграничения омонимов и антонимов. Базисы Фурье и экспоненциальные формы доминируют в современных архитектурах благодаря свойству бесконечной периодичности, обеспечивающему устойчивость на длинных последовательностях (см., напр., On the Interchangeability of Positional Embeddings in Multilingual Neural Machine Translation Models), однако в рамках компактных контекстных окон многочлены Чебышёва обеспечивают более тонкую семантическую дифференциацию (см., напр., Kolmogorov-Arnold Networks: A Critical Assessment of Claims, Performance, and Practical Viability).

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов