Тестирование «экзотических алгебр» в нейросетях: итоги 35 контролируемых экспериментов

Прокомментировать Просмотры: 4

Вещественные аналоги против гиперкомплексных на всем наборе задач

TL;DR. Слои на базе кватернионов, октонионов, седенионов и алгебр Клиффорда регулярно мелькают в публикациях под соусом «высокой эффективности параметров» и «уникальной выразительной силы». Мы потратили два месяца на их реализацию, бенчмаркинг и упорные попытки доказать их превосходство. Стоило добавить хотя бы один корректно подобранный вещественный baseline (реальный базис сравнения), как мнимое преимущество тут же испарялось — и так все 35 раз. По ходу дела мы опровергли собственный главный результат, выявили единственное подлинное исключение (научно обосновав его при этом), вывели ряд жестких математических ограничений с точными константами и свели все к элементарному правилу в одну строчку, способному сэкономить ревьюеру массу времени. Препринт: doi:10.5281/zenodo.21623615, код и сырые метрики по каждому сиду: github.com/mxkuzn/hypercomplex-placebo-audit.

Почему в это так легко поверить

Конструкция Кэли–Диксона поистине изящна. Начинаем с вещественных чисел. Удваиваем размерность получаем комплексные. Повторяем процедуру: кватернионы — умножение теряет коммутативность, зато мы получаем бесплатные трехмерные повороты. Еще шаг: октонионы — умножение перестает быть ассоциативным, что на первый взгляд выглядит дефектом, но таит глубокий математический смысл. И наконец, седенионы, где обнаруживаются делители нуля — ненулевые элементы, произведение которых дает ноль.

Каждый новый уровень кажется созданным специально для задач машинного обучения. Умножение с сохранением нормы? Идеальный инструмент для стабилизации рекуррентных сетей. Некоммутативность? Встроенная чувствительность к порядку следования. Делители нуля? Готовый примитив «взаимного исключения», словно созданный для моделирования логических противоречий.

Научная литература охотно подхватывает тренд: кватернионные свёрточные сети, октонионные эмбеддинги графов знаний, параметризованное гиперкомплексное умножение (PHM), гиперкомплексные адаптеры для LLM — поток статей об успехах не иссякает, обычно рапортуя о «прежней точности при сокращении параметров в $n$ раз».

Мы тоже поддались этому искушению. Проект включал десятки экспериментов по созданию модулей рассуждений на базе подобных алгебр. Первые успехи воодушевляли. В частности, гипотеза «октонионные пространства состояний доминируют в трекинге неабелевых групп» долгое время оставалась нашим главным козырем.

Контроль, о котором все забыли

Неудобный вопрос, который авторы гиперкомплексных исследований почти никогда не ставят: с чем именно корректно сравнивать?

Типичным бенчмарком выступает полносвязная сеть либо диагональная рекуррентная архитектура. Однако гиперкомплексный слой — это не просто «еще одна сеть», а компактная, структурированная билинейная операция недиагонального типа. Сравнивая его с бесструктурными аналогами, невозможно отделить вклад экзотической математики от банального эффекта жесткой структуры.

Мы внедрили четыре строгих контрольных теста, каждый из которых полностью выравнен по числу параметров:

Контроль

Что именно изолирует

Вещественное вращение (композиция отражений Хаусхолдера)

некоммутативность или просто честный геометрический поворот?

Переставленный структурный тензор (рандомизированная таблица умножения)

специфика конкретной алгебры или любая компактная билинейность?

Вещественные HRR (циклическая свёртка из методов 1995 года)

абстрактная алгебра или элементарный биндинг?

Вещественная ортогональность ($\text{dot}(x,y)=0$)

делители нуля или стандартный примитив взаимоисключения?

Затем мы прогнали через них весь стек задач: ассоциативную память, отслеживание групп, хоролы Баха, управление дроном (liquid-контроль), поиск противоречий, различные вариации attention и автоэнкодеры. Тесты проводились на 3–5 сидах с жесткими критериями остановки (pre-registered kill-criteria).

Итог по изначальным восьми задачам оказался безапелляционным: включение всего лишь первого контрольного теста аннулировало заявленное превосходство во всех 8 случаях из 8.

Наш собственный флагманский результат рухнул точно так же. Октонионная модель, лидировавшая на неабелевых группах, изначально сопоставлялась лишь с диагональной SSM. В схватке с равнопараметризованным вещественным вращением она проиграла вчистую с разгромным счетом — 0.38 против 1.00 на группе диэдра $D_4$. Октонионы демонстрировали успех лишь на группах, тривиально вложимых в кватернионы ($Q_8$, $\mathbb{Z}_8$). Здесь побеждает не алгебраическая магия, а банальное совпадение структур.

Ожидания, которые не оправдались

Быть может, нашим задачам просто не требовалась неассоциативность? Хорошо. Мы намеренно создали максимально неассоциативный объект из возможных: ассоциатор $[a,b,c] = (ab)c — a(bc)$, заимствованный из исключительной йордановой алгебры и тождественно равный нулю для любых ассоциативных структур. Если октонионы где-то и незаменимы, то именно здесь.

Однако параметрически сбалансированная вещественная билинейная сеть справилась с задачей ничуть не хуже октонионной (косинус угла составил 0.991 против 1.000). Отсюда вытекает самый универсальный вывод всего исследования:

Неассоциативность в генераторе данных вовсе не требует аналогичной неассоциативности в обучаемом пространстве представлений. Любое фиксированное умножение в алгебре представляет собой статический вещественный билинейный тензор, который легко поглощается стандартным универсальным аппроксиматором на вещественных числах.

Создать принципиально более мощную алгебру невозможно: теоремы Гурвица и Фробениуса строго доказывают, что нормированные алгебры с делением существуют лишь в размерностях 1, 2, 4 и 8. При этом каждая новая ступень лестницы неизменно чем-то жертвовает (порядком, коммутативностью, ассоциативностью или делением). Идея получить «все и сразу» категорически запрещена фундаментальными классификационными теоремами XIX века.

Единственное исключение: чем оно объясняется

к

Один из результатов действительно нас ошеломил. В задаче отслеживания состояний на бинарно-тетраэдральной группе кватернионная рекуррентная сеть, обученная на последовательностях длиной не более 12, успешно экстраполировала закономерности на длину 1024:

Конфигурация модели

Точность (Accuracy) при $L=1024$ (5 сидов)

Кватернион $\mathbb{H}$

0.992

Октонион $\mathbb{O}$

0.623 (бимодальное распределение: 3 из 5 идеально, 2 из 5 — коллапс)

Cayley $\text{SO}(8)$, свободная

0.206

Householder-2

0.061

Cayley $\text{SO}(4)$, жесткая

0.055

Householder-4

0.050

При этом жесткие контроли (tight controls) проваливались еще на обучающей выборке, демонстрируя не проблему экстраполяции, а банальную необучаемость. Неужели это скрытая репрезентативная магия? Отнюдь: группа $\text{SO}(4)$ математически доказуемо включает в себя точное кватернионное решение, и отдельные вещественные запуски (сиды) его периодически нащупывали. Вся суть кроется в свойствах оптимизационного бассейна (optimization basin): его «сложно отыскать, но легко зафиксировать». О преимуществе в выразительной силе здесь речи не идет.

Далее мы сопоставили этот подход с передовыми архитектурами для длинных последовательностей — в частности, с LRU (диагональной комплексной рекуррентностью). Заранее оговоренный критерий звучал так: «$\mathbb{H}$ обязана превосходить LRU при эквивалентном числе параметров, причем отрыв должен увеличиваться с ростом лага». Оба условия с треском провалились: LRU побеждает при вдвое меньшем объеме параметров (метрика exact-match составляет 0.834 против 0.140 на лаге 192), а сам разрыв динамично растет совсем в другую сторону.

Превосходство LRU при сокращении параметров вдвое
Модели LRU побеждают, используя в два раза меньше параметров

От констатации отставания к доказательству невозможности

В заключительной трети работы мы сместили фокус с вопроса «выигрывает ли алгебра?» на принципиальный вопрос — способна ли она в принципе выиграть? Полученные ответы подкреплены точными математическими константами, а не абстрактными рассуждениями:

  • Отражения недоступны. В любой алгебре Кэли–Диксона операция умножения на элемент с единичной нормой обладает детерминантом $\det > 0$. Если группа симметрий исследуемой задачи включает отражения (как, например, группа транспозиций и инверсий в музыкальных структурах), она гарантированно не укладывается в рамки умножения данной алгебры. Увеличение размерности здесь бессильно.

  • Делители нуля непригодны для тройного исключения (3-way exclusion). Невозможно найти три взаимно аннигилирующих единичных седениона: лучший предел для наихудшей пары из трех элементов составляет ровно 0.500, а для четырех — $1/\sqrt{3}$. В то же время стандартная ортогональность обеспечивает 16-кратное взаимоисключение (16-way exclusion) в тех же 16 измерениях, не требуя никаких дополнительных параметров. Экзотический примитив оказывается существенно слабее тривиального аналога, который он призван заменить.

  • Неассоциативность блокирует параллельное сканирование (parallel scan). Современные архитектуры для длинных последовательностей черпают логарифмическую глубину из префиксных сканов, требующих свойства ассоциативности. Для октонионов ($\mathbb{O}$) и седенионов ($\mathbb{S}$) сканирование не просто «приближает» ответ, оно вычисляет совершенно другую функцию (зафиксированное отклонение составляет 130–143% против пренебрежимых $\sim 10^{-16}$ у комплексно-кватернионных аналогов).

  • Попытки тензорного объединения не дают выигрыша. Тензорные произведения этих алгебр тривиально редуцируются к стандартным матричным алгебрам — мы экспериментально подтвердили изоморфизм $\mathbb{H} \otimes \mathbb{H} \cong M_4(\mathbb{R})$ с нулевой ошибкой гомоморфизма. Иными словами, все сводится к операциям, которые графические ускорители и так выполняют на аппаратном уровне.

Что в итоге устояло под проверкой

Выжили ровно две вещи, и ни одна из них не относится к числу экзотических алгебр.

Методология. Главный урок исследования можно сформулировать так: любая научная работа, посвященная структурированным слоям, в которой отсутствуют вещественные параметрически выровненные контроли (param-matched real structured controls) и тесты со случайными перестановками структур (shuffled-structure controls), изначально ничего не доказывает. Предложенный нами контрольный чек-лист состоит всего из пяти пунктов, и его применение предотвратило бы каждый ложноположительный результат, за которым мы гонялись — включая наши собственные заблуждения.

Точность вычислений (exactness). Единственным компонентом, стабильно выдававшим абсолютную точность (1.000 accuracy) без единой галлюцинации на любой длине последовательностей, оказалась скомпилированная точная таблица. Не обученная нейросеть, не аппроксимация. На реальном датасете bAbI точный символьный интерфейс (front-end) обошел обученный эндо-to-энд монолит на +0.5 по точности, тогда как все варианты векторной символьной архитектуры (VSA) — будь то гиперкомплексные или вещественные — застряли на отметке около 0.51. Каким бы ни было будущее нейросимвольных подходов, наши данные однозначны: реальное преимущество кроется в точных вычислениях, а не в экзотической арифметике.

Зачем публиковать отрицательные результаты

Потому что мы отчаянно нуждались в подобной статье, когда сами начинали этот путь. Два месяца машинного времени на GPU, порядка 35 контрольных экспериментов и несколько «триумфов», испарившихся при первом же честном сравнении — всего этого можно было избежать, имей мы под рукой подобный текст. (К слову, научное сообщество движется в том же направлении: независимое исследование слоев Клиффорда, вышедшее в июле, пришло к абсолютно тем же выводам аналогичным методом.)

Мы вели нелицеприятную хронику собственных ошибок: в финальной версии статьи присутствует отдельный раздел со всеми самоопровержениями, которые зафиксировали наши же контрольные тесты. Сюда вошел даже неприятный факт, обнаруженный на этапе финальной вычитки рукописи — седенионная метрика, тихо выпавшая из итоговой таблицы, потому что она нарушала «красивую» картину. Мы вернули ее на место, сделав наш вывод более честным и взвешенным.

Если вы занимаетесь структурированными архитектурами и уверены, что мы допустили где-то просчет — весь наш аудит полностью воспроизводим: каждая цифра в каждой таблице генерируется закоммиченными скриптами, подкрепленными JSON-файлами по каждому сиду. Открывайте Issues в репозитории — именно для открытой научной дискуссии мы это и обнародовали.

Препринт: doi.org/10.5281/zenodo.21623615 · Код и данные: github.com/mxkuzn/hypercomplex-placebo-audit.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов