Новый взгляд на градиентный спуск через призму фундаментальной математики
Внутреннее устройство глубоких нейросетей исследовано вдоль и поперёк: детально описаны механизмы прямого и обратного распространения ошибки, а также алгоритмы градиентного спуска. Тем не менее на концептуальном уровне большинство моделей до сих пор воспринимаются как «чёрные ящики». В них непрерывно оптимизируются миллионы параметров и вычисляются колоссальные композиции функций, а за счёт параллельных вычислений результат формируется быстрее, чем удаётся осознать всю сложность и изящество системы. Попытки строго описать и систематизировать эти процессы не прекращаются, и фундаментальная математика остаётся ключевым инструментом для глубокого анализа механизмов искусственного интеллекта.
В публикации исследователей из MIT CSAIL «Modular Duality in Deep Learning» предложена методология формализации различных модулей нейросетей (полносвязных, эмбеддингов и др.). Ниже представлен структурированный обзор ключевых идей этой работы.
Начнём с базовых принципов: градиентный спуск служит универсальным инструментом минимизации функции потерь. Практика обновления весовых коэффициентов общеизвестна, однако авторы статьи задаются нетривиальным вопросом: корректна ли эта процедура с точки зрения строгой математики? Если взглянуть на дифференциальную геометрию и функциональный анализ, параметры модели принадлежат исходному векторному пространству, тогда как градиент обитает в сопряжённом пространстве, выступая ковектором (линейным функционалом). Следовательно, прямое вычитание градиента из весов некорректно без предварительного применения дуального отображения, согласующего пространства. Зачем нужна подобная строгость, если оптимизаторы и так справляются со своей задачей? Дело в том, что ландшафт функции потерь обладает неоднородной кривизной по разным направлениям, чего стандартный градиент не учитывает. Сами исследователи с иронией отмечают:
This restriction may seem absurd! After all, here the weight space
and its dual
are both just
. However, insisting upon this type check serves to remind us that the curvature of the loss function may be highly heterogeneous.
Тем самым подчёркивается: подобный формализм — не избыточная педантичность, а необходимый шаг для учёта скрытой геометрии функции потерь.
Для устранения данного несоответствия дуальное отображение относительно заданной нормы в векторном пространстве определяется следующим образом:
В случае евклидова пространства это выражается через неравенство Коши — Буняковского — Шварца:
Равенство достигается тогда и только тогда, когда ,
. Принимая во внимание ограничение на норму вектора
, получаем:
Таким путём авторы приходят к концепции модульной нормы. Однако сперва дадим строгое определение модуля:
Definition 4 (Module). Given input vector space
, output vector space
and weight vector space
, a module
is an object with the following four attributes:
(a) a function,
, which maps an input and a weight vector to an output;
(b) a number,
, which is used to set the proportion of feature learning that this module contributes to any supermodule;
(c) a number,
, which estimates the module’s sensitivity to input perturbations;
(d) a norm over the weight space,
, sometimes abbreviated to just
Если семантика пункта (a) привычна (стандартный прямой проход через слой), то остальные требуют пояснения. Параметр определяет вклад модуля в общее представление и задаёт долю обучения признаков внутри объемлющей архитектуры. Величина
характеризует чувствительность выхода к малым возмущениям входного сигнала. Наконец, норма
оценивает сложность и эффективный масштаб весовых коэффициентов, позволяя контролировать ёмкость модуля и его обобщающую способность.
В особую категорию авторы выделяют «правильно нормированные» модули (Well-normed modules), у которых отображение удовлетворяет условию Липшица с константой 1 по входам и с константой
по весам. Данное свойство предотвращает взрыв активаций при градиентном шаге и гарантирует робастность архитектуры к зашумлению и состязательным атакам (adversarial attacks). Для описанных модулей формализуются операции композиции (последовательное соединение) и конкатенации (параллельное соединение) с соответствующим пересчётом параметров.
Рассмотрим применение этой теории на базовом линейном модуле.
The Linear module sends inputs from
to outputs in
. The weight space is given by the matrix space
. We endow the Linear module with attributes:
, the matrix-vector product;
;
, where
is a hyperparameter;
, the
induced operator norm.
, where the gradient
has
reduced SVD
Разберём ключевые аспекты: прямой проход тривиален; единичная чувствительность следует из 1-липшицевости по входу; масса выступает гиперпараметром, регулирующим темп обучения. Выбор операторной нормы гарантирует согласованную нормированность (well-normedness): пока входы и веса ограничены единичными шарами, выходы также строго ограничены единицей. Вместо стандартного градиентного шага (как в классических SGD или Adam) авторы заменяют градиентную матрицу
на её полярную проекцию
, обнуляя разброс сингулярных чисел до единицы (полуортогонализация). Такое преобразование
математически эквивалентно логике матричного оптимизатора Shampoo. Коэффициент
в точности совпадает со спектральным масштабированием из теории
(Maximal Update Parametrization), что даёт возможность свободно варьировать ширину сети без повторного подбора гиперпараметров оптимизации.
Авторы уделили внимание и вычислительной эффективности: прямое SVD-разложение матриц градиентов накладно, поэтому для его аппроксимации используется итерационный метод Ньютона — Шульца для прямоугольных матриц (Rectangular Newton-Schulz Iteration):
-
Положим
-
Обновим:
где при последовательность
сходится к
, что наглядно иллюстрирует приведённый ниже график:

В заключение авторы выделяют перспективные направления исследований:
-
создание строгой типизации пространств активаций с учётом их целевых норм и масштабов;
-
ускоренное обучение нейросетей (включая рекордные результаты оптимизации NanoGPT);
-
формирование целостной математической теории глубокого обучения;
-
согласование активаций и градиентных обновлений (анализ взаимной корреляции шага весов и входящих сигналов).
Предложенные направления чрезвычайно актуальны: строгая типизация и фундаментальный базис позволят устранить эвристическую неопределённость в дизайне моделей, оптимизация ускорит адаптацию на потоках свежих данных, а контроль выравнивания активаций усилит устойчивость к вредоносным воздействиям и шумам.
Статья MIT CSAIL представляет собой последовательную попытку структурировать методы оптимизации глубоких сетей языком строгой математики. Она наглядно иллюстрирует, как классические инструменты линейной алгебры и геометрии векторных пространств способны стать прочным фундаментом для создания более эффективных и предсказуемых систем искусственного интеллекта.
Европа погрузилась в цифровую тьму
Почему реки подчиняются законам математики?
Трижды искусственный интеллект
Первопроходец авиации: история создания легендарного парового самолета Можайского
4 технологии на стыке с психологией: когда мозг становится интерфейсом, а человек — моделью
ИИ расшифровал весь архив Циолковского: 51 008 листов рукописей и проверка точности без эталона
Чем можно заполнить адамантановые клетки