Ученые из Гарварда объяснили, почему бесконечное масштабирование нейросетей не делает их умнее

Ученые из Гарварда объяснили, почему бесконечное масштабирование нейросетей не делает их умнее

Прокомментировать Просмотры: 24

Группа физиков-теоретиков из Гарвардского университета представила исследование, проливающее свет на математическую природу успеха современных нейросетевых архитектур. Авторы доказали, что прогресс ИИ подчиняется строгим физическим закономерностям, а не является результатом случайных достижений. Процесс обучения нейросетей зачастую иронично называют «цифровой алхимией», так как инженеры, увеличивая объемы данных, получают более мощные модели, но не до конца осознают фундаментальные причины этого роста. Данная работа переводит машинное обучение из области эмпирических догадок в плоскость точных физических наук, демонстрируя, что нейросети подчиняются принципам, схожим с поведением сложных физических систем.

Ученые убедительно показали, что впечатляющая эффективность ИИ при масштабировании параметров и данных обусловлена фундаментальными законами статистической механики. Применив аппарат теории случайных матриц, исследователи вывели аналитические формулы, объясняющие «законы масштабирования» (scaling laws) — те самые математические правила, которые позволяют разработчикам предсказывать производительность будущих моделей еще до этапа их тренировки.

Ключевым инструментом исследования стала концепция перенормировки, позаимствованная из квантовой теории поля. Физики обнаружили, что статистический шум в обучающих данных ведет себя подобно квантовым флуктуациям, эффективно «перенормируя» параметры системы. В контексте гребневой регрессии, выбранной в качестве базовой модели, этот эффект проявляется в возникновении неявной регуляризации. Даже при отсутствии прямых ограничений, «шум» данных обеспечивает стабильность модели в условиях перепараметризации, когда количество весов значительно превосходит число обучающих примеров.

Для упрощения вычислений авторы использовали «математический чит-код» — S-преобразование из свободной теории вероятностей. Этот инструмент позволил заменить громоздкие расчеты, требовавшие ранее применения метода реплик, на элегантные алгебраические уравнения. Благодаря S-преобразованию удалось точно соотнести ошибку на этапе обучения с ошибкой на тестовой выборке (train-test gap), что дает возможность оценивать эффективность нейросети без проведения трудоемких проверок на колоссальных массивах данных.

Работа дает четкое понимание факторов, определяющих скорость обучения ИИ. Выяснилось, что показатели степени в законах масштабирования зависят от структуры данных, их емкости и сложности задачи. Физики выделили четыре режима функционирования нейросетей — от доминирования полезного сигнала до ограничения шумом. Это позволяет инженерам точно рассчитывать необходимые вычислительные ресурсы и объемы данных для достижения целевого уровня «интеллекта», превращая разработку ИИ в предсказуемый инженерный процесс.

В индустрии сложилось убеждение, что увеличение размеров сети всегда ведет к успеху. Однако авторы доказали, что существует критический порог, за которым дальнейшее расширение теряет смысл из-за доминирования случайности параметров. Это служит важным сигналом для отрасли: бесконечное «раздувание» моделей не является панацеей. Иллюстрация: Nano Banana

Одним из значимых практических открытий стал «барьер инициализации» или режим ограничения дисперсией. Математически доказано, что бесконечное увеличение ширины нейросети не всегда способствует прогрессу. При определенных условиях случайность начальных параметров начинает подавлять полезный сигнал. В таких сценариях дальнейшее наращивание архитектуры бессмысленно — для повышения точности требуются альтернативные методы, такие как ансамблирование нескольких моделей.

Исследование также объясняет феномен «двойного спуска» (double descent), при котором рост сложности модели не всегда ведет к переобучению, а напротив, может повысить обобщающую способность после кратковременного спада. Гарвардские ученые доказали, что этот эффект является закономерной физической сингулярностью. По мере увеличения объема данных «эффективный параметр» модели плавно адаптируется, позволяя системе находить всё более точные и лаконичные решения.

Авторы подчеркивают универсальность своей теории, применимой как к простым регрессионным моделям, так и к сложным многослойным архитектурам. Фактически, создана «карта производительности», указывающая на «узкие места», ограничивающие эволюцию искусственного интеллекта.

Теоретический фундамент, заложенный гарвардской группой, открывает новую главу в развитии машинного обучения. Смещение акцента с эмпирического перебора вариантов на интеллектуальное проектирование архитектур — единственный путь к созданию высокоэффективных систем в эпоху, когда расходы на обучение моделей исчисляются миллиардами. Работа подтверждает: чтобы сделать ИИ совершеннее, требуется не просто больше данных, а глубокое понимание физических законов их обработки.

 

Источник: iXBT

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов