Почему шестьдесят лет назад нейробиологи понимали мозг лучше, чем мы сегодня понимаем искусственный интеллект
Конец пятидесятых годов прошлого века, Гарвард, исследовательская лаборатория Дэвида Хьюбела и Торстена Визеля. Наркотизированной кошке проецируют на экран световые полосы, в то время как в зрительную зону коры погружен микроэлектрод, регистрирующий активность одиночного нейрона. Никаких вычислительных систем — исключительно аналоговый инструментарий. Тем не менее этот эксперимент заложил фундамент одного из величайших открытий в истории нейронауки: обнаружения корковых нейронов, избирательно настроенных на определенный угол ориентации стимула. Впоследствии авторы были удостоены за это достижение Нобелевской премии.
В 2026 году ситуация выглядит с точностью до наоборот. Мы способны извлечь любые весовые коэффициенты искусственной нейросети, проанализировать любые карты активаций и градиенты, однако истинные механизмы ее функционирования по-прежнему остаются черным ящиком. Объект изучения стал максимально прозрачным, но уровень нашего понимания парадоксально снизился.
Именно эта проблематика детально разбирается в свежем препринте «From Interpretability Methods to Interpretable Models». На протяжении пятнадцати лет сообщество специалистов по объяснимому искусственному интеллекту (Explainable AI, XAI) в сфере компьютерного зрения занималось по сути одним и тем же: совершенствовало методологию интерпретации, сопоставляло различные подходы, валидировало их достоверность и устойчивость к внешним атакам. Однако фундаментальный вопрос, лежащий на поверхности, задавали крайне редко: стала ли сама модель действительно прозрачнее для человеческого восприятия?

Инструментарий, который совершенствовался не в том направлении
За минувшие годы в области компьютерного зрения сформировались четыре ключевых направления.
Методы атрибуции (attribution) призваны выявить пиксели, оказавшие ключевое влияние на итоговое решение модели. Это наиболее зрелая и развитая категория подходов, включающая градиентные техники, методы на основе активаций и входных пертурбаций. При этом именно атрибуция подверглась наиболее жесткой критике. Ранние проверки на валидность продемонстрировали, что многие популярные алгоритмы работают не эффективнее примитивных детекторов границ и демонстрируют полную индифферентность к рандомизации весов или целевых меток. Дальнейшие изыскания выявили серьезные изъяны в их стабильности, устойчивости к деструктивным манипуляциям и самом определении корректного обоснования.
Визуализация признаков (feature visualization) решает иную задачу. Если атрибуция указывает на область фокусировки модели, то визуализация демонстрирует, что именно нейросеть там фиксирует. Подход либо отыскивает реальные изображения, максимизирующие отклик конкретного нейрона, либо синтезирует искусственные паттерны под заданную активацию.
Концепт-ориентированные методы (concept-based) оперируют понятными человеку абстракциями вместо разрозненных нейронов. Ранние решения вроде TCAV оперировали предопределенным словарем концептов, тогда как современные архитектуры, включая разреженные автокодировщики (SAE), извлекают смысловые категории непосредственно из латентных представлений модели без жестких априорных ограничений.
Схемные методы (circuit-based) подходят к проблеме иначе, препарируя внутреннюю вычислительную логику модели. Показательным примером является программа Circuits под руководством сооснователя Anthropic Криса Олы. Исследовательская группа поэтапно проследила, как в начальных слоях сети InceptionV1 функционируют детекторы кривизны. Изучая нейрон за нейроном и слой за слоем, ученые реконструировали картину первичного анализа визуальных данных. Позднее аналогичную методологию применили к мультимодальной нейросети CLIP от OpenAI, обнаружив мультимодальные нейроны, которые активируются как при демонстрации реального паука, так и при предъявлении текстового лексема «spider».
Выявление полисемантичных нейронов в InceptionV1, способных кодировать несколько принципиально несвязанных понятий, стало мощным стимулом для развития концепт-ориентированных подходов. Пределы применимости одного инструмента естественным образом породили потребность в создании следующего.
Дискуссии о реальной ценности этих инструментов не утихают по сей день. В марте 2025 года команда механистической интерпретируемости из DeepMind предприняла попытку протестировать SAE в боевых условиях. Вместо абстрактного поиска концептов исследователи сравнили автокодировщики с более простым базовым решением в прикладной задаче обнаружения вредоносных намерений в промптах языковых моделей. Для этого обучили два классификатора: стандартную линейную пробу поверх скрытых активаций и классификатор на базе признаков, выделенных с помощью SAE. Результаты оказались разочаровывающими для авторов метода: линейная проба продемонстрировала практически безупречную точность, уверенно справляясь даже с ранее не встречавшимися вариантами атак, в то время как SAE заметно проигрывал. В результате лаборатория объявила о снижении приоритета фундаментальных исследований в направлении SAE, поскольку технология не обеспечивала ожидаемого прироста эффективности.
Тем не менее группа ученых из Корнеллского университета и Калифорнийского университета в Беркли представила контртезис: выводы DeepMind справедливы исключительно для сценариев с априорно известными концептами (например, при поиске заранее определенных категорий угроз). Однако в задачах обнаружения латентных или еще не описанных концептов SAE обладают фундаментальным преимуществом, которое линейная проба концептуально предоставить не способна.
В итоге исследовательское сообщество продолжает ожесточенные споры об эффективности частных методов внутри одного класса, полностью игнорируя корневой вопрос: приближают ли эти технологии реального пользователя к пониманию логики работы моделей?
Несовершенство инструмента — не повод останавливать поиск
Аналогичные процессы происходили и на заре становления нейрофизиологии. Еще в конце 1950-х годов команда Джерома Леттвина внедрила микроэлектроды в зрительный нерв лягушки и зафиксировала клетки, действовавшие как специализированные детекторы добычи, реагирующие исключительно на движущиеся мелкие темные пятна.
К 1972 году исследовательской группе Чарльза Гросса удалось исследовать нижневисочную кору макак, где были обнаружены нейроны, откликающиеся на куда более сложные стимулы, в частности на очертания лапы. Согласно популярной научной легенде тех лет, один из таких нейронов сработал совершенно случайно, когда экспериментаторы взмахнули перед животным туалетным ершиком.
Инструментальная база эволюционировала: на смену примитивным стимулам пришел метод обратной коррекции, позволивший картировать рецептивные поля, а затем появились причинно-следственные методики вроде микростимуляции, открывшие возможность не просто пассивно регистрировать активность, но и целенаправленно вмешиваться в динамику нейронных ансамблей.
Тем не менее парадигма поочередного снятия сигналов с одиночных электродов долгое время навязывала ученым линейное представление о зрительном восприятии как о последовательном потоке данных. Лишь позже выяснилось, что кора функционирует за счет сложнейших рекуррентных связей, где сигналы из вышестоящих отделов модулируют активность даже в первичной зрительной зоне. Без учета обратной связи невозможно построить целостную картину вычислений, выполняемых мозгом. Разумеется, базовая модель прямой передачи сигналов не утратила актуальности — первичный скоростной анализ по-прежнему играет ключевую роль в зрении, — однако теперь эта картина стала значительно богаче. Несовершенство имеющихся инструментов никогда не служило основанием для сворачивания научных изысканий.
Почему текущий момент оптимален для прорыва
Несмотря на лавинообразный рост числа систем компьютерного зрения, их архитектурное разнообразие парадоксально сокращается. На смену бесчисленным вариациям сверточных сетей пришло ограниченное ядро базовых семейств: трансформеры изображений (Vision Transformer), контрастные модели вроде CLIP, архитектуры DINO v3, подходы с маскированием пикселей (masked image modeling), а также предиктивные системы мирового моделирования (world-model) на базе I-JEPA.
Это обстоятельство позволяет взглянуть на проблему под совершенно новым углом. Если раньше под каждую уникальную архитектуру требовалось изобретать собственный метод интерпретации, то теперь исследователи могут применять универсальный инструментарий для системного анализа того, как различные обучающие цели и датасеты формируют внутренние представления сетей.
Главная сложность заключается в сопоставимости моделей, поскольку каждая из них обладает собственным уникальным «внутренним языком» описания реальности. Ранее исследователи ограничивались подсчетом уникальных детекторов концептов или усреднением оценок интерпретируемости признаков, игнорируя глубокие структурные различия. Сегодня на передовую выходят средства прямого кросс-модельного сравнения — кросс-кодировщики и универсальные разреженные автокодировщики. Они формируют единое латентное пространство концептов для нескольких нейросетей одновременно, обеспечивая беспрецедентную точность сопоставления.
Тем не менее это снимает лишь технический пласт проблем, оставляя без ответа фундаментальный вопрос: стали ли модели прозрачнее для человеческого разума и продвинулись ли мы в этом направлении? Структурная корреляция между внутренними пространствами различных моделей вовсе не тождественна когнитивной понятности для человека.
Две разные проблемы, которые продолжают путать
В академических публикациях по XAI систематически смешиваются две совершенно разные задачи, которые необходимо четко разграничивать.
Что именно модель представляет и вычисляет. Это прерогатива структурного анализа. Мы можем взять две обученные нейросети, скормить им идентичные наборы данных и математически оценить степень сходства их внутренних представлений в автоматическом режиме, без привлечения людей, используя кросс-кодировщики и концепт-методы.
Понимает ли человек логику работы системы. Речь идет не о разработчиках архитектуры, а о независимых экспертах, от заключений которых зависит сертификация и практическое внедрение ИИ. Здесь не существует простых решений, и подобные нюансы невозможно зафиксировать с помощью графиков. Понятность модели для человека может быть доказана исключительно в ходе экспериментов с реальными пользователями.
В медицинской сфере эта дихотомия проявляется наиболее остро. В одном из недавних обзоров уязвимостей XAI приводится показательный пример из нейрорадиологии. Модель GPT-4 генерировала пространные, безупречно структурированные обоснования диагнозов, и клиницисты безоговорочно доверяли ее рекомендациям даже в тех случаях, когда они содержали фатальные ошибки. Искусственный интеллект уверенно навязывал нестандартные терапевтические протоколы, опираясь на псевдологические аргументы, и практически никогда не демонстрировал эпистемической скромности или сомнений в собственных выводах.
Данный феномен подтверждается и другими изысканиями: само наличие развернутого объяснения подсознательно воспринимается человеком как маркер высокой экспертности, даже если само объяснение абсолютно несостоятельно.
В результате врач, дезориентированный гладкими, но ложными формулировками нейросети, утрачивает способность к объективной и независимой оценке ситуации.
При этом уровень интерпретируемости никак не коррелирует с масштабом и вычислительной мощностью модели. Наращивание параметров не делает систему автоматически более понятной для человека — эти свойства лежат в совершенно разных плоскостях.
Ловушка автоматизации
Поскольку психофизические исследования человеческого восприятия требуют колоссальных временных и ресурсных затрат, возникает закономерный соблазн исключить человека из контура валидации, заменив его суррогатной моделью. Первую масштабную попытку реализовали именно так: метрика Machine Interpretability Score (оценка машинной интерпретируемости) автоматизирует классическую задачу принудительного выбора. Она анализирует, насколько последовательно обученная модель перцептивного сходства способна кластеризовать изображения, вызывающие максимальный отклик у конкретного нейрона.
Однако автоматический арбитр в данном случае сам является аппроксимацией человеческого восприятия. Подобная метрика изначально закладывает в фундамент именно те допущения, которые должна была беспристрастно проверить. В итоге интерпретируемость подменяется степенью согласия с алгоритмическими представлениями о том, что именно люди считают визуально похожим, — хотя целью исследования было как раз познание этой природы.
Мы наблюдаем ту же логическую ловушку, что и в примере с медицинскими диагнозами, только вывернутую наизнанку. Если там форма псевдообъяснения вводила в заблуждение человека, то здесь форма автоматизированного измерения подменяет собой искомый вопрос. Приоритет очевиден: сперва строгая психофизика обязана дать исчерпывающее определение понятию «человек понял модель», и лишь затем можно переходить к автоматизации измерений. Фиксация преждевременных метрик чревата оптимизацией ложных целевых функций.
Что ждет нас дальше?
В системной нейробиологии исследовательский объект долгое время оставался практически недосягаемым: мозг скрыт черепной коробкой, а микроэлектрод позволяет фиксировать активность лишь микроскопической горстки нейронов из многих миллиардов. Настоящая капля в океане. Десятилетиями ученые были вынуждены оперировать грубыми методами, однако это сформировало науку, которая кирпичик за кирпичиком выстраивает фундамент знаний.
Наша текущая ситуация выглядит зеркально: мы обладаем абсолютной, тотальной прозрачностью всех параметров искусственной нейросети. И тем не менее вопрос о том, понимаем ли мы созданные нами же модели, повис в воздухе. Исключительно потому, что подавляющее большинство исследователей предпочитают ходить по замкнутому кругу бенчмарков, бесконечно сопоставляя методы друг с другом, вместо того чтобы поставить этот фундаментальный вопрос напрямую.
Разрыв между экспертным подтверждением и подлинным независимым пониманием остается главным камнем преткновения для всей индустрии. Процедуры сертификации, жесткие требования регуляторов вроде EU AI Act, доверие конечных пользователей — всё это зиждется на наивной вере в то, что некий сторонний наблюдатель способен вскрыть архитектуру сети и разобраться в ее внутренних механизмах. До тех пор пока это предположение не будет верифицировано в ходе строгих психофизических экспериментов, интерпретируемость останется предметом слепой веры, а не строго измеренной характеристикой.
Сталкивались ли вы в своей инженерной практике с ситуациями, когда убедительное объяснение модели — будь то карта атрибуции, вектор концепта или любой другой артефакт — заставляло эксперта поверить в логику системы, но при этом рассыпалось при элементарной независимой проверке?
Психологическая безопасность на работе: как научить сотрудников открыто говорить об ошибках
Правда о нанотехнологиях: ждать ли костюм Железного человека?
Марсианские хроники «Кьюриосити»: 10 завораживающих снимков за 5000 дней работы на Красной планете
Что мешает летящему телу превратиться в черную дыру?
Ученые выяснили, что человеческий мозг состоит из двух отдельных органов
Глубокий разбор матричной структуры буквицы 7х7