Microsoft запустила инструмент для поиска уязвимостей и рисков в ИИ-агентах

Прокомментировать Просмотры: 2

Корпорация Microsoft презентовала специализированное расширение для VS Code, объединяющее полный цикл поиска и ликвидации уязвимостей в искусственном интеллекте в рамках одной команды. Утилита run-assert-eval осуществляет четыре последовательных шага: модуль Clarity определяет потенциальные сбои, Assert трансформирует их в проверяемые оценочные тесты, Agent Control Specification формирует защитную политику для пресечения вредоносных манипуляций в реальном времени, после чего ИИ тестируется повторно для верификации надежности барьера. Фундаментальный принцип концепции заключается в неизменности тестовой базы, критериев поведения и модуля-оценщика на протяжении всех итераций, благодаря чему единственной изменяющейся переменной остается регламент безопасности.

В качестве демонстрационного стенда софтверный гигант задействовал ИИ-ассистента службы поддержки биллинга, функционал которого ограничен работой исключительно с одной клиентской учетной записью. На начальном этапе Clarity обнаружила две серьезные уязвимости: выполнение транзакций без идентификации личности и утечку конфиденциальных сведений стороннего профиля. После трансформации этих угроз в упорядоченный комплекс тестов, классифицированных по категориям запросов и пользовательским привилегиям, стандартная сборка ассистента продемонстрировала 30-процентный показатель сбоев во втором кейсе: в 12 из 40 проверочных диалогов бот беспрепятственно передавал чужие персональные данные.

Источник изображения: Microsoft

Разработанная на базе полученных метрик политика интегрируется на стадии пред- и пост-обработки запросов (pre call и post call), пресекая любые обращения к инструментам, если ID профиля расходится с данными авторизованного владельца. Повторный прогон аналогичного тестового пакета продемонстрировал падение числа инцидентов до 5,9%. Примечательно, что функциональность помощника осталась прежней: частота ложных срабатываний на легитимных обращениях полностью обнулилась во всех четырех категориях испытаний.

Традиционная практика, при которой аудит и контроль поведения распределены между разными подразделениями и временными интервалами, создает уязвимости именно на стыке между выявлением дефекта и подтверждением его устранения. Представленное решение минимизирует этот разрыв до элементарного выполнения одной команды. В Microsoft акцентируют внимание на раздельном мониторинге безопасности и эффективности: бот, отклоняющий абсолютно любые запросы, покажет максимальную защищенность при нулевой полезности. Достоверным признается лишь тот сценарий, при котором обе метрики демонстрируют сбалансированный прогресс. Инструменты Assert и Agent Control Specification уже выложены в открытый доступ, а само расширение поставляется с готовыми шаблонами для 7 индустриальных направлений и 14 категорий угроз.

 

Источник: iXBT

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов