Microsoft запустила инструмент для поиска уязвимостей и рисков в ИИ-агентах
Корпорация Microsoft презентовала специализированное расширение для VS Code, объединяющее полный цикл поиска и ликвидации уязвимостей в искусственном интеллекте в рамках одной команды. Утилита run-assert-eval осуществляет четыре последовательных шага: модуль Clarity определяет потенциальные сбои, Assert трансформирует их в проверяемые оценочные тесты, Agent Control Specification формирует защитную политику для пресечения вредоносных манипуляций в реальном времени, после чего ИИ тестируется повторно для верификации надежности барьера. Фундаментальный принцип концепции заключается в неизменности тестовой базы, критериев поведения и модуля-оценщика на протяжении всех итераций, благодаря чему единственной изменяющейся переменной остается регламент безопасности.
В качестве демонстрационного стенда софтверный гигант задействовал ИИ-ассистента службы поддержки биллинга, функционал которого ограничен работой исключительно с одной клиентской учетной записью. На начальном этапе Clarity обнаружила две серьезные уязвимости: выполнение транзакций без идентификации личности и утечку конфиденциальных сведений стороннего профиля. После трансформации этих угроз в упорядоченный комплекс тестов, классифицированных по категориям запросов и пользовательским привилегиям, стандартная сборка ассистента продемонстрировала 30-процентный показатель сбоев во втором кейсе: в 12 из 40 проверочных диалогов бот беспрепятственно передавал чужие персональные данные.

Разработанная на базе полученных метрик политика интегрируется на стадии пред- и пост-обработки запросов (pre call и post call), пресекая любые обращения к инструментам, если ID профиля расходится с данными авторизованного владельца. Повторный прогон аналогичного тестового пакета продемонстрировал падение числа инцидентов до 5,9%. Примечательно, что функциональность помощника осталась прежней: частота ложных срабатываний на легитимных обращениях полностью обнулилась во всех четырех категориях испытаний.
Традиционная практика, при которой аудит и контроль поведения распределены между разными подразделениями и временными интервалами, создает уязвимости именно на стыке между выявлением дефекта и подтверждением его устранения. Представленное решение минимизирует этот разрыв до элементарного выполнения одной команды. В Microsoft акцентируют внимание на раздельном мониторинге безопасности и эффективности: бот, отклоняющий абсолютно любые запросы, покажет максимальную защищенность при нулевой полезности. Достоверным признается лишь тот сценарий, при котором обе метрики демонстрируют сбалансированный прогресс. Инструменты Assert и Agent Control Specification уже выложены в открытый доступ, а само расширение поставляется с готовыми шаблонами для 7 индустриальных направлений и 14 категорий угроз.
Источник: iXBT
«Кто ступит на Луну первым»: глава NASA пообещал ускорить программу Artemis и напомнил о флаге на скафандре
PNY лишила гарантии владельца сгоревшей GeForce RTX 5090 из-за штатного кабеля БП
ChatGPT Pro Max за 500 долларов в месяц: OpenAI готовит самый дорогой тариф
Скоростной 5G в метро: T2 показал результаты тестов в Москве и Петербурге
Xiaomi 18 Pro уступил Xiaomi 17 Ultra в яркости и видимости экрана при сравнении
Максимальный вайб: HMD анонсировала Vibe2 Pro с аккумулятором на 6000 мА·ч
Huawei Mate 90 Pro Max удивит уникальной камерой с 1-дюймовым телеобъективом и 10-кратным зумом
В октябре россияне смогут наблюдать два звездопада