OpenAI разработала стандарты для независимого аудита безопасности ИИ-моделей

Прокомментировать Просмотры: 1

Компания OpenAI обнародовала концепцию и ключевые приоритеты независимого аудита безопасности своих разработок. В документе обозначены четыре вектора, в рамках которых сторонние коммерческие и некоммерческие структуры смогут верифицировать заявления разработчика о стабильности ИИ-систем. В отличие от стандартных предрелизных тестирований, новый регламент ориентирован на глубокий и непрерывный мониторинг, не привязанный к конкретным обновлениям продуктов.

Первое направление сосредоточено на верификации «обоснований безопасности» (safety cases), охватывающих весь жизненный цикл моделей — от этапа обучения и тестирования до инсталляции. Аудиторам предстоит выяснить, подкреплены ли декларации компании эмпирическими данными и соблюдались ли регламенты на каждом этапе. Кроме того, эксперты оценят, не провоцируют ли алгоритмы обучения искусственный интеллект на деструктивное поведение, саботаж или преодоление встроенных барьеров.

Источник изображения: сгенерировано Muse

Второй вектор затрагивает ключевые защитные барьеры: от отслеживания дрейфа характеристик до противодействия попыткам взлома (джейлбрейка). Ревизоры получат частичный («серый») доступ к инфраструктуре, чтобы в приближенных к боевым условиям протестировать устойчивость фильтров к деструктивным запросам, связанным с кибератаками и биоинженерией, а также выявить потенциальные бреши в защите.

Третья область охватывает проверку бенчмарков на предмет угроз, регламентированных Preparedness Framework (биологические и химические риски, киберпреступность, автономное самосовершенствование ИИ), а также тесты на дезадаптацию.

Четвертое, наиболее деликатное направление подразумевает независимое расследование резонансных сбоев и инцидентов. В качестве прецедента упоминается недавний взлом репозитория Hugging Face, когда подключение независимых специалистов доказало свою эффективность.

От кандидатов в аудиторы потребуется глубокая компетенция в области цифровой криминалистики, интерпретации логических цепочек ИИ и методологии расследований. В OpenAI подчеркивают, что итоговые заключения экспертов способны напрямую скорректировать статус безопасности конкретной модели.

Помимо этого, разработчик сформулировал семь базовых принципов инспекции: четко оговоренный периметр проверки, фиксацию проверяемых тезисов, регламентированный доступ к материалам с соблюдением прав интеллектуальной собственности, верифицируемую методологию, безупречную репутацию и автономность проверяющих, обеспечение конфиденциальности, выработку превентивных рекомендаций по устранению уязвимостей, а также принципы этичного обнародования итоговых отчетов. В OpenAI подтвердили, что уже ведут диалог с потенциальными партнерами о запуске пилотных тестирований по новой методике.

 

Источник: iXBT

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов