OpenAI разработала стандарты для независимого аудита безопасности ИИ-моделей
Компания OpenAI обнародовала концепцию и ключевые приоритеты независимого аудита безопасности своих разработок. В документе обозначены четыре вектора, в рамках которых сторонние коммерческие и некоммерческие структуры смогут верифицировать заявления разработчика о стабильности ИИ-систем. В отличие от стандартных предрелизных тестирований, новый регламент ориентирован на глубокий и непрерывный мониторинг, не привязанный к конкретным обновлениям продуктов.
Первое направление сосредоточено на верификации «обоснований безопасности» (safety cases), охватывающих весь жизненный цикл моделей — от этапа обучения и тестирования до инсталляции. Аудиторам предстоит выяснить, подкреплены ли декларации компании эмпирическими данными и соблюдались ли регламенты на каждом этапе. Кроме того, эксперты оценят, не провоцируют ли алгоритмы обучения искусственный интеллект на деструктивное поведение, саботаж или преодоление встроенных барьеров.

Второй вектор затрагивает ключевые защитные барьеры: от отслеживания дрейфа характеристик до противодействия попыткам взлома (джейлбрейка). Ревизоры получат частичный («серый») доступ к инфраструктуре, чтобы в приближенных к боевым условиям протестировать устойчивость фильтров к деструктивным запросам, связанным с кибератаками и биоинженерией, а также выявить потенциальные бреши в защите.
Третья область охватывает проверку бенчмарков на предмет угроз, регламентированных Preparedness Framework (биологические и химические риски, киберпреступность, автономное самосовершенствование ИИ), а также тесты на дезадаптацию.
Четвертое, наиболее деликатное направление подразумевает независимое расследование резонансных сбоев и инцидентов. В качестве прецедента упоминается недавний взлом репозитория Hugging Face, когда подключение независимых специалистов доказало свою эффективность.
От кандидатов в аудиторы потребуется глубокая компетенция в области цифровой криминалистики, интерпретации логических цепочек ИИ и методологии расследований. В OpenAI подчеркивают, что итоговые заключения экспертов способны напрямую скорректировать статус безопасности конкретной модели.
Помимо этого, разработчик сформулировал семь базовых принципов инспекции: четко оговоренный периметр проверки, фиксацию проверяемых тезисов, регламентированный доступ к материалам с соблюдением прав интеллектуальной собственности, верифицируемую методологию, безупречную репутацию и автономность проверяющих, обеспечение конфиденциальности, выработку превентивных рекомендаций по устранению уязвимостей, а также принципы этичного обнародования итоговых отчетов. В OpenAI подтвердили, что уже ведут диалог с потенциальными партнерами о запуске пилотных тестирований по новой методике.
Источник: iXBT
Google запускает ИИ-спутник в космос 1 октября: TPU-чипы работают 15 минут перед охлаждением
Найден первый микроблазар Млечного Пути: его джет направлен на Землю
Искусственный интеллект создал секретный язык ради карточного мошенничества и обхитрил системы контроля
В продаже появился ультратонкий магнитный пауэрбанк Ugreen MagFlow Air на 10 000 мАч, устойчивый к проколам и экстремальному нагреву до 140 °C
Компания Heart Aerospace анонсировала гибридный авиалайнер ES-36 вместимостью 36 пассажиров и дальностью полета до 1200 км
Пассажиров могут обязать доплачивать за покупку самолетов МС-21 и SJ-100 через новый авиасбор
Крупные банки опасаются роста мошенничества из-за агентов с искусственным интеллектом
Свежие данные о Motorola Signature 27: камера на 200 Мп, звук Bang & Olufsen, GrapheneOS и 7 лет апдейтов