Бот ChatGPT-User проигнорировал robots.txt на 54% изученных страниц: OpenAI предупреждает о таком поведении
Изображение сгенерировано: Nano Banana
По данным аналитической платформы TollBit, за первое полугодие 2026 года свыше половины (54%) запросов агента ChatGPT-User к европейским сайтам затронули страницы, доступ к которым был прямо ограничен файлом robots.txt. Это наивысшая доля среди всех отслеживаемых систем: для сравнения, у краулера Bytespider аналогичный показатель достиг 48%, а у PerplexityBot — 42%. Если рассматривать совокупную выборку порталов из Европы и Северной Америки, на запрещённые разделы пришлось порядка 15% всех визитов ИИ-ботов.
Эксперты подчёркивают, что отчёт отражает исключительно статистику внутри сети TollBit, а не глобальную картину всего интернета. Под обходом ограничений сервис понимает результативный запрос к адресу, на который владелец ресурса установил запрет для конкретного бота. Таким образом, метрика фиксирует лишь сами прецеденты обращений, оставляя за скобками скрытые мотивы запросов и возможные случаи фальсификации заголовков User-Agent.
Специфика поведения ChatGPT-User обусловлена функционалом самого алгоритма. Техническая документация OpenAI разъясняет, что этот агент загружает контент в режиме реального времени, когда человек задаёт в ChatGPT или кастомном GPT вопрос, требующий изучения внешнего источника. Поскольку действие совершается по прямой инициативе пользователя, разработчики допускают неприменение директив robots.txt. В этом заключается ключевое отличие агента от краулера GPTBot, собирающего массивы данных для обучения базовых моделей, и поискового бота OAI-SearchBot, отвечающего за выдачу релевантных ответов в поиске ChatGPT.
Сложившаяся практика в очередной раз подтверждает, что директивы robots.txt не являются физическим барьером для защиты контента. Файл лишь транслирует рекомендации владельца сайта, но никак не блокирует отдачу данных сервером. Для надёжного закрытия чувствительной информации администраторам необходимо задействовать полноценные инструменты контроля доступа — обязательную аутентификацию, авторизацию, сетевые экраны и правила фильтрации на уровне веб-сервера. Веб-мастерам важно чётко разграничивать формальные правила индексации для ИИ-сервисов и реальную архитектуру защиты данных.
Источник: iXBT
Спутник «Арктика-М» заснял движение лунной тени по Земле во время солнечного затмения 12 августа
Нейтронная звезда может попасть внутрь чёрной дыры без гравитационного коллапса
Новый ИИ от Suvi Health превратит беседы у постели больного в комплексный план лечения
В США тестируют единые стандарты применения искусственного интеллекта в страховании
Intuitive Machines построит три геостационарных спутника связи за $600 млн
Пять компаний получат $60 млн от Пентагона на интеграцию своих спутников с сетью SpaceX
Окаменелость возрастом 236 млн лет доказала, что живорождение у предков млекопитающих возникло на 90 млн лет раньше
Спутниковые группировки вскоре могут спровоцировать лавинообразный рост космического мусора