Бот ChatGPT-User проигнорировал robots.txt на 54% изученных страниц: OpenAI предупреждает о таком поведении

Прокомментировать Просмотры: 6

Изображение сгенерировано: Nano Banana

По данным аналитической платформы TollBit, за первое полугодие 2026 года свыше половины (54%) запросов агента ChatGPT-User к европейским сайтам затронули страницы, доступ к которым был прямо ограничен файлом robots.txt. Это наивысшая доля среди всех отслеживаемых систем: для сравнения, у краулера Bytespider аналогичный показатель достиг 48%, а у PerplexityBot — 42%. Если рассматривать совокупную выборку порталов из Европы и Северной Америки, на запрещённые разделы пришлось порядка 15% всех визитов ИИ-ботов.

Эксперты подчёркивают, что отчёт отражает исключительно статистику внутри сети TollBit, а не глобальную картину всего интернета. Под обходом ограничений сервис понимает результативный запрос к адресу, на который владелец ресурса установил запрет для конкретного бота. Таким образом, метрика фиксирует лишь сами прецеденты обращений, оставляя за скобками скрытые мотивы запросов и возможные случаи фальсификации заголовков User-Agent.

Специфика поведения ChatGPT-User обусловлена функционалом самого алгоритма. Техническая документация OpenAI разъясняет, что этот агент загружает контент в режиме реального времени, когда человек задаёт в ChatGPT или кастомном GPT вопрос, требующий изучения внешнего источника. Поскольку действие совершается по прямой инициативе пользователя, разработчики допускают неприменение директив robots.txt. В этом заключается ключевое отличие агента от краулера GPTBot, собирающего массивы данных для обучения базовых моделей, и поискового бота OAI-SearchBot, отвечающего за выдачу релевантных ответов в поиске ChatGPT.

Сложившаяся практика в очередной раз подтверждает, что директивы robots.txt не являются физическим барьером для защиты контента. Файл лишь транслирует рекомендации владельца сайта, но никак не блокирует отдачу данных сервером. Для надёжного закрытия чувствительной информации администраторам необходимо задействовать полноценные инструменты контроля доступа — обязательную аутентификацию, авторизацию, сетевые экраны и правила фильтрации на уровне веб-сервера. Веб-мастерам важно чётко разграничивать формальные правила индексации для ИИ-сервисов и реальную архитектуру защиты данных.

 

Источник: iXBT

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов