Бот ChatGPT-User проигнорировал robots.txt на 54% изученных страниц: OpenAI предупреждает о таком поведении
Изображение сгенерировано: Nano Banana
По данным аналитической платформы TollBit, за первое полугодие 2026 года свыше половины (54%) запросов агента ChatGPT-User к европейским сайтам затронули страницы, доступ к которым был прямо ограничен файлом robots.txt. Это наивысшая доля среди всех отслеживаемых систем: для сравнения, у краулера Bytespider аналогичный показатель достиг 48%, а у PerplexityBot — 42%. Если рассматривать совокупную выборку порталов из Европы и Северной Америки, на запрещённые разделы пришлось порядка 15% всех визитов ИИ-ботов.
Эксперты подчёркивают, что отчёт отражает исключительно статистику внутри сети TollBit, а не глобальную картину всего интернета. Под обходом ограничений сервис понимает результативный запрос к адресу, на который владелец ресурса установил запрет для конкретного бота. Таким образом, метрика фиксирует лишь сами прецеденты обращений, оставляя за скобками скрытые мотивы запросов и возможные случаи фальсификации заголовков User-Agent.
Специфика поведения ChatGPT-User обусловлена функционалом самого алгоритма. Техническая документация OpenAI разъясняет, что этот агент загружает контент в режиме реального времени, когда человек задаёт в ChatGPT или кастомном GPT вопрос, требующий изучения внешнего источника. Поскольку действие совершается по прямой инициативе пользователя, разработчики допускают неприменение директив robots.txt. В этом заключается ключевое отличие агента от краулера GPTBot, собирающего массивы данных для обучения базовых моделей, и поискового бота OAI-SearchBot, отвечающего за выдачу релевантных ответов в поиске ChatGPT.
Сложившаяся практика в очередной раз подтверждает, что директивы robots.txt не являются физическим барьером для защиты контента. Файл лишь транслирует рекомендации владельца сайта, но никак не блокирует отдачу данных сервером. Для надёжного закрытия чувствительной информации администраторам необходимо задействовать полноценные инструменты контроля доступа — обязательную аутентификацию, авторизацию, сетевые экраны и правила фильтрации на уровне веб-сервера. Веб-мастерам важно чётко разграничивать формальные правила индексации для ИИ-сервисов и реальную архитектуру защиты данных.
Источник: iXBT
Ученые внесли в каталог 40-тысячный околоземный астероид и предупреждают, что это лишь начало
Китайский телескоп с ИИ-агентом попал в отчёт Стэнфорда как эталон научного применения искусственного интеллекта
Инсайдер раскрыл почти все характеристики будущего флагмана OnePlus 16
Через три года нехватка специалистов по разработке ИИ-чипов в США может превысить 150 000 человек
Китайский бренд проектирует смартфон с камерой на 200 Мп и вторым 1,72-дюймовым экраном
Honor выпустила 2-литровую рабочую станцию на базе Nvidia RTX Spark
Российский конкурент Boeing и Airbus оценили в 7,5 млрд рублей с перспективой удешевления
Anthropic засекретила новую биолабораторию