ChatGPT-User обошёл robots.txt на 54% проверенных страниц: данные TollBit и позиция OpenAI

ChatGPT-User обошёл robots.txt на 54% проверенных страниц: данные TollBit и позиция OpenAI

Платформа TollBit, отслеживающая трафик в собственной сети, сообщила, что в первой половине 2026 года бот ChatGPT-User обращался к страницам, которые издатели явно запретили ему в robots.txt, в 54% зафиксированных случаев. Это самый высокий показатель среди европейских сайтов в выборке: у Bytespider он составил 48%, у PerplexityBot — 42%.

В целом по европейским и североамериканским сайтам из выборки TollBit около 15% обращений ИИ-ботов пришлись на страницы с запретом. Речь идёт не обо всех сайтах интернета, а только о тех, чей трафик наблюдает платформа.

TollBit определяет обход как успешный запрос к URL, который издатель явно запретил соответствующему боту. Статистика показывает факт обращения, но не устанавливает причину каждого запроса и не исключает подмену user-agent.

В документации OpenAI указано, что ChatGPT-User может обращаться к странице, когда пользователь задаёт ChatGPT или пользовательскому GPT вопрос, требующий получения содержимого. Агент инициируется пользователем, поэтому правила robots.txt могут к нему не применяться. Это отличает его от OAI-SearchBot, который определяет возможность использования содержимого в поисковых ответах, и от GPTBot, предназначенного для сбора данных для обучения базовых моделей.

Специалисты напоминают, что robots.txt не является технической защитой страницы. Он лишь передаёт указания автоматизированным агентам, но не запрещает серверу отдать файл. Если ресурс действительно нельзя предоставлять внешнему агенту, нужны другие механизмы: аутентификация, авторизация, сетевые правила или блокировка на уровне сервера.

Для команд, управляющих веб-ресурсами, это означает необходимость отдельно контролировать видимость сайта для поисковых и ИИ-сервисов и фактический доступ к данным. Пример ChatGPT-User показывает, что полагаться только на robots.txt при защите контента недостаточно.