Главное Авторские колонки Пресс-релизы Промо Вакансии Вопросы
93 0 В избр. Сохранено
Авторизуйтесь
Вход с паролем

GPTBot, ClaudeBot и другие: пускать ли ИИ-краулеры на свой сайт

У сайтов появилась новая категория посетителей, о которой большинство владельцев даже не догадывается — ИИ-боты: краулеры OpenAI, Anthropic, ByteDance и других ИИ-компаний. В Яндекс Метрике и Google Analytics их не видно: счётчики фиксируют тех, кто исполняет JavaScript, а роботы просто скачивают страницы.
Мнение автора может не совпадать с мнением редакции

Увидеть их можно только в журналах доступа сервера — и там картина неожиданная: у контентных сайтов доля ИИ-роботов за последний год выросла в разы и порой сопоставима с классическими поисковыми роботами.


Владелец сайта оказывается перед выбором без очевидного ответа. Закрыть доступ — значит выпасть из ответов ChatGPT, Perplexity и «Режима ИИ» Google, куда постепенно перетекает поиск. Оставить всё как есть — значит бесплатно отдавать свой контент на обучение чужих моделей: тексты, которые писались месяцами, становятся частью ответа нейросети, часто без ссылки на источник.

В действительности выбор не ограничивается двумя крайностями. «ИИ-боты» — это несколько разных типов роботов с разными целями, и правильное решение для каждого типа своё. Ниже — какие боты нейросетей сканируют сайты, как запретить их в robots.txt и что делать с теми, кто запреты игнорирует.

Какие ИИ-боты сканируют сайт: три типа с разными целями

Сборщики обучающих данных. GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Bytespider (ByteDance). Они скачивают контент для обучающих выборок будущих моделей. Сайт не получает взамен ничего: ни переходов, ни упоминаний. Если контент — основная ценность бизнеса, пускать их нет причин.

Индексаторы ИИ-поиска. OAI-SearchBot (OpenAI), PerplexityBot (Perplexity). Эти роботы наполняют поисковый индекс: когда пользователь задаёт вопрос, ИИ-поиск отвечает со ссылками на источники. По сути это аналог обычной поисковой индексации и новый канал переходов на сайт. Закрывать их — то же самое, что закрыться от Яндекса и Google.

Агенты по запросу пользователя. ChatGPT-User, Perplexity-User, Claude-User. Такой робот приходит, когда живой человек прямо сейчас попросил ассистента открыть конкретную страницу: «прочитай эту статью», «сравни цены на этом сайте». Блокировать его — всё равно что отказать живому посетителю.

Короткая шпаргалка, кого имеет смысл закрыть, а кого пустить.

Закрыть — сборщики обучающих данных. Сайт не получает взамен ни переходов, ни упоминаний:

  • GPTBot (OpenAI) — обучение моделей;
  • ClaudeBot (Anthropic) — обучение моделей;
  • Bytespider (ByteDance) — обучение моделей;
  • CCBot (Common Crawl) — публичный архив страниц, из которого берут обучающие выборки.

Пустить — индексаторы ИИ-поиска. Сайт получает переходы из ответов ассистента:

  • OAI-SearchBot (OpenAI) — индекс ИИ-поиска ChatGPT;
  • PerplexityBot (Perplexity) — индекс ИИ-поиска Perplexity.

Пустить — агенты по запросу пользователя. Сайт получает живого посетителя:

  • ChatGPT-User (OpenAI);
  • Claude-User (Anthropic);
  • Perplexity-User (Perplexity).

Важный нюанс: у одной компании есть роботы всех трёх типов, и представляются они по-разному. «Закрыть OpenAI целиком» и «закрыть GPTBot» — очень разные решения: первое лишает сайт и переходов из ИИ-поиска, второе — только ограничивает сбор данных для обучения. У Google для этого есть отдельное правило Google-Extended: оно запрещает использовать контент для обучения моделей, не затрагивая обычную поисковую индексацию.

Похожее разделение появилось и у Яндекса: за ИИ-ответы («Нейро», теперь «Поиск с Алисой») отвечает отдельный робот YandexAdditional — запрет для него в robots.txt убирает сайт из ИИ-ответов, не влияя на обычную индексацию. А вот запретить использование контента для обучения YandexGPT, оставшись при этом в поиске, пока нельзя — отдельного робота для обучения у Яндекса нет.

Как запретить ИИ-ботов в robots.txt — и почему этого мало

Первое, что приходит в голову, — прописать запрет в robots.txt. Для честных роботов это работает, и начать стоит именно с него: User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: CCBot Disallow: / User-agent: Bytespider Disallow: / User-agent: Google-Extended Disallow: /

Но у robots.txt есть принципиальное ограничение: это просьба, а не защита. Файл никого ни к чему не обязывает. OpenAI, Anthropic и Google декларируют, что соблюдают его, — и, по наблюдениям, действительно соблюдают. Однако заметная часть роботов запрет игнорирует: агрессивные краулеры и парсеры без документации выкачивают сайт целиком, создают нагрузку на сервер, съедают лимиты хостинга и замусоривают журналы и статистику.

Вторая проблема — подделки. Представиться кем угодно робот может одной строкой кода: в журналах сайта регулярно встречается «GPTBot» или «Googlebot», который на самом деле — обычный сборщик контента с арендованного сервера. Отличить настоящего робота от поддельного можно только по сетевым адресам: компании публикуют официальные списки своих диапазонов, и их нужно регулярно сверять с фактическим трафиком. Вручную поддерживать такую проверку — отдельная постоянная работа, и своими силами она почти никогда не делается.

Поэтому на практике задачу решают специализированные сервисы защиты — Cloudflare, WebShield и другие: они сами следят за актуальностью списков, отличают настоящих роботов от подделок и блокируют тех, кто вообще не представляется.

Стратегия: кого блокировать, кого пускать

Разумное правило по умолчанию для большинства сайтов:

  • сборщиков обучающих данных — закрыть: отдача от них нулевая, а контент — актив;
  • индексаторов ИИ-поиска и агентов пользователей — пустить: это живые люди и переходы, то есть тот самый трафик, ради которого сайт существует.

Дальше — поправка на специфику. Издание или блог с уникальными текстами может закрыться жёстче, вплоть до всех ИИ-роботов, кроме агентов. Магазину или сервису, которому важно попадать в рекомендации ассистентов, наоборот, стоит держать двери открытыми шире.

Как заблокировать ИИ-ботов за два клика

Лестница решений выглядит так. Первая ступень — robots.txt: бесплатно, быстро, но добровольно. Вторая — правила на собственном сервере: работают, но требуют регулярно актуализировать списки роботов и их адресов. Третья — сервис защиты, который берёт эту работу на себя.

В WebShield управление ИИ-роботами выглядит просто: в панели для каждого сайта — список известных роботов, сгруппированных по типам. Галочка напротив — робот проходит, снята — получает отказ. Типовая настройка «ИИ-поиск пускать, сборщиков обучающих данных блокировать» занимает меньше минуты.

Подделки при этом отсеиваются автоматически: робот, который представляется чужим именем, доступа не получает, как и сборщики, которые не представляются вовсе и маскируются под обычный браузер. А в статистике видно, кто и сколько ходил на сайт: какие роботы, как часто, что изменилось после включения блокировки.

Что в итоге

Полностью защитить контент от нейросетей невозможно — но управлять доступом вполне реально. Вопрос давно не в том, «пускать ли ИИ на сайт». Вопрос — кого именно и на каких условиях. Контент — это актив, и раздавать его стоит осознанно: тем, кто возвращает ценность переходами и клиентами, а не тем, кто молча уносит его в обучающую выборку.

0
В избр. Сохранено
Авторизуйтесь
Вход с паролем