Привет. Я Сергей Язовский. 15 лет в SEO, три года занимаюсь GEO-оптимизацией — продвижением сайтов в ответах нейросетей.
Начну с наблюдения, которое проще проверить, чем объяснить. Я взял robots.txt двадцати одного крупного российского сайта — онлайн-школы, маркетплейсы, клиники, банковские сервисы, юридические порталы, медиа — и посмотрел, как они управляют доступом AI-краулеров. Результат: AI-ботов упоминает один сайт из двадцати одного. И упоминает в разделе «запретить».
Это robots.txt крупной сети медицинских клиник: 629 блоков User-agent, собранных из какой-то подборки «закрываемся от плохих ботов». В списке запрещённых — GPTBot, ChatGPT-User, CCBot, anthropic-ai. Клиника, которая должна бороться за пациентов из ИИ-поиска, своими руками закрыла нейросетям вход. Никто не проверял, потому что никому не пришло в голову, что причина может лежать здесь.
И вот вам прямой ответ на вопрос из заголовка. Чтобы понять, видят ли нейросети ваш сайт, нужно проверить четыре вещи: robots.txt на предмет AI-краулеров, настройки CDN и файрвола, мета-теги страниц и логи сервера с реальными визитами ИИ-ботов. Пятнадцать минут работы, без бюджета и без разработчика. Всё остальное в этой статье — как именно это делать и что делать с результатами.
А теперь давайте разберёмся по-настоящему.
Половина интернета — уже не люди
Начнём с масштаба, потому что без него разговор про robots.txt звучит как возня с техническими мелочами.
По данным Cloudflare, через сеть которой проходит больше 20% веба, в 2026 году доля неживого трафика в интернете впервые перевалила за 50%. И структура этого трафика изменилась радикально: 52% запросов краулеров в июне 2026 года приходилось на обучение ИИ-моделей — против 22% весной 2025 года. Ещё более 36% — краулеры смешанного назначения. Доля чистого поискового обхода — та, к которой мы привыкли за двадцать лет SEO — стала небольшой и продолжает падать. В некоторых категориях сайтов, которые обходят активнее всего, живой трафик за год просел почти на 40%.
Реакция инфраструктуры не заставила ждать: с июля 2025 года Cloudflare блокирует обучающие AI-краулеры по умолчанию для всех новых доменов. Возможно, за вас уже всё решили, и вы об этом не знаете.
Но здесь и зарыта главная ошибка. «Закрыть AI-ботов» — это не одно действие. Это три разных действия с тремя разными последствиями, и одно из них равносильно удалению себя из ответов нейросетей.
Три типа AI-ботов, которых все путают
Это ключевая вещь всей статьи. Если вы запомните только один абзац — пусть это будет следующий.
Обучающие краулеры собирают текст, чтобы на нём училась следующая версия модели. Они не влияют на то, упомянут вас в ответе сегодня. Закрыть их — законное решение, вопрос ваших взглядов на интеллектуальную собственность, а не потери видимости.
Поисковые краулеры строят индекс, из которого нейросеть достаёт источники, когда отвечает со ссылками. Закрыть их — значит вычеркнуть себя из ИИ-выдачи. Полностью.
Live-fetch агенты идут на вашу страницу в момент, когда живой пользователь задал вопрос и нейросеть решила заглянуть на сайт прямо сейчас. Это ближе всего к настоящему клиенту. Закрыть их — самая дорогая из ошибок.
Дальше — конкретика. Вот кто к вам приходит и что означает каждая строка.
| User-agent | Владелец | Назначение | Блокировать? |
|---|---|---|---|
GPTBot | OpenAI | Обучение моделей GPT | На ваш выбор |
OAI-SearchBot | OpenAI | Индекс для поиска ChatGPT | Нет |
ChatGPT-User | OpenAI | Live-запрос от пользователя ChatGPT | Нет |
ClaudeBot | Anthropic | Обучение моделей Claude | На ваш выбор |
Claude-User | Anthropic | Live-запрос от пользователя Claude | Нет |
PerplexityBot | Perplexity | Индекс для ответов Perplexity | Нет |
Googlebot | Поиск + AI Overviews | Нет | |
Google-Extended | Токен отказа от обучения Gemini | На ваш выбор | |
Bingbot | Microsoft | Индекс Bing, питает Copilot | Нет |
YandexBot | Яндекс | Основной индекс Яндекса | Нет |
YandexAdditional | Яндекс | Показ в ответах YandexGPT и Алисы | Нет |
Applebot-Extended | Apple | Отказ от обучения Apple Intelligence | На ваш выбор |
meta-externalagent | Meta | Обучение Meta AI | На ваш выбор |
CCBot | Common Crawl | Открытый датасет для обучения LLM | На ваш выбор |
Bytespider | ByteDance | Обучение моделей TikTok | Можно закрыть |
Вернитесь к клинике из начала статьи. В её списке запретов стоял ChatGPT-User — бот, который приходит, когда человек спросил у ChatGPT про стоматологию в своём районе. Нейросеть пошла за деталями и получила отказ.
Отдельно про Bingbot. Его до сих пор часто воспринимают как «второстепенный поисковик, можно и прикрыть». Индекс Bing питает Microsoft Copilot и исторически участвовал в формировании ответов поиска ChatGPT — про этот механизм я подробно писал в статье про попадание в ответы ChatGPT через индексацию Bing. Запрет Bingbot тихо выносит вас из ИИ-ответов там, где вы этого совсем не ждёте.
И ещё тонкость, на которой спотыкаются даже опытные SEO-специалисты: Google-Extended и Applebot-Extended — не краулеры, а токены robots.txt. Ботов с такими именами не существует, они лишь сигналят «не используйте контент для обучения». Запретить их можно спокойно — на индексацию в поиске Google и работу Siri это не влияет.
YandexAdditional: директива, про которую не знает почти никто
Это самая недооценённая строка в российском GEO, и я готов повторять это на каждом выступлении.
В документации Яндекса есть YandexAdditional и YandexAdditionalBot. Формулировка официальная и предельно конкретная: директива «учитывается при обработке robots.txt для ограничения отображения контента страницы в быстрых ответах с YandexGPT и в ответах Поиска с Алисой». При этом сам он не совершает запросов для индексирования и применяется к страницам, которые уже обошёл основной робот.
Переведу на человеческий. Это не краулер. Это выключатель вашего присутствия в нейроответах Яндекса и в ответах Алисы. Одна строка Disallow в этом блоке — и страница остаётся в обычном поиске, продолжает получать органику, но исчезает из быстрых ответов YandexGPT. Без санкций, без предупреждений в Вебмастере, без единого признака проблемы в отчётах.
Теперь вспомните типичную диагностику: клиент жалуется, что органика стоит нормально, а нейроответы Яндекса его не показывают. Мы идём проверять структуру контента, локальность, разметку, свежесть — весь чек-лист. А причина может лежать в четырёх строчках robots.txt, написанных три года назад подрядчиком, который аккуратно закрыл «всё лишнее». Как отличать алгоритмические причины от технических — разбирал в материале про диагностику падения ИИ-трафика.
В моей выборке из 21 сайта YandexAdditional не упомянул ни один — ни в разрешающем виде, ни в запрещающем. Для бизнеса, который борется за видимость в YandexGPT и Алисе, это выглядит как гонка на машине, у которой никто не проверял, снят ли ручник.
Проверка за 15 минут: четыре шага
Это то, что я делаю первым делом на любом аудите, ещё до разговоров про контент и стратегию. Порядок имеет значение — идите сверху вниз.
Шаг 1. Прочитать robots.txt глазами
Откройте вашсайт.ру/robots.txt в браузере и поищите по тексту: GPT, Claude, Perplexity, OAI, Additional, CCBot, Extended. Не по одному слову «bot» — их там будет сотня. Именно по этим фрагментам.
Отдельно проверьте блок User-agent: *: Disallow: / в нём означает, что вы закрыты для всех, включая нейросети. А запрет разделов вроде /uslugi/ означает, что нейросеть не увидит ровно то, что вы продаёте.
Шаг 2. Проверить, что реально отвечает сервер
robots.txt — это просьба. CDN и файрвол — это сила. Бот может видеть разрешение в robots.txt и получать 403 от Cloudflare. Проверяется парой команд в терминале — подставьте свой адрес:
curl -A "Mozilla/5.0 (compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot)" \
-s -o /dev/null -w "%{http_code}\n" https://вашсайт.ру/
curl -A "Mozilla/5.0 (compatible; ChatGPT-User/1.0; +https://openai.com/bot)" \
-s -o /dev/null -w "%{http_code}\n" https://вашсайт.ру/
Ждём 200. Получили 403, 429 или 503 — вас блокирует не robots.txt, а инфраструктура. Это самая частая техническая причина невидимости, которую я встречаю, и её почти никогда не ищут, потому что в браузере сайт открывается прекрасно.
Полезно ещё сравнить размер ответа для бота и для обычного браузера — замените в команде %{http_code} на %{size_download}. Если боту отдаётся 3 килобайта, а браузеру 300, значит контент собирается JavaScript’ом, и нейросеть видит пустой каркас страницы.
Шаг 3. Заглянуть в настройки CDN и файрвола
Если сайт на Cloudflare, зайдите в раздел управления ботами и проверьте, не включена ли блокировка AI-краулеров: для доменов, добавленных после июля 2025 года, обучающие краулеры закрыты по умолчанию. Заодно посмотрите Bot Fight Mode и Rate Limiting. На собственном сервере проверьте nginx.conf и .htaccess на правила, отсекающие запросы по User-Agent — они писались против парсеров и живут в конфигах годами.
Шаг 4. Проверить мета-теги и заголовки
Последнее место, где прячется запрет — сама страница. Ищите в коде noindex, nosnippet, noarchive, max-snippet и заголовок ответа X-Robots-Tag. nosnippet и max-snippet:0 запрещают использовать фрагменты текста — именно те, из которых собирается ИИ-ответ. Страница остаётся в индексе, но цитировать её нельзя.
Логи сервера: единственное честное доказательство
Всё, что выше, отвечает на вопрос «не закрыт ли я». Логи отвечают на вопрос поинтереснее: приходят ли за мной вообще. Разница принципиальная — разрешение в robots.txt не означает, что нейросети про вас знают. Я много раз видел сайты с идеально открытым доступом, к которым за месяц не заглянул ни один AI-краулер. Не потому что запрещено — потому что не за чем.
Возьмите access-log за последние 30 дней и посчитайте визиты по типам ботов:
grep -icE "GPTBot|OAI-SearchBot|ChatGPT-User" access.log
grep -icE "ClaudeBot|Claude-User|Claude-SearchBot" access.log
grep -ic "PerplexityBot" access.log
# какие страницы забирает поисковый бот OpenAI
grep "OAI-SearchBot" access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -20
# какие коды ответа он получает — здесь всплывают скрытые 403
grep "OAI-SearchBot" access.log | awk '{print $9}' | sort | uniq -c
Моя рабочая таблица интерпретаций результата:
| Что видно в логах | Что это значит | Что делать |
|---|---|---|
| Ботов нет вообще | Сайт вне зоны интереса нейросетей: нет внешних упоминаний и сигналов, ведущих к вам | Работать над упоминаниями и ссылками, а не над техникой |
| Обход есть, коды 403 или 429 | Доступ режет CDN, файрвол или лимит запросов | Править правила инфраструктуры |
| Только обучающие боты, live-fetch нет | Контент забирают в обучение, но в живых ответах вас не спрашивают | Усиливать контент под конкретные вопросы |
Есть ChatGPT-User и Claude-User | Лучший сценарий: нейросеть идёт к вам по запросу живого человека | Смотреть, какие URL берут, и усиливать эти страницы |
| Обход резко упал | Изменились правила доступа или контент перестал обновляться | Сверить дату падения с датой правок конфигов |
Логи важны ещё и потому, что переходы из нейросетей плохо считаются обычной аналитикой: трафик из мобильных приложений ИИ-сервисов часто приходит без заголовка Referer и оседает как прямые заходы. Логи краулеров остаются самым ранним достоверным сигналом, что GEO-работа даёт эффект. Что считать дальше — в разборе метрик GEO-оптимизации.
Пять способов закрыться от нейросетей, ничего не заметив
Собрал по частоте встречаемости на аудитах — от самого распространённого к более редкому.
Первое: robots.txt из подборки. Кто-то нашёл готовый список «закрываем плохих ботов», вставил целиком и забыл. Такие списки писались против парсеров, а сегодня в них по инерции попадают GPTBot, CCBot, anthropic-ai и, что хуже всего, ChatGPT-User. Ровно этот случай — сайт клиники из начала статьи.
Второе: настройки CDN по умолчанию. Домен переехал на Cloudflare, обучающие краулеры закрылись автоматически, никто не заходил в панель. Технически не ваша ошибка, но последствия ваши.
Третье: Bot Fight Mode и защита от DDoS. Механизм отдаёт JavaScript-челлендж вместо страницы. Живой браузер его не замечает, краулер получает заглушку. В том же режиме работает агрессивный Rate Limiting.
Четвёртое: контент, который рисует JavaScript. Доступ открыт, код 200 отдаётся, но в HTML для бота текста нет. Признак виден в сравнении размера ответа из шага 2.
Пятое: мета-теги из прошлой жизни сайта. noarchive и nosnippet ставили, чтобы конкуренты не тянули контент из кэша. Сегодня они мешают цитированию.
Пускать ли обучающие краулеры: разбор без идеологии
С поисковыми и live-fetch ботами всё однозначно — пускать. А вот с обучающими начинается настоящий выбор, и здесь одного ответа для всех нет.
Аргумент против подкреплён цифрами Cloudflare: за неделю июня 2025 года соотношение «скачанных страниц на один переход к вам» доходило до 70 900:1 у Anthropic. Это не обмен, это односторонний вынос. Крупные медиа поэтому и закрываются — ограничив доступ, они создают дефицит и получают рычаг в переговорах о лицензировании.
Аргумент за работает для другого типа сайтов. Обучающий обход формирует то, что модель «знает» о вашем бренде без обращения к интернету. Когда пользователь спрашивает «какие компании занимаются X», нейросеть часто отвечает из внутренних знаний. Отсутствие в обучающих данных — это отсутствие в этом слое ответов, и быстро его не восполнить.
Моя рабочая логика простая. Если вы продаёте товары или услуги — открывайте всё. Ваш контент не является продуктом, он является витриной, и любое упоминание работает на вас. Если вы продаёте сам контент — медиа, издательство, база знаний по подписке, обучающие материалы — закрывайте обучающие краулеры и оставляйте поисковые с live-fetch. Получите видимость без бесплатной раздачи архива.
Чего точно не стоит делать — закрывать обучающие краулеры «на всякий случай», не понимая механики.
Мой рабочий robots.txt для бизнес-сайта
Вариант для компании, которая продаёт товары или услуги и хочет максимальную видимость в нейросетях. Добавляется к вашим существующим правилам, ничего не отменяя:
# Поисковые и live-fetch боты нейросетей — открыто
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: DuckAssistBot
Allow: /
# Нейроответы Яндекса и Алиса — открыто
User-agent: YandexAdditional
Allow: /
User-agent: YandexAdditionalBot
Allow: /
# Обучающие краулеры — решение на ваш выбор
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
Sitemap: https://вашсайт.ру/sitemap.xml
Для контентного проекта, который не готов отдавать архив в обучение, в блоке обучающих краулеров Allow меняется на Disallow: /, и туда же добавляются CCBot, Google-Extended, Applebot-Extended, meta-externalagent и Bytespider. Верхняя часть файла — поисковые и live-fetch боты — остаётся открытой без изменений.
И главное: robots.txt — это разрешение, а не приглашение. Он снимает препятствия, но не создаёт причину прийти. Причину создаёт контент, на который ссылаются другие — про механику этого я писал в статье про ссылки для GEO-стратегии.
Мой вывод
За три года работы с GEO я убедился: техническая доступность — это не то, что приносит результат, но это то, без чего результата не будет вообще. Можно год писать идеальный контент, собирать отзывы и наращивать упоминания — и не получить ни одного визита из нейросетей, потому что четыре строки в robots.txt отменяют всю работу.
Проверка занимает пятнадцать минут, а повторять её стоит при переезде на хостинг, подключении CDN и смене подрядчика — ровно тогда запреты появляются сами собой.
Ни один из двадцати одного разобранного сайта не имеет осознанной политики по AI-краулерам: кто-то закрыт по недоразумению, остальные открыты по случайности. В большинстве ниш доступ пока не стал конкурентным преимуществом — потому и стоит заняться им сейчас.
Начните с самого простого. Откройте свой robots.txt и найдите в нём слово GPT. То, что вы увидите, скажет о ваших шансах в ИИ-поиске больше, чем любой аудит контента.
Часто задаваемые вопросы
Если я закрою GPTBot, исчезну ли из ответов ChatGPT? Не обязательно — и это главная путаница. GPTBot собирает данные для обучения моделей. За ответы ChatGPT в режиме поиска отвечает OAI-SearchBot, за живые запросы — ChatGPT-User. Если эти два бота открыты, а GPTBot закрыт, вы остаётесь в поиске ChatGPT, но выпадаете из обучающих данных. Это законный выбор с понятными последствиями.
Нужно ли явно добавлять YandexAdditional, чтобы попадать в нейроответы Яндекса? Нет. По умолчанию, если директива отсутствует, ограничений нет. Добавить Allow: / стоит только если в вашем файле есть глобальный блок, под который потенциально подпадёт этот токен. Disallow добавляют осознанно — чтобы убрать сайт из быстрых ответов YandexGPT и Алисы, оставшись в обычном поиске.
Как убедиться, что бот действительно от OpenAI или Яндекса? Через reverse DNS: имена хостов роботов Яндекса оканчиваются на yandex.ru, yandex.net или yandex.com, OpenAI публикует диапазоны IP своих краулеров. Команда: host <ip_из_лога>. Не совпало — бот фальшивый, и robots.txt его не остановит.
Нужен ли llms.txt, если robots.txt уже настроен? Это разные инструменты. robots.txt говорит краулерам «можно/нельзя». llms.txt говорит языковым моделям «вот что важно знать о нас». Второй не заменяет первый и не влияет на разрешения доступа. Когда делать llms.txt — разбирал в отдельной статье.
Помогает ли настройка robots.txt, если сайт вообще ни в каких нейроответах не появляется? Нет. robots.txt убирает барьеры, но не создаёт причину прийти. Если краулеры не обходят сайт даже при открытом доступе — значит, нет сигналов авторитетности: внешних упоминаний, ссылок, цитирований в медиа. Техническая проверка нужна первой, но GEO строится на контенте и репутации.
Что делать, если нет доступа к логам сервера? Если сайт на Cloudflare — раздел Analytics → Bots показывает трафик по категориям ботов. Для Googlebot и Bingbot подойдёт Search Console. Альтернатива — отдельный endpoint, логирующий запросы конкретных User-Agent: час работы разработчика.