Код и данные · robots.txtГенератор robots.txt с ИИ-ботами и Яндексом

Соберите robots.txt, который пускает поисковики, решает судьбу ИИ-ботов по классам и правильно говорит с Яндексом. Вставьте готовый файл — проверим, кого он на самом деле пускает.

Файл собирается в браузере — ни правила, ни адреса не уходят на сервер
01Генератор02О robots.txt03Вопросы04Похожие
01

Генератор

Базовые правила

Clean-param для Яндекса · параметры · путь
Пресеты

Обучение моделей

GPTBot, ClaudeBot, Google-Extended, CCBot…

Запрет не влияет на поиск и на ответы со ссылками.

GPTBot
OpenAI
соблюдает robots.txtдокументация
ClaudeBot
Anthropic
соблюдает robots.txtдокументация
Google-Extended · токен
Google
соблюдает robots.txtдокументация
Applebot-Extended · токен
Apple
соблюдает robots.txtдокументация
CCBot
Common Crawl
соблюдает robots.txtдокументация
Meta-ExternalAgent
Meta
соблюдает robots.txtдокументация
Amazonbot
Amazon
соблюдает robots.txtдокументация
MistralAI-Training
Mistral
соблюдает robots.txtдокументация
Bytespider
ByteDance
нет документации
cohere-training-data-crawler
Cohere
нет документации
Timpibot
Timpi
нет документации

ИИ-поиск и цитирование

OAI-SearchBot, Claude-SearchBot, PerplexityBot, YandexAdditional…

Запрет убирает сайт из ответов со ссылками — это потеря трафика.

Запросы пользователей

ChatGPT-User, Claude-User, Perplexity-User…

Многие из них могут игнорировать robots.txt; надёжно — только на сервере.

robots.txt · 27 строк
User-agent: *
Disallow: /admin/
Disallow: /search
# ИИ: обучение моделей — запрещено
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: Meta-ExternalAgent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: Bytespider
User-agent: cohere-training-data-crawler
User-agent: Timpibot
Disallow: /
# Яндекс: Нейро — разрешено, кроме общих запретов (правило * он не читает)
User-agent: YandexAdditional
User-agent: YandexAdditionalBot
Disallow: /admin/
Disallow: /search
Clean-param: utm_source&utm_medium&utm_campaign /
Sitemap: https://example.ru/sitemap.xml

Чего robots.txt не умеет

AI Overviews Google и чат Bing работают через обычных поисковых роботов — их ограничивают метатегами в <head>.

AI Overviews и AI Mode Google
<meta name="robots" content="nosnippet"> или max-snippet:0
Ответы в чате Bing
<meta name="robots" content="noarchive, nocache">
02

О robots.txt

Файл robots.txt говорит роботам, какие разделы сайта им можно обходить. С появлением нейросетей у него появилась новая работа: решать, может ли компания учить модель на ваших текстах и показывать их в ответах чат-ботов. ИИ-боты бывают трёх видов, и запрет каждого даёт разный эффект — генератор показывает его до того, как вы сохраните файл.

Обучение

GPTBot, ClaudeBot
Disallow: /
Запрет не даёт использовать тексты сайта для обучения моделей и не влияет ни на поиск, ни на цитирование.

ИИ-поиск

OAI-SearchBot, PerplexityBot
трафик
Эти боты приводят сайт в ответы со ссылками. Запрет убирает вас из таких ответов.

Запросы пользователей

ChatGPT-User
может игнорировать
Боты, которые открывают страницу по просьбе человека. Многие прямо пишут, что robots.txt могут не соблюдать.

Google-Extended

Токен, не робот
не влияет на поиск
Запрещает обучение Gemini и опору на сайт в Gemini и Vertex AI, но не влияет на поиск Google и AI Overviews — те работают через обычного Googlebot.

YandexAdditional

Яндекс
только по имени
Запрещает показывать сайт в ответах Нейро и Алисы. Работает, только если указан по имени: правило для «*» он не читает.

Без Host

Устарело
Host:
Яндекс давно не поддерживает директиву Host — главное зеркало задают редиректом. Генератор её не добавляет.
03

Частые вопросы

Запретите в robots.txt ботов класса «обучение»: GPTBot, ClaudeBot, Google-Extended, CCBot, Meta-ExternalAgent и других. Генератор собирает их в одну группу с «Disallow: /» — это пресет «Не обучать, но цитировать». Такой запрет не влияет ни на поиск, ни на ответы со ссылками на ваш сайт: за них отвечают другие боты, и их он не трогает.

Обновлено

Список ботов сверяется с документацией компаний раз в месяц. robots.txt — просьба, а не защита: надёжно закрыться можно только на сервере.

«» добавлен в избранное