ИИ-краулеры на сайте: как посмотреть логи и выбрать позицию по доступу
15 мин чтенияВладельцы узнали, что их тексты уходят в обучение и в ответы нейросетей, и массово закрывают доступ целиком — вместе с шансом быть процитированными. К 2026 году решение стало двусторонним: закрыть можно, но вместе с обучающими роботами вы выключаете и тех, кто приводит людей. Ниже — процедура на один вечер: посмотреть логи и увидеть реальных гостей, посчитать, что даёт и что отнимает запрет, выбрать одну из трёх позиций и проверить результат по Вебмастеру, чтобы не выпасть из поиска по опечатке в robots.txt.
- Сначала логи, потом robots.txt. В наших проектах роботы дают 30-60% всех запросов, но ИИ-краулеры среди них обычно только 3-15% — а грузят сервер чаще комбинации фильтров и парсеры цен.
- Роботы делятся на тех, кто собирает тексты для обучения, и тех, кто приходит собрать ответ со ссылкой на вас. Первых можно закрыть почти без потерь, вторых закрывать — значит добровольно пропасть из ответов.
- robots.txt — просьба, а не защита. Парсеры и сканеры её не читают вовсе; ограничение частоты и блокировки делаются на уровне сервера.
- Самая дорогая ошибка — отдельная группа User-agent для одного робота: она отменяет для него все общие правила, и он уходит во внутренний поиск и фильтры. Проверять правки нужно в Вебмастере, в инструменте «Анализ robots.txt».
- Логи содержат IP-адреса и адреса страниц: выгружать их целиком в чат-помощник для разбора не стоит, обезличивайте или разбирайте на своей стороне; правовую квалификацию таких данных уточните у юриста.
- Кто обходит сайт кроме привычных поисковых роботов
- Как посмотреть логи сервера и понять, кто приходил
- Что даёт запрет и что он одновременно отнимает
- Три позиции: открыть всё, закрыть всё, разделить по разделам
- Синтаксис robots.txt без ошибок, которые стоят трафика
- Нагрузка на сервер: когда пора ограничивать частоту обхода
- Чек-лист проверки после любых изменений в доступе
- Путь клиента
- Стратегия по шагам
- Чек-лист
- Что в итоге
- Вопросы и ответы
Кто обходит сайт кроме привычных поисковых роботов
Откройте лог сервера за любые сутки — живых посетителей в нём окажется меньшинство. В наших проектах доля запросов от роботов обычно составляет 30-60% всего потока, а у каталогов с фильтрами доходит до 70-80%. ИИ-краулеры — лишь часть этой массы, и принимать решение по ним, не разобрав остальных, бессмысленно: закроете не то, что на самом деле грузит сервер.
Шесть групп, которые встречаются почти в любом проекте:
- Поисковые роботы Яндекса и Google. Ходят регулярно, приносят органический трафик. Их не закрывают нигде, кроме служебных разделов.
- Обучающие ИИ-краулеры. Скачивают тексты в корпус, на котором учат языковые модели. Прямых переходов не дают ни завтра, ни через год.
- Индексирующие роботы сервисов ответов. Строят собственный индекс страниц, из которого потом собирается ответ пользователю со ссылкой на источник. Именно они приносят упоминания.
- Заходы по запросу пользователя. Робот приходит в тот момент, когда живой человек задал вопрос или вставил ссылку: одна-две страницы, без обхода вглубь. Такой заход чаще всего заканчивается цитатой или переходом.
- SEO- и аналитические сервисы. Снимают структуру и ссылки для отчётов — ваших и чужих. Нагрузку создают, пользы не приносят, если вы этими сервисами не пользуетесь.
- Парсеры конкурентов и сканеры уязвимостей. Первые снимают цены и остатки по каталогу, вторые перебирают адреса админки и служебных файлов. Ни те, ни другие robots.txt не читают в принципе.
| Кто приходит | Зачем | Даёт трафик | Читает robots.txt | Что обычно делаем |
|---|---|---|---|---|
| Поисковые роботы | Индексация для выдачи | Да, основной источник | Да | Открываем всё, кроме служебного |
| Обучающие ИИ-краулеры | Сбор текстов для обучения моделей | Нет | Как правило, да | Решение владельца, потери небольшие |
| Роботы сервисов ответов | Свой индекс для ответов со ссылками | Да, немного, но качественный | Как правило, да | Оставляем открытыми |
| Заход по запросу пользователя | Прочитать конкретную страницу здесь и сейчас | Да, вплоть до прямого перехода | Не всегда | Оставляем открытым |
| SEO-сервисы | Данные для отчётов и баз ссылок | Нет | Обычно да | Закрываем или ограничиваем частоту |
| Парсеры и сканеры | Снять цены, найти дыру в админке | Нет | Нет | Блокируем на уровне сервера |
Разделение внутри ИИ-роботов и есть суть всего решения. Обучающий краулер забирает текст и не возвращает ничего измеримого. Робот сервиса ответов и заход по запросу пользователя работают иначе: они читают страницу, чтобы собрать из неё ответ и поставить ссылку. Строчка в robots.txt вида «запретить всем нейросетям» бьёт по всем трём сразу, а фраза «мы просто запретили обучение» — обычно самообман: имена агентов в файле выписаны наугад из чужого совета, а не из ваших логов. Как устроено попадание в такие ответы и что для него нужно на стороне сайта, мы разбирали в материале про продвижение в ответах нейросетей.
Отдельно про Метрику: искать там ботов не нужно. Счётчик — это скрипт, который выполняется в браузере, а большинство краулеров скрипты не исполняют, поэтому в отчётах их просто нет. В счётчике есть «Фильтрация роботов» (Настройка счётчика → вкладка «Фильтры») и отчёт Отчёты → Стандартные отчёты → Мониторинг → Роботы, но там видна только та малая часть, которая скрипт всё-таки выполнила. Источник правды по обходу — логи сервера, всё остальное производно. Проверить обратную сторону — цитируют ли вас в ответах и приходят ли люди — можно отдельной процедурой, мы описали её в материале о том, как проверить, цитирует ли вас нейропоиск.
Как посмотреть логи сервера и понять, кто приходил
Лог доступа — текстовый файл, куда сервер пишет каждый запрос: с какого адреса пришли, когда, за какой страницей, что получили в ответ и сколько байт скачали. В самом конце строки стоит user-agent — то, как робот сам себя представил. Это самый достоверный источник данных по обходу.
Где искать файл:
- Обычный хостинг: панель управления → раздел «Логи» или «Журналы». Файлы вида site-access.log, ротация чаще всего раз в сутки, хранение 7-30 дней. Если раздел пуст, ведение логов включается там же галочкой — включите и вернитесь через сутки.
- Сервер с nginx: /var/log/nginx/access.log, рядом лежат сжатые архивы прошлых дней.
- Сервер с Apache: /var/log/apache2/access.log или /var/log/httpd/access_log.
- Если перед сайтом стоит CDN или защитный прокси, часть запросов до вашего сервера не доходит вовсе — тогда картину по ботам смотрите ещё и в панели этого сервиса, иначе половина обхода останется невидимой.
Пять команд, которые дают полную картину примерно за десять минут. Подставьте имя своего файла и фрагмент имени агента из первого списка:
- Кто приходил и сколько раз: awk -F'"' '{print $6}' access.log | sort | uniq -c | sort -rn | head -30. Слева — число запросов, справа — представление робота. Начинайте разбор именно отсюда.
- Сколько запросов сделал конкретный робот: grep -c 'фрагмент-имени' access.log.
- Сколько трафика он скачал: grep 'фрагмент-имени' access.log | awk '{s+=$10} END {print s/1024/1024, "МБ"}'. Полезно, когда тариф считает исходящий трафик.
- Какие коды ответа он получал: grep 'фрагмент-имени' access.log | awk '{print $9}' | sort | uniq -c | sort -rn. Много 404 и 5xx — робот ходит по мусорным адресам и роняет сервер вместо того, чтобы читать товар.
- Куда именно он ходил: grep 'фрагмент-имени' access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -40. Здесь обычно и вскрывается, что весь обход ушёл в комбинации фильтров и внутренний поиск.
Без консоли тоже можно: скачайте лог за сутки, откройте в табличном редакторе с разделителем «пробел», отсортируйте по последнему столбцу и посчитайте строки по каждому агенту. Медленнее, но результат тот же. Ориентир по объёму: суточный лог каталожного сайта — это обычно от 50 до 300 тысяч строк и 20-80 МБ, редактор такое открывает, хотя и не мгновенно.
Важная деталь: user-agent подделывается в одну строку. Любой парсер может представиться поисковым роботом, чтобы его не блокировали. Проверка — обратный DNS: берём IP из лога, смотрим имя хоста, потом это имя разрешаем обратно в IP и сверяем. Настоящие роботы Яндекса резолвятся в домены yandex.ru, yandex.net и yandex.com, робот Google — в googlebot.com и google.com. Если имя не сходится, перед вами не поисковик, и правила robots.txt на такого гостя не действуют по определению.
Типовая ошибка владельца — посмотреть один час одного дня. Роботы ходят волнами: обход раздела может занимать три часа раз в неделю, и по случайному часу вы либо не увидите его вовсе, либо решите, что вас атакуют. Берите минимум семь суток подряд и сравнивайте с той же неделей месяц назад. Заодно вы увидите то, что обычно всплывает при техническом аудите сайта: дубли адресов, вечные редиректы и разделы, отдающие 500-е коды.
И про данные. В логе лежат IP-адреса посетителей, адреса страниц и иногда параметры запросов. Не выгружайте сырой лог целиком в чат-помощника, чтобы он «сам всё разобрал»: обезличивайте, убирая столбец с адресами, или считайте на своей стороне командами выше. Правовую квалификацию таких данных и порядок их хранения уточните у юриста — здесь лучше спросить заранее, чем разбираться потом.
Что даёт запрет и что он одновременно отнимает
Теперь самое важное: что вы реально покупаете строчкой запрета и чем за неё платите. Начнём с того, чего запрет не делает, потому что здесь у большинства владельцев главная иллюзия.
robots.txt — это просьба, а не замок. Файл лежит в открытом доступе, любой может его прочитать, и соблюдают его добросовестные роботы: поисковики, крупные ИИ-краулеры, известные сервисы. Парсер цен конкурента и сканер уязвимостей его игнорируют — более того, для них список запрещённых каталогов работает как подсказка, куда идти. Поэтому защита контента от парсинга и правила обхода — две разные задачи: первая решается на уровне сервера ограничением частоты, ответами 429 и блокировками, вторая — текстовым файлом в корне.
Что запрет действительно даёт:
- Ваши тексты не попадают в новые обучающие выборки тех сервисов, которые правила соблюдают. Оговорка существенная: то, что уже собрано раньше, из чужих корпусов не исчезнет.
- Немного падает нагрузка. Обычно ИИ-краулеры — это 3-15% запросов, у контентных проектов с большим блогом до 20-25%. Это заметно в счётчике ресурсов, но редко решает проблему медленного сайта.
- Меньше готового материала для чужих компиляций. Частично: описания товаров и цены всё равно доступны через каталоги, площадки объявлений и карточки в Яндекс Бизнесе.
Что запрет отнимает:
- Упоминания в ответах. Если робот не может прочитать страницу, компания не появится в ответе — а конкурент, который остался открытым, появится. Это самая недооценённая потеря: она не видна ни в одном отчёте, потому что пропавшего показа никто не считает.
- Переходы. В наших проектах трафик с сервисов, отвечающих текстом, обычно составляет 0,5-4% визитов. Цифра скромная, но люди приходят прочитавшими ответ и с готовым вопросом, и заявок с такого визита обычно больше среднего по сайту.
- Актуальность. Когда доступа к сайту нет, ответ соберут из старых копий и чужих пересказов. Для мебели, окон и авто это означает, что в ответе окажутся прошлогодние цены, снятые с производства модели и сроки поставки, которых у вас давно нет.
Дальше считаем. Откройте Метрику: Отчёты → Стандартные отчёты → Источники → Источники, сводка, разверните «Переходы по ссылкам с сайтов» и выпишите домены сервисов, которые отвечают текстом. Сохраните их отдельным сегментом кнопкой «Сегмент» → «Сохранить», задайте условие «Источники» → «Сайт» → «содержит» и посмотрите за последние 3-6 месяцев: сколько визитов, сколько достижений цели, какой процент отказов. Вот это и есть цена вопроса в цифрах, а не в ощущениях. Если из этого сегмента приходит десяток заявок в месяц, закрывать доступ целиком — дорогое удовольствие.
Типовая ошибка владельца здесь такая: закрыть всё и ждать, что упоминания исчезнут. Через месяц он обнаруживает, что его товары по-прежнему пересказываются в ответах — только теперь по данным с площадок объявлений, из отзывов и по описаниям дилеров, где цены выше, а комплектация не ваша. Управлять этим уже нельзя: вы отключили себе право голоса, но не отключили разговор. Если задача — чтобы про вас говорили правильно, работает противоположный подход: открытые страницы с конкретикой, ценами и условиями, написанные так, чтобы их было удобно цитировать. Как готовить такие тексты, мы разбирали в материале про текст под нейропоиск.
Три позиции: открыть всё, закрыть всё, разделить по разделам
Крайних решений два, рабочих — три. Ниже сравнение, после него — как выбрать своё за пять минут.
| Позиция | Что делаем | Что получаем | Чем платим | Кому подходит |
|---|---|---|---|---|
| Открыть всё | Общие правила для всех, отдельных запретов по ИИ-роботам нет | Максимум шансов попасть в ответы и получить упоминание компании | Тексты уходят и в обучающие корпуса, обход добавляет 3-15% запросов | Каталоги, услуги, стройка, ремонт, B2B — тем, кому нужна известность |
| Закрыть всё | Запрет обхода для всех агентов, кроме поисковых роботов | Новые обучающие выборки вас не получают, нагрузка чуть ниже | Из ответов пропадаете вы, а конкурент остаётся; переходы теряются целиком | Проекты, где контент и есть продукт: платные базы, расчётные сервисы, методики |
| Разделить по разделам | Коммерческие и справочные страницы открыты, служебные и самое ценное закрыты | Упоминания и переходы сохраняются, ценное не отдаётся | Полчаса на настройку и полчаса на проверку раз в квартал | Большинству проектов |
Третья позиция в наших проектах выбирается чаще двух других, и вот как она собирается на практике. Разделите сайт на четыре корзины:
- Открыть уверенно. Каталог, карточки товаров и услуг, страницы цен и условий, доставка и оплата, гарантия, контакты, портфолио и выполненные объекты, блог. Это то, чем вы хотите, чтобы вас представляли. Сюда же — страницы, отвечающие на вопросы «сколько стоит», «какие сроки», «что входит в монтаж».
- Закрыть в любом случае, для всех роботов. Корзина, оформление заказа, личный кабинет, страницы результатов внутреннего поиска, сравнение, служебные каталоги движка, тестовые копии и поддомены разработки, файлы выгрузок для маркетплейсов.
- Закрыть только для ИИ-краулеров. Материалы, где ваша уникальная методика: подробные расчёты, инженерные таблицы подбора, замерные инструкции, обучающие материалы для дилеров. Их логично держать в поиске (люди по ним приходят), но не отдавать целиком в чужой пересказ.
- Разбираться отдельно. Страницы с параметрами фильтров и сортировки. Это отдельная большая тема, и решать её строчкой в robots.txt наугад — путь к потере трафика с фильтров; мы разбирали её в материале про фильтры каталога и индексацию.
Как выбрать позицию быстро. Задайте себе два вопроса. Первый: если завтра ваш сайт исчезнет из всех текстовых ответов, вы это заметите по деньгам? Для интернет-магазина мебели, оконной компании или отделочника ответ обычно «да, заметим не сразу, но заметим». Для B2B с длинным циклом сделки — «заметим по числу обращений от новых компаний». Второй: есть ли у вас на сайте материал, который сам по себе является товаром и который клиент покупает? Если да, эту часть закрываем адресно, остальное оставляем открытым.
Что не нужно закрывать ни в одной из позиций — цены и условия. Регулярно встречается логика «уберём цены от роботов, чтобы конкуренты не видели»: конкурент увидит их за две минуты руками, а вот из ответов вы выпадете — на вопрос «сколько стоит» ответят те, у кого цифра доступна. Это тот же выбор, который разбирается в материале о том, показывать цены на сайте или нет, только теперь ставка выше: закрытая цена означает отсутствие в ответе целиком, а не просто менее удобный сайт.
И ещё: закрытая часть за авторизацией — дилерские прайсы, личный кабинет клиента, база документов — роботам недоступна и без robots.txt. Если что-то из этого всё-таки нашлось в логах обхода, проблема не в файле, а в правах доступа, и чинить надо её.
Синтаксис robots.txt без ошибок, которые стоят трафика
Файл простой, но у него есть несколько правил, нарушение которых стоит трафика. Разберём их по порядку — с примерами того, как это ломается в реальности.
- User-agent: имя-агента — начало группы правил ровно для одного робота. Имя берите из своих логов, а не из чужого списка в интернете: агенты появляются и переименовываются, и половина популярных подборок к 2026 году уже устарела.
- Disallow: /cart/ — запрет на адреса, начинающиеся с этого пути. Disallow: / — запрет на весь сайт. Disallow: без значения — наоборот, разрешение всего.
- Allow: /catalog/ — исключение из запрета. При конфликте выигрывает более длинное и точное правило, а не то, что написано ниже.
- Спецсимволы: звёздочка заменяет любую последовательность, знак доллара в конце означает точное окончание адреса. Правило «Disallow: /*sort=» закроет все адреса с этим параметром в любом месте строки.
- Sitemap: полный адрес карты сайта — пишется отдельной строкой и действует для всех роботов независимо от групп.
- Clean-param — директива Яндекса, помогает объединить адреса, отличающиеся только служебным параметром. Другие роботы её не читают.
Теперь ошибки, которые встречаются чаще всего.
Отдельная группа отменяет общие правила. Это самая дорогая ошибка и её почти невозможно заметить глазами. Робот выполняет ровно одну группу — ту, где указано его имя, — и правила из группы «User-agent: *» к нему уже не применяются. Владелец добавляет в конец файла три строки для ИИ-краулера с одним запретом, радуется — и получает робота, который теперь свободно ходит в корзину, во внутренний поиск и в бесконечные комбинации фильтров, потому что общий блок запретов для него перестал существовать. Правильно так: в персональную группу копируются все запреты из общей плюс добавляются новые.
Пустая строка внутри группы её разрывает. Всё, что после пустой строки, считается новой группой без указания агента и может быть проигнорировано. Внутри блока пустых строк быть не должно, между блоками — одна.
Файл лежит только в корне. Один домен — один файл по адресу вида example.ru/robots.txt. Для поддомена нужен свой файл; правила основного сайта на него не распространяются. Про тестовые поддомены забывают чаще всего — и в поиск попадает копия сайта разработчика.
Регистр важен, кириллица требует кодирования. Путь /Catalog/ и /catalog/ — разные адреса. Русские буквы в адресе записываются в закодированном виде, иначе строка не сработает.
Файл отдаёт не тот код. Если robots.txt возвращает 500-ю ошибку, часть роботов трактует это как запрет всего сайта. Проверьте, что открывается с кодом 200 и типом text/plain. И убедитесь, что вы правите настоящий файл: некоторые движки отдают виртуальный robots.txt, когда физического в корне нет, и ваш загруженный по FTP файл просто не показывается. У сайтов на WordPress это классическая ловушка — правки делаются либо в плагине, либо созданием реального файла в корне, иначе они не применяются.
Закрытие в robots.txt не убирает страницу из выдачи. Если адрес уже проиндексирован, запрет обхода означает лишь то, что робот перестанет туда заходить, — страница может остаться в поиске без описания. Для удаления нужен мета-тег noindex на самой странице (и доступ к ней открыт, чтобы робот этот тег увидел) или удаление адреса через инструменты Вебмастера.
Проверка занимает две минуты и делает её Вебмастер: Инструменты → Анализ robots.txt. Вставьте содержимое файла, ниже добавьте 10-15 адресов — главную, категорию, карточку, страницу фильтра, корзину, служебный адрес — и нажмите «Проверить». Напротив каждого появится «разрешён» или строка правила, которое его запретило. Прогоняйте этот список после каждой правки. Что ещё смотреть в кабинете и как читать остальные отчёты — в материале про Яндекс Вебмастер.
Нагрузка на сервер: когда пора ограничивать частоту обхода
Вторая причина, по которой владельцы закрывают роботов, — сайт стал медленным. Тут важно не перепутать причину со следствием: в наших проектах ИИ-краулеры оказываются виновником замедления реже, чем на них думают. Сначала измеряем, потом ограничиваем.
Как понять, что нагрузку создают именно боты:
- Откройте в панели хостинга статистику потребления ресурсов — процессорное время, память, число процессов. Посмотрите график за 30 дней и найдите пики.
- Сопоставьте пики с логом по часам: cut -d'[' -f2 access.log | cut -d':' -f2 | sort | uniq -c. Получите распределение запросов по часам суток. Если пик приходится на ночь, живые люди тут ни при чём.
- В пиковый час посмотрите топ агентов той же командой, что в разделе про логи. Обычно на этом месте выясняется, что 40% запросов сделал один робот.
- Проверьте, куда он ходил. Ориентир: если больше половины его запросов — это адреса с параметрами фильтров, сортировки, страниц пагинации и внутреннего поиска, проблема не в роботе, а в структуре адресов.
Пороговые ориентиры из практики: устойчивые 1-2 запроса в секунду от одного агента на обычном хостинге уже заметны, 5-10 запросов в секунду кладут генерацию страниц на средних тарифах. Если боты съедают больше 30% лимита процессорного времени тарифа — пора действовать. Отдельный сигнал тревоги — рост доли ответов 5xx в логе: сервер уже не справляется, и следом просядет обход поисковыми роботами.
| Способ | Что делает | Когда применять | Риск |
|---|---|---|---|
| Скорость обхода в Вебмастере | Ограничивает частоту роботов Яндекса | Когда в статистике обхода виден рост запросов и ответов 5xx | Слишком низкое значение замедлит переиндексацию новых страниц |
| Crawl-delay в robots.txt | Просит паузу между запросами | Для сторонних роботов, которые её ещё читают | Крупные поисковики директиву не учитывают, полагаться на неё не стоит |
| Ограничение частоты на сервере | Режет число запросов в секунду с одного агента или адреса | Когда робот игнорирует robots.txt | Ошибка в правиле задевает поисковых роботов |
| Ответ 429 с заголовком Retry-After | Сообщает роботу, что можно вернуться позже | Как мягкая альтернатива блокировке | Небольшой, если 429 не прилетает живым посетителям |
| Кэширование и CDN | Отдаёт готовую страницу без обращения к базе | Когда нагрузку создаёт генерация страниц на лету | Встроенная «защита от ботов» может отсечь и поисковиков |
| Блокировка по IP или сети | Полный отказ в доступе | Для парсеров цен и сканеров уязвимостей | Адреса меняются, список нужно поддерживать |
Порядок действий такой. Сначала уберите бесконечность: закройте от обхода адреса с параметрами сортировки, страницы внутреннего поиска, календари и комбинации фильтров глубже двух-трёх значений. В наших проектах одно это снижает бот-нагрузку на 20-50% — и заодно чинит раздутый индекс. Вторым шагом включите кэширование страниц каталога. Третьим — задайте скорость обхода в Вебмастере: Индексирование → Скорость обхода, переключатель с «Доверить Яндексу» на ручное значение. И только четвёртым, если не помогло, ограничивайте частоту на сервере адресно.
Ошибка владельца на этом шаге почти всегда одинаковая: включить в панели хостинга или у CDN общую «защиту от ботов» одним тумблером. Формально нагрузка падает. Фактически через две-три недели просядет обход поисковыми роботами, а вместе с ним и позиции. Проверить это можно сразу: Вебмастер → Инструменты → Проверка ответа сервера, выберите робота в списке user-agent, вставьте адрес главной и карточки товара, нажмите «Проверить» — должен вернуться код 200. Если 403 или 429, защита режет своих.
И держите в голове, что скорость сайта для живого человека и нагрузка от ботов — связанные, но разные истории: боты грузят сервер, а конверсию убивают тяжёлые картинки и скрипты. Как одно влияет на другое, мы разбирали в материале про скорость сайта и конверсию.
Чек-лист проверки после любых изменений в доступе
Правки в доступе опасны тем, что последствия видны не сразу: файл вы поменяли сегодня, а трафик просядет через две-три недели, и связать одно с другим будет уже сложно. Поэтому проверка делается в два захода — сразу после правки и через две недели.
В день правки, по порядку:
- Откройте адрес вашсайт.ру/robots.txt в браузере в режиме инкогнито. Файл должен открыться как обычный текст, без ошибок и без оформления страницы. Если открылась 404-я или дизайн сайта — вы правили не тот файл.
- Вебмастер → Инструменты → Анализ robots.txt. Вставьте содержимое, добавьте список из 10-15 адресов (главная, раздел каталога, две карточки, страница услуги, статья блога, контакты, корзина, служебный адрес, страница фильтра) и проверьте. Главная и коммерческие страницы — «разрешён», служебные — «запрещён».
- Вебмастер → Инструменты → Проверка ответа сервера. Прогоните 3-5 адресов с выбором робота в списке user-agent: везде должен быть код 200.
- Запишите в отдельный файл дату, что именно поменяли и зачем. Через полгода это сэкономит вечер разбирательств, а при смене подрядчика — неделю.
Через 7-14 дней:
- Вебмастер → Индексирование → Статистика обхода. Смотрите динамику числа обойдённых страниц и распределение кодов ответа. Провал обхода вдвое — сигнал, что правило задело поисковых роботов.
- Вебмастер → Индексирование → Страницы в поиске → вкладка «Исключённые». Отфильтруйте по статусу, связанному с запретом в robots.txt, и убедитесь, что там только те адреса, которые вы закрывали намеренно.
- Search Console → Настройки → Статистика сканирования. То же самое со стороны Google: число запросов, средняя скорость ответа, доля ошибок.
- Метрика → сохранённый ранее сегмент с переходами с сервисов ответов. Сравните две недели до и две после: если переходы обнулились, а вы этого не планировали, ищите лишний запрет.
- Снова снимите топ агентов из логов и сравните с первым замером. Так вы увидите, кто действительно перестал ходить, а кто правила проигнорировал.
Ориентиры по срокам: robots.txt роботы перечитывают обычно раз в сутки, поэтому эффект на обходе виден в течение 1-3 дней. Изменения в индексе — 1-3 недели, иногда дольше на больших каталогах. Не делайте выводов на второй день и, что важнее, не меняйте файл каждые три дня: вы потеряете возможность понять, какая именно правка сработала.
Отдельно — про откат. Держите копию предыдущей версии файла рядом, с датой в имени. Если через две недели обход упал, а причина неочевидна, вернуть старую версию и посмотреть, восстановится ли картина, быстрее, чем искать ошибку в логике правил. Это стандартная процедура разбора, когда показатели поехали вниз, — мы описали её целиком в материале о том, что делать, если трафик упал: сначала список изменений с датами, потом сопоставление с графиком, и только потом гипотезы.
И последнее. Пересматривайте решение раз в квартал, а не один раз навсегда. Роботы появляются новые, имена агентов меняются, а вместе с ними меняется и цена вопроса: сегодня переходы из ответов дают полпроцента визитов, через полгода — четыре. Двадцать минут раз в три месяца на просмотр логов и сверку списка агентов — нормальная плата за то, чтобы не обнаружить однажды, что вас нет там, где клиенты уже задают вопросы.
Путь клиента: где эта тема срабатывает
Тема всплывает в момент, когда владелец узнаёт, что его тексты пересказываются в ответах нейросетей, и первым порывом хочет закрыть доступ целиком. Ниже — путь от эмоции к решению, которое считается в цифрах.
Что у клиентаЗадал вопрос про свой товар и увидел пересказ своей же страницы без ссылки на компанию. Первая мысль — всё запретить.
Что делаемСнимаем факты: выгружаем лог за 7 суток и считаем, кто реально приходил и сколько запросов сделал.
Сигнал, что работаетЕсть список агентов с числом запросов, объёмом трафика и разделами, куда они ходили.
Что у клиентаКажется, что от ИИ-роботов нет никакой пользы, а нагрузка есть.
Что делаемВ Метрике собираем сегмент переходов с сервисов, отвечающих текстом, и смотрим визиты и достижения целей за 3-6 месяцев.
Сигнал, что работаетИзвестна цена вопроса в заявках: от нуля до нескольких десятков обращений в месяц.
Что у клиентаГотов не закрывать всё, но не понимает, что именно можно отдавать, а что нет.
Что делаемРаскладываем сайт на четыре корзины: открыть, закрыть для всех, закрыть только для ИИ-роботов, разбираться отдельно.
Сигнал, что работаетЕсть согласованный список разделов и переписанный robots.txt с копией прежней версии.
Что у клиентаСайт по вечерам подтормаживает, хостинг присылает уведомления о лимитах.
Что делаемЗакрываем бесконечные комбинации фильтров и внутренний поиск, включаем кэш, задаём скорость обхода в Вебмастере.
Сигнал, что работаетДоля ответов 5xx в логе падает, потребление ресурсов возвращается в лимит тарифа.
Что у клиентаПравки внесены, но непонятно, не задели ли они поисковых роботов.
Что делаемЧерез 7-14 дней сверяем статистику обхода, исключённые страницы и сегмент переходов; возвращаемся к вопросу раз в квартал.
Сигнал, что работаетОбход поисковых роботов на прежнем уровне, закрытыми оказались только запланированные адреса.
Стратегия: что делать по шагам
Цель: Принять решение по доступу роботов на основе своих логов и цифр по переходам, а не по совету из чата, и внедрить его так, чтобы не потерять поисковый трафик.
- День 1 Включить ведение логов, если оно отключено, и выгрузить доступ за последние 7 суток. Свести топ агентов, объём трафика и коды ответа. Таблица: кто ходит, сколько запросов, куда именно, какие ответы получает.
- День 2 Собрать в Метрике сегмент переходов с сервисов ответов и посмотреть визиты и цели за 3-6 месяцев. Проверить подлинность спорных роботов обратным DNS. Понятная цена запрета в обращениях и очищенный список реальных гостей.
- Дни 3-4 Разложить разделы на четыре корзины и переписать robots.txt: общая группа плюс персональные группы с полным набором запретов. Сохранить копию прежней версии с датой. Новый файл в корне, старая версия лежит рядом для отката.
- День 4 Прогнать 10-15 адресов через «Анализ robots.txt» в Вебмастере и проверить коды ответа для поисковых роботов через «Проверку ответа сервера». Разрешения совпадают с задуманным, коды ответа 200 на всех коммерческих страницах.
- Неделя 2 Снять нагрузку: закрыть комбинации фильтров и внутренний поиск, включить кэширование, при необходимости задать скорость обхода и ограничение частоты для агентов, игнорирующих правила. Потребление ресурсов в пределах тарифа, доля 5xx снижается.
- Раз в квартал Повторно снять топ агентов, сверить со списком в файле, пересчитать переходы из ответов и пересмотреть решение. Файл соответствует реальности, новые роботы не проходят мимо решения.
Сроки — ориентир для планирования, а не обязательство: скорость зависит от ниши, конкуренции и состояния сайта.
Чек-лист: правки доступа роботов без потери трафика
Пройдите пункты по порядку — до правки, в день правки и через две недели после неё.
- Выгрузите лог за 7 суток и сведите топ агентов по числу запросов
- Проверьте, куда именно ходят роботы: каталог или комбинации фильтров и внутренний поиск
- Сверьте спорных роботов обратным DNS — user-agent подделывается
- Соберите в Метрике сегмент переходов с сервисов, отвечающих текстом, и посмотрите цели
- Разложите разделы на четыре корзины: открыть, закрыть для всех, закрыть для ИИ-роботов, разбираться отдельно
- Скопируйте в каждую персональную группу User-agent все запреты из общей группы
- Уберите пустые строки внутри групп и проверьте, что файл лежит в корне домена
- Сохраните копию прежней версии robots.txt с датой в имени
- Проверьте 10-15 адресов в Вебмастере через «Анализ robots.txt»
- Прогоните главную и карточку через «Проверку ответа сервера» с выбором поискового робота
- Через 7-14 дней сверьте статистику обхода и вкладку «Исключённые» в Страницах в поиске
- Запишите дату и суть правки в журнал изменений и вернитесь к вопросу через квартал
Мы почти никогда не закрываем всё целиком. Сначала неделю смотрим логи: кто ходит, сколько запросов, куда лезет. Чаще всего оказывается, что сервер грузят не ИИ-краулеры, а комбинации фильтров и парсеры цен, и лечится это не строчкой в robots.txt, а закрытием параметров и кэшем.
Что в итоге
Решение по доступу роботов перестало быть техническим — это выбор между «нас не пересказывают» и «нас упоминают». Крайности здесь стоят дорого в обе стороны: открытый настежь сайт отдаёт тексты в обучающие корпуса, закрытый наглухо выпадает из ответов, а вопрос клиента всё равно получает ответ — только по чужим данным и с чужой ценой.
Рабочая середина собирается за один вечер: неделя логов, сегмент переходов в Метрике, четыре корзины разделов и аккуратный robots.txt с полным набором запретов в каждой группе. Дальше — две проверки в Вебмастере и журнал изменений, чтобы через месяц не гадать, из-за чего просел обход. И пересмотр раз в квартал: имена агентов меняются быстрее, чем успевают устареть чужие подборки в интернете.
С чего начать: Сегодня выгрузите лог за последние семь суток и сведите топ агентов одной командой — до этого замера любые правки в robots.txt делаются вслепую.
Вопросы и ответы
Стоит ли вообще закрывать ИИ-краулеры в robots.txt?
Зависит от того, что вы продаёте. Если контент — вспомогательный инструмент продаж (каталог мебели, окна, ремонт, автоуслуги, B2B-поставки), закрывать целиком обычно невыгодно: вместе с обучающими роботами вы выключаете тех, кто приводит людей из ответов. Если контент и есть продукт — расчётные методики, платные базы, обучающие материалы, — эту часть логично закрыть адресно, а коммерческие страницы оставить открытыми. Универсального ответа нет, считайте по своему сегменту переходов в Метрике.
Защищает ли robots.txt контент от копирования?
Нет. Это просьба, а не блокировка: файл читают добросовестные роботы, а парсеры цен и сканеры уязвимостей его игнорируют — для них список закрытых каталогов скорее подсказка. Защита от парсинга делается на уровне сервера: ограничение числа запросов в секунду, ответы 429 и 403, блокировка по адресам и сетям, кэширование. Это отдельная задача, и robots.txt её не решает.
Как отличить настоящего поискового робота от подделки?
По обратному DNS, потому что user-agent подделывается в одну строку. Возьмите IP из лога, получите по нему имя хоста, затем разрешите это имя обратно в IP и сверьте. Роботы Яндекса резолвятся в домены yandex.ru, yandex.net и yandex.com, робот Google — в googlebot.com и google.com. Если имя не сходится, правила robots.txt для этого гостя не работают и вопрос решается блокировкой.
Почему после добавления группы для одного робота он полез в корзину и поиск?
Потому что робот выполняет ровно одну группу правил — ту, где указано его имя. Общий блок «User-agent: *» к нему после этого не применяется. Если вы добавили персональную группу с одним запретом, все остальные ваши запреты для него исчезли. Правило простое: в персональную группу копируются все запреты из общей плюс дописываются новые. Проверяется это за две минуты в Вебмастере, в инструменте «Анализ robots.txt».
Через сколько подействуют изменения в robots.txt?
Роботы перечитывают файл обычно раз в сутки, поэтому изменение обхода видно за 1-3 дня — в Вебмастере это Индексирование → Статистика обхода. Изменения в индексе занимают 1-3 недели, на больших каталогах дольше. Не меняйте файл чаще раза в две недели: иначе вы не поймёте, какая именно правка дала эффект.
Как понять, что пора ограничивать частоту обхода?
Смотрите три сигнала: в панели хостинга боты занимают больше 30% лимита процессорного времени; в логе один агент даёт устойчиво больше 1-2 запросов в секунду; растёт доля ответов 5xx. Но сначала проверьте, куда робот ходит — если больше половины запросов уходит в комбинации фильтров, сортировки и внутренний поиск, закрытие этих адресов снимает 20-50% нагрузки и ограничивать никого не придётся.
- Структура каталога, собранная из спроса, а не из выгрузки
- Ускорение загрузки первого экрана
- Интеграция форм с CRM без потери источника
- Редизайн без переноса структуры и адресов
- Тяжёлые изображения и скрипты «на всякий случай»
- Формы без передачи источника заявки
Что делать дальше
₽Посчитать экономикуСходится ли реклама при вашем чеке
?Задать вопросОтветим по вашей ситуации
Опишите задачу в двух словах — специалист ответит в Telegram, обычно в течение рабочего дня. Без презентаций и обязательств.
Написать в Telegram ↗✓Заявка на продвижениеОценить мой сайт
Бесплатно оценим текущее состояние и риски — до того, как вы начнёте что-то менять.
Обсуждение
Спросите, что осталось непонятным — автор материала отвечает в комментариях.
