Разработка

ИИ-краулеры на сайте: как посмотреть логи и выбрать позицию по доступу

15 мин чтения
Игорь Волков — портрет-иллюстрация
Руководитель отдела разработки Media Monster
2 764 просмотров

Владельцы узнали, что их тексты уходят в обучение и в ответы нейросетей, и массово закрывают доступ целиком — вместе с шансом быть процитированными. К 2026 году решение стало двусторонним: закрыть можно, но вместе с обучающими роботами вы выключаете и тех, кто приводит людей. Ниже — процедура на один вечер: посмотреть логи и увидеть реальных гостей, посчитать, что даёт и что отнимает запрет, выбрать одну из трёх позиций и проверить результат по Вебмастеру, чтобы не выпасть из поиска по опечатке в robots.txt.

Коротко — главное из статьи
  • Сначала логи, потом robots.txt. В наших проектах роботы дают 30-60% всех запросов, но ИИ-краулеры среди них обычно только 3-15% — а грузят сервер чаще комбинации фильтров и парсеры цен.
  • Роботы делятся на тех, кто собирает тексты для обучения, и тех, кто приходит собрать ответ со ссылкой на вас. Первых можно закрыть почти без потерь, вторых закрывать — значит добровольно пропасть из ответов.
  • robots.txt — просьба, а не защита. Парсеры и сканеры её не читают вовсе; ограничение частоты и блокировки делаются на уровне сервера.
  • Самая дорогая ошибка — отдельная группа User-agent для одного робота: она отменяет для него все общие правила, и он уходит во внутренний поиск и фильтры. Проверять правки нужно в Вебмастере, в инструменте «Анализ robots.txt».
  • Логи содержат IP-адреса и адреса страниц: выгружать их целиком в чат-помощник для разбора не стоит, обезличивайте или разбирайте на своей стороне; правовую квалификацию таких данных уточните у юриста.

Кто обходит сайт кроме привычных поисковых роботов

Откройте лог сервера за любые сутки — живых посетителей в нём окажется меньшинство. В наших проектах доля запросов от роботов обычно составляет 30-60% всего потока, а у каталогов с фильтрами доходит до 70-80%. ИИ-краулеры — лишь часть этой массы, и принимать решение по ним, не разобрав остальных, бессмысленно: закроете не то, что на самом деле грузит сервер.

Шесть групп, которые встречаются почти в любом проекте:

  • Поисковые роботы Яндекса и Google. Ходят регулярно, приносят органический трафик. Их не закрывают нигде, кроме служебных разделов.
  • Обучающие ИИ-краулеры. Скачивают тексты в корпус, на котором учат языковые модели. Прямых переходов не дают ни завтра, ни через год.
  • Индексирующие роботы сервисов ответов. Строят собственный индекс страниц, из которого потом собирается ответ пользователю со ссылкой на источник. Именно они приносят упоминания.
  • Заходы по запросу пользователя. Робот приходит в тот момент, когда живой человек задал вопрос или вставил ссылку: одна-две страницы, без обхода вглубь. Такой заход чаще всего заканчивается цитатой или переходом.
  • SEO- и аналитические сервисы. Снимают структуру и ссылки для отчётов — ваших и чужих. Нагрузку создают, пользы не приносят, если вы этими сервисами не пользуетесь.
  • Парсеры конкурентов и сканеры уязвимостей. Первые снимают цены и остатки по каталогу, вторые перебирают адреса админки и служебных файлов. Ни те, ни другие robots.txt не читают в принципе.
Кто обходит сайт кроме привычных поисковых роботов
Кто приходитЗачемДаёт трафикЧитает robots.txtЧто обычно делаем
Поисковые роботыИндексация для выдачиДа, основной источникДаОткрываем всё, кроме служебного
Обучающие ИИ-краулерыСбор текстов для обучения моделейНетКак правило, даРешение владельца, потери небольшие
Роботы сервисов ответовСвой индекс для ответов со ссылкамиДа, немного, но качественныйКак правило, даОставляем открытыми
Заход по запросу пользователяПрочитать конкретную страницу здесь и сейчасДа, вплоть до прямого переходаНе всегдаОставляем открытым
SEO-сервисыДанные для отчётов и баз ссылокНетОбычно даЗакрываем или ограничиваем частоту
Парсеры и сканерыСнять цены, найти дыру в админкеНетНетБлокируем на уровне сервера

Разделение внутри ИИ-роботов и есть суть всего решения. Обучающий краулер забирает текст и не возвращает ничего измеримого. Робот сервиса ответов и заход по запросу пользователя работают иначе: они читают страницу, чтобы собрать из неё ответ и поставить ссылку. Строчка в robots.txt вида «запретить всем нейросетям» бьёт по всем трём сразу, а фраза «мы просто запретили обучение» — обычно самообман: имена агентов в файле выписаны наугад из чужого совета, а не из ваших логов. Как устроено попадание в такие ответы и что для него нужно на стороне сайта, мы разбирали в материале про продвижение в ответах нейросетей.

Отдельно про Метрику: искать там ботов не нужно. Счётчик — это скрипт, который выполняется в браузере, а большинство краулеров скрипты не исполняют, поэтому в отчётах их просто нет. В счётчике есть «Фильтрация роботов» (Настройка счётчика → вкладка «Фильтры») и отчёт Отчёты → Стандартные отчёты → Мониторинг → Роботы, но там видна только та малая часть, которая скрипт всё-таки выполнила. Источник правды по обходу — логи сервера, всё остальное производно. Проверить обратную сторону — цитируют ли вас в ответах и приходят ли люди — можно отдельной процедурой, мы описали её в материале о том, как проверить, цитирует ли вас нейропоиск.

Как посмотреть логи сервера и понять, кто приходил

Лог доступа — текстовый файл, куда сервер пишет каждый запрос: с какого адреса пришли, когда, за какой страницей, что получили в ответ и сколько байт скачали. В самом конце строки стоит user-agent — то, как робот сам себя представил. Это самый достоверный источник данных по обходу.

Где искать файл:

  • Обычный хостинг: панель управления → раздел «Логи» или «Журналы». Файлы вида site-access.log, ротация чаще всего раз в сутки, хранение 7-30 дней. Если раздел пуст, ведение логов включается там же галочкой — включите и вернитесь через сутки.
  • Сервер с nginx: /var/log/nginx/access.log, рядом лежат сжатые архивы прошлых дней.
  • Сервер с Apache: /var/log/apache2/access.log или /var/log/httpd/access_log.
  • Если перед сайтом стоит CDN или защитный прокси, часть запросов до вашего сервера не доходит вовсе — тогда картину по ботам смотрите ещё и в панели этого сервиса, иначе половина обхода останется невидимой.

Пять команд, которые дают полную картину примерно за десять минут. Подставьте имя своего файла и фрагмент имени агента из первого списка:

  1. Кто приходил и сколько раз: awk -F'"' '{print $6}' access.log | sort | uniq -c | sort -rn | head -30. Слева — число запросов, справа — представление робота. Начинайте разбор именно отсюда.
  2. Сколько запросов сделал конкретный робот: grep -c 'фрагмент-имени' access.log.
  3. Сколько трафика он скачал: grep 'фрагмент-имени' access.log | awk '{s+=$10} END {print s/1024/1024, "МБ"}'. Полезно, когда тариф считает исходящий трафик.
  4. Какие коды ответа он получал: grep 'фрагмент-имени' access.log | awk '{print $9}' | sort | uniq -c | sort -rn. Много 404 и 5xx — робот ходит по мусорным адресам и роняет сервер вместо того, чтобы читать товар.
  5. Куда именно он ходил: grep 'фрагмент-имени' access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head -40. Здесь обычно и вскрывается, что весь обход ушёл в комбинации фильтров и внутренний поиск.

Без консоли тоже можно: скачайте лог за сутки, откройте в табличном редакторе с разделителем «пробел», отсортируйте по последнему столбцу и посчитайте строки по каждому агенту. Медленнее, но результат тот же. Ориентир по объёму: суточный лог каталожного сайта — это обычно от 50 до 300 тысяч строк и 20-80 МБ, редактор такое открывает, хотя и не мгновенно.

Важная деталь: user-agent подделывается в одну строку. Любой парсер может представиться поисковым роботом, чтобы его не блокировали. Проверка — обратный DNS: берём IP из лога, смотрим имя хоста, потом это имя разрешаем обратно в IP и сверяем. Настоящие роботы Яндекса резолвятся в домены yandex.ru, yandex.net и yandex.com, робот Google — в googlebot.com и google.com. Если имя не сходится, перед вами не поисковик, и правила robots.txt на такого гостя не действуют по определению.

Типовая ошибка владельца — посмотреть один час одного дня. Роботы ходят волнами: обход раздела может занимать три часа раз в неделю, и по случайному часу вы либо не увидите его вовсе, либо решите, что вас атакуют. Берите минимум семь суток подряд и сравнивайте с той же неделей месяц назад. Заодно вы увидите то, что обычно всплывает при техническом аудите сайта: дубли адресов, вечные редиректы и разделы, отдающие 500-е коды.

И про данные. В логе лежат IP-адреса посетителей, адреса страниц и иногда параметры запросов. Не выгружайте сырой лог целиком в чат-помощника, чтобы он «сам всё разобрал»: обезличивайте, убирая столбец с адресами, или считайте на своей стороне командами выше. Правовую квалификацию таких данных и порядок их хранения уточните у юриста — здесь лучше спросить заранее, чем разбираться потом.

Что даёт запрет и что он одновременно отнимает

Теперь самое важное: что вы реально покупаете строчкой запрета и чем за неё платите. Начнём с того, чего запрет не делает, потому что здесь у большинства владельцев главная иллюзия.

robots.txt — это просьба, а не замок. Файл лежит в открытом доступе, любой может его прочитать, и соблюдают его добросовестные роботы: поисковики, крупные ИИ-краулеры, известные сервисы. Парсер цен конкурента и сканер уязвимостей его игнорируют — более того, для них список запрещённых каталогов работает как подсказка, куда идти. Поэтому защита контента от парсинга и правила обхода — две разные задачи: первая решается на уровне сервера ограничением частоты, ответами 429 и блокировками, вторая — текстовым файлом в корне.

Что запрет действительно даёт:

  • Ваши тексты не попадают в новые обучающие выборки тех сервисов, которые правила соблюдают. Оговорка существенная: то, что уже собрано раньше, из чужих корпусов не исчезнет.
  • Немного падает нагрузка. Обычно ИИ-краулеры — это 3-15% запросов, у контентных проектов с большим блогом до 20-25%. Это заметно в счётчике ресурсов, но редко решает проблему медленного сайта.
  • Меньше готового материала для чужих компиляций. Частично: описания товаров и цены всё равно доступны через каталоги, площадки объявлений и карточки в Яндекс Бизнесе.

Что запрет отнимает:

  • Упоминания в ответах. Если робот не может прочитать страницу, компания не появится в ответе — а конкурент, который остался открытым, появится. Это самая недооценённая потеря: она не видна ни в одном отчёте, потому что пропавшего показа никто не считает.
  • Переходы. В наших проектах трафик с сервисов, отвечающих текстом, обычно составляет 0,5-4% визитов. Цифра скромная, но люди приходят прочитавшими ответ и с готовым вопросом, и заявок с такого визита обычно больше среднего по сайту.
  • Актуальность. Когда доступа к сайту нет, ответ соберут из старых копий и чужих пересказов. Для мебели, окон и авто это означает, что в ответе окажутся прошлогодние цены, снятые с производства модели и сроки поставки, которых у вас давно нет.

Дальше считаем. Откройте Метрику: Отчёты → Стандартные отчёты → Источники → Источники, сводка, разверните «Переходы по ссылкам с сайтов» и выпишите домены сервисов, которые отвечают текстом. Сохраните их отдельным сегментом кнопкой «Сегмент» → «Сохранить», задайте условие «Источники» → «Сайт» → «содержит» и посмотрите за последние 3-6 месяцев: сколько визитов, сколько достижений цели, какой процент отказов. Вот это и есть цена вопроса в цифрах, а не в ощущениях. Если из этого сегмента приходит десяток заявок в месяц, закрывать доступ целиком — дорогое удовольствие.

Типовая ошибка владельца здесь такая: закрыть всё и ждать, что упоминания исчезнут. Через месяц он обнаруживает, что его товары по-прежнему пересказываются в ответах — только теперь по данным с площадок объявлений, из отзывов и по описаниям дилеров, где цены выше, а комплектация не ваша. Управлять этим уже нельзя: вы отключили себе право голоса, но не отключили разговор. Если задача — чтобы про вас говорили правильно, работает противоположный подход: открытые страницы с конкретикой, ценами и условиями, написанные так, чтобы их было удобно цитировать. Как готовить такие тексты, мы разбирали в материале про текст под нейропоиск.

Бесплатный SEO-аудит сайта

Разберём ваш сайт, как в статьях этого блога: что мешает расти в Яндексе и Google и где теряются заявки.

Отправка формы не является заключением договора и не порождает обязательств сторон.

Три позиции: открыть всё, закрыть всё, разделить по разделам

Крайних решений два, рабочих — три. Ниже сравнение, после него — как выбрать своё за пять минут.

Три позиции: открыть всё, закрыть всё, разделить по разделам
ПозицияЧто делаемЧто получаемЧем платимКому подходит
Открыть всёОбщие правила для всех, отдельных запретов по ИИ-роботам нетМаксимум шансов попасть в ответы и получить упоминание компанииТексты уходят и в обучающие корпуса, обход добавляет 3-15% запросовКаталоги, услуги, стройка, ремонт, B2B — тем, кому нужна известность
Закрыть всёЗапрет обхода для всех агентов, кроме поисковых роботовНовые обучающие выборки вас не получают, нагрузка чуть нижеИз ответов пропадаете вы, а конкурент остаётся; переходы теряются целикомПроекты, где контент и есть продукт: платные базы, расчётные сервисы, методики
Разделить по разделамКоммерческие и справочные страницы открыты, служебные и самое ценное закрытыУпоминания и переходы сохраняются, ценное не отдаётсяПолчаса на настройку и полчаса на проверку раз в кварталБольшинству проектов

Третья позиция в наших проектах выбирается чаще двух других, и вот как она собирается на практике. Разделите сайт на четыре корзины:

  1. Открыть уверенно. Каталог, карточки товаров и услуг, страницы цен и условий, доставка и оплата, гарантия, контакты, портфолио и выполненные объекты, блог. Это то, чем вы хотите, чтобы вас представляли. Сюда же — страницы, отвечающие на вопросы «сколько стоит», «какие сроки», «что входит в монтаж».
  2. Закрыть в любом случае, для всех роботов. Корзина, оформление заказа, личный кабинет, страницы результатов внутреннего поиска, сравнение, служебные каталоги движка, тестовые копии и поддомены разработки, файлы выгрузок для маркетплейсов.
  3. Закрыть только для ИИ-краулеров. Материалы, где ваша уникальная методика: подробные расчёты, инженерные таблицы подбора, замерные инструкции, обучающие материалы для дилеров. Их логично держать в поиске (люди по ним приходят), но не отдавать целиком в чужой пересказ.
  4. Разбираться отдельно. Страницы с параметрами фильтров и сортировки. Это отдельная большая тема, и решать её строчкой в robots.txt наугад — путь к потере трафика с фильтров; мы разбирали её в материале про фильтры каталога и индексацию.

Как выбрать позицию быстро. Задайте себе два вопроса. Первый: если завтра ваш сайт исчезнет из всех текстовых ответов, вы это заметите по деньгам? Для интернет-магазина мебели, оконной компании или отделочника ответ обычно «да, заметим не сразу, но заметим». Для B2B с длинным циклом сделки — «заметим по числу обращений от новых компаний». Второй: есть ли у вас на сайте материал, который сам по себе является товаром и который клиент покупает? Если да, эту часть закрываем адресно, остальное оставляем открытым.

Что не нужно закрывать ни в одной из позиций — цены и условия. Регулярно встречается логика «уберём цены от роботов, чтобы конкуренты не видели»: конкурент увидит их за две минуты руками, а вот из ответов вы выпадете — на вопрос «сколько стоит» ответят те, у кого цифра доступна. Это тот же выбор, который разбирается в материале о том, показывать цены на сайте или нет, только теперь ставка выше: закрытая цена означает отсутствие в ответе целиком, а не просто менее удобный сайт.

И ещё: закрытая часть за авторизацией — дилерские прайсы, личный кабинет клиента, база документов — роботам недоступна и без robots.txt. Если что-то из этого всё-таки нашлось в логах обхода, проблема не в файле, а в правах доступа, и чинить надо её.

Синтаксис robots.txt без ошибок, которые стоят трафика

Файл простой, но у него есть несколько правил, нарушение которых стоит трафика. Разберём их по порядку — с примерами того, как это ломается в реальности.

  • User-agent: имя-агента — начало группы правил ровно для одного робота. Имя берите из своих логов, а не из чужого списка в интернете: агенты появляются и переименовываются, и половина популярных подборок к 2026 году уже устарела.
  • Disallow: /cart/ — запрет на адреса, начинающиеся с этого пути. Disallow: / — запрет на весь сайт. Disallow: без значения — наоборот, разрешение всего.
  • Allow: /catalog/ — исключение из запрета. При конфликте выигрывает более длинное и точное правило, а не то, что написано ниже.
  • Спецсимволы: звёздочка заменяет любую последовательность, знак доллара в конце означает точное окончание адреса. Правило «Disallow: /*sort=» закроет все адреса с этим параметром в любом месте строки.
  • Sitemap: полный адрес карты сайта — пишется отдельной строкой и действует для всех роботов независимо от групп.
  • Clean-param — директива Яндекса, помогает объединить адреса, отличающиеся только служебным параметром. Другие роботы её не читают.

Теперь ошибки, которые встречаются чаще всего.

Отдельная группа отменяет общие правила. Это самая дорогая ошибка и её почти невозможно заметить глазами. Робот выполняет ровно одну группу — ту, где указано его имя, — и правила из группы «User-agent: *» к нему уже не применяются. Владелец добавляет в конец файла три строки для ИИ-краулера с одним запретом, радуется — и получает робота, который теперь свободно ходит в корзину, во внутренний поиск и в бесконечные комбинации фильтров, потому что общий блок запретов для него перестал существовать. Правильно так: в персональную группу копируются все запреты из общей плюс добавляются новые.

Пустая строка внутри группы её разрывает. Всё, что после пустой строки, считается новой группой без указания агента и может быть проигнорировано. Внутри блока пустых строк быть не должно, между блоками — одна.

Файл лежит только в корне. Один домен — один файл по адресу вида example.ru/robots.txt. Для поддомена нужен свой файл; правила основного сайта на него не распространяются. Про тестовые поддомены забывают чаще всего — и в поиск попадает копия сайта разработчика.

Регистр важен, кириллица требует кодирования. Путь /Catalog/ и /catalog/ — разные адреса. Русские буквы в адресе записываются в закодированном виде, иначе строка не сработает.

Файл отдаёт не тот код. Если robots.txt возвращает 500-ю ошибку, часть роботов трактует это как запрет всего сайта. Проверьте, что открывается с кодом 200 и типом text/plain. И убедитесь, что вы правите настоящий файл: некоторые движки отдают виртуальный robots.txt, когда физического в корне нет, и ваш загруженный по FTP файл просто не показывается. У сайтов на WordPress это классическая ловушка — правки делаются либо в плагине, либо созданием реального файла в корне, иначе они не применяются.

Закрытие в robots.txt не убирает страницу из выдачи. Если адрес уже проиндексирован, запрет обхода означает лишь то, что робот перестанет туда заходить, — страница может остаться в поиске без описания. Для удаления нужен мета-тег noindex на самой странице (и доступ к ней открыт, чтобы робот этот тег увидел) или удаление адреса через инструменты Вебмастера.

Проверка занимает две минуты и делает её Вебмастер: Инструменты → Анализ robots.txt. Вставьте содержимое файла, ниже добавьте 10-15 адресов — главную, категорию, карточку, страницу фильтра, корзину, служебный адрес — и нажмите «Проверить». Напротив каждого появится «разрешён» или строка правила, которое его запретило. Прогоняйте этот список после каждой правки. Что ещё смотреть в кабинете и как читать остальные отчёты — в материале про Яндекс Вебмастер.

Нагрузка на сервер: когда пора ограничивать частоту обхода

Вторая причина, по которой владельцы закрывают роботов, — сайт стал медленным. Тут важно не перепутать причину со следствием: в наших проектах ИИ-краулеры оказываются виновником замедления реже, чем на них думают. Сначала измеряем, потом ограничиваем.

Как понять, что нагрузку создают именно боты:

  1. Откройте в панели хостинга статистику потребления ресурсов — процессорное время, память, число процессов. Посмотрите график за 30 дней и найдите пики.
  2. Сопоставьте пики с логом по часам: cut -d'[' -f2 access.log | cut -d':' -f2 | sort | uniq -c. Получите распределение запросов по часам суток. Если пик приходится на ночь, живые люди тут ни при чём.
  3. В пиковый час посмотрите топ агентов той же командой, что в разделе про логи. Обычно на этом месте выясняется, что 40% запросов сделал один робот.
  4. Проверьте, куда он ходил. Ориентир: если больше половины его запросов — это адреса с параметрами фильтров, сортировки, страниц пагинации и внутреннего поиска, проблема не в роботе, а в структуре адресов.

Пороговые ориентиры из практики: устойчивые 1-2 запроса в секунду от одного агента на обычном хостинге уже заметны, 5-10 запросов в секунду кладут генерацию страниц на средних тарифах. Если боты съедают больше 30% лимита процессорного времени тарифа — пора действовать. Отдельный сигнал тревоги — рост доли ответов 5xx в логе: сервер уже не справляется, и следом просядет обход поисковыми роботами.

Нагрузка на сервер: когда пора ограничивать частоту обхода
СпособЧто делаетКогда применятьРиск
Скорость обхода в ВебмастереОграничивает частоту роботов ЯндексаКогда в статистике обхода виден рост запросов и ответов 5xxСлишком низкое значение замедлит переиндексацию новых страниц
Crawl-delay в robots.txtПросит паузу между запросамиДля сторонних роботов, которые её ещё читаютКрупные поисковики директиву не учитывают, полагаться на неё не стоит
Ограничение частоты на сервереРежет число запросов в секунду с одного агента или адресаКогда робот игнорирует robots.txtОшибка в правиле задевает поисковых роботов
Ответ 429 с заголовком Retry-AfterСообщает роботу, что можно вернуться позжеКак мягкая альтернатива блокировкеНебольшой, если 429 не прилетает живым посетителям
Кэширование и CDNОтдаёт готовую страницу без обращения к базеКогда нагрузку создаёт генерация страниц на летуВстроенная «защита от ботов» может отсечь и поисковиков
Блокировка по IP или сетиПолный отказ в доступеДля парсеров цен и сканеров уязвимостейАдреса меняются, список нужно поддерживать

Порядок действий такой. Сначала уберите бесконечность: закройте от обхода адреса с параметрами сортировки, страницы внутреннего поиска, календари и комбинации фильтров глубже двух-трёх значений. В наших проектах одно это снижает бот-нагрузку на 20-50% — и заодно чинит раздутый индекс. Вторым шагом включите кэширование страниц каталога. Третьим — задайте скорость обхода в Вебмастере: Индексирование → Скорость обхода, переключатель с «Доверить Яндексу» на ручное значение. И только четвёртым, если не помогло, ограничивайте частоту на сервере адресно.

Ошибка владельца на этом шаге почти всегда одинаковая: включить в панели хостинга или у CDN общую «защиту от ботов» одним тумблером. Формально нагрузка падает. Фактически через две-три недели просядет обход поисковыми роботами, а вместе с ним и позиции. Проверить это можно сразу: Вебмастер → Инструменты → Проверка ответа сервера, выберите робота в списке user-agent, вставьте адрес главной и карточки товара, нажмите «Проверить» — должен вернуться код 200. Если 403 или 429, защита режет своих.

И держите в голове, что скорость сайта для живого человека и нагрузка от ботов — связанные, но разные истории: боты грузят сервер, а конверсию убивают тяжёлые картинки и скрипты. Как одно влияет на другое, мы разбирали в материале про скорость сайта и конверсию.

Чек-лист проверки после любых изменений в доступе

Правки в доступе опасны тем, что последствия видны не сразу: файл вы поменяли сегодня, а трафик просядет через две-три недели, и связать одно с другим будет уже сложно. Поэтому проверка делается в два захода — сразу после правки и через две недели.

В день правки, по порядку:

  1. Откройте адрес вашсайт.ру/robots.txt в браузере в режиме инкогнито. Файл должен открыться как обычный текст, без ошибок и без оформления страницы. Если открылась 404-я или дизайн сайта — вы правили не тот файл.
  2. Вебмастер → Инструменты → Анализ robots.txt. Вставьте содержимое, добавьте список из 10-15 адресов (главная, раздел каталога, две карточки, страница услуги, статья блога, контакты, корзина, служебный адрес, страница фильтра) и проверьте. Главная и коммерческие страницы — «разрешён», служебные — «запрещён».
  3. Вебмастер → Инструменты → Проверка ответа сервера. Прогоните 3-5 адресов с выбором робота в списке user-agent: везде должен быть код 200.
  4. Запишите в отдельный файл дату, что именно поменяли и зачем. Через полгода это сэкономит вечер разбирательств, а при смене подрядчика — неделю.

Через 7-14 дней:

  1. Вебмастер → Индексирование → Статистика обхода. Смотрите динамику числа обойдённых страниц и распределение кодов ответа. Провал обхода вдвое — сигнал, что правило задело поисковых роботов.
  2. Вебмастер → Индексирование → Страницы в поиске → вкладка «Исключённые». Отфильтруйте по статусу, связанному с запретом в robots.txt, и убедитесь, что там только те адреса, которые вы закрывали намеренно.
  3. Search Console → Настройки → Статистика сканирования. То же самое со стороны Google: число запросов, средняя скорость ответа, доля ошибок.
  4. Метрика → сохранённый ранее сегмент с переходами с сервисов ответов. Сравните две недели до и две после: если переходы обнулились, а вы этого не планировали, ищите лишний запрет.
  5. Снова снимите топ агентов из логов и сравните с первым замером. Так вы увидите, кто действительно перестал ходить, а кто правила проигнорировал.

Ориентиры по срокам: robots.txt роботы перечитывают обычно раз в сутки, поэтому эффект на обходе виден в течение 1-3 дней. Изменения в индексе — 1-3 недели, иногда дольше на больших каталогах. Не делайте выводов на второй день и, что важнее, не меняйте файл каждые три дня: вы потеряете возможность понять, какая именно правка сработала.

Отдельно — про откат. Держите копию предыдущей версии файла рядом, с датой в имени. Если через две недели обход упал, а причина неочевидна, вернуть старую версию и посмотреть, восстановится ли картина, быстрее, чем искать ошибку в логике правил. Это стандартная процедура разбора, когда показатели поехали вниз, — мы описали её целиком в материале о том, что делать, если трафик упал: сначала список изменений с датами, потом сопоставление с графиком, и только потом гипотезы.

И последнее. Пересматривайте решение раз в квартал, а не один раз навсегда. Роботы появляются новые, имена агентов меняются, а вместе с ними меняется и цена вопроса: сегодня переходы из ответов дают полпроцента визитов, через полгода — четыре. Двадцать минут раз в три месяца на просмотр логов и сверку списка агентов — нормальная плата за то, чтобы не обнаружить однажды, что вас нет там, где клиенты уже задают вопросы.

Путь клиента: где эта тема срабатывает

Тема всплывает в момент, когда владелец узнаёт, что его тексты пересказываются в ответах нейросетей, и первым порывом хочет закрыть доступ целиком. Ниже — путь от эмоции к решению, которое считается в цифрах.

Узнал, что контент используют

Что у клиентаЗадал вопрос про свой товар и увидел пересказ своей же страницы без ссылки на компанию. Первая мысль — всё запретить.

Что делаемСнимаем факты: выгружаем лог за 7 суток и считаем, кто реально приходил и сколько запросов сделал.

Сигнал, что работаетЕсть список агентов с числом запросов, объёмом трафика и разделами, куда они ходили.

Считаем, что теряем при запрете

Что у клиентаКажется, что от ИИ-роботов нет никакой пользы, а нагрузка есть.

Что делаемВ Метрике собираем сегмент переходов с сервисов, отвечающих текстом, и смотрим визиты и достижения целей за 3-6 месяцев.

Сигнал, что работаетИзвестна цена вопроса в заявках: от нуля до нескольких десятков обращений в месяц.

Выбираем позицию по доступу

Что у клиентаГотов не закрывать всё, но не понимает, что именно можно отдавать, а что нет.

Что делаемРаскладываем сайт на четыре корзины: открыть, закрыть для всех, закрыть только для ИИ-роботов, разбираться отдельно.

Сигнал, что работаетЕсть согласованный список разделов и переписанный robots.txt с копией прежней версии.

Снимаем нагрузку

Что у клиентаСайт по вечерам подтормаживает, хостинг присылает уведомления о лимитах.

Что делаемЗакрываем бесконечные комбинации фильтров и внутренний поиск, включаем кэш, задаём скорость обхода в Вебмастере.

Сигнал, что работаетДоля ответов 5xx в логе падает, потребление ресурсов возвращается в лимит тарифа.

Проверка и регулярный пересмотр

Что у клиентаПравки внесены, но непонятно, не задели ли они поисковых роботов.

Что делаемЧерез 7-14 дней сверяем статистику обхода, исключённые страницы и сегмент переходов; возвращаемся к вопросу раз в квартал.

Сигнал, что работаетОбход поисковых роботов на прежнем уровне, закрытыми оказались только запланированные адреса.

Стратегия: что делать по шагам

Цель: Принять решение по доступу роботов на основе своих логов и цифр по переходам, а не по совету из чата, и внедрить его так, чтобы не потерять поисковый трафик.

  1. День 1 Включить ведение логов, если оно отключено, и выгрузить доступ за последние 7 суток. Свести топ агентов, объём трафика и коды ответа. Таблица: кто ходит, сколько запросов, куда именно, какие ответы получает.
  2. День 2 Собрать в Метрике сегмент переходов с сервисов ответов и посмотреть визиты и цели за 3-6 месяцев. Проверить подлинность спорных роботов обратным DNS. Понятная цена запрета в обращениях и очищенный список реальных гостей.
  3. Дни 3-4 Разложить разделы на четыре корзины и переписать robots.txt: общая группа плюс персональные группы с полным набором запретов. Сохранить копию прежней версии с датой. Новый файл в корне, старая версия лежит рядом для отката.
  4. День 4 Прогнать 10-15 адресов через «Анализ robots.txt» в Вебмастере и проверить коды ответа для поисковых роботов через «Проверку ответа сервера». Разрешения совпадают с задуманным, коды ответа 200 на всех коммерческих страницах.
  5. Неделя 2 Снять нагрузку: закрыть комбинации фильтров и внутренний поиск, включить кэширование, при необходимости задать скорость обхода и ограничение частоты для агентов, игнорирующих правила. Потребление ресурсов в пределах тарифа, доля 5xx снижается.
  6. Раз в квартал Повторно снять топ агентов, сверить со списком в файле, пересчитать переходы из ответов и пересмотреть решение. Файл соответствует реальности, новые роботы не проходят мимо решения.

Сроки — ориентир для планирования, а не обязательство: скорость зависит от ниши, конкуренции и состояния сайта.

Чек-лист: правки доступа роботов без потери трафика

Пройдите пункты по порядку — до правки, в день правки и через две недели после неё.

  • Выгрузите лог за 7 суток и сведите топ агентов по числу запросов
  • Проверьте, куда именно ходят роботы: каталог или комбинации фильтров и внутренний поиск
  • Сверьте спорных роботов обратным DNS — user-agent подделывается
  • Соберите в Метрике сегмент переходов с сервисов, отвечающих текстом, и посмотрите цели
  • Разложите разделы на четыре корзины: открыть, закрыть для всех, закрыть для ИИ-роботов, разбираться отдельно
  • Скопируйте в каждую персональную группу User-agent все запреты из общей группы
  • Уберите пустые строки внутри групп и проверьте, что файл лежит в корне домена
  • Сохраните копию прежней версии robots.txt с датой в имени
  • Проверьте 10-15 адресов в Вебмастере через «Анализ robots.txt»
  • Прогоните главную и карточку через «Проверку ответа сервера» с выбором поискового робота
  • Через 7-14 дней сверьте статистику обхода и вкладку «Исключённые» в Страницах в поиске
  • Запишите дату и суть правки в журнал изменений и вернитесь к вопросу через квартал
Скачать чек-лист ↓
Мы почти никогда не закрываем всё целиком. Сначала неделю смотрим логи: кто ходит, сколько запросов, куда лезет. Чаще всего оказывается, что сервер грузят не ИИ-краулеры, а комбинации фильтров и парсеры цен, и лечится это не строчкой в robots.txt, а закрытием параметров и кэшем.
Игорь ВолковРуководитель отдела разработки Media Monster

Что в итоге

Решение по доступу роботов перестало быть техническим — это выбор между «нас не пересказывают» и «нас упоминают». Крайности здесь стоят дорого в обе стороны: открытый настежь сайт отдаёт тексты в обучающие корпуса, закрытый наглухо выпадает из ответов, а вопрос клиента всё равно получает ответ — только по чужим данным и с чужой ценой.

Рабочая середина собирается за один вечер: неделя логов, сегмент переходов в Метрике, четыре корзины разделов и аккуратный robots.txt с полным набором запретов в каждой группе. Дальше — две проверки в Вебмастере и журнал изменений, чтобы через месяц не гадать, из-за чего просел обход. И пересмотр раз в квартал: имена агентов меняются быстрее, чем успевают устареть чужие подборки в интернете.

С чего начать: Сегодня выгрузите лог за последние семь суток и сведите топ агентов одной командой — до этого замера любые правки в robots.txt делаются вслепую.

Вопросы и ответы

Стоит ли вообще закрывать ИИ-краулеры в robots.txt?

Зависит от того, что вы продаёте. Если контент — вспомогательный инструмент продаж (каталог мебели, окна, ремонт, автоуслуги, B2B-поставки), закрывать целиком обычно невыгодно: вместе с обучающими роботами вы выключаете тех, кто приводит людей из ответов. Если контент и есть продукт — расчётные методики, платные базы, обучающие материалы, — эту часть логично закрыть адресно, а коммерческие страницы оставить открытыми. Универсального ответа нет, считайте по своему сегменту переходов в Метрике.

Защищает ли robots.txt контент от копирования?

Нет. Это просьба, а не блокировка: файл читают добросовестные роботы, а парсеры цен и сканеры уязвимостей его игнорируют — для них список закрытых каталогов скорее подсказка. Защита от парсинга делается на уровне сервера: ограничение числа запросов в секунду, ответы 429 и 403, блокировка по адресам и сетям, кэширование. Это отдельная задача, и robots.txt её не решает.

Как отличить настоящего поискового робота от подделки?

По обратному DNS, потому что user-agent подделывается в одну строку. Возьмите IP из лога, получите по нему имя хоста, затем разрешите это имя обратно в IP и сверьте. Роботы Яндекса резолвятся в домены yandex.ru, yandex.net и yandex.com, робот Google — в googlebot.com и google.com. Если имя не сходится, правила robots.txt для этого гостя не работают и вопрос решается блокировкой.

Почему после добавления группы для одного робота он полез в корзину и поиск?

Потому что робот выполняет ровно одну группу правил — ту, где указано его имя. Общий блок «User-agent: *» к нему после этого не применяется. Если вы добавили персональную группу с одним запретом, все остальные ваши запреты для него исчезли. Правило простое: в персональную группу копируются все запреты из общей плюс дописываются новые. Проверяется это за две минуты в Вебмастере, в инструменте «Анализ robots.txt».

Через сколько подействуют изменения в robots.txt?

Роботы перечитывают файл обычно раз в сутки, поэтому изменение обхода видно за 1-3 дня — в Вебмастере это Индексирование → Статистика обхода. Изменения в индексе занимают 1-3 недели, на больших каталогах дольше. Не меняйте файл чаще раза в две недели: иначе вы не поймёте, какая именно правка дала эффект.

Как понять, что пора ограничивать частоту обхода?

Смотрите три сигнала: в панели хостинга боты занимают больше 30% лимита процессорного времени; в логе один агент даёт устойчиво больше 1-2 запросов в секунду; растёт доля ответов 5xx. Но сначала проверьте, куда робот ходит — если больше половины запросов уходит в комбинации фильтров, сортировки и внутренний поиск, закрытие этих адресов снимает 20-50% нагрузки и ограничивать никого не придётся.

Игорь Волков — портрет-иллюстрация
Руководитель отдела разработки Media Monster

Игорь 12 лет занимается разработкой коммерческих сайтов: интернет-магазины, каталоги с обменом данными, корпоративные сайты и посадочные страницы под рекламу. Работал и на стороне подрядчика, и внутри компании-заказчика, поэтому хорошо понимает обе стороны конфликта «разработчики против маркетинга». В Media Monster руководит отделом разработки и отвечает за то, чтобы сайт создавался под продвижение, а не вопреки ему.

С какими задачами к нему приходят

Самая частая — «сделали редизайн, и просел трафик». Причины почти всегда одни и те же: сменились адреса страниц без переадресации, пропали тексты и заголовки, часть страниц закрылась от индексации при переносе с тестовой площадки. Вторая по частоте — «сайт не даёт добавить нужные страницы»: система управления не позволяет создавать разделы под спрос, и продвижение упирается в потолок платформы.

Отдельная категория — интеграции: наличие и цены должны приезжать из учётной системы, заявки — уходить в CRM, звонки — привязываться к источникам. Здесь основная работа не в коде, а в согласовании: какие данные передаются, как часто и что считать ошибкой обмена.

И, наконец, приходят с брошенными проектами: разработчик пропал, доступов нет, сайт работает, но менять его некому.

Как работает

Начинает не с макета, а со структуры. Пока не понятно, какие страницы нужны и под какой спрос, рисовать дизайн преждевременно: структура определяет и шаблоны, и объём работ, и способ вывода товаров. На проектах, где продвижением занимается другая команда, требует, чтобы карта страниц была согласована до старта вёрстки — иначе через полгода приходится переделывать.

Второй принцип — сдавать по чек-листу. После каждой выкладки проходится список технических проверок на боевом сайте: доступность страниц, файл robots.txt, метатеги, адреса, карта сайта, счётчики. Проверку делает не тот, кто выкладывал.

Третье — доступы принадлежат клиенту. Домен, хостинг, панель управления, репозиторий оформляются на владельца бизнеса с самого начала, а не «когда закончим».

Чего не делает

Не запускает сайт без плана переноса, если у проекта уже есть трафик: сопоставление старых и новых адресов делается до выкладки, а не после падения. Не строит каталог на решениях, которые не позволяют управлять адресами и метатегами страниц. Не берёт проект, где заказчик не готов выделить человека для сбора данных о товарах, — без характеристик и фотографий каталог всё равно не заработает, и срок сорвётся не по вине разработки.

В блоге

Пишет в рубрику «Разработка»: разборы переездов и редизайнов, чек-листы приёмки, интеграции с учётными системами, кейсы проектов. Все клиентские истории публикуются обезличенно — без названий, доменов и регионов.

Портрет автора — иллюстрация, а не фотография.

Материал подготовлен по редакционной политике блога: практика проектов, официальные источники, проверка перед публикацией.

Что это даёт на практике
Главное из этого материала. Сначала логи, потом robots.txt. В наших проектах роботы дают 30-60% всех запросов, но ИИ-краулеры среди них обычно только 3-15% — а грузят сервер чаще комбинации фильтров и парсеры цен.
✓ Что работает
  • Структура каталога, собранная из спроса, а не из выгрузки
  • Ускорение загрузки первого экрана
  • Интеграция форм с CRM без потери источника
✕ Что результата не даёт
  • Редизайн без переноса структуры и адресов
  • Тяжёлые изображения и скрипты «на всякий случай»
  • Формы без передачи источника заявки
Выводы обобщены по проектам направления «Разработка» и обезличены: названия компаний, домены и иные идентифицирующие данные не раскрываются. Результат в каждом проекте зависит от ниши, конкуренции и исходного состояния — см. условия использования.
Планируете переделку сайта или упёрлись в платформу?
Бесплатно оценим текущее состояние и риски — до того, как вы начнёте что-то менять.
Оценить мой сайт

Что делать дальше

Посчитать экономикуСходится ли реклама при вашем чеке
?Задать вопросОтветим по вашей ситуации

Опишите задачу в двух словах — специалист ответит в Telegram, обычно в течение рабочего дня. Без презентаций и обязательств.

Написать в Telegram ↗
Заявка на продвижениеОценить мой сайт

Бесплатно оценим текущее состояние и риски — до того, как вы начнёте что-то менять.

Что ищут по теме

Частотность — показы в месяц по России, данные Вордстата на 18.08.2026.

Материал был полезен?
Оценок пока нет — поставьте первую

Обсуждение

Спросите, что осталось непонятным — автор материала отвечает в комментариях.

Загружаем комментарии…
Комментарии — от подтверждённых читателей

Один раз подтвердите себя в Telegram: так в обсуждении нет спама, а имя подставляется само. Мы видим только имя и никогда не пишем первыми без вашего запроса.

Читайте по теме

SEONewИИ Как проверить, цитирует ли ваш сайт нейропоиск: четыре способа и таблица замеров МО Максим Орлов13 мин · 22 августа 2026

← Все статьи рубрики «Разработка»

SEO-продвижение сайтов

Показы растут, а клики падают: разбираем страницы по группам и решаем, что с каждой делать Как проверить, цитирует ли ваш сайт нейропоиск: четыре способа и таблица замеров Как сгенерировать описания для 500 карточек товара и не получить штампы Ревизия блога: какие статьи теряют трафик первыми и что с ними делать Title и description рядом с ответом нейропоиска: как получить клик Все статьи рубрики (44) →

Реклама в Яндекс Директе

Генерация объявлений нейросетью: что можно доверить машине, а что переписывать руками Какие цели отдавать автостратегии в Директе, а какие только мешают ей обучаться Алгоритм «переучился» на плохих конверсиях: как вернуть кампанию к нормальным заявкам Автостратегия и бюджет: где ставить ограничители расхода и что делать при скачке цены заявки Товарный фид: ошибки, которые ломают автогенерацию объявлений Все статьи рубрики (22) →

SMM и таргетированная реклама

Нейросеть для креативов: где выигрыш, а где риск отказа модерации Фотографии объектов и товаров: как снимать, чтобы это работало на продажи и на поиск Таргет во ВКонтакте: связки, которые дают заявки в 2026 Отделочные и общестроительные работы: продвижение через объекты и фотоотчёты Возврат клиентов через мессенджеры и рассылки: как напоминать о себе и не стать спамом Все статьи рубрики (9) →

Разработка сайтов

Что нельзя загружать в нейросеть: персональные данные, договоры и коммерческая тайна База знаний для нейросети: как перестать быть компанией, про которую всё придумано Машиночитаемая страница: таблицы, атрибуты и согласованность данных ИИ-краулеры на сайте: как посмотреть логи и выбрать позицию по доступу Прайс на сайте: показывать цены или нет и что делать, если цена индивидуальная Все статьи рубрики (21) →

Веб-аналитика и сквозная аналитика

Сколько на самом деле экономит ИИ: как посчитать часы и деньги Что мерить в SEO вместо позиций: семь метрик и месячный отчёт на одну страницу Сколько стоит внедрить ИИ в маркетинг небольшой компании и когда это окупается Аналитика оконного бизнеса: как проследить путь от клика до подписанного договора Аналитика автосалона: звонки, тест-драйвы и что считать конверсией Все статьи рубрики (18) →

Кейсы с цифрами

Проверка фактов за нейросетью: где она ошибается и как это ловить Кейс: подрядчик загородного строительства перестал считать заявки и начал считать выезды Кейс: как оконная компания готовилась к сезону с января — сайт, реклама и учёт замеров Кейс: автосервис вышел в локальную выдачу без бюджета на ссылки Кейс: как готовили сезонный бизнес к пику спроса и почему часть работ не окупилась Все статьи рубрики (14) →

Подтемы

Семантическое ядро Яндекс Метрика Автостратегии Директа Регионы и гео Интернет-магазины Все подтемы (9) →

Словарь терминов

ДРР — что это CPL — что это CAC — что это Когортный анализ — что это UTM-метки — что это Все термины (36) →

Ниши и категории

Мебельный маркетинг 7 Дверной бизнес 5 B2B-сектор 5 Недвижимость 5 E-commerce 5 Все направления (10) →

SEO в 2026

GEO — ответы нейросетей Локальный спрос и карты Технический аудит Внутренняя перелинковка Коммерческие факторы

Сейчас читают

Кейс: рост органики в 4 раза за 7 месяцев — и почему первые три были почти без результата Кейс: в 2,2 раза больше заявок на том же бюджете — за счёт перераспределения Кейс: трафик упал на 38% — разбор инцидента по часам Коммерческие факторы ранжирования: полный чек-лист из 18 пунктов «Обучение стратегии остановлено» в Яндекс Директе: причины и что делать Карта блога — все статьи RSS-лента блога

Блог Media Monster

Бесплатный аудит сайта и рекламы Как мы готовим материалы Условия использования Политика конфиденциальности Согласие на обработку данных