RAPI

FLOW

Создать магазин

Robots.txt для интернет-магазина: правила, примеры и проверка

Что закрывать в robots.txt, как учитывать параметры и фильтры, чем запрет обхода отличается от noindex и как проверить правила для Яндекса и Google.

Белый кот у открытого каталога товаров и закрытого бокового прохода для служебных карточек

Robots.txt для интернет-магазина управляет обходом адресов поисковыми роботами. Используйте его, чтобы ограничивать ненужные служебные страницы и бесконечные комбинации параметров, сохраняя доступ к товарам, категориям и полезным посадочным страницам. Он не гарантирует удаление адреса, или URL, из поиска и не защищает личные данные.

Перед настройкой составьте список реальных адресов магазина и решите, какие страницы должны участвовать в поиске. Не копируйте готовый файл другой платформы: одинаково названные разделы могут иметь разные пути, а общий запрет параметров способен закрыть нужный каталог.

Что делает robots.txt и где его разместить

Файл находится по пути /robots.txt в корне сайта. Робот сначала получает правила, затем использует их при обходе подходящих адресов. На HTTPS-сайте проверяйте именно HTTPS-версию и тот домен, с которого доступны страницы.

Основные директивы — User-agent, Disallow, Allow и Sitemap. Первая задаёт робота, вторая запрещает обход, третья разрешает исключение, а последняя указывает абсолютный адрес карты сайта. Звёздочка в User-agent: * означает общую группу роботов, для которых нет более подходящей отдельной группы.

Файл должен отдаваться как обычный текст, а не как HTML-страница ошибки или форма входа. Для нормальной рабочей настройки обеспечьте ответ 200 OK и доступность без авторизации. Поведение поисковиков при отсутствии файла и серверных ошибках различается; не проверяйте ограничения только тем, что адрес открылся в браузере.

Правила действуют в пределах соответствующего протокола, домена и порта. Файл основного сайта не заменяет правила поддомена и не закрывает отдельный тестовый стенд. Тестовую копию с непубличными данными защищайте авторизацией или серверными ограничениями доступа.

Robots.txt публичен, а роботы могут не соблюдать его. Не записывайте в нём секреты и не считайте запрет /account/ защитой кабинета. Доступ к заказам и персональным данным должен контролировать сам сайт.

Выберите правила по типам страниц

Начинайте не с масок, а с назначения страницы. Полезная категория и внутренняя выдача поиска иногда выглядят похоже, но решают разные задачи. Для поисковой оптимизации, или SEO, важны адреса, которые дают покупателю самостоятельный ответ и поддерживаются магазином.

Тип адресаЧто проверитьОбычно разумное решение
Карточка доступного товараСодержимое, цена, основной URLОставить обход открытым
Категория или полезная подборкаСамостоятельная задача и ассортиментОставить открытой, согласовать с sitemap
Корзина и оформлениеНет ли нужного контента по тому же путиОграничить ненужный обход, отдельно решить индексацию
Кабинет и административный разделРеальная защита доступаАвторизация; robots.txt — дополнительное правило обхода
Внутренний поискНе создаёт ли бесконечные страницы запросовОбычно ограничить обход; уже известные URL обработать отдельно
СортировкаМеняет ли только порядок товаровУправлять дублями и при необходимости обходом
ФильтрЕсть ли отдельный спрос и полезная страницаРешать для каждой группы, а не закрывать все
ПагинацияДоступны ли товары с последующих страницНе закрывать автоматически
CSS, JavaScript и изображенияНужны ли для отображения товара и навигацииСохранить доступ к необходимым ресурсам

Не закрывайте карточку только потому, что товар временно закончился. У неё могут оставаться полезное описание, спрос и путь к альтернативам. Наличие, постоянное удаление и управление обходом — разные решения.

Для категорий и фильтров сначала определите структуру. Например, подборка «зимние ботинки» может быть полезной страницей, а комбинация сортировки и нескольких случайных характеристик — дублем. Этот выбор подробнее объясняет структура каталога интернет-магазина.

Составьте файл под реальные адреса магазина

Ниже — учебный файл для магазина, где служебные разделы имеют пути /cart, /checkout, /account, /search и /admin. Эти адреса не являются стандартом всех платформ. Домен shop.example в примере обозначает условный магазин: замените его адресом своей доступной карты сайта.

User-agent: *
Disallow: /cart$
Disallow: /cart/
Disallow: /cart?
Disallow: /checkout$
Disallow: /checkout/
Disallow: /checkout?
Disallow: /account$
Disallow: /account/
Disallow: /account?
Disallow: /search$
Disallow: /search/
Disallow: /search?
Disallow: /admin$
Disallow: /admin/
Disallow: /admin?

Sitemap: https://shop.example/sitemap.xml

В этой записи $ обозначает конец сопоставляемого URL: /cart$ ограничивает сам /cart, но не /cartoon и не /cart?promo=1. Строка /cart/ закрывает вложенные пути, а /cart? — адрес с параметрами. Для Яндекса и Google проверяйте именно реальные URL, включая регистр и варианты со слешем.

Вместо трёх строк можно использовать общий префикс Disallow: /cart, если вы уверены, что он не затронет другие страницы. Простота файла полезна, но не должна скрывать смысл маски. Один неверный широкий префикс способен закрыть целый нужный раздел.

Всё, что не запрещено подходящими правилами, обычно доступно для обхода. Не требуется разрешать отдельной строкой каждую карточку. Пустое значение Disallow: не равно Disallow: /: последняя запись запрещает весь сайт.

Когда нужен Allow

Allow используется для разрешённого исключения внутри запрещённого пути. Например, если условный служебный раздел содержит публичную инструкцию, которую действительно нужно обходить:

User-agent: *
Disallow: /service/
Allow: /service/help$

У Яндекса и Google выбор правила зависит от наиболее подходящего совпадения, а не просто от позиции строки в файле. Более конкретное разрешение может открыть исключение. Проверьте URL анализатором: /service/help$ не разрешает автоматически вложенную страницу /service/help/payment.

Не создавайте отдельные группы Googlebot и Yandex без необходимости. Общая группа и группа конкретного робота не всегда складываются; например, Google выбирает подходящую специфичную группу вместо добавления всех правил *. Если используете отдельную группу, убедитесь, что в ней сохранены нужные ограничения.

Разберите фильтры и параметры отдельно

Самая опасная заготовка — Disallow: /*?. Она запрещает обход всех адресов с вопросительным знаком. Под такое правило могут попасть не только рекламные метки, но и страницы пагинации, варианты товара или полезные фильтры.

Допустим, /catalog/shoes?page=2 содержит товары, до которых робот иначе не доберётся, а /catalog/shoes?sort=price только меняет порядок. Одинаковый запрет для них решает одну проблему ценой другой. Сначала проверьте навигацию, доступность карточек и основной адрес каждой группы.

Для условного параметра сортировки можно рассмотреть две маски:

User-agent: *
Disallow: /*?sort=
Disallow: /*&sort=

Первая учитывает параметр в начале строки запроса, вторая — после другого параметра. Они не являются универсальным рецептом: ваш магазин может использовать order, иной путь или другой порядок формирования URL. Не применяйте такой запрет к уже известным дублям без решения об их индексации.

Полезные фильтры оставляйте управляемыми

Если сочетание отвечает самостоятельному запросу, дайте ему устойчивый адрес, понятный заголовок, подходящий ассортимент и внутренние ссылки. Не добавляйте в поисковую карту все математически возможные сочетания. Пустые и почти одинаковые страницы редко помогают выбору.

У остальных комбинаций ограничивайте создание бесконечного множества адресов и выберите согласованную стратегию дублей. Где-то достаточно основного URL, где-то нужен запрет индексации, а при большом пространстве ненужных новых адресов — ограничение обхода. Robots.txt — только часть технической настройки каталога.

Яндекс поддерживает Clean-param для параметров, которые не меняют содержимое страницы, например некоторых рекламных меток. Google эту директиву не поддерживает. Не перечисляйте в ней параметры, которые действительно выбирают другой размер, состав товаров или страницу списка: это может объединить разные страницы по ошибке.

Не смешивайте Disallow, noindex и canonical

Эти инструменты дают разные указания. Согласуйте их до публикации файла, особенно если адреса уже известны поисковику. Иначе робот получит запрет раньше, чем увидит нужное изменение.

ИнструментКакую задачу решаетОграничение
Disallow в robots.txtОграничивает обходИзвестный URL может остаться в поиске без прочитанного содержимого
noindex в метатеге или HTTP-заголовкеПросит исключить страницу из поискаРобот должен получить страницу или заголовок
rel=canonicalУказывает предпочтительный адрес среди дублейЭто сигнал выбора, а не защита и не запрет обхода
SitemapПомогает обнаружить предпочтительные страницыНе гарантирует индексацию и не отменяет запреты

Чтобы убрать уже найденную страницу через noindex, оставьте её доступной для обхода и дайте поисковику прочитать указание. Одновременно запрещённый адрес не позволит прочитать новый метатег. Не считайте, что добавление двух запретов усиливает результат.

Если задача — объединить дубли через canonical, робот также должен видеть сигнал и страницы, нужные для их сопоставления. Не используйте robots.txt как замену каноническому адресу. Для страницы, которую нужно продолжать исключать через noindex, доступ к этому указанию должен сохраняться.

В sitemap оставляйте предпочтительные адреса, которые предназначены для поиска и не противоречат вашим правилам. Закрытый дубль, перенаправление и страница с noindex обычно не должны быть частью такого списка. Для большого каталога проверяйте согласованность автоматически.

При срочном удалении известного адреса поисковики предлагают специальные инструменты, но они не заменяют постоянного решения на сайте. Выберите подходящий способ: закрытие доступа к приватным данным, noindex, корректное удаление или перенаправление по смыслу. Порядок широкой проверки описан в статье «SEO интернет-магазина».

Проверьте файл до и после публикации

Подготовьте контрольный набор адресов: карточку, категорию, полезный фильтр, сортировку, вторую страницу списка, корзину, кабинет и изображение товара. Добавьте адреса с разным порядком параметров и один похожий путь, который не должен попасть под запрет. Для примера с /cart таким отрицательным контролем будет /cartoon, если он существует на вашем сайте.

Порядок проверки:

  1. Сохраните предыдущую версию и запишите цель изменений.
  2. Проверьте синтаксис и контрольные URL для Яндекса и Google.
  3. Убедитесь, что файл в корне возвращает текст и ожидаемый HTTP-статус.
  4. Откройте sitemap и сопоставьте его страницы с правилами.
  5. Проверьте важные страницы вместе с ресурсами, нужными для отображения.
  6. После публикации подтвердите, что сервер отдаёт новую версию.
  7. Наблюдайте за обходом и индексированием в отчётах поисковиков.

Для Яндекса используйте анализ robots.txt в Вебмастере. В Google Search Console проверяйте сведения о robots.txt и доступность выбранных URL через проверку страниц; один инструмент не заменяет все этапы. Поисковики могут обновлять сохранённую версию правил с задержкой, поэтому изменения в отчётах не обязаны появиться сразу.

У конструктора или CMS файл может генерироваться автоматически. До ручного изменения выясните, не перезапишет ли его следующее обновление настроек. После переноса сайта на другой домен, смены структуры или добавления фильтров контрольный набор нужно пройти снова.

Не трактуйте сообщение «заблокировано robots.txt» как безусловную ошибку. Для служебной страницы это может быть ожидаемый результат, для коммерческой категории — причина потери обхода. Проверяйте назначение URL, а не только название статуса.

Частые вопросы

Можно ли удалить страницу из поиска через Disallow?

Надёжно решить эту задачу одним запретом обхода нельзя. Яндекс и Google предупреждают, что известный URL может остаться в поиске. Для исключения используйте подходящий механизм, например доступный роботу noindex, а для приватных данных — контроль доступа.

Нужно ли закрывать все фильтры и параметры?

Нет. Часть адресов может содержать полезные подборки, варианты или последующие страницы каталога. Сначала разделите их по назначению, оцените дубли и доступность товаров, затем выбирайте правила.

Нужно ли добавлять Host для Яндекса?

Не переносите эту директиву из старых шаблонов. В текущем перечне поддерживаемых директив Яндекса Host не указан. Основной адрес сайта задавайте согласованными перенаправлениями, каноническими URL и настройками поисковых сервисов.

Почему робот не видит noindex на закрытой странице?

Disallow запрещает ему получить страницу, а noindex находится в её содержимом или ответе сервера. Чтобы робот прочитал указание, откройте обход этого URL и проверьте фактический ответ.

Robots.txt защищает сайт от посторонних роботов?

Нет. Это публичные указания для роботов, которые их соблюдают. Для защиты данных и ограничения нежелательных запросов нужны механизмы сервера и приложения.

Хорошее правило проверяется на двух адресах: оно закрывает ненужный и сохраняет доступ к полезному. Поддерживайте такой набор проверок вместе с файлом, чтобы очередное изменение каталога не закрыло продажи от поискового обхода.

Весь функционал бесплатно на 3 месяца

Далее 990 рублей в месяц

Создать магазин