Файл robots.txt сообщает поисковым роботам, какие разделы сайта им можно обходить, а какие лучше пропустить. Одна неверная строка способна закрыть важный каталог или, наоборот, пустить робота в бесконечные фильтры. При этом robots.txt не удаляет страницу из поиска и не защищает закрытые данные.
Разберём синтаксис, безопасный порядок настройки для Яндекса и Google, проверку файла и ошибки, которые чаще всего влияют на сканирование.
Что делает robots.txt
Robots.txt — обычный текстовый файл в корне хоста. Для адреса https://example.ru/ он должен открываться по адресу https://example.ru/robots.txt. Правила относятся только к тому протоколу, домену и порту, где размещён файл. Поддомену нужен собственный robots.txt.
Робот запрашивает файл перед обходом страниц и сопоставляет URL с группой правил для своего имени. Добросовестные поисковые системы учитывают инструкции, но любой сторонний бот может их игнорировать.
Robots.txt не управляет индексом напрямую
Запрет Disallow ограничивает сканирование. Если закрытый URL уже известен поисковой системе по ссылкам, он может остаться в результатах без обновлённого содержимого. Для удаления страницы из поиска используют подходящий HTTP-статус, метатег robots с noindex на доступной для обхода странице или инструмент удаления в кабинете поисковой системы.
Не закрывайте через robots.txt страницу, на которой поисковик должен увидеть noindex. Сначала робот должен получить HTML и прочитать директиву.
Базовый синтаксис
User-agent: *
Disallow: /private/
Allow: /private/public-file.html
Sitemap: https://example.ru/sitemap.xml
| Директива | Назначение | Пример |
|---|---|---|
User-agent |
Начинает группу для определённого робота | User-agent: * |
Disallow |
Закрывает путь от обхода | Disallow: /cart/ |
Allow |
Открывает исключение внутри закрытого пути | Allow: /catalog/public/ |
Sitemap |
Указывает полный адрес карты сайта | Sitemap: https://example.ru/sitemap.xml |
Директивы пишут по одной в строке. Комментарий начинается с символа #. Кодировка файла должна быть UTF-8, а сервер должен отдавать его как обычный текст.

Как работают группы User-agent
Каждая группа начинается с одного или нескольких User-agent, после которых идут правила. Звёздочка обозначает всех роботов, для которых нет более подходящей отдельной группы.
User-agent: *
Disallow: /search/
User-agent: Yandex
Disallow: /search/
Disallow: /filter/
Не копируйте большие шаблоны без разбора. Поддержка отдельных директив и логика выбора правил могут различаться. Для ответственных настроек сверяйтесь с актуальной документацией Яндекса и Google.
Как составить файл для сайта
- Соберите типы URL. Каталог, статьи, карточки, поиск, фильтры, корзина, личный кабинет и технические страницы.
- Определите ценные страницы. Они должны быть доступны роботу вместе с CSS, JavaScript и изображениями, нужными для отображения.
- Найдите ловушки сканирования. Бесконечные параметры, дубли сортировок, внутренний поиск и служебные разделы.
- Напишите минимальные правила. Чем короче файл, тем легче заметить ошибку.
- Добавьте Sitemap. Используйте абсолютный URL карты сайта.
- Проверьте важные и закрываемые адреса. Нельзя ограничиваться визуальным чтением файла.
Пример для информационного сайта
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /search/
Sitemap: https://example.ru/sitemap_index.xml
Это только отправная точка, а не готовый шаблон для любого WordPress. Структура URL зависит от темы, плагинов, магазина, языковых версий и настроек постоянных ссылок. Не закрывайте каталоги плагинов и темы целиком, если их ресурсы нужны поисковику для рендеринга страницы.
Параметры, фильтры и внутренний поиск
Интернет-магазин способен создавать тысячи комбинаций сортировки и фильтров. Простой запрет всех URL со знаком вопроса иногда закрывает полезные страницы и рекламные метки. Сначала изучите, какие параметры меняют содержание, какие создают дубли и как они уже обрабатываются canonical и внутренними ссылками.
Внутренний поиск обычно не является посадочной страницей и может порождать практически бесконечное число URL. Его часто ограничивают, но точный путь нужно проверить на конкретном сайте.
Маски и совпадения
Звёздочка * заменяет последовательность символов, а знак $ обозначает конец URL в системах, которые поддерживают такую запись. Чем шире маска, тем выше риск случайно закрыть полезные адреса.
User-agent: *
Disallow: /*?sort=
Disallow: /*.pdf$
Перед публикацией протестируйте несколько адресов, которые должны закрываться, и столько же важных URL, которые должны оставаться открытыми.
Где указывать Sitemap
Строку Sitemap можно разместить вне группы правил. Адрес должен быть абсолютным и доступным поисковому роботу. Если карт несколько, допустимо указать каждую отдельной строкой или использовать индексный файл Sitemap.
Карта сайта не заставляет поисковик индексировать URL и не отменяет запрет обхода. Она помогает обнаруживать канонические адреса и отслеживать их обработку.

Как загрузить robots.txt
Создайте файл с точным именем robots.txt и загрузите его в корень сайта через панель хостинга, систему управления сайтом или процесс развёртывания. После публикации откройте адрес в обычном и приватном окне. Сервер должен отвечать без авторизации, циклического редиректа и HTML-обёртки.
Если файл формирует SEO-плагин или платформа, не загружайте второй вариант вручную. Сначала выясните, какой источник фактически отвечает на запрос.
Проверка в Яндексе и Google
- Откройте robots.txt по прямому URL и проверьте HTTP-ответ.
- Используйте инструменты Яндекс Вебмастера для анализа правил и конкретных страниц.
- Проверьте URL через Search Console, чтобы понять, может ли Google его сканировать и индексировать.
- Посмотрите журналы сервера или отчёты сканирования после изменения.
- Повторите проверку при смене домена, протокола или структуры сайта.
Robots.txt является только частью технической оптимизации. Полезно также пройти технический аудит сайта и проверить ответы сервера, канонические адреса, карту сайта и внутренние ссылки.
Частые ошибки
- Disallow: /. Такая строка закрывает весь сайт от обхода.
- Файл лежит не в корне. Robots.txt внутри папки не управляет всем хостом.
- Попытка спрятать секретные данные. Адреса в файле видны всем, а сторонние боты могут игнорировать правила.
- Блокировка ресурсов. Без CSS и JavaScript робот может неверно оценить страницу.
- Запрет страницы с noindex. Робот не сможет прочитать метатег.
- Слепое копирование шаблона CMS. Реальная структура проекта отличается.
- Отсутствие повторной проверки. Небольшое изменение маски влияет на целый раздел.
Безопасный порядок изменения
Сохраните текущую версию файла, подготовьте минимальную правку и протестируйте набор URL. После загрузки убедитесь, что robots.txt доступен, важные страницы разрешены, а Sitemap открывается. Затем наблюдайте отчёты поисковых систем и сканирование. Если результат отличается от ожидаемого, верните предыдущую версию и разберите правило отдельно.
Хороший robots.txt обычно короткий и понятный. Он экономит ресурсы обхода, не закрывая страницы, которые должны появляться в поиске.