Инструменты и чек-листы

Robots.txt и sitemap.xml: как правильно настроить для Яндекса

Robots.txt и sitemap.xml простыми словами: директивы, Clean-param, примеры для сайта услуг и магазина, что включать в карту сайта и как проверить оба файла в Вебмастере.

Владислав Рахвальский
Время чтения: 7 минут23 сентября 2026 г.

Robots.txt и sitemap.xml — два служебных файла, которые управляют тем, как поисковые роботы обходят сайт: первый говорит, куда ходить не нужно, второй — какие страницы важны и где их найти. Ошибка в любом из них может незаметно выкинуть из индекса целый раздел или, наоборот, заполнить индекс мусорными страницами. В этой инструкции разбираем директивы robots.txt с примерами, правила составления карты сайта, особенности Яндекса и Google в 2026 году и способы проверки. Статья для владельцев сайтов, маркетологов и разработчиков, которые настраивают сайт сами или проверяют работу подрядчика.

Что такое robots.txt и зачем он нужен

Robots.txt — текстовый файл в корне сайта (по адресу вида site.ru/robots.txt), в котором записаны правила обхода для поисковых роботов. Он не защищает страницы от посторонних — любой человек может открыть закрытый в robots.txt адрес. Его задача другая: не тратить ресурсы робота на страницы, которые не нужны в поиске, — корзину, личный кабинет, результаты внутреннего поиска, служебные параметры.

Требования к файлу:

  • лежит строго в корне домена, отдельно для каждого поддомена;
  • отдаётся с кодом ответа 200 и в кодировке UTF-8;
  • называется строго в нижнем регистре — robots.txt;
  • весит немного: поисковики обрабатывают файл ограниченного размера, и на практике нормальный robots.txt укладывается в несколько килобайт.

Если robots.txt не открывается или отдаёт ошибку сервера, поведение роботов может быть непредсказуемым — от полного обхода всего подряд до временной остановки сканирования. Такие вещи мы проверяем в первую очередь в рамках технического аудита сайта.

Основные директивы robots.txt

ДирективаЧто делаетКто поддерживает
User-agentУказывает, к какому роботу относятся правила ниже. Звёздочка — ко всемЯндекс, Google
DisallowЗапрещает обход адресов, начинающихся с указанного путиЯндекс, Google
AllowРазрешает обход, используется для исключений внутри запрещённого разделаЯндекс, Google
SitemapПолный адрес карты сайта; можно указать несколькоЯндекс, Google
Clean-paramСообщает, какие GET-параметры не меняют содержимое страницы, чтобы робот не считал такие адреса разнымиТолько Яндекс
HostРаньше указывал главное зеркало. Яндекс больше не поддерживает, вместо неё нужен 301-редиректУстарела
Crawl-delayРаньше задавала паузу между запросами. Яндекс её не учитывает — скорость обхода настраивается в Вебмастере; Google тоже игнорируетУстарела для обоих

В путях можно использовать два спецсимвола: звёздочка означает любую последовательность символов, а знак доллара — конец адреса. Когда к одному URL подходят и Allow, и Disallow, применяется правило с более длинным (более точным) путём; при равной длине приоритет у Allow.

Пример robots.txt для сайта услуг

Типичный файл для небольшого сайта компании выглядит так:

User-agent: *
Disallow: /admin/
Disallow: /search/
Disallow: /*?sort=
Disallow: /personal/
Allow: /personal/oferta/
Clean-param: utm_source&utm_medium&utm_campaign&utm_content&utm_term
Clean-param: yclid&gclid

Sitemap: https://site.ru/sitemap.xml

Что здесь происходит: закрыта админка и внутренний поиск, закрыты адреса сортировок и личный кабинет, но внутри него отдельно разрешена страница публичной оферты (сработает правило Allow с более длинным путём), а метки рекламных кампаний склеиваются через Clean-param, чтобы Яндекс не плодил дубли страниц с разными utm. В конце — адрес карты сайта.

Для интернет-магазина список длиннее: корзина, оформление заказа, сравнение, личный кабинет, служебные параметры фильтров, которые не являются посадочными страницами. Но принцип тот же — закрываем служебное, оставляем всё, что может приносить трафик.

Частые ошибки в robots.txt

  • Закрыт весь сайт. Строка «Disallow: /» остаётся после разработки на тестовом домене и переезжает на боевой. Сайт тихо выпадает из индекса. Это самая дорогая ошибка из всех.
  • Закрыты CSS, JavaScript и изображения. Роботу нужно видеть страницу так же, как пользователю. Если стили и скрипты закрыты, поисковик может неверно оценить мобильную версию и содержимое.
  • Попытка убрать страницу из индекса через Disallow. Для Google это не гарантия: если на закрытую страницу ведут ссылки, адрес может появиться в выдаче без описания. Чтобы гарантированно исключить страницу, используйте мета-тег noindex и не запрещайте её обход — иначе робот не увидит этот тег.
  • Устаревшие директивы. Host и Crawl-delay ничего не делают, но создают ложное ощущение, что зеркала и нагрузка настроены.
  • Слишком широкие маски. Правило «Disallow: /*?» закрывает все адреса с параметрами, включая, например, пагинацию или фильтры, которые вы хотели продвигать.

Если страницы пропали из поиска, robots.txt — первое, что стоит проверить. Остальные причины разобраны в статье почему сайт не индексируется.

Отдельные правила для разных роботов

В одном robots.txt можно задать разные правила для разных роботов — например, отдельный блок для Яндекса с директивой Clean-param. Здесь есть важная ловушка: робот выбирает самый подходящий для себя блок User-agent и выполняет только его. Если в файле есть блок для всех роботов и отдельный блок для Яндекса, робот Яндекса прочитает только свой блок, а общие правила проигнорирует. Поэтому все нужные запреты придётся продублировать в каждом блоке. Если специальные правила не нужны, проще держать один общий блок.

В 2026 году у владельцев сайтов появился ещё один вопрос — роботы нейросетей. Многие ИИ-компании используют собственных краулеров, и часть из них декларирует, что соблюдает robots.txt, поэтому им можно закрыть доступ отдельным блоком по имени робота. Прежде чем это делать, взвесьте последствия:

  • ответы Яндекс Нейро и Алисы опираются на поисковый индекс Яндекса, поэтому запрет основного робота Яндекса уберёт сайт и из поиска, и из нейроответов;
  • закрытие отдельных ИИ-краулеров не влияет на классический поиск, но может лишить вас упоминаний в ответах соответствующих ассистентов;
  • robots.txt — это просьба, а не защита: недобросовестные сборщики данных его просто игнорируют.

Для большинства коммерческих сайтов, которым нужна видимость, мы не рекомендуем закрываться от нейросетей: упоминание в ответе ассистента — ещё один канал, по которому клиент может узнать о компании.

Что такое sitemap.xml

Sitemap.xml — это карта сайта для поисковых роботов: XML-файл со списком адресов, которые вы хотите видеть в индексе, и датами их последнего изменения. Она особенно полезна для новых сайтов, у которых мало внешних ссылок, для больших каталогов и для страниц, до которых сложно добраться по внутренним ссылкам.

Технические ограничения одного файла — до 50 000 адресов и до 50 МБ в несжатом виде. Если адресов больше, карту делят на несколько файлов и объединяют индексным файлом sitemap, который ссылается на остальные.

Какие страницы включать в sitemap.xml

Главное правило: карта сайта — это список страниц, которые вы хотите видеть в поиске. Значит, в ней должны быть только адреса, которые:

  • отдают код 200, а не редирект и не ошибку;
  • не закрыты в robots.txt и не содержат noindex;
  • являются каноническими — без параметров, utm-меток и дублей со слэшем и без (про канонические адреса — в статье о теге canonical);
  • несут ценность для поиска: услуги, категории, товары, статьи, контакты.

Не включайте в карту служебные страницы, результаты поиска, страницы пагинации без самостоятельной ценности, тестовые и черновые разделы. Карта, в которой половина адресов с ошибками или редиректами, снижает доверие робота к ней как к источнику.

Теги внутри sitemap: lastmod, changefreq, priority

ТегНазначениеКак относиться
locПолный адрес страницыОбязателен, абсолютный URL с протоколом
lastmodДата последнего изменения содержимогоПолезен, но только если дата честная и меняется при реальном обновлении страницы
changefreqОжидаемая частота измененийGoogle официально игнорирует; рассчитывать на него как на способ ускорить обход не стоит
priorityОтносительная важность страницыGoogle официально игнорирует; значимость страниц лучше задавать структурой и внутренней перелинковкой

Частая ошибка — lastmod, который автоматически ставит текущую дату всем страницам при каждой генерации карты. Такой сигнал бесполезен: поисковик быстро понимает, что даты не отражают реальных изменений.

Как создать robots.txt и sitemap.xml на разных платформах

  • Tilda генерирует оба файла автоматически, частично управлять ими можно через настройки сайта и страниц — например, скрыть страницу из поиска.
  • WordPress с версии 5.5 умеет создавать базовую карту сайта сам, а SEO-плагины дают больше настроек и редактор robots.txt.
  • 1С-Битрикс имеет встроенные инструменты для генерации карты сайта и редактирования robots.txt в SEO-модуле.
  • Сайты на современных фреймворках генерируют оба файла кодом, и здесь важно, чтобы разработчик предусмотрел автоматическое обновление карты при добавлении страниц.

На любой платформе после обновлений, переездов и подключения новых модулей оба файла стоит перепроверять. Мы делаем это регулярно в рамках технической поддержки сайтов, потому что одна неудачная правка шаблона может закрыть от индексации весь раздел.

Как проверить robots.txt и sitemap.xml

  1. Яндекс Вебмастер → Инструменты → Анализ robots.txt. Вставьте список важных адресов и убедитесь, что они разрешены, а служебные — запрещены.
  2. Яндекс Вебмастер → Инструменты → Анализ файлов Sitemap. Покажет синтаксические ошибки в карте.
  3. Яндекс Вебмастер → Индексирование → Файлы Sitemap. Добавьте карту, чтобы робот знал о ней напрямую. Как настроить Вебмастер с нуля, мы описали в статье о настройке Яндекс Вебмастера.
  4. Google Search Console → Файлы Sitemap — аналогичная отправка и отчёт об обработанных адресах. Там же в настройках можно посмотреть, как Google получил ваш robots.txt.
  5. Выборочная проверка адресов. Возьмите 10–20 URL из карты и убедитесь, что они открываются с кодом 200 и не содержат noindex. Для отдельной страницы удобно использовать наш бесплатный SEO-анализ страницы.

И ещё одна привычка, которая экономит много нервов: после каждого релиза сайта, переезда на новый сервер или смены шаблона откройте robots.txt в браузере и посмотрите на него глазами. Проверка занимает минуту, а ошибка вроде случайно перенесённого с тестовой версии запрета на весь сайт может стоить недель восстановления позиций. Если над сайтом работает несколько подрядчиков, договоритесь, кто отвечает за служебные файлы, — иначе каждый будет считать, что проверил кто-то другой.

Памятка по robots.txt и sitemap.xml

Robots.txt закрывает от обхода служебные разделы и параметры, sitemap.xml подсказывает роботу, какие страницы важны. В robots.txt используйте Disallow, Allow, Sitemap и Clean-param для Яндекса, забудьте про Host и Crawl-delay и никогда не закрывайте стили и скрипты. В sitemap.xml держите только канонические страницы с кодом 200 и честными датами изменений. Проверяйте оба файла в Вебмастере после каждого заметного изменения сайта.

Не уверены, что robots.txt и карта сайта настроены правильно, или страницы выпадают из индекса? Закажите технический аудит сайта — проверим индексацию, служебные файлы, дубли и дадим понятный план исправлений.
Услуга по теме
Технический аудит сайта

Найдём ошибки, которые мешают росту, и дадим готовое ТЗ для программиста.

Подробнее и цены
#robots.txt и sitemap.xml#настройка robots.txt#как составить robots txt#sitemap xml что это#карта сайта для яндекса#clean-param#директивы robots txt#проверка robots txt
ДалееКак написать SEO-текст для сайта: пошаговая инструкция 2026