Robots.txt и sitemap.xml: как правильно настроить для Яндекса
Robots.txt и sitemap.xml простыми словами: директивы, Clean-param, примеры для сайта услуг и магазина, что включать в карту сайта и как проверить оба файла в Вебмастере.
Robots.txt и sitemap.xml — два служебных файла, которые управляют тем, как поисковые роботы обходят сайт: первый говорит, куда ходить не нужно, второй — какие страницы важны и где их найти. Ошибка в любом из них может незаметно выкинуть из индекса целый раздел или, наоборот, заполнить индекс мусорными страницами. В этой инструкции разбираем директивы robots.txt с примерами, правила составления карты сайта, особенности Яндекса и Google в 2026 году и способы проверки. Статья для владельцев сайтов, маркетологов и разработчиков, которые настраивают сайт сами или проверяют работу подрядчика.
Что такое robots.txt и зачем он нужен
Robots.txt — текстовый файл в корне сайта (по адресу вида site.ru/robots.txt), в котором записаны правила обхода для поисковых роботов. Он не защищает страницы от посторонних — любой человек может открыть закрытый в robots.txt адрес. Его задача другая: не тратить ресурсы робота на страницы, которые не нужны в поиске, — корзину, личный кабинет, результаты внутреннего поиска, служебные параметры.
Требования к файлу:
- лежит строго в корне домена, отдельно для каждого поддомена;
- отдаётся с кодом ответа 200 и в кодировке UTF-8;
- называется строго в нижнем регистре — robots.txt;
- весит немного: поисковики обрабатывают файл ограниченного размера, и на практике нормальный robots.txt укладывается в несколько килобайт.
Если robots.txt не открывается или отдаёт ошибку сервера, поведение роботов может быть непредсказуемым — от полного обхода всего подряд до временной остановки сканирования. Такие вещи мы проверяем в первую очередь в рамках технического аудита сайта.
Основные директивы robots.txt
| Директива | Что делает | Кто поддерживает |
|---|---|---|
| User-agent | Указывает, к какому роботу относятся правила ниже. Звёздочка — ко всем | Яндекс, Google |
| Disallow | Запрещает обход адресов, начинающихся с указанного пути | Яндекс, Google |
| Allow | Разрешает обход, используется для исключений внутри запрещённого раздела | Яндекс, Google |
| Sitemap | Полный адрес карты сайта; можно указать несколько | Яндекс, Google |
| Clean-param | Сообщает, какие GET-параметры не меняют содержимое страницы, чтобы робот не считал такие адреса разными | Только Яндекс |
| Host | Раньше указывал главное зеркало. Яндекс больше не поддерживает, вместо неё нужен 301-редирект | Устарела |
| Crawl-delay | Раньше задавала паузу между запросами. Яндекс её не учитывает — скорость обхода настраивается в Вебмастере; Google тоже игнорирует | Устарела для обоих |
В путях можно использовать два спецсимвола: звёздочка означает любую последовательность символов, а знак доллара — конец адреса. Когда к одному URL подходят и Allow, и Disallow, применяется правило с более длинным (более точным) путём; при равной длине приоритет у Allow.
Пример robots.txt для сайта услуг
Типичный файл для небольшого сайта компании выглядит так:
User-agent: *
Disallow: /admin/
Disallow: /search/
Disallow: /*?sort=
Disallow: /personal/
Allow: /personal/oferta/
Clean-param: utm_source&utm_medium&utm_campaign&utm_content&utm_term
Clean-param: yclid&gclid
Sitemap: https://site.ru/sitemap.xml
Что здесь происходит: закрыта админка и внутренний поиск, закрыты адреса сортировок и личный кабинет, но внутри него отдельно разрешена страница публичной оферты (сработает правило Allow с более длинным путём), а метки рекламных кампаний склеиваются через Clean-param, чтобы Яндекс не плодил дубли страниц с разными utm. В конце — адрес карты сайта.
Для интернет-магазина список длиннее: корзина, оформление заказа, сравнение, личный кабинет, служебные параметры фильтров, которые не являются посадочными страницами. Но принцип тот же — закрываем служебное, оставляем всё, что может приносить трафик.
Частые ошибки в robots.txt
- Закрыт весь сайт. Строка «Disallow: /» остаётся после разработки на тестовом домене и переезжает на боевой. Сайт тихо выпадает из индекса. Это самая дорогая ошибка из всех.
- Закрыты CSS, JavaScript и изображения. Роботу нужно видеть страницу так же, как пользователю. Если стили и скрипты закрыты, поисковик может неверно оценить мобильную версию и содержимое.
- Попытка убрать страницу из индекса через Disallow. Для Google это не гарантия: если на закрытую страницу ведут ссылки, адрес может появиться в выдаче без описания. Чтобы гарантированно исключить страницу, используйте мета-тег noindex и не запрещайте её обход — иначе робот не увидит этот тег.
- Устаревшие директивы. Host и Crawl-delay ничего не делают, но создают ложное ощущение, что зеркала и нагрузка настроены.
- Слишком широкие маски. Правило «Disallow: /*?» закрывает все адреса с параметрами, включая, например, пагинацию или фильтры, которые вы хотели продвигать.
Если страницы пропали из поиска, robots.txt — первое, что стоит проверить. Остальные причины разобраны в статье почему сайт не индексируется.
Отдельные правила для разных роботов
В одном robots.txt можно задать разные правила для разных роботов — например, отдельный блок для Яндекса с директивой Clean-param. Здесь есть важная ловушка: робот выбирает самый подходящий для себя блок User-agent и выполняет только его. Если в файле есть блок для всех роботов и отдельный блок для Яндекса, робот Яндекса прочитает только свой блок, а общие правила проигнорирует. Поэтому все нужные запреты придётся продублировать в каждом блоке. Если специальные правила не нужны, проще держать один общий блок.
В 2026 году у владельцев сайтов появился ещё один вопрос — роботы нейросетей. Многие ИИ-компании используют собственных краулеров, и часть из них декларирует, что соблюдает robots.txt, поэтому им можно закрыть доступ отдельным блоком по имени робота. Прежде чем это делать, взвесьте последствия:
- ответы Яндекс Нейро и Алисы опираются на поисковый индекс Яндекса, поэтому запрет основного робота Яндекса уберёт сайт и из поиска, и из нейроответов;
- закрытие отдельных ИИ-краулеров не влияет на классический поиск, но может лишить вас упоминаний в ответах соответствующих ассистентов;
- robots.txt — это просьба, а не защита: недобросовестные сборщики данных его просто игнорируют.
Для большинства коммерческих сайтов, которым нужна видимость, мы не рекомендуем закрываться от нейросетей: упоминание в ответе ассистента — ещё один канал, по которому клиент может узнать о компании.
Что такое sitemap.xml
Sitemap.xml — это карта сайта для поисковых роботов: XML-файл со списком адресов, которые вы хотите видеть в индексе, и датами их последнего изменения. Она особенно полезна для новых сайтов, у которых мало внешних ссылок, для больших каталогов и для страниц, до которых сложно добраться по внутренним ссылкам.
Технические ограничения одного файла — до 50 000 адресов и до 50 МБ в несжатом виде. Если адресов больше, карту делят на несколько файлов и объединяют индексным файлом sitemap, который ссылается на остальные.
Какие страницы включать в sitemap.xml
Главное правило: карта сайта — это список страниц, которые вы хотите видеть в поиске. Значит, в ней должны быть только адреса, которые:
- отдают код 200, а не редирект и не ошибку;
- не закрыты в robots.txt и не содержат noindex;
- являются каноническими — без параметров, utm-меток и дублей со слэшем и без (про канонические адреса — в статье о теге canonical);
- несут ценность для поиска: услуги, категории, товары, статьи, контакты.
Не включайте в карту служебные страницы, результаты поиска, страницы пагинации без самостоятельной ценности, тестовые и черновые разделы. Карта, в которой половина адресов с ошибками или редиректами, снижает доверие робота к ней как к источнику.
Теги внутри sitemap: lastmod, changefreq, priority
| Тег | Назначение | Как относиться |
|---|---|---|
| loc | Полный адрес страницы | Обязателен, абсолютный URL с протоколом |
| lastmod | Дата последнего изменения содержимого | Полезен, но только если дата честная и меняется при реальном обновлении страницы |
| changefreq | Ожидаемая частота изменений | Google официально игнорирует; рассчитывать на него как на способ ускорить обход не стоит |
| priority | Относительная важность страницы | Google официально игнорирует; значимость страниц лучше задавать структурой и внутренней перелинковкой |
Частая ошибка — lastmod, который автоматически ставит текущую дату всем страницам при каждой генерации карты. Такой сигнал бесполезен: поисковик быстро понимает, что даты не отражают реальных изменений.
Как создать robots.txt и sitemap.xml на разных платформах
- Tilda генерирует оба файла автоматически, частично управлять ими можно через настройки сайта и страниц — например, скрыть страницу из поиска.
- WordPress с версии 5.5 умеет создавать базовую карту сайта сам, а SEO-плагины дают больше настроек и редактор robots.txt.
- 1С-Битрикс имеет встроенные инструменты для генерации карты сайта и редактирования robots.txt в SEO-модуле.
- Сайты на современных фреймворках генерируют оба файла кодом, и здесь важно, чтобы разработчик предусмотрел автоматическое обновление карты при добавлении страниц.
На любой платформе после обновлений, переездов и подключения новых модулей оба файла стоит перепроверять. Мы делаем это регулярно в рамках технической поддержки сайтов, потому что одна неудачная правка шаблона может закрыть от индексации весь раздел.
Как проверить robots.txt и sitemap.xml
- Яндекс Вебмастер → Инструменты → Анализ robots.txt. Вставьте список важных адресов и убедитесь, что они разрешены, а служебные — запрещены.
- Яндекс Вебмастер → Инструменты → Анализ файлов Sitemap. Покажет синтаксические ошибки в карте.
- Яндекс Вебмастер → Индексирование → Файлы Sitemap. Добавьте карту, чтобы робот знал о ней напрямую. Как настроить Вебмастер с нуля, мы описали в статье о настройке Яндекс Вебмастера.
- Google Search Console → Файлы Sitemap — аналогичная отправка и отчёт об обработанных адресах. Там же в настройках можно посмотреть, как Google получил ваш robots.txt.
- Выборочная проверка адресов. Возьмите 10–20 URL из карты и убедитесь, что они открываются с кодом 200 и не содержат noindex. Для отдельной страницы удобно использовать наш бесплатный SEO-анализ страницы.
И ещё одна привычка, которая экономит много нервов: после каждого релиза сайта, переезда на новый сервер или смены шаблона откройте robots.txt в браузере и посмотрите на него глазами. Проверка занимает минуту, а ошибка вроде случайно перенесённого с тестовой версии запрета на весь сайт может стоить недель восстановления позиций. Если над сайтом работает несколько подрядчиков, договоритесь, кто отвечает за служебные файлы, — иначе каждый будет считать, что проверил кто-то другой.
Памятка по robots.txt и sitemap.xml
Robots.txt закрывает от обхода служебные разделы и параметры, sitemap.xml подсказывает роботу, какие страницы важны. В robots.txt используйте Disallow, Allow, Sitemap и Clean-param для Яндекса, забудьте про Host и Crawl-delay и никогда не закрывайте стили и скрипты. В sitemap.xml держите только канонические страницы с кодом 200 и честными датами изменений. Проверяйте оба файла в Вебмастере после каждого заметного изменения сайта.
Не уверены, что robots.txt и карта сайта настроены правильно, или страницы выпадают из индекса? Закажите технический аудит сайта — проверим индексацию, служебные файлы, дубли и дадим понятный план исправлений.
Найдём ошибки, которые мешают росту, и дадим готовое ТЗ для программиста.