Сначала список URL, затем правила

Настройте robots.txt без универсальных запретов наугад

Одинакового robots.txt для всех сайтов не существует. Безопасный файл начинается с понимания структуры сайта и проверки конкретных важных и служебных адресов.

  • сохраните текущий файл;
  • проверяйте шаблоны URL, а не отдельные примеры;
  • публикуйте только после теста.
Процесс настройки robots.txt: инвентаризация сайта, подготовка правил и проверка перед публикацией
Инвентаризация → черновик → тест важных URL → публикация → повторная проверка.

Готовое сообщение разработчику

«Проверьте текущий /robots.txt и сохраните копию. Составьте список важных страниц, которые должны обходиться, и служебных шаблонов URL, которые можно закрыть. Добавьте только подтверждённые правила, укажите рабочий Sitemap и перед публикацией покажите тест контрольных URL для Googlebot. Не используйте общий запрет параметров, пока не проверены пагинация, фильтры, CSS, JavaScript и изображения».

Что подготовить

  • копию текущего robots.txt и резервную копию способа его генерации;
  • список важных типов страниц: категории, товары, услуги, статьи;
  • примеры поиска, фильтров, корзины, кабинета, параметров и дублей;
  • адрес действующего sitemap.xml;
  • доступ к CMS, репозиторию или корню сайта для публикации.

Пошаговая настройка

  1. Откройте https://example.com/robots.txt и сохраните файл.
  2. Убедитесь, что он отвечает кодом 200 и относится к нужному протоколу, домену и поддомену.
  3. Соберите реальные шаблоны важных и служебных URL из обхода сайта, аналитики и CMS.
  4. Начните с минимального файла и добавляйте запреты только с понятной причиной.
  5. Проверьте каждое правило на важных, пограничных и служебных URL.
  6. Опубликуйте файл в корне хоста, очистите связанный кэш и повторите проверку.
  7. Наблюдайте за отчётами Search Console и журналами обхода после изменения.

Безопасный минимальный пример

User-agent: *
Disallow:

Sitemap: https://example.com/sitemap.xml

Пустой Disallow не запрещает обход. Затем добавляются только правила, подтверждённые структурой конкретного сайта.

Пример точечного запрета

User-agent: *
Disallow: /cart/
Disallow: /account/
Disallow: /internal-search/

Sitemap: https://example.com/sitemap.xml

Техническая проверка и откат

curl -i https://example.com/robots.txt
curl -sS https://example.com/robots.txt

Файл должен быть обычным текстом, доступным без авторизации и бесконечных перенаправлений. Синтаксис и поведение сверяйте с официальной документацией Google.

Если важные URL оказались закрыты, сразу верните сохранённую версию или минимальный безопасный файл, очистите кэш и повторите тест. Помните: robots.txt управляет обходом, но не является надёжным способом скрыть конфиденциальные данные или удалить URL из индекса.

После изменения воспользуйтесь инструкцией ручной проверки. Исправление noindex, canonical, sitemap и структуры URL выполняется отдельно. Если не уверены в правилах, можно заказать настройку.

История изменений

  1. — Добавлены безопасный процесс изменения, первичные источники и порядок отката.