WordPress продвижение — СЕО раскрутка Вордпресс | FLSEO
WordPress – все также популярная CMS, которая в первую очередь ориентирована на информационные ресурсы. Но и информационные сайты необходимо оптимизировать и продвигать в поисковой системе. Именно правильные и грамотные действия приведут поток посетителей на ваш ресурс.
14 показов
709 открытий
Немного о CMS WordPress
Если говорить о преимуществах данного движка, то нельзя не отметить:
1. Свободную лицензию.
2. Возможность подключения плагинов, которые расширяют функционал платформы.
3. Простой и легкий дизйан.
Огромное количество различных плагинов WordPress сильно расширяют возможности платформы. Это делает WP практически универсальной CMS, которую используют для создания корпоративных сайтов, онлайн-магазинов и других типов интернет-ресурсов.
На что стоит обратить внимание при оптимизации сайта
О SEO стоит подумать еще на этапе создания сайта. В частности, на эффективность продвижения может повлиять выбор доменного имени, а также хостинг-провайдера. Многие оптимизаторы рекомендуют использовать в качестве названия домена слово, связанное с вашей нишей. Это не обязательный критерий выбора, но может положительно сказаться на ранжировании. В любом случае, ваше доменное имя должно быть кратким и читаемым, чтобы пользователям было проще его запомнить. Если же вы покупаете уже зарегистрированный домен, чтобы избежать песочницы, убедитесь, что ранее он не попадал под фильтры поисковиков.
Хостинг сайта также важен. Если по условиям договора с провайдером на вашем сайте будет размещаться множество рекламы, это отрицательно скажется и на пользовательском опыте, и на позициях. Сервер должен быть расположен в вашей стране, или близко к ней, так как от этого будет зависеть скорость работы ресурса у пользователей.
Настройка индексации сайта
Индексация – это сбор поисковой системой информации о контенте документа. На основе этой информации алгоритмы поисковика определяют, на какие запросы пользователь сможет получить ответ, почему ваш контент ценен по сравнению с конкурентами. Если индексация прошло некорректно, страницы вашего сайта могут не попасть в поисковую выдачу.
Во избежание таких проблем необходимо убедиться, что сайт открыт для индексирования. Для этого нужно зайти в административную панель и перейти в раздел с настройками. Если в пункте «Видимость для поисковых систем» стоит отметка, запрещающая индексацию, – уберите ее.
Настройки robots.txt
Очень важно убедиться в корректности файла robots.txt. Он находится в корневом каталоге сайте. Используется ботами поисковых систем для определения, какой именно контент необходимо индексировать.
В robot.txt следует закрыть от индексации следующие типы контента и страниц:
Как запретить или разрешить индексацию WordPress сайта
По умолчанию, WordPress не разрешает индексировать сайт. Это нужно для того, чтобы пустые сайты не индексировались поисковыми системами. Но если ваш сайт уже содержит достаточно информации и вы желаете разрешить поисковым системам индексировать WordPress сайт, то сделать это совсем не сложно.
Для начала необходимо зайти в панель администратора WordPress. Затем перейти на вкладу «Параметры -> Чтение». При этом откроется страница, где вы можете запретить или разрешить индексацию WordPress сайта одной галочкой.
Для того, чтобы запретить индексацию WordPress сайта, необходимо поставить галочку в поле «Видимость для поисковых систем». А если необходимо разрешить индексацию WordPress сайта, то следует снять галочку в том же поле. Все очень просто.
Настроим индексацию Вашего сайта
Настроим правильную индексацию сайта поисковыми системами. Сэкономьте кучу времени на изучении этого вопроса. Просто закажите услугу, мы сделаем все самостоятельно.
от 2 900 рублей
Заказать настройку индексации
Где еще может быть запрещена или разрешена индексация сайта
Следует убедиться, что сайт не запрещен к индексации в других местах. Это может быть файл robots.txt, настройки в SEO плагине, meta данные в HTML страницы. Чтобы проверить, разрешен ли сейчас сайт к индексации, я рекомендую использовать сервис Яндекс.Вебмастер .
Важно понимать, что именно поисковые системы должны индексировать, и что совсем не должны видеть.
Поисковые системы Яндекс и Гугл должны индексировать только публичные документы на сайте. Такими являются HTML страницы, изображения и другие файлы, которые полезные пользователям вашего сайта.
Поисковые системы НЕ должны индексировать технические страницы, страницы с повторяющимся содержимым (дубли), технические файлы и те файлы, которые не предназначены для публичного просмотра.
Управлять индексацией следует в файле robots.txt. Также есть возможность закрыть определенные разделы сайта и страницы с помощью SEO плагинов для Worpress.
Заказать настройку индексации
Опубликовано: 2 мая 2013
Другие полезные статьи на нашем блоге
- ⭐ Laravel или WordPress — что выбрать для своего сайта? Привет! Это статья для владельцев сайтов и для тех, кто хочет запустить свой Онлайн-проект или Интернет сервис. Ну, если ты придумал какой-то микро-стартап или нужен сайт для обслуживания твоего бизнеса…
- ⭐ Сайт на Elementor медленно загружается. Что делать? Привет! Хочу поделиться своим мнением про плагин для WordPress Elementor, и рассказать о том, почему сайты на Elementor получаются «плохими» и «медленными» в большинстве случаев. Парочка важных поправок Во-первых, сам…
- ⭐ Лучшие бесплатные уроки по Laravel Привет! У некоторых специалистов могут возникнуть серьезные сложности, когда они переходят с одного привычного инструмента на другой. Также может произойти у многи WOrdpress специалистов, которые решили изучить Laravel. Нужно сказать,…
- ⭐ Timeweb — отзыв и подробный обзор Привет! Timeweb — это компания, которая предоставляет услуги хостинга и VPS/VDS сервера в аренду. Этот пост можно воспринимть как отзыв о Timeweb, поскольку описывать я буду свой персонльный опыт работы…
Файл robots.txt для WordPress
Рассмотрим, зачем нужен файл robots.txt для WordPress, где он находится на хостинге и как настроить правильный robots.txt для WordPress.
Для чего нужен файл robots.txt?
Для того чтобы сайт начал отображаться в Яндекс, Google, Yahoo и других поисковых системах (ПС), они должны внести его страницы в свои каталоги. Этот процесс называется индексацией.
Чтобы проиндексировать тот или иной веб-ресурс, поисковые системы посылают на сайты поисковых роботов (иногда их называют ботами). Они методично сканируют и обрабатывают содержимое каждой страницы сайта. После окончания индексации начинается «социальная жизнь» ресурса: его контент попадается пользователям в результатах поиска по запросам.
Многие сайты создаются на готовых движках и CMS (системах управления контентом) WordPress, Joomla, Drupal и других. Как правило, такие системы содержат страницы, которые не должны попадать в поисковую выдачу:
- временные файлы (tmp);
- личные данные посетителей (private);
- служебные страницы (admin);
- результаты поиска по сайту и т. д.
Чтобы внутренняя информация не попала в результаты поиска, ее нужно закрыть от индексации. В этом помогает файл robots.txt. Он служит для того, чтобы сообщить поисковым роботам, какие страницы сайта нужно индексировать, а какие — нет. Иными словами, robots.txt — это файл, состоящий из текстовых команд (правил), которыми поисковые роботы руководствуются при индексации сайта.
Наличие robots.txt значительно ускоряет процесс индексации. Благодаря нему в поисковую выдачу не попадают лишние страницы, а нужные индексируются быстрее.
Где находится robots.txt WordPress?
Файл robots.txt находится в корневой папке сайта. Если сайт создавался на WordPress, скорее всего, robots.txt присутствует в нем по умолчанию. Чтобы найти robots.txt на WordPress, введите в адресной строке браузера:
https://www.домен-вашего-сайта/robots.txt

- Если файл присутствует, откроется страница с перечнем правил индексации. Однако чтобы редактировать их, вам потребуется найти и открыть robots.txt на хостинге. Как правило, он находится в корневой папке сайта:

- Если же файл robots.txt по какой-то причине отсутствует, вы можете создать его вручную на своем компьютере и загрузить на хостинг или воспользоваться готовыми решениями (плагинами WordPress).
Как создать файл robots.txt для WordPress?
Есть два способа создания robots.txt:
- Вручную на компьютере.
- С помощью плагинов в WordPress.
Первый способ прост лишь на первый взгляд. После создания пустого документа и загрузки его на сайт, вы должны будете наполнить его содержанием (директивами). Ниже мы расскажем об основных правилах, однако стоит учитывать, что тонкая настройка требует специальных знаний SEO-оптимизации.
Создание robots.txt вручную
Откройте программу «Блокнот».

Нажмите Файл → Сохранить как… (или комбинацию клавиш Ctrl + Shift + S):

Введите название robots.txt и нажмите Сохранить.
Откройте корневую папку сайта и загрузите в нее созданный файл по инструкции. Готово, вы разместили пустой файл и после этого сможете редактировать его прямо в панели управления хостингом.
Создание robots.txt с помощью плагина
Откройте административную панель WordPress по инструкции.

Перейдите в раздел «Плагины» и нажмите Добавить новый:
Введите в строке поиска справа название Yoast SEO и нажмите Enter.

Нажмите Установить → Активировать:

Перейдите к настройкам плагина, выбрав в меню SEO → Инструменты. Затем нажмите Редактор файлов:

Нажмите Создать файл robots.txt:

Нажмите Сохранить изменения в robots.txt: Готово, файл с минимальным количеством директив будет создан автоматически.
Настройка robots.txt WordPress
После создания файла вам предстоит настроить robots.txt для своего сайта. Рассмотрим основы синтаксиса (структуры) этого файла:
- Файл может состоять из одной и более групп директив (правил).
- В каждой группе должно указываться, для какого поискового робота предназначены правила, к каким разделам/файлам у него нет доступа, а к какому — есть.
- Правила читаются поисковыми роботами по порядку, сверху вниз.
- Файл чувствителен к регистру, поэтому если название раздела или файла задано капслоком (например, FILE.PDF), именно так стоит писать и в robots.txt.
- Все правила одной группы должны следовать без пропуска строк.
- Чтобы оставить комментарий, нужно прописать шарп (#) в начале строки.
Все правила в файле задаются через двоеточие. Например:
User-agent: Googlebot
Где User-agent — команда (директива), а Googlebot — значение.
Основные директивы и их значения
User-agent — эта директива указывает, на каких поисковых роботов распространяются остальные правила в документе. Она может принимать следующие значения:
- User-agent: * — общее правило для всех поисковых систем;
- User-agent: Googlebot — робот Google;
- User-agent: Yandex — робот Яндекс;
- User-agent: Mai.ru — робот Mail.ru;
- User-agent: Yahoo Slurp — робот Yahoo и др.
У крупнейших поисковых систем Яндекс и Google есть десятки роботов, предназначенных для индексации конкретных разделов и элементов сайтов. Например:
- YandexBot — для органической выдачи;
- YandexDirect — для контекстной рекламы;
- YandexNews — для новостных сайтов и т. п.
Для решения некоторых специфических задач веб-разработчики могут обращаться к конкретным поисковым роботам и настраивать правила исключительно для них.
Disallow — это директива, которая указывает, какие разделы или страницы нельзя посещать поисковым роботам. Все значения задаются в виде относительных ссылок (то есть без указания домена). Основные правила запрета:
- Disallow: /wp-admin — закрывает админку сайта;
- Disallow: /cgi-bin — запрет индексации директории, в которой хранятся CGI-скрипты;
- Disallow: /*? или Disallow: /search — закрывает от индексации поиск на сайте;
- Disallow: *utm* — закрывает все страницы с UTM-метками;
- Disallow: */xmlrpc.php — закрывает файл с API WordPress и т. д.
Вариантов того, какие файлы нужно закрывать от индексации, очень много. Вносите значения аккуратно, чтобы по ошибке не указать контентные страницы, что повредит поисковой позиции сайта.
Allow — это директива, которая указывает, какие разделы и страницы должны проиндексировать поисковые роботы. Как и с директивой Disallow, в значении нужно указывать относительные ссылки:
- Allow: /*.css или Allow: *.css — индексировать все css-файлы;
- Allow: /*.js — обходить js-файлы;
- Allow: /wp-admin/admin-ajax.php — разрешает индексацию асинхронных JS-скриптов, которые используются в некоторых темах.
В директиве Allow не нужно указывать все разделы и файлы сайта. Проиндексируется всё, что не было запрещено директивой Disallow. Поэтому задавайте только исключения из правила Disallow.
Sitemap — это необязательная директива, которая указывает, где находится карта сайта Sitemap. Единственная директива, которая поддерживает абсолютные ссылки (то есть местоположение файла должно указываться целиком): Sitemap: https://site.ru/sitemap.xml , где site.ru — имя домена.
Также есть некоторые директивы, которые считаются уже устаревшими. Их можно удалить из кода, чтобы не «засорять» файл:
- Crawl-delay. Задает паузу в индексации для поисковых роботов. Например, если задать для Crawl-Delay параметр 2 секунды, то каждый новый раздел/файл будет индексироваться через 2 секунды после предыдущего. Это правило раньше указывали, чтобы не создавать дополнительную нагрузку на хостинг. Но сейчас мощности современных процессоров достаточно для любой нагрузки.
- Host. Указывает основное зеркало сайта. Например, если все страницы сайта доступны с www и без этого префикса, один из вариантов будет считаться зеркалом. Главное — чтобы на них совпадал контент. Раньше зеркало нужно было задавать в robots.txt, но сейчас поисковые системы определяют этот параметр автоматически.
- Clean-param. Директива, которая использовалась, чтобы ограничить индексацию совпадающего динамического контента. Считается неэффективной.
Пример robots.txt
Рассмотрим стандартный файл robots.txt, который можно скопировать и использовать для блога, заменив название домена в директиве Sitemap и убрав комментарии (текст справа, включая #):
User-agent: * # общие правила для всех поисковых роботов Disallow: /wp-admin/ # запретить индексацию папки wp-admin (все служебные папки) Disallow: /readme.html # закрыть доступ к стандартному файлу о программном обеспечении Disallow: /*? # запретить индексацию результатов поиска по сайту Disallow: /?s= # запретить все URL поиска по сайту Allow: /wp-admin/admin-ajax.php # индексировать асинхронные JS-файлы темы Allow: /*.css # индексировать CSS-файлы Allow: /*.js # индексировать JS-скрипты Sitemap: https://site.ru/sitemap.xml # указать местоположение карты сайта
Как редактировать robots.txt на WordPress?
Чтобы внести изменения в файл robots.txt, откройте его в панели управления хостингом. Используйте плагин Yoast SEO (или аналогичное решение в WordPress) для редактирования файлов:

Проверка работы файла robots.txt
Чтобы убедиться в корректности составленного файла, используйте стандартный инструмент Яндекс.Вебмастер:
Перейдите в раздел Инструменты → Анализ robots.txt.

Содержимое robots.txt обновится автоматически. Нажмите Проверить:
Если в синтаксисе файла будут ошибки, Яндекс укажет, в каких строчках проблема и даст рекомендации по исправлению.
Помогла ли вам статья?
Спасибо за оценку. Рады помочь
Настраиваем файл robots.txt для WordPress
В этой статье пример оптимального, на мой взгляд, кода для файла robots.txt под WordPress, который вы можете использовать в своих сайтах.
Оглавление:
- Оптимальный код robots.txt для WordPress
- Версия 1 (не строгая)
- Версия 2 (строгая)
- Директивы (разбор кода)
- ВАЖНО: Сортировка правил
- Проверка robots.txt и документация
- robots.txt в WordPress
- robots_txt
- do_robotstxt
- Рекомендации
- Ошибочные рекомендации
- Спорные рекомендации
- Нельзя закрывать /wp-admin/admin-ajax.php
- Нельзя закрывать /wp-includes/
- Не закрывайте фиды: */feed
- Нестандартные Директивы
- Clean-param
- Crawl-delay (устарела)
- Host (устарела)
- Заключение
Для начала, вспомним зачем нужен robots.txt — файл robots.txt нужен исключительно для поисковых роботов, чтобы «сказать» им какие разделы/страницы сайта посещать, а какие посещать не нужно. Страницы, которые закрыты от посещения не будут попадать в индекс поисковиков (Yandex, Google и т.д.).

Закрыть страницу от робота можно также через мета-тег robots или в HTTP-заголовке ответа X-Robots-Tag . Преимущество файла robots.txt в том, что робот при посещении сайта сначала загружает все правила из файла robots.txt и опираясь на них ходит по страницам сайта исключая из посещения страницы, URL которых не подходит под правила.
Таким образом, если мы закрыли страницу в robots.txt, робот просто пропустит её не сделав никаких запросов на сервер. А если мы закрыли страницу в заголовке X-Robots-Tag или мета-теге, роботу нужно сначала сделать запрос к серверу, получить ответ, посмотреть что находится в заголовке или метатеге и только потом принять решения индексировать страницу или нет.
Таким образом, файл robots.txt объясняет роботу какие страницы (URL) сайта нужно просто пропускать не делая никаких запросов. Это экономит время обхода роботом всех страниц сайта и экономит ресурсы сервера.
Рассмотрим на примере. Допустим, у нас есть сайт на котором всего 10 000 страниц (не 404 URL). Из них полезных страниц с уникальным контентом всего 3000, остальное это архивы по датам, авторам, страницы пагинации и другие страницы контент на которых дублируется (например фильтры с GET параметрами). Допустим, мы хотим закрыть от индексации эти 7000 неуникальных страниц:
- если сделать это через robots.txt , то роботу для индексации всего сайта нужно будет посетить всего 3000 страниц остальное будет отсеяно сразу же на уровне URL.
- если сделать это через мета-тег robots, то роботу для индексации всего сайта нужно будет посетить все 10 000 страниц сайта. Потому что нужно получить контент страницы, чтобы узнать что находится в мета-теге (в котором указано что страницу индексировать не нужно).
Несложно догадаться, что в этом случае первый вариант гораздо предпочтительнее потому что на обход сайта робот будет тратить гораздо меньше времени, а сервер будет генерировать гораздо меньше страниц.
Оптимальный код robots.txt для WordPress
Важно понимать, что ниже приведен универсальный пример кода для файла robots.txt . Для каждого конкретного сайта его нужно расширять или вносить корректировки. И лучше не трогайте ничего если не понимаете что делаете — обращайтесь к знающим людям.
Версия 1 (не строгая)
Эта версия, пожалуй, более предпочтительна по сравнению со второй, потому что тут нет опасности запретить индексацию каких либо файлов внутри ядра WordPress или папки wp-content .
User-agent: * # Создаем секцию правил для роботов. * значит для всех # роботов. Чтобы указать секцию правил для отдельного # робота, вместо * укажите его имя: GoogleBot, Yandex. Disallow: /cgi-bin # Стандартная папка на хостинге. Disallow: /wp-admin/ # Закрываем админку. Allow: /wp-admin/admin-ajax.php # Откроем аякс. Disallow: /? # Все параметры запроса на главной. Disallow: *?s= # Поиск. Disallow: *&s= # Поиск. Disallow: /search # Поиск. Disallow: /author/ # Архив автора. Disallow: */embed$ # Все встраивания. Disallow: */xmlrpc.php # Файл WordPress API Disallow: *utm*= # Ссылки с utm-метками Disallow: *openstat= # Ссылки с метками openstat # Одина или несколько ссылок на карту сайта (файл Sitemap). Это независимая # директива и дублировать её для каждого User-agent не нужно. Так например # Google XML Sitemap создает 2 карты сайта: Sitemap: http://example.com/sitemap.xml Sitemap: http://example.com/sitemap.xml.gz # Версия кода: 2.0 # Не забудьте поменять `example.com` на ваш сайт.
Версия 2 (строгая)
В этом варианте мы контролируем все доступы. Сначала глобально запрещаем доступ к почти всему от WP ( Disallow: /wp- ), а затем открываем, там где нужно.
Этот код я пожалуй не рекомендовал бы, потому что тут закрывается все от wp- и нужно будет описать все что разрешено. Так в будущем, когда WP введет что-то новое, это новое может стать недоступно для роботов. Так например получилось с картой сайта WP.
User-agent: * # Создаем секцию правил для роботов. * значит для всех # роботов. Чтобы указать секцию правил для отдельного # робота, вместо * укажите его имя: GoogleBot, Yandex. Disallow: /cgi-bin # Стандартная папка на хостинге. Disallow: /wp- # Все связанное с WP - это: /wp-content /wp-admin # /wp-includes /wp-json wp-login.php wp-register.php. Disallow: /wp/ # Каталог куда установлено ядро WP (если ядро установлено # в подкаталог). Если WP установлен стандартно, то # правило можно удалить. Disallow: /? # Все параметры запроса на главной. Disallow: *?s= # Поиск. Disallow: *&s= # Поиск. Disallow: /search # Поиск. Disallow: /author/ # Архив автора. Disallow: */embed$ # Все встраивания. Disallow: */xmlrpc.php # Файл WordPress API Disallow: *utm*= # Ссылки с utm-метками Disallow: *openstat= # Ссылки с метками openstat Allow: */wp-*/*ajax*.php # AJAX запросы: */admin-ajax.php */front-ajaxs.php Allow: */wp-sitemap # карта сайта (главная и вложенные) Allow: */uploads # открываем uploads Allow: */wp-*/*.js # внутри /wp- (/*/ - для приоритета) Allow: */wp-*/*.css # внутри /wp- (/*/ - для приоритета) Allow: */wp-*/*.png # картинки в плагинах, cache папке и т.д. Allow: */wp-*/*.jpg # картинки в плагинах, cache папке и т.д. Allow: */wp-*/*.jpeg # картинки в плагинах, cache папке и т.д. Allow: */wp-*/*.gif # картинки в плагинах, cache папке и т.д. Allow: */wp-*/*.svg # картинки в плагинах, cache папке и т.д. Allow: */wp-*/*.webp # файлы в плагинах, cache папке и т.д. Allow: */wp-*/*.swf # файлы в плагинах, cache папке и т.д. Allow: */wp-*/*.pdf # файлы в плагинах, cache папке и т.д. # Секция правил закончена # Одна или несколько ссылок на карту сайта (файл Sitemap). Это независимая # директива и дублировать её для каждого User-agent не нужно. Так например # Google XML Sitemap создает 2 карты сайта: Sitemap: http://example.com/wp-sitemap.xml Sitemap: http://example.com/wp-sitemap.xml.gz # Версия кода: 2.0 # Не забудьте поменять `example.com` на ваш сайт.
В правилах Allow: вы можете видеть дополнительные, казалось бы ненужные, знаки * — они нужны для увеличения приоритета правила. Зачем это нужно смотрите в сортировке правил.
Директивы (разбор кода)
- Google doc по robots.txt.
- Yandex doc по robots.txt
Определяет для какого робота будет работать блок правил, который написан после этой строки. Тут возможны два варианта:
- User-agent: * — указывает, что правила после этой строки будут работать для всех поисковых роботов.
- User-agent: ИМЯ_РОБОТА — указывает конкретного робота, для которого будет работать блок правил. Например: User-agent: Yandex , User-agent: Googlebot .
Возможные роботы (боты) Яндекса:
Yandex робот проверяет наличие записей, начинающихся с User-agent: , в них учитываются подстроки Yandex (регистр значения не имеет) или * . Если обнаружена строка User-agent: Yandex , то строка User-agent: * не учитывается. Если строки User-agent: Yandex и User-agent: * отсутствуют, считается, что доступ роботу не ограничен.
- Yandex — любой робот Яндекса.
- YandexImages — Индексирует изображения для показа на Яндекс Картинках.
- YandexMedia — Индексирует мультимедийные данные.
- YandexDirect — Скачивает информацию о контенте сайтов-партнеров Рекламной сети Яндекса, чтобы уточнить их тематику для подбора релевантной рекламы.
- YandexDirectDyn — Скачивает файл фавиконки сайта для отображения в результатах поиска.
- YandexBot — Основной индексирующий робот.
- YandexAccessibilityBot — Скачивает страницы для проверки их доступности пользователям. Его максимальная частота обращений к сайту составляет 3 обращения в секунду. Робот игнорирует настройку в интерфейсе Яндекс Вебмастера.
- YandexAdNet — Робот Рекламной сети Яндекса.
- YandexBlogs — Робот поиска по блогам, индексирующий комментарии постов.
- YandexCalendar — Робот Яндекс Календаря. Скачивает файлы календарей по инициативе пользователей, которые часто располагаются в запрещенных для индексации каталогах.
- YandexDialogs — Отправляет запросы в навыки Алисы.
- YaDirectFetcher — Скачивает целевые страницы рекламных объявлений для проверки их доступности и уточнения тематики. Это необходимо для размещения объявлений в поисковой выдаче и на сайтах-партнерах.. Робот не использует файл robots.txt, поэтому игнорирует директивы, установленные для него.
- YandexForDomain — Робот почты для домена, используется при проверке прав на владение доменом.
- YandexImageResizer — Робот мобильных сервисов.
- YandexMobileBot — Определяет страницы с версткой, подходящей под мобильные устройства.
- YandexMarket — Робот Яндекс Маркета.
- YandexMetrika — Робот Яндекс Метрики. Скачивает страницы сайта для проверки их доступности, в том числе проверяет целевые страницы объявлений Яндекс Директа. Робот не использует файл robots.txt, поэтому игнорирует директивы, установленные для него.
- YandexMobileScreenShotBot — Делает снимок мобильной страницы.
- YandexNews — Робот Яндекс Новостей.
- YandexOntoDB — Робот объектного ответа.
- YandexOntoDBAPI — Робот объектного ответа, скачивающий динамические данные.
- YandexPagechecker — Обращается к странице при валидации микроразметки через форму Валидатор микроразметки.
- YandexPartner — Скачивает информацию о контенте сайтов-партнеров Яндекса
- YandexRCA — Собирает данные для формирования превью. Например, для расширенного отображения сайта в поиске.
- YandexSearchShop — Скачивает YML-файлы каталогов товаров (по инициативе пользователей), которые часто располагаются в запрещенных для индексации каталогах.
- YandexSitelinks — Проверяет доступность страниц, которые используются в качестве быстрых ссылок.
- YandexSpravBot — Робот Яндекс Бизнеса.
- YandexTracker — Робот Яндекс Трекера.
- YandexTurbo — Обходит RSS-канал, созданный для формирования Турбо-страниц. Его максимальная частота обращений к сайту составляет 3 обращения в секунду. Робот игнорирует настройку в интерфейсе Яндекс Вебмастера и директиву Crawl-delay.
- YandexUserproxy — Проксирует действия пользователей на сервисах Яндекса: отправляет запросы в ответ на нажатие кнопок, скачивает страницы для перевода онлайн и т. д.
- YandexVertis — Робот поисковых вертикалей.
- YandexVerticals — Робот Яндекс Вертикалей: Авто.ру, Янекс.Недвижимость, Яндекс Работа, Яндекс Отзывы.
- YandexVideo — Индексирует видео для показа в поиске Яндекса по видео.
- YandexVideoParser — Индексирует видео для показа в поиске Яндекса по видео.
- YandexWebmaster — Робот Яндекс Вебмастера.
- Полный список роботов Яндекса.
Возможные роботы (боты) Google:
- Googlebot — основной индексирующий робот.
- Googlebot-Image — индексирует изображения.
- Mediapartners-Google — робот отвечающий за размещение рекламы на сайте. Важен для тех, у кого крутится реклама от AdSense. Благодаря этому user-agent вы можете управлять размещение рекламы запрещая или разрешая её на тех или иных страницах.
- Полный список роботов Google.
Запрещает роботам «ходить» по ссылкам, в которых встречается указанная подстрока:
- Disallow: /cgi-bin — закрывает каталог скриптов на сервере.
- Disallow: *?s= — закрывает страницы поиска.
- Disallow: */page/ — закрывает все виды пагинации.
- Disallow: */embed$ — закрывает все URL заканчивающиеся на /embed .
Пример добавления нового правила. Допустим нам нужно закрыть от индексации все записи в категории news. Для этого добавляем правило:
Disallow: /news
Оно запретить роботам ходить по ссылками такого вида:
- http://example.com/news
- http://example.com/news/drugoe-nazvanie/
Если нужно закрыть любые вхождения /news , то пишем:
Disallow: */news
- http://example.com/news
- http://example.com/my/news/drugoe-nazvanie/
- http://example.com/category/newsletter-nazvanie.html
Подробнее изучить директивы robots.txt вы можете на странице помощи Яндекса. Имейте ввиду, что не все правила, которые описаны там, работают для Google.
ВАЖНО о кириллице: роботы не понимают кириллицу, её им нужно предоставлять в кодированном виде. Например:
Disallow: /каталог # неправильно. Disallow: /%D0%BA%D0%B0%D1%82%D0%B0%D0%BB%D0%BE%D0%B3 # правильно.
Allow: В строке Allow: */uploads мы намеренно разрешаем индексировать страницы, в которых встречается /uploads . Это правило обязательно, т.к. выше мы запрещаем индексировать страницы начинающихся с /wp- , а /wp- входит в /wp-content/uploads. Поэтому, чтобы перебить правило Disallow: /wp- нужна строчка Allow: */uploads , ведь по ссылкам типа /wp-content/uploads/. у нас могут лежать картинки, которые должны индексироваться, так же там могут лежать какие-то загруженные файлы, которые незачем скрывать.
Allow: может быть расположена «до» или «после» Disallow: . При чтении правил роботы их сначала сортируют, затем читают, поэтому не имеет значения в каком месте находится Allow: , Disallow: . Подробнее о сортировке смотрите ниже. Sitemap: Правило Sitemap: http://example.com/sitemap.xml указывает роботу на файл с картой сайта в формате XML. Если у вас на сайте есть такой файл, то пропишите полный путь к нему. Таких файлов может быть несколько, тогда нужно указать путь к каждому файлу отдельно.
ВАЖНО: Сортировка правил
Yandex и Google обрабатывает директивы Allow и Disallow не по порядку в котором они указаны, а сначала сортирует их от короткого правила к длинному, а затем обрабатывает последнее подходящее правило:
User-agent: * Allow: */uploads Disallow: /wp-
будет прочитана как:
User-agent: * Disallow: /wp- Allow: */uploads
Таким образом, если проверяется ссылка вида: /wp-content/uploads/file.jpg , правило Disallow: /wp- ссылку запретит, а следующее правило Allow: */uploads её разрешит и ссылка будет доступна для сканирования.
Чтобы быстро понять и применять особенность сортировки, запомните такое правило: «чем длиннее правило, тем больший приоритет оно имеет. Если длина правил одинаковая, то приоритет отдается директиве Allow.»
Проверка robots.txt и документация
Проверить правильно ли работают правила можно по следующим ссылкам:
- Яндекс: http://webmaster.yandex.ru/robots.xml.
- Google: https://www.google.com/webmasters/tools/robots-testing-tool Нужна авторизация и наличия сайта в панели веб-мастера.
- Яндекс документация robots.txt.
- Google документация robots.txt
- Сервис для создания файла robots.txt: http://pr-cy.ru/robots/
- Сервис для создания и проверки robots.txt: https://seolib.ru/tools/generate/robots/
robots.txt в WordPress
ВАЖНО чтобы в корне вашего сайта НЕ было файла robots.txt ! Если он там есть, то все описанное ниже просто не будет работать, потому что ваш сервер будет отдавать контент этого статического файла.
В WordPress запрос /robots.txt обрабатывается нестандартно. Для него «налету» создается контент файла robots.txt (через PHP).
Динамическое создание контента /robots.txt позволит удобно изменять его через админку, хуки или SEO плагины.
Изменить содержание robots.txt можно через:
- Хук robots_txt.
- Хук do_robotstxt.
- Плагин https://ru.wordpress.org/plugins/pc-robotstxt/ или ему подобные.
Рассмотрим оба хука: чем они отличаются и как их использовать.
robots_txt
По умолчанию WP 5.5 создает следующий контент для страницы /robots.txt :
User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Sitemap: http://example.com/wp-sitemap.xml
Смотрите do_robots() — как работает динамическое создание файла robots.txt .
Этот хук позволяет дополнить уже имеющиеся данные файла robots.txt . Код можно вставить в файл темы functions.php .
// Дополним базовый robots.txt // -1 before wp-sitemap.xml add_action( 'robots_txt', 'wp_kama_robots_txt_append', -1 ); function wp_kama_robots_txt_append( $output )< $str = ' Disallow: /cgi-bin # Стандартная папка на хостинге. Disallow: /? # Все параметры запроса на главной. Disallow: *?s= # Поиск. Disallow: *&s= # Поиск. Disallow: /search # Поиск. Disallow: /author/ # Архив автора. Disallow: */embed # Все встраивания. Disallow: */page/ # Все виды пагинации. Disallow: */xmlrpc.php # Файл WordPress API Disallow: *utm*= # Ссылки с utm-метками Disallow: *openstat= # Ссылки с метками openstat '; $str = trim( $str ); $str = preg_replace( '/^[\t ]+(?!#)/mU', '', $str ); $output .= "$str\n"; return $output; >
В результате перейдем на страницу /robots.txt и видим:
User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Disallow: /cgi-bin # Стандартная папка на хостинге. Disallow: /? # Все параметры запроса на главной. Disallow: *?s= # Поиск. Disallow: *&s= # Поиск. Disallow: /search # Поиск. Disallow: /author/ # Архив автора. Disallow: */embed # Все встраивания. Disallow: */page/ # Все виды пагинации. Disallow: */xmlrpc.php # Файл WordPress API Disallow: *utm*= # Ссылки с utm-метками Disallow: *openstat= # Ссылки с метками openstat Sitemap: http://example.com/wp-sitemap.xml
Обратите внимание, что мы дополнили родные данные ВП, а не заменили их.
do_robotstxt
Этот хук позволяет полностью заменить контент страницы /robots.txt .
add_action( 'do_robotstxt', 'wp_kama_robots_txt' ); function wp_kama_robots_txt()< $lines = [ 'User-agent: *', 'Disallow: /wp-admin/', 'Disallow: /wp-includes/', '', ]; echo implode( "\r\n", $lines ); die; // обрываем работу PHP >
Теперь, пройдя по ссылке http://site.com/robots.txt увидим:
User-agent: * Disallow: /wp-admin/ Disallow: /wp-includes/
Рекомендации
Ошибочные рекомендации
- Прописывание Sitemap после каждого User-agent
Это делать не нужно. Один sitemap должен быть указан один раз в любом месте файла robots.txt . - Закрыть папки wp-content , wp-includes , cache , plugins , themes
Это устаревшие требования. Однако подобные советы я находил даже в статье с пафосным названием «Самые правильный robots для WordPress 2018»! Для Яндекса и Google лучше будет их вообще не закрывать. Или закрывать «по умному», как это описано выше (Версия 2). - Закрывать страницы тегов и категорий
Если ваш сайт действительно имеет такую структуру, что на этих страницах контент дублируется и в них нет особой ценности, то лучше закрыть. Однако нередко продвижение ресурса осуществляется в том числе за счет страниц категорий и тегирования. В этом случае можно потерять часть трафика - Прописать Crawl-Delay
Модное правило. Однако его нужно указывать только тогда, когда действительно есть необходимость ограничить посещение роботами вашего сайта. Если сайт небольшой и посещения не создают значительной нагрузки на сервер, то ограничивать время «чтобы было» будет не самой разумной затеей. - Ляпы
Некоторые правила я могу отнести только к категории «блогер не подумал». Например: Disallow: /20 — по такому правилу не только закроете все архивы, но и заодно все статьи о 20 способах или 200 советах, как сделать мир лучше
Спорные рекомендации
- Закрывать от индексации страницы пагинации /page/
Это делать не нужно. Для таких страниц настраивается тег rel=»canonical» , таким образом, такие страницы тоже посещаются роботом и на них учитываются расположенные товары/статьи, а также учитывается внутренняя ссылочная масса. - Комментарии
Некоторые ребята советуют закрывать от индексирования комментарии Disallow: /comments и Disallow: */comment-* . - Открыть папку uploads только для Googlebot-Image и YandexImages
User-agent: Googlebot-Image Allow: /wp-content/uploads/ User-agent: YandexImages Allow: /wp-content/uploads/
Нельзя закрывать /wp-admin/admin-ajax.php
/wp-admin/admin-ajax.php это дефолтный файл WordPress, на который отправлются AJAX запросы.
Роботы анализируют структуру сайта — из чего он состоит, включая файлы CSS, JS и ajax запросы.
admin-ajax.php нужно разрешить к индексации, потому что он может использоваться плагинами и темой для подгрузки контента и роботы должны уметь подгружать такой контент, если надо и индексировать его.
Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php
Нельзя закрывать /wp-includes/
Disallow: /wp-includes/
C приходом алгоритма Panda 4, Google стал видеть сайты так же как пользователи, вместе с CSS и JavaScript.
На многих сайтах используются старые приёмы, которые блокируют индексацию /wp-includes/ . А тут хранятся файлы стилей и скриптов, которые часто подлючаются на фронте. Например, файлы:
/wp-includes/css/dist/block-library/style.min.css /wp-includes/js/wp-embed.min.js
Эти файлы, необходимые для работы сайта. А это значит, Google увидит сайт уже не таким, как его видят посетители.
Не закрывайте фиды: */feed
Disallow: */feed
Потому что наличие открытых фидов требуется, например, для Яндекс Дзен, когда нужно подключить сайт к каналу (спасибо комментатору «Цифровой»). Возможно открытые фиды нужны где-то еще.
Фиды имеют свой формат в заголовках ответа, благодаря которому поисковики понимают что это не HTML страница, а фид и, очевидно, обрабатывают его иначе.
Нестандартные Директивы
Clean-param
Google не понимаю эту директиву. Указывает роботу, что URL страницы содержит GET-параметры, которые не нужно учитывать при индексировании. Такими параметрами могут быть идентификаторы сессий, пользователей, метки UTM, т.е. все то что не влияет на содержимое страницы.
Заполняйте директиву Clean-param максимально полно и поддерживайте ее актуальность. Новый параметр, не влияющий на контент страницы, может привести к появлению страниц-дублей, которые не должны попасть в поиск. Из-за большого количества таких страниц робот медленнее обходит сайт. А значит, важные изменения дольше не попадут в результаты поиска. Робот Яндекса, используя эту директиву, не будет многократно перезагружать дублирующуюся информацию. Таким образом, увеличится эффективность обхода вашего сайта, снизится нагрузка на сервер.
Например, на сайте есть страницы, в которых параметр ref используется только для того, чтобы отследить с какого ресурса был сделан запрос и не меняет содержимое, по всем трем адресам будет показана одна и та же страница:
example.com/dir/bookname?ref=site_1 example.com/dir/bookname?ref=site_2 example.com/dir/bookname?ref=site_3
Если указать директиву следующим образом:
User-agent: Yandex Clean-param: ref /dir/bookname
то робот Яндекса сведет все адреса страницы к одному:
example.com/dir/bookname
Пример очистки нескольких параметров сразу: ref и sort :
Clean-param: ref&sort /dir/bookname
Clean-Param является межсекционной, поэтому может быть указана в любом месте файла robots.txt . Если директив указано несколько, все они будут учтены роботом.
Crawl-delay (устарела)
User-agent: Yandex Disallow: /wp-admin Disallow: /wp-includes Crawl-delay: 1.5 User-agent: * Disallow: /wp-admin Disallow: /wp-includes Allow: /wp-*.gif
Google не понимает эту директиву. Таймаут его роботам можно указать в панели вебмастера.
Яндекс перестал учитывать Crawl-delay
Проанализировав письма за последние два года в нашу поддержку по вопросам индексирования, мы выяснили, что одной из основных причин медленного скачивания документов является неправильно настроенная директива Crawl-delay в robots.txt […] Для того чтобы владельцам сайтов не пришлось больше об этом беспокоиться и чтобы все действительно нужные страницы сайтов появлялись и обновлялись в поиске быстро, мы решили отказаться от учёта директивы Crawl-delay.
Для чего была нужна директива Crawl-delay
Когда робот сканирует сайт как сумасшедший и это создает излишнюю нагрузку на сервер. Робота можно попросить «поубавить обороты». Для этого можно использовать директиву Crawl-delay . Она указывает время в секундах, которое робот должен простаивать (ждать) для сканирования каждой следующей страницы сайта.
Host (устарела)
Google Директиву Host никогда не поддерживал, а Яндекс полностью отказывается от неё. Host можно смело удалять из robots.txt . Вместо Host нужно настраивать 301 редирект со всех зеркал сайта на главный сайт (главное зеркало).
Заключение
Важно помнить, что изменения в robots.txt на уже рабочем сайте будут заметны только спустя несколько месяцев (2-3 месяца).
Ходят слухи, что Google иногда может проигнорировать правила в robots.txt и взять страницу в индекс, если сочтет, что страница ну очень уникальная и полезная и она просто обязана быть в индексе. Однако другие слухи опровергают эту гипотезу, ссылаясь на неправильный код robots.txt . Я больше склоняюсь ко второму.
На сервисе avi1.ru Вы можете уже сейчас приобрести продвижение SMM более чем в 7 самых популярных социальных сетях. При этом обратите внимание на достаточно низкую стоимость всех услуг сайта.
До этого из: SEO
- Перелинковка статей в WordPress (предыдущие записи из категории). Функция 2
- Как лучше удалить слово category из постоянной ссылки (УРЛа) в WordPress
- Сравнение СЕО плагинов platinum SEO Pack и All in One SEO Pack и отказ от них
