Как полностью или частично запретить индексирование сайта краулером Quintura
Файл Robots.txt
Запрет индексации всего сайта
Чтобы удалить сайт из поисковых систем и запретить всем роботам в дальнейшем его сканировать, разместите в корневом каталоге сервера файл robots.txt следующего содержания:
User-agent: * Disallow: /
Чтобы запретить индексировать ваш сайт исключительно поисковому роботу Quintura, разместите в корневом каталоге сервера файл robots.txt со следующим содержанием:
User-agent: Quintura-Crw Disallow: /
Запрет индексирования конкретных областей сайта
Чтобы удалить каталоги или отдельные страницы сайта, можно поместить файл robots.txt в корневом каталоге сервера. О том, как создать файл robots.txt, рассказывается в стандарте исключений для роботов. Создавая файл robots.txt, учитывайте следующие моменты. Принимая решение о том, какие страницы сканировать на том или ином хосте, поисковый робот Quintura действует в соответствии со всеми записями в файле robots.txt, где параметр User-agent равняется слову Quintura-Crw. Если такой записи нет, выполняются правила, для которых User-agent равен "*". Если такой записи нет, выполняются правила, для которых User-agent равен Googlebot.
Чтобы удалить все страницы того или иного каталога (например, timurs), добавьте в файл robots.txt такую запись:
User-agent: Quintura-Crw Disallow: /timurs/
Если вместо предыдущего примера набрать следующее:
User-agent: Quintura-Crw Disallow: /timurs
То будут запрещены все разделы начинающиеся с timurs например /timurs1, /timurs2 и т.д.
При таких параметрах robots.txt краулер Quintura закачает и проиндексирует ваш сайт за исключением разделов users, forum и login.php?action=login, закачивая по одной странице каждые 5с. При этом страницы login.php не будут качаться только в том случае, если в ссылке присутствует параметр 'action=login' (остальные параметры не имеют значения).
Sitemap
Sitemap это способ указать краулеру, какие страницы на сайте следует индексировать, при этом робот не будет сканировать весь сайт, а обратится только к тем страницам, которые указаны в сайтмэпе.
В данном случае краулер Quintura проигнорирует вышеуказанные правила и будет индексировать сайт по правилам, которые описаны в файлах /products.xml и /services.txt. Более подробной информации о том как создавать файлы sitemap находится по ссылке .
Примечание:
Если файл сайтмэпа не доступен или не соответствует стандарту, краулер Quintura будет индексировать сайт в режиме сканирования, учитывая указанные правила.
Мета-теги
Другой стандарт предусматривает использование на странице формата HTML мета-тега <META>, запрещающего роботам индексировать страницу. Этот стандарт описан на странице /RobotsExclusion#h71-3.
Чтобы запретить всем роботам индексировать страницу сайта, добавьте в раздел <HEAD> этой страницы следующий мета-тег:
<META NAME="ROBOTS" CONTENT="NOINDEX, NOFOLLOW">
Чтобы разрешить роботам индексировать страницу, но запретить переходить по внешним ссылкам, используйте следующий тег:
<META NAME="ROBOTS" CONTENT="NOFOLLOW">
Чтобы разрешить роботам брать со страницы ссылки на другие страницы сайта, но не индексировать саму страницу, используйте следующий тег:
<META NAME="ROBOTS" CONTENT="NOINDEX, FOLLOW">
HTML-тег <noindex>
Краулер Quintura поддерживает тег noindex, который запрещает индексировать заданные (служебные) участки текста. В начале служебного фрагмента ставится <noindex>, а в конце — </noindex>, и Quintura не будет индексировать данный участок текста.
Пример:
... текст ... <noindex>этот текст нельзя индексировать</noindex> ... текст ...