Робот Quintura —

Оглавление документа


Как полностью или частично запретить индексирование сайта краулером Quintura

Файл Robots.txt?

Запрет индексации всего сайта

Чтобы удалить сайт из поисковых систем и запретить всем роботам в дальнейшем его сканировать, разместите в корневом каталоге сервера файл robots.txt следующего содержания:


User-agent: *
Disallow: /


Чтобы запретить индексировать ваш сайт исключительно поисковому роботу Quintura, разместите в корневом каталоге сервера файл robots.txt со следующим содержанием:


User-agent: Quintura-Crw
Disallow: /

Запрет индексирования конкретных областей сайта


Чтобы удалить каталоги или отдельные страницы сайта, можно поместить файл robots.txt в корневом каталоге сервера. О том, как создать файл robots.txt, рассказывается в стандарте исключений для роботов. Создавая файл robots.txt, учитывайте следующие моменты. Принимая решение о том, какие страницы сканировать на том или ином хосте, поисковый робот Quintura действует в соответствии со всеми записями в файле robots.txt, где параметр User-agent равняется слову “Quintura-Crw”. Если такой записи нет, выполняются правила, для которых User-agent равен "*". Если такой записи нет, выполняются правила, для которых User-agent равен “Googlebot”.


Чтобы удалить все страницы того или иного каталога (например, “timurs”), добавьте в файл robots.txt такую запись:

User-agent: Quintura-Crw
Disallow: /timurs/


Если вместо предыдущего примера набрать следующее:

User-agent: Quintura-Crw
Disallow: /timurs

То будут запрещены все разделы начинающиеся с “timurs” например /timurs1, /timurs2 и т.д.


Пример файла более сложного файла robots.txt:

User-Agent: Quintura-Crw
Crawl-Delay: 5
Disallow: /users/
Disallow: /forum.php
Disallow: /login.php?action=login


При таких параметрах robots.txt краулер Quintura закачает и проиндексирует ваш сайт за исключением разделов users, forum и login.php?action=login, закачивая по одной странице каждые 5с. При этом страницы login.php не будут качаться только в том случае, если в ссылке присутствует параметр 'action=login' (остальные параметры не имеют значения).

Sitemap


Sitemap это способ указать краулеру, какие страницы на сайте следует индексировать, при этом робот не будет сканировать весь сайт, а обратится только к тем страницам, которые указаны в сайтмэпе.


Пример:


User-Agent: Quintura-Crw
Crawl-Delay: 5
Disallow: /users
Disallow: /forum.php
Disallow: /login.php?action=login

Sitemap: /products.xml
Sitemap: /services.txt


В данном случае краулер Quintura проигнорирует вышеуказанные правила и будет индексировать сайт по правилам, которые описаны в файлах /products.xml и /services.txt. Более подробной информации о том как создавать файлы sitemap находится по ссылке .


Примечание:
Если файл сайтмэпа не доступен или не соответствует стандарту, краулер Quintura будет индексировать сайт в режиме сканирования, учитывая указанные правила.

Мета-теги


Другой стандарт предусматривает использование на странице формата HTML мета-тега <META>, запрещающего роботам индексировать страницу. Этот стандарт описан на странице /RobotsExclusion#h71-3.


Чтобы запретить всем роботам индексировать страницу сайта, добавьте в раздел <HEAD> этой страницы следующий мета-тег:


<META NAME="ROBOTS" CONTENT="NOINDEX, NOFOLLOW">


Чтобы разрешить роботам индексировать страницу, но запретить переходить по внешним ссылкам, используйте следующий тег:


<META NAME="ROBOTS" CONTENT="NOFOLLOW">


Чтобы разрешить роботам брать со страницы ссылки на другие страницы сайта, но не индексировать саму страницу, используйте следующий тег:


<META NAME="ROBOTS" CONTENT="NOINDEX, FOLLOW">


HTML-тег <noindex>


Краулер Quintura поддерживает тег noindex, который запрещает индексировать заданные (служебные) участки текста. В начале служебного фрагмента ставится <noindex>, а в конце — </noindex>, и Quintura не будет индексировать данный участок текста.


Пример:


... текст ... <noindex>этот текст нельзя индексировать</noindex> ... текст ...


 

На правах рекламы

Партнерские программы с оплатой за клик, действия и % с продаж. ЦОП Яндекс-Директ
Партнерская сеть приглашает партнеров и предлагает широкий выбор программ по разнообразным тематикам.
2009-05-18 10:27:47 | Владелец: Rozh Y? | Свойства | Наблюдать | Версия для печати
Разработка сайта — веб-студия «Силуэт»
Хостинг — телекоммуникационная компания «Новател»
Сайт работает на Wacko Wiki
Rambler's Top100