- Robots.Txt по-русски - -

Роботы

Posted By Atabekov On 09.01.2013 @ 11:57 пп In | No Comments

 

Поиск

Вся основная информация по роботам поиска [8] находятся на странице информации для вебмастеров [9]. Ниже приведены основные выдержки по основным вопросам индексирования.

Как отображается робот в логах сервера

Поисковый робот компании использует следующие User-Agent:

  • Mozilla/5.0 (compatible; _Bot/2.0; +);
  • Mozilla/5.0 (compatible; _Bot/Fast/2.0; +).

Как проверить, что робот от

Для того чтобы проверить, что робот действительно принадлежит , необходимо выполнить следующее:

  1. По логам веб-сервера найдите ip-адрес для интересующего вас user-agent.
  2. Затем, сделав обратный dns-запрос для данного ip-адреса (например, команда host в *nix-системах) можно определить его хост. Все имена хостов, с которых выполняют запросы наши роботы, оканчиваются на .

В случае несовпадения хоста это может значить, что этот робот использует поддельный user-agent и не принадлежит .

Директива User-agent

Робот использует только записи с ‘User-agent: ‘ и ‘User-agent: *’ (* = все роботы). Причем  запись с ‘User-agent: ‘ имеет приоритет перед записью ‘User-agent: *’. Таким образом, если даны указания и роботу , и общие для всех роботов, то будут использованы первые. Если не заданы ни та, ни другая записи, то считается, что робот не имеет ограничений для данного сайта.

Директива Host

Директивой можно указать роботу главный сайт, в том случае если вы используете сайты-зеркала. Значением в данной строке выступает доменное имя. Для поддержания формата файла robots.txt директива должна идти внутри записи, начинающейся с User-agent.

Пример:

User-agent: *
Disallow: # обязательная для каждой записи строка с директивой Disallow
Host:

Запрет на индексирование сайта

Индексирование сайта может быть запрещено по нескольким причинам:

  • Страницы содержат ошибки, вследствие чего информацию, размещенную, на сайте, невозможно проиндексировать.
  • В robots.txt запрещено индексирование как отдельных страниц, так и сайта в целом.
  • Используются недобросовестные приемы продвижения сайта в поисковых системах.

Удаление сайта

Для исключения сайта или его отдельных страниц  из поиска Mail.ruдалите эти страницы со своего сайта или запретите их индексирование в robots.txt. Не стоит забывать, что в случае запрета на индексирование, это не гарантирует, что они не будут находиться в поиске, поскольку они могут искаться по ссылкам со сторонних веб-ресурсов.


Article printed from Robots.Txt по-русски:

URL to article: /rurobots/mail-ru

URLs in this post:

[1] Поиск : #

[2] Как отображается робот в логах сервера: #_____

[3] Как проверить, что робот от : #_1

[4] Директива User-agent: #User-agent

[5] Директива Host: #Host

[6] Запрет на индексирование сайта: #___

[7] Удаление сайта: #_

[8] :

[9] информации для вебмастеров:

Copyright © 2026–2011 Robots.Txt по-русски (/). All rights reserved.