Ошибки, часто встречающиеся в файле robots.txt


Оглавление документа

Непосредственно ошибки

Перепутанные инструкции


Одна из самых распространённых ошибок в robots.txt – перепутаные между собой инструкции. Например:


User-agent: /
Disallow: Yandex


Правильно писать вот так:


User-agent: Yandex
Disallow: /

Указание нескольких каталогов в одной инструкции Disallow


Многие владельцы сайтов пытаются поместить все запрещаемые к индексации каталоги в одну инструкцию Disallow.


Disallow: /css/ /cgi-bin/ /images/


Такая запись нарушает стандарт, и невозможно угадать, как ее обработают разные роботы. Некоторые могут «отбросить» пробелы и интерпретируют эту запись как «Disallow: /css/cgi-bin/images/». Некоторые могут использовать только первую или последнюю папки (/css/ или /images/ соответственно). Кто-то может просто отбросить непонятную инструкцию полностью.


Конечно, какие-то роботы могут обработать эту конструкцию именно так, как расчитывал веб-мастер, но расчитывать на это все же не стоит. Правильно надо писать так:


Disallow: /css/
Disallow: /cgi-bin/
Disallow: /images/

Имя файла содержит заглавные буквы


Файл должен называться robots.txt, а не Robots.txt или ROBOTS.TXT.

Использование файла robot.txt вместо robots.txt


Еще раз – файл должен называться robots.txt.

Пустая строка в User-agent


Так неправильно:

User-agent:
Disallow:


Так правильно:

User-agent: *
Disallow:

Url в директиве Host


Следует писать без аббревиатуры протокола передачи гипертекста, то есть без http:// и без закрывающего слеша /


Неправильно:


User-agent: Yandex
Disallow: /cgi-bin
Host:


Правильно:


User-agent: Yandex
Disallow: /cgi-bin
Host:


Директива host Является корректной только для робота Яндекса

Использование в Disallow символов подстановки


Иногда хочется написать что-то вроде:


User-agent: *
Disallow: file*.html


для указания все файлов file1.html, file2.html, file3.html и т.д. Но нельзя, к сожалению (некоторые роботы поддерживают символы подстановки).

Плохой стиль

Комментарии на одной строке с инструкциями


По стандарту, такая запись вполне возможна:


Disallow: /cgi-bin/ #запрещаем роботам индексировать cgi-bin


В прошлом некоторые роботы не обрабатывали такие строки. Вероятно, сейчас ни у одной из основных поисковых систем уже нет такой проблемы, но стоит ли рисковать? Лучше помещать комментарии отдельно.

Редирект на страницу 404-й ошибки:


Довольно часто, на сайтах без файла robots.txt при запросе этого файла делается переадресация на другую страницу. Иногда такая переадресация происходит без отдачи статуса 404 Not Found. Пауку самому приходится разбираться, что он получил – robors.txt или обычный html-файл. Эта ситуация вряд ли создаст какие-то проблемы, но все-таки лучше всегда класть в корень сайта пустой файл robots.txt.

Заглавные буквы – это плохой стиль


USER-AGENT: GOOGLEBOT
DISALLOW:


Хотя по стандарту robots.txt и нечувствителен к регистру, часто к нему чувствительны имена файов и директорий. Кроме того, написание robots.txt сплошь заглавными буквами считается плохим стилем.


User-agent: googlebot
Disallow:

Перечисление всех файлов


Еще одной ошибкой является перечисление каждого файла в директории:


User-agent: *
Disallow: /AL/Alabama.html
Disallow: /AL/AR.html
Disallow: /Az/AZ.html
Disallow: /Az/bali.html
Disallow: /Az/bed-breakfast.html


Вместо этого можно просто закрыть от индексации директорию целиком:


User-agent: *
Disallow: /AL/
Disallow: /Az/

Инструкции Allow не существует!


Нет инструкции Allow, есть только Disallow. Файл robots.txt ничего не разрешает, только запрещает!

Отдельные роботы (например googlebot) понимают директиву Allow

Так неправильно:


User-agent: Yandex
Disallow: /john/
Allow: /jane/


А вот так – правильно:


User-agent: Yandex
Disallow: /john/
Disallow:

Использование дополнительных директив в секции *


Некоторые роботы могут неправильно отреагировать на использование дополнительных директив. Это значит, что не стоит использовать дополнительные директивы в секции «*».
То есть рекомендуется создавать специальные секции для нестандартных директив, таких как «Host».


Так неправильно:


User-agent: *
Disallow: /css/
Host:


А вот так – правильно:


User-agent: *
Disallow: /css/

User-agent: Yandex
Disallow: /css/
Host:

Отсутствие инструкции Disallow


Даже если мы хотим просто использовать дополнительную директиву и не хотим ничего запрещать, лучше всего указать пустой Disallow. По стандарту интрукция Disallow является обязательной, и робот может «неправильно вас понять».


Так неправильно:


User-agent: Yandex
Host:


Так правильно:


User-agent: Yandex
Disallow:
Host:


Обсуждение этого вопроса на 

Отсутствие слешей при указании директории


Как в этом случае поступит робот?


User-agent: Yandex
Disallow: john


По стандарту, он не будет индексировать файл с именем “john” и директорию с именем “john”. Для указания только директории надо писать так:


User-agent: Yandex
Disallow: /john/

Неправильный http-заголовок


Сервер должен возвращать в HTTP-заголовке для robots.txt «Content-Type: text/plain» а, например, не «Content-Type: text/html». Неправильный заголовок может привести к тому, что некоторые роботы не обработают файл.


 
Файлов нет. [Показать файлы/форму]
Комментарии [Скрыть комментарии/форму]

«Нет инструкции Allow, есть только Disallow. "


Ерунда. Команда Allow существует.
Смотрим на сайт Гугла.

Видим
User-agent: *
Allow: /searchhistory/
Disallow: /news?output=xhtml&
Allow: /news?output=xhtml

-- 65.88.45.174 (2006-10-17 01:02:57)

Это специфика конкретного поисковика. Точно также как “Host” у Яндекса.

-- (2006-10-17 12:24:51)

Очень спорное последнее утверждение.
Сотрудники Яндекса утверждали, что сервер не обязательно должен выдавать файл, как текстовый, что подтверждается и заголовками запроса от роботов, как D, так и I, которые отличаются для robots.txt большей либеральностью.
Cherny

-- (2006-10-20 12:25:47)
Cherny, спасибо за комментарий – я немного поправил формулировку. Я тоже думаю что большинство роботов отнесутся к некорректному заголовку вполне терпимо. Но ИМХО лучше таких вещей избегать.

Эту ошибку прислал Николай (), возможно он сталкивался с какими-то «проблемными» в смысле заголовков роботами. Я спрошу его об этом.
-- MikhaelKorneev (2006-10-20 19:17:45)

В исправлении на первую распространенную ошибку, сделана не менее распространенная ошибка


Disallow: *


В секции Disallow wildcards не поддерживаются.


Выдержка из 


The third paragraph indicates that all other robots should not visit URLs starting with /tmp or /log. Note the '*' is a special token, meaning “any other User-agent”; you cannot use wildcard patterns or regular expressions in either User-agent or Disallow lines.

-- 217.114.34.88 (2007-05-23 15:03:18)

Спасибо, исправил.

-- MikhaelKorneev (2007-05-26 15:27:29)

мне нужно чтоб сканировались страницы с тамим названием


и запретить проверку роботам данным


вопрос: как правильно указать значения в robots.txt ?

-- ПроРок? (2007-08-12 19:13:36)

На правах рекламы

Партнерские программы: Яндекс-Директ и свои PPC
Партнерская сеть приглашает партнеров. Мы работаем над вашими сайтами вместе с вами!

2007-05-26 15:26:56 | Владелец: Mikhael Korneev | Свойства | Наблюдать | Версия для печати
Разработка сайта — веб-студия «Силуэт»
Хостинг — телекоммуникационная компания «Новател»
Сайт работает на Wacko Wiki
Rambler's Top100