- Robots.Txt по-русски - -
Стандарт исключений для роботов
Posted By GlebMarkov On 06.05.2010 @ 1:24 дп In | No Comments
Этот докумен представляет собой результат соглашения, достигнутого в листе рассылки посвященном поисковым роботам ( – Это список рассылки больше не существует, доступен его архив за 1994–1997 годы [10].) 30 июня 1994 между большинством производителей поисковых роботов и другими заинтересованными людьми. Он также обсуждался в списке рассылке Technical World Wide Web (). Стандарт основан на рабочей версии документа, публиковавшейся под тем же названием.
Этот документ не является официальным или чьим-либо корпоративным стандартом ( в сокращенном варианте он опубликован в приложении к стандарту HTML 4 на w3c [11]). и не гарантирует того, что все нынешние и будущие поисковые роботы будут использовать его. В соответствии с ним большинство производителей роботов предлагает возможность защитить Веб-серверы от нежелательного посещения их поисковыми роботами.
Последняя версия этого документа расположена по адресу [12].
Роботы (их также иногда называют пауками или поисковиками) – это программы которые автоматически путешествуют по веб-страницам, собирая на каждой из них ссылки и проходя по ним дальше. Подробнее о роботах вы можете узнать в ЧаВо [13] или разделе Роботы Рунета [14].
В 1993 и 1994 годах выяснилось, что индексирование роботами серверов порой происходит против желания владельцев этих серверов. В частности, иногда работа роботов затрудняет работу с сервером обычных пользователей, иногда одни и те же файлы индексируются несколько раз. В других случаях роботы индексируют не то, что надо, например, очень «глубокие» виртуальные директории, временную информацию или CGI-скрипты. Этот стандарт призван решить подобные проблемы.
Для того, чтобы исключить посещение сервера или его частей роботом необходимо создать на сервере файл, содержащий информацию для управления поведением поискового робота. Этот файл должен быть доступен по протоколу HTTP по локальному URL /robots.txt. Содержание этого файла см. ниже.
Такое решение было принято для того, чтобы поисковый робот мог найти правила, описывающие требуемые от него действия, всего лишь простым запросом одного файла. Кроме того файл /robots.txt легко создать на любом из существующих Веб-серверов.
Выбор именно такого URL мотивирован несколькими критериями:
Формат и семантика файла /robots.txt следующие:
Файл должен содержать одну или несколько записей (records), разделенных одной или несколькими пустыми строками (оканчивающимися CR, CR/NL или NL). Каждая запись должна содержать строки (lines) в форме:
<field>:<optional_space><value><optional_space>
Поле <field> является регистронезависимым.
Комментарии могут быть включены в файл в обычной для UNIX форме: символ # означает начало комментария, конец строки – конец комментария.
Запись должна начинаться с одной или нескольких строк User-Agent, следом должна быть одна или несколько строк Disallow, формат которых приведен ниже. Нераспознанные строки игнорируются.
Любая запись (record) должна состоять хотя бы из одной строки (line) User-Agent и одной – Disallow
Если файл /robots.txt пуст, или не отвечает заданному формату и семантике, или его не существует, любой поисковый робот будет работать по своему алгоритму.
Пример 1:
# robots.txt for
User-Agent: *
Disallow: /cyberworld/map/ # this is an infinite virtual URL space
Disallow: /tmp/ # these will soon disappear
В примере 1 закрывается от индексации содержимое директорий /cyberworld/map/ и /tmp/.
Пример 2:
# robots.txt for
User-Agent: *
Disallow: /cyberworld/map/ # this is an infinite virtual URL space
# Cybermapper knows where to go
User-Agent: cybermapper
Disallow:
В примере 2 закрывается от индексации содержимое директории /cyberworld/map/, однако поисковому роботу cybermapper все разрешено.
Пример 3:
# robots.txt for
User-Agent: *
Disallow: /
В примере 3 любому поисковому роботу запрещается индексировать сервер.
В настоящее время стандарт несколько изменился, например, можно записывать в строке User-Agent несколько имен роботов, разделенных пробелами или табуляторами.
Martijn Koster,
Перевод: Андрей Аликберов, (перевод опубликован с разрешения [15])
Article printed from Robots.Txt по-русски:
URL to article: /robotsexclusion/spec
URLs in this post:
[1] Статус этого документа: #__
[2] Введение: #
[3] Назначение: #_1
[4] Формат: #_2
[5] User-Agent: #User-Agent
[6] Disallow: #Disallow
[7] Примеры: #_3
[8] Примечания переводчика: #_
[9] Адреса авторов: #__1
[10] архив за 1994–1997 годы:
[11] опубликован в приложении к стандарту HTML 4 на w3c:
[12] :
[13] ЧаВо: /chavo
[14] Роботы Рунета: /rurobots
[15] :
Click here to print.
Copyright © 2026–2011 Robots.Txt по-русски (/). All rights reserved.