Строка statabot в базах помечена «нежелательный» с рекомендацией сразу блокировать. На деле это официальный краулер компании StataCorp — разработчика статистического пакета Stata, широко используемого в академической среде и аналитике. Разбираемся, зачем он вообще существует и почему его появление на типичном сайте — редкость, а не рядовое явление.
Что такое Statabot на самом деле
Statabot — веб-краулер StataCorp, который индексирует так называемые stata.toc-файлы: оглавления пакетов дополнений (ado-файлов) для статистического ПО Stata. Именно на этой инфраструктуре построена встроенная в Stata система поиска и установки сторонних пакетов через команды net search и usersite — аналог того, чем для R является CRAN, а для Python — PyPI, только для Stata. Официальная страница поддержки StataCorp прямо описывает бота, включая контакт для владельцев сайтов, которые хотят добавить или убрать свой сайт из индекса.
| Параметр | Значение |
| Название | Statabot |
| User-Agent / паттерн | statabot |
| Оператор | StataCorp — разработчик статистического ПО Stata |
| Категория TrafficVeil | Индексирующий краулер пакетного репозитория (не «прочий нежелательный сервис») |
| Что делает на сайте | Ищет и индексирует stata.toc-файлы — оглавления пакетов дополнений Stata, обычным HTTP/1.1 GET-запросом |
| Список IP | ❌ Публичного списка нет; проверяйте ASN и поведение |
| robots.txt | Официальный краулер известной компании; при необходимости StataCorp можно попросить исключить сайт из индекса напрямую |
| Пометка TrafficVeil | Легитимный — но появление на сайте, не связанном со Stata-пакетами, маловероятно и требует проверки |
Зачем Statabot приходит на сайт
Бот целенаправленно ищет stata.toc-файлы — это узкоспециализированная задача, актуальная только для сайтов, которые размещают пакеты дополнений для Stata (часто это личные страницы исследователей или университетские репозитории). Для подавляющего большинства сайтов, не имеющих отношения к статистическому ПО, естественных причин для визита Statabot просто нет.
Почему пометка «нежелательный» здесь ошибочна
Черновая классификация исходит из того, что оператор «не указан публично» — но это не так: StataCorp прямо документирует бота на официальной странице поддержки, включая контактный email для управления присутствием сайта в индексе. Для владельцев академических и исследовательских ресурсов, распространяющих ado-пакеты, попадание в индекс Statabot — способ, которым пользователи Stata вообще находят их код через net search, а не паразитная нагрузка.
Как найти Statabot в логах
# Базовый поиск
grep -i "statabot" /var/log/nginx/access.log
# Какие файлы запрашивает бот — обычно это *.toc и связанные ado-файлы
grep -i "statabot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP
grep -i "statabot" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
Если сайт не связан со статистическим ПО, а строка всё равно встречается — сверьте IP через ASN, прежде чем считать источник настоящим Statabot:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
robots.txt и настройка через TrafficVeil
# Разрешить (стандартный вариант для сайтов, размещающих Stata-пакеты)
User-agent: statabot
Allow: /
# Если сайт не связан со Stata и участие в индексе не нужно
User-agent: statabot
Disallow: /
TrafficVeil: для академических и исследовательских сайтов, публикующих ado-пакеты Stata, разумный вариант — allow: это официальный, узкоспециализированный краулер известной компании, а не источник паразитной нагрузки. Для остальных доменов, где визит нетипичен, стоит один раз сверить IP по ASN и, если совпадение не подтверждается, обращаться с этим UA как с обычным неопознанным трафиком.
Что в итоге делать со Statabot
| Ситуация | Действие |
| Сайт размещает пакеты дополнений Stata (ado-файлы, .toc) | Allow — это способ, которым пользователи Stata находят ваш код |
| Сайт не связан со Stata, визит редкий и не мешает | Можно оставить как есть либо точечно закрыть, критичного риска нет |
| Хочется исключить сайт из индекса Statabot окончательно | Написать в поддержку StataCorp напрямую с указанием полного URL сайта |
| Подозрение на спуфинг UA на нетипичном сайте | Сверять по ASN, прежде чем считать источник подлинным |