Nicecrawler — краулер с собственным сайтом-визиткой nicecrawler.com: обходит и, по всей видимости, архивирует публичные страницы. Устойчивой подробной first-party политики о целях сбора данных немного — сайт называет себя, указывает контактный домен в UA, но не раскрывает деталей о том, кто и зачем использует собранные данные. Это не Googlebot: в логах токен явный и легко отделим от поисковых роботов.
1. Что такое Nicecrawler
Технически важная деталь, которая объясняет поведение бота в логах: Nicecrawler/1.1 использует полноценный headless-браузер на основе Chrome — он не просто скачивает HTML, а дожидается полной загрузки страницы, включая все изображения, CSS и JavaScript, чтобы увидеть страницу примерно так же, как её видит реальный пользователь в Chrome. Именно поэтому за один визит бота в логах может появиться сразу несколько запросов подряд: к самому HTML, затем к картинкам, стилям и скриптам — это не признак сканирования сайта вглубь, а следствие рендеринга одной страницы целиком.
| Название | Nicecrawler |
| User-Agent / паттерн | Nicecrawler — полная строка: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Nicecrawler/1.1; +http://www.nicecrawler.com/) Chrome/90.0.4430.97 Safari/537.36 |
| Оператор | Не раскрыт публично за пределами домена-визитки nicecrawler.com; по независимым каталогам ботов зафиксирован с 2021–2022 года и остаётся активным |
| Роль | Обход и, предположительно, архивация публичных страниц; полноценный рендеринг страницы через Chrome-based headless-браузер |
| Документация / ориентир | nicecrawler.com — указан в самой строке UA, но подробной first-party политики о целях и объёме сбора данных не обнаружено |
| Список IP | ❌ Официального списка IP не найдено — верификация построена на обратном DNS |
| robots.txt | Ожидается соблюдение, но независимые каталоги ботов прямо помечают статус соблюдения как «неизвестно» — дублируйте запрет на уровне сервера, не полагаясь только на файл |
| Пометка TrafficVeil | По вашей сводке — порядка 0,1 тыс. запросов; не Googlebot |
2. Зачем Nicecrawler приходит на сайт
Заявленная задача бота — обход и архивация публичного контента сайтов. Поскольку first-party объяснений цели сбора немного, а оператор за доменом nicecrawler.com детально не раскрыт, у владельца сайта нет прямого способа узнать, кто использует собранные данные и с какой конечной целью — в отличие от многих других ботов в этой энциклопедии, где оператор и назначение хорошо задокументированы.
- Какие зоны чаще трогает: публичные страницы сайта целиком, включая связанные ресурсы (изображения, CSS, JS) — из-за полного рендеринга в Chrome-based браузере;
- Что ищет: контент страницы в том виде, в котором его видит реальный пользователь браузера, а не только исходный HTML;
- Чем отличается от браузерного пользователя: нет постоянной пользовательской сессии, обход методичный, но за счёт полного рендеринга генерирует характерную группу запросов на одну и ту же страницу почти одновременно.
Типичный кейс: в access.log видно кластер запросов от Nicecrawler к одному URL и сразу же — к его изображениям, стилям и скриптам за короткий промежуток времени. Это штатное поведение headless-рендеринга, а не аномалия и не признак атаки, но по совокупности хитов нагрузка на одну страницу может быть выше, чем от простого HTML-only краулера.
3. Нагрузка и риски именно для Nicecrawler
По вашей сводке TrafficVeil — порядка 0,1 тыс. запросов, то есть объём небольшой. Основной практический риск здесь не в нагрузке, а в неопределённости цели: раз оператор и назначение данных не задокументированы публично, у владельца сайта нет способа оценить, стоит ли выгода (если она вообще есть) той цене, что контент попадает в неизвестную инфраструктуру. Дополнительный фактор — полный рендеринг через headless-браузер: если сайт тяжёлый по JS/CSS/изображениям, разовый визит бота создаёт больше запросов, чем аналогичный краулер без рендеринга.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти Nicecrawler в логах
Не ищите «просто ботов» — ищите конкретный токен Nicecrawler и обращайте внимание на кластеры запросов к одному URL и его ресурсам.
# Базовый поиск
grep -i "Nicecrawler" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "Nicecrawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "Nicecrawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "Nicecrawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверить кластеризацию запросов на одну страницу (признак полного рендеринга)
grep -i "Nicecrawler" /var/log/nginx/access.log | awk '{print $4, $7}' | sort | head -50
Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет, поэтому для верификации используйте обратный DNS: заявленная схема — резолвинг вида crawler-*.nicecrawler.com. Если IP из логов не резолвится в этот поддомен, скорее всего это подделка под UA, а не настоящий бот.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для Nicecrawler
User-agent: Nicecrawler
Disallow: /
Важно: соблюдение robots.txt ожидается, но независимые каталоги ботов прямо отмечают этот статус как неизвестный — не проверенный документально. Раз первичной пользы от бота для владельца сайта не видно, а прозрачности у оператора мало, дублируйте запрет через nginx или Apache, а не полагайтесь на один файл.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "Nicecrawler") {
return 403;
}
TrafficVeil
- Найдите Nicecrawler в ботах домена или в /system/bots;
- Поскольку прямой пользы для владельца сайта не задокументировано, а прозрачность оператора низкая — категория «запретить» по умолчанию оправдана;
- После изменения сверьте логи: хиты Nicecrawler и связанные с ним запросы к статике должны уйти в блок, а нужные поисковики — остаться без изменений;
- Отдельно проверьте по обратному DNS (crawler-*.nicecrawler.com), не путаете ли вы настоящего бота со спуфингом под его UA.
7. Рекомендации: что делать с Nicecrawler
- Нет пользы — deny; это разумный default для бота с непрозрачным назначением и недокументированным оператором;
- На Google это правило не влияет — Nicecrawler полностью независим от поисковой индексации;
- Дублируйте запрет на уровне сервера или TrafficVeil, поскольку соблюдение robots.txt этим ботом документально не подтверждено;
- Если решите оставить allow — учитывайте, что из-за полного рендеринга через headless-браузер нагрузка на одну страницу выше, чем у простого HTML-краулера.
8. С кем не путать Nicecrawler
| Бот / сосед | Кластер | UA | Комментарий |
| Googlebot | Поисковые системы | googlebot | не связан с Nicecrawler, тоже рендерит JS, но полностью документирован и IP-верифицируем |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный, другой оператор |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
9. Стратегия allow/deny для Nicecrawler
| Ситуация | Действие |
| Стандартная ситуация — пользы не видно | Deny по умолчанию, на nginx/Apache/TrafficVeil |
| Появилась подтверждённая деловая причина не блокировать | Allow точечно, с мониторингом объёма запросов на статику |
| Нужно не задеть поисковые системы | Блокировать строго по токену Nicecrawler, не трогать Googlebot/YandexBot |
| Подозрение на spoofing UA | Проверять обратный DNS на crawler-*.nicecrawler.com, не доверять только строке UA |
Частые вопросы
Почему за один визит Nicecrawler в логах появляется сразу несколько запросов?
Значит ли кластер запросов, что бот сканирует сайт глубже, чем кажется?
Известно ли, кто стоит за Nicecrawler и зачем он собирает данные?
Стоит ли полагаться только на robots.txt для блокировки этого бота?
Как проверить, что запрос действительно от Nicecrawler, а не подделка?
Почему deny — разумный default именно для этого бота?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.