Боты5 мин чтения·13 августа 2026 г.

Nicecrawler в логах: непрозрачный краулер с полным рендерингом

Разбираем Nicecrawler — краулер с недокументированным оператором и назначением, который рендерит страницы через Chrome-based headless-браузер. Объясняем, почему за один визит появляется кластер запросов, как найти бота в access.log и почему deny — разумный default.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Nicecrawler: нежелательный прочие краулеры и сервисы

Nicecrawler — краулер с собственным сайтом-визиткой nicecrawler.com: обходит и, по всей видимости, архивирует публичные страницы. Устойчивой подробной first-party политики о целях сбора данных немного — сайт называет себя, указывает контактный домен в UA, но не раскрывает деталей о том, кто и зачем использует собранные данные. Это не Googlebot: в логах токен явный и легко отделим от поисковых роботов.

1. Что такое Nicecrawler

Технически важная деталь, которая объясняет поведение бота в логах: Nicecrawler/1.1 использует полноценный headless-браузер на основе Chrome — он не просто скачивает HTML, а дожидается полной загрузки страницы, включая все изображения, CSS и JavaScript, чтобы увидеть страницу примерно так же, как её видит реальный пользователь в Chrome. Именно поэтому за один визит бота в логах может появиться сразу несколько запросов подряд: к самому HTML, затем к картинкам, стилям и скриптам — это не признак сканирования сайта вглубь, а следствие рендеринга одной страницы целиком.

Название Nicecrawler
User-Agent / паттерн Nicecrawler — полная строка: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Nicecrawler/1.1; +http://www.nicecrawler.com/) Chrome/90.0.4430.97 Safari/537.36
Оператор Не раскрыт публично за пределами домена-визитки nicecrawler.com; по независимым каталогам ботов зафиксирован с 2021–2022 года и остаётся активным
Роль Обход и, предположительно, архивация публичных страниц; полноценный рендеринг страницы через Chrome-based headless-браузер
Документация / ориентир nicecrawler.com — указан в самой строке UA, но подробной first-party политики о целях и объёме сбора данных не обнаружено
Список IP ❌ Официального списка IP не найдено — верификация построена на обратном DNS
robots.txt Ожидается соблюдение, но независимые каталоги ботов прямо помечают статус соблюдения как «неизвестно» — дублируйте запрет на уровне сервера, не полагаясь только на файл
Пометка TrafficVeil По вашей сводке — порядка 0,1 тыс. запросов; не Googlebot

2. Зачем Nicecrawler приходит на сайт

Заявленная задача бота — обход и архивация публичного контента сайтов. Поскольку first-party объяснений цели сбора немного, а оператор за доменом nicecrawler.com детально не раскрыт, у владельца сайта нет прямого способа узнать, кто использует собранные данные и с какой конечной целью — в отличие от многих других ботов в этой энциклопедии, где оператор и назначение хорошо задокументированы.

  • Какие зоны чаще трогает: публичные страницы сайта целиком, включая связанные ресурсы (изображения, CSS, JS) — из-за полного рендеринга в Chrome-based браузере;
  • Что ищет: контент страницы в том виде, в котором его видит реальный пользователь браузера, а не только исходный HTML;
  • Чем отличается от браузерного пользователя: нет постоянной пользовательской сессии, обход методичный, но за счёт полного рендеринга генерирует характерную группу запросов на одну и ту же страницу почти одновременно.

Типичный кейс: в access.log видно кластер запросов от Nicecrawler к одному URL и сразу же — к его изображениям, стилям и скриптам за короткий промежуток времени. Это штатное поведение headless-рендеринга, а не аномалия и не признак атаки, но по совокупности хитов нагрузка на одну страницу может быть выше, чем от простого HTML-only краулера.

3. Нагрузка и риски именно для Nicecrawler

По вашей сводке TrafficVeil — порядка 0,1 тыс. запросов, то есть объём небольшой. Основной практический риск здесь не в нагрузке, а в неопределённости цели: раз оператор и назначение данных не задокументированы публично, у владельца сайта нет способа оценить, стоит ли выгода (если она вообще есть) той цене, что контент попадает в неизвестную инфраструктуру. Дополнительный фактор — полный рендеринг через headless-браузер: если сайт тяжёлый по JS/CSS/изображениям, разовый визит бота создаёт больше запросов, чем аналогичный краулер без рендеринга.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти Nicecrawler в логах

Не ищите «просто ботов» — ищите конкретный токен Nicecrawler и обращайте внимание на кластеры запросов к одному URL и его ресурсам.

# Базовый поиск
grep -i "Nicecrawler" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "Nicecrawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "Nicecrawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "Nicecrawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Проверить кластеризацию запросов на одну страницу (признак полного рендеринга)
grep -i "Nicecrawler" /var/log/nginx/access.log | awk '{print $4, $7}' | sort | head -50

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP нет, поэтому для верификации используйте обратный DNS: заявленная схема — резолвинг вида crawler-*.nicecrawler.com. Если IP из логов не резолвится в этот поддомен, скорее всего это подделка под UA, а не настоящий бот.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для Nicecrawler

User-agent: Nicecrawler
Disallow: /

Важно: соблюдение robots.txt ожидается, но независимые каталоги ботов прямо отмечают этот статус как неизвестный — не проверенный документально. Раз первичной пользы от бота для владельца сайта не видно, а прозрачности у оператора мало, дублируйте запрет через nginx или Apache, а не полагайтесь на один файл.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "Nicecrawler") {
    return 403;
}

TrafficVeil

  • Найдите Nicecrawler в ботах домена или в /system/bots;
  • Поскольку прямой пользы для владельца сайта не задокументировано, а прозрачность оператора низкая — категория «запретить» по умолчанию оправдана;
  • После изменения сверьте логи: хиты Nicecrawler и связанные с ним запросы к статике должны уйти в блок, а нужные поисковики — остаться без изменений;
  • Отдельно проверьте по обратному DNS (crawler-*.nicecrawler.com), не путаете ли вы настоящего бота со спуфингом под его UA.

7. Рекомендации: что делать с Nicecrawler

  • Нет пользы — deny; это разумный default для бота с непрозрачным назначением и недокументированным оператором;
  • На Google это правило не влияет — Nicecrawler полностью независим от поисковой индексации;
  • Дублируйте запрет на уровне сервера или TrafficVeil, поскольку соблюдение robots.txt этим ботом документально не подтверждено;
  • Если решите оставить allow — учитывайте, что из-за полного рендеринга через headless-браузер нагрузка на одну страницу выше, чем у простого HTML-краулера.

8. С кем не путать Nicecrawler

Бот / сосед Кластер UA Комментарий
Googlebot Поисковые системы googlebot не связан с Nicecrawler, тоже рендерит JS, но полностью документирован и IP-верифицируем
360Spider Прочие краулеры и сервисы 360spider нежелательный, другой оператор
A360-Search Прочие краулеры и сервисы a360-search нежелательный
ABEvalBot Прочие краулеры и сервисы abevalbot нежелательный

9. Стратегия allow/deny для Nicecrawler

Ситуация Действие
Стандартная ситуация — пользы не видно Deny по умолчанию, на nginx/Apache/TrafficVeil
Появилась подтверждённая деловая причина не блокировать Allow точечно, с мониторингом объёма запросов на статику
Нужно не задеть поисковые системы Блокировать строго по токену Nicecrawler, не трогать Googlebot/YandexBot
Подозрение на spoofing UA Проверять обратный DNS на crawler-*.nicecrawler.com, не доверять только строке UA

Частые вопросы

Почему за один визит Nicecrawler в логах появляется сразу несколько запросов?
Потому что бот использует полноценный Chrome-based headless-браузер и дожидается полной загрузки страницы — картинок, CSS и JavaScript, а не просто скачивает HTML.
Значит ли кластер запросов, что бот сканирует сайт глубже, чем кажется?
Нет, это следствие рендеринга одной конкретной страницы целиком, а не признак обхода дополнительных разделов сайта.
Известно ли, кто стоит за Nicecrawler и зачем он собирает данные?
Нет, подробной first-party политики о цели сбора и операторе за пределами домена nicecrawler.com не обнаружено.
Стоит ли полагаться только на robots.txt для блокировки этого бота?
Нет, независимые каталоги ботов помечают статус соблюдения robots.txt как неизвестный, поэтому запрет стоит дублировать на уровне сервера.
Как проверить, что запрос действительно от Nicecrawler, а не подделка?
Через обратный DNS — легитимный бот должен резолвиться в поддомен вида crawler-*.nicecrawler.com.
Почему deny — разумный default именно для этого бота?
Потому что прямой пользы для владельца сайта не задокументировано, а прозрачность оператора низкая — в отличие от многих других ботов в этой энциклопедии, где назначение чётко объяснено.
#Прочие краулеры и сервисы#nicecrawler
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil