Боты5 мин чтения·7 августа 2026 г.

VelenPublicWebCrawler: краулер Hunter.io — стоит ли доверять его обещаниям про robots.txt

Разбор VelenPublicWebCrawler — краулера Velen для сервиса Hunter.io. Кому реально выгодны собранные данные, почему заявление о полном соблюдении robots.txt не стоит принимать на веру и как настроить блокировку.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота VelenPublicWebCrawler: нежелательный прочие краулеры и сервисы

VelenPublicWebCrawler — краулер Velen для сервиса Hunter (hunter.io). Обходит публичные страницы для построения бизнес-датасетов и моделей машинного обучения, которые Hunter использует в своих продуктах. По заявлению оператора: только публичные URL, не чаще ~1 страницы за 2 секунды на домен, соблюдение robots.txt без нестандартных расширений директив.

Параметры

Параметр Значение
UA Mozilla/5.0 (compatible; VelenPublicWebCrawler/1.0; +https://velen.io)
Оператор Velen / Hunter
Docs hunter.io/robot, velen.io
robots.txt По заявлению оператора — да (Allow/Disallow, включая мета-инструкции на странице); nonstandard extensions не поддерживают. Независимые трекеры и полевые отчёты вебмастеров периодически фиксировали случаи несоблюдения — не принимайте заявление оператора на веру, проверяйте по логам
Частота ~1 страница / 2 сек на сайт
Контакт contact@hunter.io / engineering@velen.io

Зачем VelenPublicWebCrawler приходит на сайт и кому это выгодно

Velen написан на Go специально для Hunter и анализирует миллионы публичных страниц интернета ежемесячно. Собранные данные напрямую питают коммерческие продукты Hunter.io: поиск компаний, поиск контактов, верификацию email-адресов и смежные функции для бизнес-разведки. Практический смысл: если на сайте публично указаны email-адреса, контакты сотрудников или структура компании, именно эти данные представляют интерес для краулера — они становятся частью базы, которую потом используют клиенты Hunter (в основном для email-аутрича и поиска контактов для продаж). Прямой выгоды владельцу краулящегося сайта это не приносит — бенефициар здесь клиент Hunter, а не сам сайт. Краулер намеренно избегает контента за логином или другой аутентификацией — заходит только на то, что доступно без входа в аккаунт.

Осторожно с заявлением о robots.txt

Официальная страница velen.io и часть агрегаторов ботов утверждают полное соблюдение robots.txt и мета-инструкций страницы. Но это не универсально подтверждённый факт: независимый трекер DataDome и полевые отчёты вебмастеров фиксировали трафик под этим же UA, который правила robots.txt не учитывал — в том числе с адресов облачных провайдеров вроде DigitalOcean и OVH. Это не обязательно означает, что сам официальный краулер Velen ведёт себя нечестно — не исключён и сценарий, что кто-то использует то же имя для маскировки собственного скрипта. В любом случае практический вывод один: не полагайтесь только на заявление оператора, сверяйте поведение в собственных логах после настройки правил.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Нагрузка

По сводке TrafficVeil — порядка 36 тысяч запросов. С учётом заявленной частоты ~1 страница/2 сек на домен, такой объём для активного краулинга множества страниц выглядит ожидаемым, а не аномальным.

Контроль

grep -i "VelenPublicWebCrawler" /var/log/nginx/access.log
User-agent: VelenPublicWebCrawler
Disallow: /
if ($http_user_agent ~* "VelenPublicWebCrawler") {
    return 403;
}

Рекомендации

  • Не хотите отдавать данные о своей компании или контактах в базу Hunter — Disallow + deny; прямой пользы от индексации сайту это не приносит
  • После настройки блокировки проверьте логи отдельно — учитывая неоднозначные отчёты о соблюдении robots.txt, стоит убедиться, что трафик действительно прекратился, а не просто перестал явно представляться этим UA
  • На позиции в Google блокировка не влияет — это не поисковый краулер

Частые вопросы

Что такое VelenPublicWebCrawler и кто его оператор?
Это краулер Velen для сервиса Hunter.io, который собирает публичные данные сайтов для построения бизнес-датасетов.
Кому выгодны данные, которые собирает VelenPublicWebCrawler?
Клиентам Hunter.io, использующим поиск контактов и верификацию email для продаж и аутрича, а не самому сайту, который краулится.
Правда ли, что VelenPublicWebCrawler всегда соблюдает robots.txt?
Официально да, но независимые трекеры и отчёты вебмастеров фиксировали случаи несоблюдения под этим же UA — стоит проверять поведение по своим логам, а не доверять заявлению оператора вслепую
С какой частотой обходит сайт VelenPublicWebCrawler?
По заявлению оператора — не чаще одной страницы за 2 секунды на домен.
Заходит ли VelenPublicWebCrawler на закрытые страницы сайта?
Нет, краулер обходит только публично доступный контент и не пытается заходить на страницы за логином или другой аутентификацией.
Влияет ли блокировка VelenPublicWebCrawler на позиции в Google?
Нет, это не поисковый краулер, и на SEO это никак не сказывается.
#VelenPublicWebCrawler#Hunter.io#Velen#бизнес-датасеты#robots.txt#TrafficVeil#краулеры
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil