VelenPublicWebCrawler — краулер Velen для сервиса Hunter (hunter.io). Обходит публичные страницы для построения бизнес-датасетов и моделей машинного обучения, которые Hunter использует в своих продуктах. По заявлению оператора: только публичные URL, не чаще ~1 страницы за 2 секунды на домен, соблюдение robots.txt без нестандартных расширений директив.
Параметры
| Параметр | Значение |
|---|---|
| UA | Mozilla/5.0 (compatible; VelenPublicWebCrawler/1.0; +https://velen.io) |
| Оператор | Velen / Hunter |
| Docs | hunter.io/robot, velen.io |
| robots.txt | По заявлению оператора — да (Allow/Disallow, включая мета-инструкции на странице); nonstandard extensions не поддерживают. Независимые трекеры и полевые отчёты вебмастеров периодически фиксировали случаи несоблюдения — не принимайте заявление оператора на веру, проверяйте по логам |
| Частота | ~1 страница / 2 сек на сайт |
| Контакт | contact@hunter.io / engineering@velen.io |
Зачем VelenPublicWebCrawler приходит на сайт и кому это выгодно
Velen написан на Go специально для Hunter и анализирует миллионы публичных страниц интернета ежемесячно. Собранные данные напрямую питают коммерческие продукты Hunter.io: поиск компаний, поиск контактов, верификацию email-адресов и смежные функции для бизнес-разведки. Практический смысл: если на сайте публично указаны email-адреса, контакты сотрудников или структура компании, именно эти данные представляют интерес для краулера — они становятся частью базы, которую потом используют клиенты Hunter (в основном для email-аутрича и поиска контактов для продаж). Прямой выгоды владельцу краулящегося сайта это не приносит — бенефициар здесь клиент Hunter, а не сам сайт. Краулер намеренно избегает контента за логином или другой аутентификацией — заходит только на то, что доступно без входа в аккаунт.
Осторожно с заявлением о robots.txt
Официальная страница velen.io и часть агрегаторов ботов утверждают полное соблюдение robots.txt и мета-инструкций страницы. Но это не универсально подтверждённый факт: независимый трекер DataDome и полевые отчёты вебмастеров фиксировали трафик под этим же UA, который правила robots.txt не учитывал — в том числе с адресов облачных провайдеров вроде DigitalOcean и OVH. Это не обязательно означает, что сам официальный краулер Velen ведёт себя нечестно — не исключён и сценарий, что кто-то использует то же имя для маскировки собственного скрипта. В любом случае практический вывод один: не полагайтесь только на заявление оператора, сверяйте поведение в собственных логах после настройки правил.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка
По сводке TrafficVeil — порядка 36 тысяч запросов. С учётом заявленной частоты ~1 страница/2 сек на домен, такой объём для активного краулинга множества страниц выглядит ожидаемым, а не аномальным.
Контроль
grep -i "VelenPublicWebCrawler" /var/log/nginx/access.log
User-agent: VelenPublicWebCrawler
Disallow: /
if ($http_user_agent ~* "VelenPublicWebCrawler") {
return 403;
}
Рекомендации
- Не хотите отдавать данные о своей компании или контактах в базу Hunter — Disallow + deny; прямой пользы от индексации сайту это не приносит
- После настройки блокировки проверьте логи отдельно — учитывая неоднозначные отчёты о соблюдении robots.txt, стоит убедиться, что трафик действительно прекратился, а не просто перестал явно представляться этим UA
- На позиции в Google блокировка не влияет — это не поисковый краулер
Частые вопросы
Что такое VelenPublicWebCrawler и кто его оператор?
Кому выгодны данные, которые собирает VelenPublicWebCrawler?
Правда ли, что VelenPublicWebCrawler всегда соблюдает robots.txt?
С какой частотой обходит сайт VelenPublicWebCrawler?
Заходит ли VelenPublicWebCrawler на закрытые страницы сайта?
Влияет ли блокировка VelenPublicWebCrawler на позиции в Google?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.