WovnCrawler — официальный автоматизированный crawler компании Wovn Technologies, Inc., разработчика WOVN.io. Сервис WOVN.io используется для локализации сайтов и создания многоязычных версий веб-контента.
Главная задача WovnCrawler — не поисковая индексация и не универсальный сбор данных из интернета. Crawler получает исходный контент сайтов клиентов WOVN, чтобы сервис мог обнаруживать текст, поддерживать данные для перевода и обслуживать локализованные версии страниц.
Поэтому классифицировать его как неизвестного или заведомо нежелательного scraper неправильно.
| Параметр | Значение |
|---|---|
| Название | WovnCrawler / WOVN Crawler |
| Оператор | Wovn Technologies, Inc. |
| Сервис | WOVN.io |
| User-Agent | WovnCrawler/1.0 |
| Основной токен | WovnCrawler |
| Назначение | Получение исходного контента для локализации |
| Поисковый индекс | Нет |
| AI training | Не является заявленным назначением crawler |
| Верифицированный бот | Да, присутствует в Cloudflare Radar Bots Directory |
| Категория TrafficVeil | Прочие краулеры и сервисы / Localization |
| Рекомендуемый статус | Легитимный |
Кому принадлежит WovnCrawler
Оператор агента известен — Wovn Technologies, Inc., японская компания, развивающая WOVN.io.
Cloudflare Radar классифицирует WOVN Crawler как verified bot и прямо описывает его назначение: WOVN.io использует crawler для получения исходного языка сайтов своих клиентов.
Это позволяет намного точнее идентифицировать трафик, чем в случае малоизвестного User-Agent без документированного владельца.
Что делает WOVN.io
WOVN.io предназначен для превращения существующего сайта в многоязычный без необходимости вручную поддерживать отдельную копию каждого документа для каждого языка.
Сервису для этого необходимо получить исходный контент.
В собственной документации WOVN указывает, что при использовании WOVN.io могут обрабатываться:
- текстовые данные веб-страниц;
- URL изображений;
- контент, используемый как источник для перевода;
- данные, необходимые для проверки наличия готового перевода.
Таким образом, WovnCrawler является частью инфраструктуры локализации, а не crawler общего назначения.
Зачем crawler нужен системе локализации
Представим страницу:
https://example.com/products/widget
На ней появляется новый текст:
Free delivery on orders over $50
Если сайт использует WOVN.io, сервису необходимо обнаружить исходную строку, чтобы она могла попасть в процесс локализации и в дальнейшем отображаться пользователям на выбранном языке.
Поэтому автоматизированное получение страниц имеет понятную бизнес-задачу:
- найти исходный контент;
- получить текст для локализации;
- связать содержимое с проектом WOVN;
- обеспечить актуальность переводимых данных;
- обслуживать многоязычную версию сайта.
WovnCrawler не нужно путать с поисковым роботом
| Признак | WovnCrawler | Googlebot/YandexBot |
|---|---|---|
| Основная задача | Локализация клиентского сайта | Поисковая индексация |
| Причина обхода | Работа WOVN.io | Обнаружение страниц поисковой системой |
| Создание поискового индекса | Нет | Да |
| Связь с владельцем сайта | Обычно существует через интеграцию WOVN | Интеграция не требуется |
| Польза | Работа многоязычной версии | Видимость в поиске |
Как выглядит User-Agent WovnCrawler
Для WOVN Crawler документирован следующий User-Agent:
WovnCrawler/1.0
Для обнаружения в TrafficVeil или access.log можно использовать устойчивый токен:
WovnCrawler
и выполнять сравнение без учёта регистра.
Почему не стоит хранить полную строку как единственную сигнатуру
Версия агента со временем потенциально может измениться.
Если правило проверяет только:
WovnCrawler/1.0
то будущий вариант:
WovnCrawler/1.1
уже не совпадёт с такой сигнатурой.
Поэтому для классификации лучше использовать семейство:
WovnCrawler
а полную строку сохранять в логах как дополнительный признак.
Как найти WovnCrawler в логах
Базовый поиск в Nginx:
grep -i "wovncrawler" /var/log/nginx/access.log
Общее количество запросов:
grep -ic "wovncrawler" /var/log/nginx/access.log
Наиболее активные IP:
grep -i "wovncrawler" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -nr \
| head -20
Наиболее часто посещаемые URL:
grep -i "wovncrawler" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -nr \
| head -30
Распределение HTTP-кодов:
grep -i "wovncrawler" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -nr
Как анализировать характер обхода
Для WovnCrawler особенно полезно сопоставлять активность с самим WOVN-проектом.
| Наблюдение | Возможное объяснение |
|---|---|
| Обход публичных контентных страниц | Получение текста для локализации |
| Возврат к недавно изменённым страницам | Обнаружение нового или изменённого контента |
| Запросы сразу после подключения WOVN.io | Первичное получение содержимого проекта |
| 403 на множестве страниц | WAF мешает работе crawler |
| 429 | Сработал rate limit |
| Сканирование .env, .git или wp-login.php | Нетипично для заявленной задачи WOVN |
Как отличить настоящий WovnCrawler от подделки
Наличие корректного User-Agent само по себе не доказывает происхождение запроса.
Любой скрипт может отправить:
User-Agent: WovnCrawler/1.0
Поэтому TrafficVeil не должен автоматически предоставлять клиенту полный security bypass только из-за совпадения строки.
Проверяйте сочетание:
- User-Agent;
- IP;
- ASN;
- набор URL;
- HTTP-методы;
- частоту;
- характер обхода;
- наличие WOVN.io на самом сайте.
Факт интеграции — один из сильнейших сигналов
Если организация действительно использует WOVN.io, появление WovnCrawler логично.
Если же:
- WOVN никогда не подключался;
- команда сайта ничего о нём не знает;
- crawler появился неожиданно;
- активность носит агрессивный характер;
такой запрос требует более внимательной проверки.
Это не означает автоматически, что перед вами злоумышленник: интеграцию мог подключить другой отдел, подрядчик или владелец проекта. Но безусловный Allow в такой ситуации не нужен.
Какие запросы являются подозрительными
Нормальная задача WOVN — получение контента для локализации.
Поэтому клиент с UA WovnCrawler, который выполняет:
GET /.env
GET /.git/config
GET /wp-login.php
GET /phpmyadmin/
GET /backup.zip
GET /vendor/phpunit/...
не соответствует ожидаемому профилю localization crawler.
TrafficVeil должен применять к нему обычные защитные правила независимо от заявленного User-Agent.
Как проверить IP и ASN
IP="1.2.3.4"
whois "$IP"
dig +short -x "$IP"
Для ASN:
whois -h whois.cymru.com " -v $IP"
ASN следует использовать как дополнительный сигнал, а не как самостоятельное доказательство.
Облачная инфраструктура часто используется множеством разных сервисов, поэтому совпадение hosting ASN ещё не подтверждает WOVN.
Насколько большую нагрузку создаёт WovnCrawler
Нагрузка напрямую зависит от размера и структуры подключённого сайта.
Лендинг из десяти страниц и интернет-магазин с сотнями тысяч товарных URL — совершенно разные задачи для системы локализации.
Поэтому фиксированный порог вроде:
15 requests/minute = нормально
16 requests/minute = плохо
не имеет технического смысла без контекста.
Какие показатели действительно стоит измерять
- requests/minute;
- requests/hour;
- число уникальных URL;
- число повторных запросов;
- объём переданных данных;
- cache HIT/MISS;
- TTFB origin;
- CPU;
- HTTP-коды;
- долю crawler в общем трафике;
- изменения контента перед всплеском.
Пример: почему 10 000 запросов не всегда означают атаку
Предположим, крупный интернет-магазин подключает к WOVN.io 8 000 товарных и категорийных страниц.
Первичная обработка может создать значительное число автоматизированных запросов.
В абсолютной статистике это выглядит внушительно, но причина активности понятна: сервису необходимо обнаружить исходный контент проекта.
Совсем иначе выглядит 10 000 запросов к:
/.env
/wp-login.php
/xmlrpc.php
/phpmyadmin/
/.git/config
Такой профиль нельзя объяснить задачей локализации.
Почему crawler может возвращаться на одну страницу
Контент сайтов постоянно изменяется:
- обновляется карточка товара;
- меняется цена;
- редактируется описание;
- выходит новая статья;
- добавляется интерфейсный текст;
- изменяется навигация.
Сервис локализации должен работать с актуальным исходным содержимым, поэтому повторное получение документа само по себе не свидетельствует о плохом поведении.
WovnCrawler и robots.txt
Cloudflare Radar показывает для WOVN Crawler отдельный robots-токен:
User-agent: WovnCrawler
Disallow: /
Однако robots.txt не следует воспринимать как технический firewall.
Он сообщает preference владельца сайта совместимому crawler, но сам сервер всё равно принимает HTTP-запрос.
Поэтому, если необходимо гарантированно запретить WovnCrawler, используйте TrafficVeil, WAF или правила веб-сервера.
Почему robots.txt особенно неоднозначен для сайта с WOVN.io
Если владелец самостоятельно подключил сервис локализации, одновременно запрещать его crawler доступ ко всему сайту противоречиво.
Получится следующая схема:
WOVN.io должен получить контент
↓
robots.txt говорит не получать контент
↓
сервис локализации не может нормально выполнять задачу
Поэтому для подключённого проекта лучше управлять областью переводимого контента средствами самого сервиса и точечными security rules.
Как полностью заблокировать WovnCrawler через Nginx
Если WOVN.io точно не используется:
if ($http_user_agent ~* "WovnCrawler") {
return 403;
}
Правило простое, но блокирует по заявленному имени, а не по подтверждённой идентичности.
Блокировка через Apache
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} WovnCrawler [NC]
RewriteRule ^ - [F,L]
Такой вариант подходит для полного deny, но не для доверенной идентификации.
Когда rate limit лучше полного запрета
Если WOVN.io действительно используется, а проблема заключается только в нагрузке, полный deny может оказаться слишком грубым решением.
Сначала нужно определить:
- что именно crawler загружает;
- сколько уникальных URL обрабатывается;
- совпадает ли всплеск с импортом или обновлением контента;
- можно ли улучшить cacheability страниц;
- какова фактическая нагрузка на origin.
Только после этого имеет смысл применять rate limit.
Правильный rate limit в Nginx
Для выборочного ограничения лучше использовать map, а не пытаться помещать limit_req внутрь условного if.
map $http_user_agent $wovn_limit_key {
default "";
~*WovnCrawler $binary_remote_addr;
}
limit_req_zone $wovn_limit_key zone=wovncrawler:10m rate=1r/s;
server {
location / {
limit_req zone=wovncrawler burst=10;
}
}
Значение 1r/s здесь является примером конфигурации, а не универсальной рекомендацией: реальный лимит следует выбирать по нагрузке и требованиям WOVN-проекта.
Что произойдёт при блокировке WovnCrawler
Блокировка crawler не должна сама по себе выключить исходную версию сайта.
Однако если ресурс использует WOVN.io, сервис может потерять возможность нормально получать необходимый исходный контент.
Возможные последствия:
- новый текст не попадает в процесс локализации;
- изменённые страницы обновляются с задержкой;
- переводимая версия расходится с исходной;
- часть функций локализации работает неполно;
- в административной части WOVN появляются проблемы с актуальностью контента.
Есть ли влияние на SEO
WovnCrawler не является Googlebot или YandexBot, поэтому его блокировка напрямую не исключает страницу из поисковых систем.
Но для сайта, который использует WOVN.io для мультиязычности, возможен косвенный эффект.
Если локализованные версии перестанут корректно обновляться, пользователи и поисковые системы могут получать устаревший или неполный перевод.
Поэтому решение следует принимать исходя из роли WOVN в архитектуре конкретного сайта.
WovnCrawler и данные сайта
WOVN отдельно документирует, какие данные могут отправляться в сервис при локализации.
В частности, речь идёт о текстовых данных и URL изображений, необходимых для работы переводов.
При этом WOVN предоставляет механизм ignore extraction, позволяющий владельцу определить контент, который не следует передавать сервису.
Это более правильный подход к чувствительным участкам, чем попытка полностью блокировать crawler после подключения системы локализации.
Почему формы требуют отдельного внимания
Данные, вводимые посетителями в формы, существенно отличаются от публичного текста страницы.
WOVN указывает в материалах по privacy, что владелец интегрированного сайта должен контролировать, какие данные используются системой локализации.
При интеграции важно проверить:
- формы регистрации;
- личный кабинет;
- checkout;
- контактные формы;
- персонализированные страницы;
- внутренние интерфейсы.
Чувствительный пользовательский контент не следует случайно включать в extraction workflow.
Стоит ли считать WovnCrawler нежелательным
По умолчанию — нет.
У агента есть:
- известный оператор;
- конкретный коммерческий сервис;
- документированное назначение;
- стабильный User-Agent;
- подтверждение в verified bot directory.
Это признаки легитимной автоматизации.
Но легитимный не означает обязательный для каждого сайта.
Когда WovnCrawler следует разрешить
- WOVN.io подключён владельцем;
- сайт использует WOVN для мультиязычности;
- необходимо обнаруживать новые исходные строки;
- переводы должны обновляться при изменении сайта;
- характер запросов соответствует localization crawler.
Когда его можно блокировать
- WOVN.io точно не используется;
- интеграция была удалена;
- crawler не приносит бизнес-пользы;
- UA не подтверждается другими признаками;
- поведение напоминает vulnerability scanning;
- источник создаёт аномальную нагрузку и не связан с проектом.
WovnCrawler в TrafficVeil
В TrafficVeil WovnCrawler правильнее классифицировать как Localization Crawler внутри группы сервисных агентов.
Рекомендуемая схема анализа:
- найти
WovnCrawlerв User-Agent; - сохранить полную строку UA;
- проверить IP;
- определить ASN;
- проанализировать URL;
- сопоставить активность с использованием WOVN.io;
- проверить HTTP-методы;
- выявить security-sensitive paths;
- только после этого назначить политику.
Как должна выглядеть карточка WovnCrawler
| Поле | Рекомендуемое значение |
|---|---|
| Название | WOVN Crawler |
| Оператор | Wovn Technologies, Inc. |
| Сервис | WOVN.io |
| Категория | Localization / Прочие краулеры и сервисы |
| Статус | Легитимный |
| User-Agent | WovnCrawler/1.0 |
| Назначение | Получение исходного контента для локализации |
| При активном WOVN.io | Allow при нормальном поведении |
| Без интеграции WOVN | Allow не обязателен |
| Рекомендуемая проверка | UA + IP/ASN + URL + контекст интеграции |
Как диагностировать проблему после подключения TrafficVeil
Если после включения защиты WOVN.io перестал корректно получать новый контент:
- найдите запросы
WovnCrawler; - посмотрите HTTP-коды;
- проверьте наличие
403; - проверьте
429; - посмотрите, не выдаётся ли CAPTCHA вместо страницы;
- сравните запрашиваемые URL с WOVN-проектом;
- определите сработавшее правило TrafficVeil;
- создайте минимально необходимое исключение;
- проверьте повторное получение контента.
Почему полный bypass тоже не нужен
Даже легитимному crawler не следует отключать вообще все механизмы защиты только по User-Agent.
Например, запрос:
User-Agent: WovnCrawler/1.0
GET /.env
должен оставаться подозрительным независимо от известного имени.
Лучше разрешить нормальный localization traffic и одновременно сохранять защиту от:
- доступа к секретным файлам;
- path traversal;
- инъекций;
- аномального POST;
- сканирования административных endpoints.
Практический чек-лист
- Исправьте классификацию. WovnCrawler — официальный crawler Wovn Technologies.
- Проверьте UA. Документированный вариант —
WovnCrawler/1.0. - Уточните интеграцию. Использует ли сайт WOVN.io.
- Посмотрите URL. Контентные страницы логичны, security scanning — нет.
- Измерьте объём. Учитывайте размер локализуемого сайта.
- Проверьте HTTP-коды. 403/429 способны нарушать работу сервиса.
- Не доверяйте одному UA. Используйте сетевые и поведенческие признаки.
- Не блокируйте вслепую. Для действующей локализации crawler может быть необходим.
- Контролируйте чувствительный контент. Используйте scope/ignore extraction и защитные правила.
Итог
WovnCrawler — легитимный crawler Wovn Technologies, обслуживающий систему многоязычной локализации WOVN.io. Его основная задача — получать исходный контент сайтов клиентов для перевода и поддержки локализованных версий, а не создавать поисковый индекс или собирать данные для неизвестного внешнего проекта.
Документированный User-Agent — WovnCrawler/1.0, а сам агент присутствует среди verified bots Cloudflare.
Для сайта с активным WOVN.io систематическая блокировка crawler может нарушить обнаружение и актуализацию переводимого содержимого. Для ресурса, который WOVN не использует, отдельный Allow обычно не требуется.
Оптимальная политика TrafficVeil — учитывать User-Agent, IP/ASN, запрашиваемые URL, интенсивность и сам факт подключения WOVN.io. Это позволяет пропускать полезную локализационную автоматизацию и одновременно не предоставлять безусловное доверие любому клиенту, который просто представился WovnCrawler.