TrafficVeil
Боты 10 мин25 августа 2026 г.

WovnCrawler: зачем WOVN.io сканирует сайт для перевода контента

Подробный разбор WovnCrawler от Wovn Technologies: зачем сервис локализации получает исходные страницы, как выглядит User-Agent, какой трафик считать нормальным и почему блокировка может нарушить многоязычную версию сайта.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Кому принадлежит WovnCrawler
  2. Что делает WOVN.io
  3. Зачем crawler нужен системе локализации
  4. WovnCrawler не нужно путать с поисковым роботом
  5. Как выглядит User-Agent WovnCrawler
  6. Почему не стоит хранить полную строку как единственную сигнатуру
  7. Как найти WovnCrawler в логах
  8. Как анализировать характер обхода
  9. Как отличить настоящий WovnCrawler от подделки
  10. Факт интеграции — один из сильнейших сигналов
  11. Какие запросы являются подозрительными
  12. Как проверить IP и ASN
  13. Насколько большую нагрузку создаёт WovnCrawler
  14. Какие показатели действительно стоит измерять
  15. Пример: почему 10 000 запросов не всегда означают атаку
  16. Почему crawler может возвращаться на одну страницу
  17. WovnCrawler и robots.txt
  18. Почему robots.txt особенно неоднозначен для сайта с WOVN.io
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

WovnCrawler — официальный автоматизированный crawler компании Wovn Technologies, Inc., разработчика WOVN.io. Сервис WOVN.io используется для локализации сайтов и создания многоязычных версий веб-контента.

Главная задача WovnCrawler — не поисковая индексация и не универсальный сбор данных из интернета. Crawler получает исходный контент сайтов клиентов WOVN, чтобы сервис мог обнаруживать текст, поддерживать данные для перевода и обслуживать локализованные версии страниц.

Поэтому классифицировать его как неизвестного или заведомо нежелательного scraper неправильно.

Параметр Значение
Название WovnCrawler / WOVN Crawler
Оператор Wovn Technologies, Inc.
Сервис WOVN.io
User-Agent WovnCrawler/1.0
Основной токен WovnCrawler
Назначение Получение исходного контента для локализации
Поисковый индекс Нет
AI training Не является заявленным назначением crawler
Верифицированный бот Да, присутствует в Cloudflare Radar Bots Directory
Категория TrafficVeil Прочие краулеры и сервисы / Localization
Рекомендуемый статус Легитимный

Кому принадлежит WovnCrawler

Оператор агента известен — Wovn Technologies, Inc., японская компания, развивающая WOVN.io.

Cloudflare Radar классифицирует WOVN Crawler как verified bot и прямо описывает его назначение: WOVN.io использует crawler для получения исходного языка сайтов своих клиентов.

Это позволяет намного точнее идентифицировать трафик, чем в случае малоизвестного User-Agent без документированного владельца.

Что делает WOVN.io

WOVN.io предназначен для превращения существующего сайта в многоязычный без необходимости вручную поддерживать отдельную копию каждого документа для каждого языка.

Сервису для этого необходимо получить исходный контент.

В собственной документации WOVN указывает, что при использовании WOVN.io могут обрабатываться:

  • текстовые данные веб-страниц;
  • URL изображений;
  • контент, используемый как источник для перевода;
  • данные, необходимые для проверки наличия готового перевода.

Таким образом, WovnCrawler является частью инфраструктуры локализации, а не crawler общего назначения.

Зачем crawler нужен системе локализации

Представим страницу:

https://example.com/products/widget

На ней появляется новый текст:

Free delivery on orders over $50

Если сайт использует WOVN.io, сервису необходимо обнаружить исходную строку, чтобы она могла попасть в процесс локализации и в дальнейшем отображаться пользователям на выбранном языке.

Поэтому автоматизированное получение страниц имеет понятную бизнес-задачу:

  1. найти исходный контент;
  2. получить текст для локализации;
  3. связать содержимое с проектом WOVN;
  4. обеспечить актуальность переводимых данных;
  5. обслуживать многоязычную версию сайта.

WovnCrawler не нужно путать с поисковым роботом

Признак WovnCrawler Googlebot/YandexBot
Основная задача Локализация клиентского сайта Поисковая индексация
Причина обхода Работа WOVN.io Обнаружение страниц поисковой системой
Создание поискового индекса Нет Да
Связь с владельцем сайта Обычно существует через интеграцию WOVN Интеграция не требуется
Польза Работа многоязычной версии Видимость в поиске

Как выглядит User-Agent WovnCrawler

Для WOVN Crawler документирован следующий User-Agent:

WovnCrawler/1.0

Для обнаружения в TrafficVeil или access.log можно использовать устойчивый токен:

WovnCrawler

и выполнять сравнение без учёта регистра.

Почему не стоит хранить полную строку как единственную сигнатуру

Версия агента со временем потенциально может измениться.

Если правило проверяет только:

WovnCrawler/1.0

то будущий вариант:

WovnCrawler/1.1

уже не совпадёт с такой сигнатурой.

Поэтому для классификации лучше использовать семейство:

WovnCrawler

а полную строку сохранять в логах как дополнительный признак.

Как найти WovnCrawler в логах

Базовый поиск в Nginx:

grep -i "wovncrawler" /var/log/nginx/access.log

Общее количество запросов:

grep -ic "wovncrawler" /var/log/nginx/access.log

Наиболее активные IP:

grep -i "wovncrawler" /var/log/nginx/access.log \
| awk '{print $1}' \
| sort \
| uniq -c \
| sort -nr \
| head -20

Наиболее часто посещаемые URL:

grep -i "wovncrawler" /var/log/nginx/access.log \
| awk '{print $7}' \
| sort \
| uniq -c \
| sort -nr \
| head -30

Распределение HTTP-кодов:

grep -i "wovncrawler" /var/log/nginx/access.log \
| awk '{print $9}' \
| sort \
| uniq -c \
| sort -nr

Как анализировать характер обхода

Для WovnCrawler особенно полезно сопоставлять активность с самим WOVN-проектом.

Наблюдение Возможное объяснение
Обход публичных контентных страниц Получение текста для локализации
Возврат к недавно изменённым страницам Обнаружение нового или изменённого контента
Запросы сразу после подключения WOVN.io Первичное получение содержимого проекта
403 на множестве страниц WAF мешает работе crawler
429 Сработал rate limit
Сканирование .env, .git или wp-login.php Нетипично для заявленной задачи WOVN

Как отличить настоящий WovnCrawler от подделки

Наличие корректного User-Agent само по себе не доказывает происхождение запроса.

Любой скрипт может отправить:

User-Agent: WovnCrawler/1.0

Поэтому TrafficVeil не должен автоматически предоставлять клиенту полный security bypass только из-за совпадения строки.

Проверяйте сочетание:

  • User-Agent;
  • IP;
  • ASN;
  • набор URL;
  • HTTP-методы;
  • частоту;
  • характер обхода;
  • наличие WOVN.io на самом сайте.

Факт интеграции — один из сильнейших сигналов

Если организация действительно использует WOVN.io, появление WovnCrawler логично.

Если же:

  • WOVN никогда не подключался;
  • команда сайта ничего о нём не знает;
  • crawler появился неожиданно;
  • активность носит агрессивный характер;

такой запрос требует более внимательной проверки.

Это не означает автоматически, что перед вами злоумышленник: интеграцию мог подключить другой отдел, подрядчик или владелец проекта. Но безусловный Allow в такой ситуации не нужен.

Какие запросы являются подозрительными

Нормальная задача WOVN — получение контента для локализации.

Поэтому клиент с UA WovnCrawler, который выполняет:

GET /.env
GET /.git/config
GET /wp-login.php
GET /phpmyadmin/
GET /backup.zip
GET /vendor/phpunit/...

не соответствует ожидаемому профилю localization crawler.

TrafficVeil должен применять к нему обычные защитные правила независимо от заявленного User-Agent.

Как проверить IP и ASN

IP="1.2.3.4"

whois "$IP"
dig +short -x "$IP"

Для ASN:

whois -h whois.cymru.com " -v $IP"

ASN следует использовать как дополнительный сигнал, а не как самостоятельное доказательство.

Облачная инфраструктура часто используется множеством разных сервисов, поэтому совпадение hosting ASN ещё не подтверждает WOVN.

Насколько большую нагрузку создаёт WovnCrawler

Нагрузка напрямую зависит от размера и структуры подключённого сайта.

Лендинг из десяти страниц и интернет-магазин с сотнями тысяч товарных URL — совершенно разные задачи для системы локализации.

Поэтому фиксированный порог вроде:

15 requests/minute = нормально
16 requests/minute = плохо

не имеет технического смысла без контекста.

Какие показатели действительно стоит измерять

  • requests/minute;
  • requests/hour;
  • число уникальных URL;
  • число повторных запросов;
  • объём переданных данных;
  • cache HIT/MISS;
  • TTFB origin;
  • CPU;
  • HTTP-коды;
  • долю crawler в общем трафике;
  • изменения контента перед всплеском.

Пример: почему 10 000 запросов не всегда означают атаку

Предположим, крупный интернет-магазин подключает к WOVN.io 8 000 товарных и категорийных страниц.

Первичная обработка может создать значительное число автоматизированных запросов.

В абсолютной статистике это выглядит внушительно, но причина активности понятна: сервису необходимо обнаружить исходный контент проекта.

Совсем иначе выглядит 10 000 запросов к:

/.env
/wp-login.php
/xmlrpc.php
/phpmyadmin/
/.git/config

Такой профиль нельзя объяснить задачей локализации.

Почему crawler может возвращаться на одну страницу

Контент сайтов постоянно изменяется:

  • обновляется карточка товара;
  • меняется цена;
  • редактируется описание;
  • выходит новая статья;
  • добавляется интерфейсный текст;
  • изменяется навигация.

Сервис локализации должен работать с актуальным исходным содержимым, поэтому повторное получение документа само по себе не свидетельствует о плохом поведении.

WovnCrawler и robots.txt

Cloudflare Radar показывает для WOVN Crawler отдельный robots-токен:

User-agent: WovnCrawler
Disallow: /

Однако robots.txt не следует воспринимать как технический firewall.

Он сообщает preference владельца сайта совместимому crawler, но сам сервер всё равно принимает HTTP-запрос.

Поэтому, если необходимо гарантированно запретить WovnCrawler, используйте TrafficVeil, WAF или правила веб-сервера.

Почему robots.txt особенно неоднозначен для сайта с WOVN.io

Если владелец самостоятельно подключил сервис локализации, одновременно запрещать его crawler доступ ко всему сайту противоречиво.

Получится следующая схема:

WOVN.io должен получить контент
↓
robots.txt говорит не получать контент
↓
сервис локализации не может нормально выполнять задачу

Поэтому для подключённого проекта лучше управлять областью переводимого контента средствами самого сервиса и точечными security rules.

Как полностью заблокировать WovnCrawler через Nginx

Если WOVN.io точно не используется:

if ($http_user_agent ~* "WovnCrawler") {
    return 403;
}

Правило простое, но блокирует по заявленному имени, а не по подтверждённой идентичности.

Блокировка через Apache

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} WovnCrawler [NC]
RewriteRule ^ - [F,L]

Такой вариант подходит для полного deny, но не для доверенной идентификации.

Когда rate limit лучше полного запрета

Если WOVN.io действительно используется, а проблема заключается только в нагрузке, полный deny может оказаться слишком грубым решением.

Сначала нужно определить:

  1. что именно crawler загружает;
  2. сколько уникальных URL обрабатывается;
  3. совпадает ли всплеск с импортом или обновлением контента;
  4. можно ли улучшить cacheability страниц;
  5. какова фактическая нагрузка на origin.

Только после этого имеет смысл применять rate limit.

Правильный rate limit в Nginx

Для выборочного ограничения лучше использовать map, а не пытаться помещать limit_req внутрь условного if.

map $http_user_agent $wovn_limit_key {
    default "";
    ~*WovnCrawler $binary_remote_addr;
}

limit_req_zone $wovn_limit_key zone=wovncrawler:10m rate=1r/s;

server {
    location / {
        limit_req zone=wovncrawler burst=10;
    }
}

Значение 1r/s здесь является примером конфигурации, а не универсальной рекомендацией: реальный лимит следует выбирать по нагрузке и требованиям WOVN-проекта.

Что произойдёт при блокировке WovnCrawler

Блокировка crawler не должна сама по себе выключить исходную версию сайта.

Однако если ресурс использует WOVN.io, сервис может потерять возможность нормально получать необходимый исходный контент.

Возможные последствия:

  • новый текст не попадает в процесс локализации;
  • изменённые страницы обновляются с задержкой;
  • переводимая версия расходится с исходной;
  • часть функций локализации работает неполно;
  • в административной части WOVN появляются проблемы с актуальностью контента.

Есть ли влияние на SEO

WovnCrawler не является Googlebot или YandexBot, поэтому его блокировка напрямую не исключает страницу из поисковых систем.

Но для сайта, который использует WOVN.io для мультиязычности, возможен косвенный эффект.

Если локализованные версии перестанут корректно обновляться, пользователи и поисковые системы могут получать устаревший или неполный перевод.

Поэтому решение следует принимать исходя из роли WOVN в архитектуре конкретного сайта.

WovnCrawler и данные сайта

WOVN отдельно документирует, какие данные могут отправляться в сервис при локализации.

В частности, речь идёт о текстовых данных и URL изображений, необходимых для работы переводов.

При этом WOVN предоставляет механизм ignore extraction, позволяющий владельцу определить контент, который не следует передавать сервису.

Это более правильный подход к чувствительным участкам, чем попытка полностью блокировать crawler после подключения системы локализации.

Почему формы требуют отдельного внимания

Данные, вводимые посетителями в формы, существенно отличаются от публичного текста страницы.

WOVN указывает в материалах по privacy, что владелец интегрированного сайта должен контролировать, какие данные используются системой локализации.

При интеграции важно проверить:

  • формы регистрации;
  • личный кабинет;
  • checkout;
  • контактные формы;
  • персонализированные страницы;
  • внутренние интерфейсы.

Чувствительный пользовательский контент не следует случайно включать в extraction workflow.

Стоит ли считать WovnCrawler нежелательным

По умолчанию — нет.

У агента есть:

  • известный оператор;
  • конкретный коммерческий сервис;
  • документированное назначение;
  • стабильный User-Agent;
  • подтверждение в verified bot directory.

Это признаки легитимной автоматизации.

Но легитимный не означает обязательный для каждого сайта.

Когда WovnCrawler следует разрешить

  • WOVN.io подключён владельцем;
  • сайт использует WOVN для мультиязычности;
  • необходимо обнаруживать новые исходные строки;
  • переводы должны обновляться при изменении сайта;
  • характер запросов соответствует localization crawler.

Когда его можно блокировать

  • WOVN.io точно не используется;
  • интеграция была удалена;
  • crawler не приносит бизнес-пользы;
  • UA не подтверждается другими признаками;
  • поведение напоминает vulnerability scanning;
  • источник создаёт аномальную нагрузку и не связан с проектом.

WovnCrawler в TrafficVeil

В TrafficVeil WovnCrawler правильнее классифицировать как Localization Crawler внутри группы сервисных агентов.

Рекомендуемая схема анализа:

  1. найти WovnCrawler в User-Agent;
  2. сохранить полную строку UA;
  3. проверить IP;
  4. определить ASN;
  5. проанализировать URL;
  6. сопоставить активность с использованием WOVN.io;
  7. проверить HTTP-методы;
  8. выявить security-sensitive paths;
  9. только после этого назначить политику.

Как должна выглядеть карточка WovnCrawler

Поле Рекомендуемое значение
Название WOVN Crawler
Оператор Wovn Technologies, Inc.
Сервис WOVN.io
Категория Localization / Прочие краулеры и сервисы
Статус Легитимный
User-Agent WovnCrawler/1.0
Назначение Получение исходного контента для локализации
При активном WOVN.io Allow при нормальном поведении
Без интеграции WOVN Allow не обязателен
Рекомендуемая проверка UA + IP/ASN + URL + контекст интеграции

Как диагностировать проблему после подключения TrafficVeil

Если после включения защиты WOVN.io перестал корректно получать новый контент:

  1. найдите запросы WovnCrawler;
  2. посмотрите HTTP-коды;
  3. проверьте наличие 403;
  4. проверьте 429;
  5. посмотрите, не выдаётся ли CAPTCHA вместо страницы;
  6. сравните запрашиваемые URL с WOVN-проектом;
  7. определите сработавшее правило TrafficVeil;
  8. создайте минимально необходимое исключение;
  9. проверьте повторное получение контента.

Почему полный bypass тоже не нужен

Даже легитимному crawler не следует отключать вообще все механизмы защиты только по User-Agent.

Например, запрос:

User-Agent: WovnCrawler/1.0
GET /.env

должен оставаться подозрительным независимо от известного имени.

Лучше разрешить нормальный localization traffic и одновременно сохранять защиту от:

  • доступа к секретным файлам;
  • path traversal;
  • инъекций;
  • аномального POST;
  • сканирования административных endpoints.

Практический чек-лист

  1. Исправьте классификацию. WovnCrawler — официальный crawler Wovn Technologies.
  2. Проверьте UA. Документированный вариант — WovnCrawler/1.0.
  3. Уточните интеграцию. Использует ли сайт WOVN.io.
  4. Посмотрите URL. Контентные страницы логичны, security scanning — нет.
  5. Измерьте объём. Учитывайте размер локализуемого сайта.
  6. Проверьте HTTP-коды. 403/429 способны нарушать работу сервиса.
  7. Не доверяйте одному UA. Используйте сетевые и поведенческие признаки.
  8. Не блокируйте вслепую. Для действующей локализации crawler может быть необходим.
  9. Контролируйте чувствительный контент. Используйте scope/ignore extraction и защитные правила.

Итог

WovnCrawler — легитимный crawler Wovn Technologies, обслуживающий систему многоязычной локализации WOVN.io. Его основная задача — получать исходный контент сайтов клиентов для перевода и поддержки локализованных версий, а не создавать поисковый индекс или собирать данные для неизвестного внешнего проекта.

Документированный User-Agent — WovnCrawler/1.0, а сам агент присутствует среди verified bots Cloudflare.

Для сайта с активным WOVN.io систематическая блокировка crawler может нарушить обнаружение и актуализацию переводимого содержимого. Для ресурса, который WOVN не использует, отдельный Allow обычно не требуется.

Оптимальная политика TrafficVeil — учитывать User-Agent, IP/ASN, запрашиваемые URL, интенсивность и сам факт подключения WOVN.io. Это позволяет пропускать полезную локализационную автоматизацию и одновременно не предоставлять безусловное доверие любому клиенту, который просто представился WovnCrawler.

Частые вопросы

Кому принадлежит WovnCrawler?

WovnCrawler является официальным crawler компании Wovn Technologies, Inc., разработчика сервиса локализации WOVN.io.

Какой User-Agent использует WOVN Crawler?

Cloudflare Radar указывает для верифицированного агента строку WovnCrawler/1.0.

Зачем WOVN.io нужно загружать страницы сайта?

Сервис получает исходный контент сайта, чтобы использовать его как данные для перевода и формирования локализованных версий.

Является ли WovnCrawler поисковым роботом?

Нет, его документированная задача связана с локализацией сайтов клиентов WOVN.io, а не с созданием общедоступного поискового индекса.

Стоит ли блокировать WovnCrawler, если сайт использует WOVN.io?

Обычно нет, поскольку ограничение доступа к исходным страницам может мешать сервису получать контент, необходимый для локализации.

Что делать, если WovnCrawler появился на сайте, который не использует WOVN.io?

Нужно проверить полный User-Agent, IP/ASN, запрашиваемые URL и возможные интеграции, а при отсутствии бизнес-причины доступ можно ограничить.

#WovnCrawler#WOVN Crawler#WOVN.io#Wovn Technologies#локализация сайта#перевод сайта#multilingual website#User-Agent#веб-краулеры#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

WovnCrawler от WOVN.io — User-Agent и блокировка | TrafficVeil