TrafficVeil
Боты 4 мин24 августа 2026 г.

DeepL в логах: перевод страницы, не обучающий краулер

deepl в логах путают со сборщиком данных для обучения ИИ, хотя вероятнее — чей-то запрос на перевод вашей страницы. Разбираемся, почему тревога об «утечке контента» здесь преувеличена.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. Что такое DeepL на самом деле
  2. Почему тревога «контент утечёт в обучающую выборку» здесь, скорее всего, преувеличена
  3. Как найти DeepL в логах
  4. robots.txt и настройка через TrafficVeil
  5. Что в итоге делать с DeepL
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

Строка deepl в логах легко принять за очередного AI-краулера, наполняющего чужой обучающий корпус, — тем более DeepL действительно AI-компания. Но у DeepL основной продукт — машинный перевод, и самая очевидная причина, по которой его бот вообще обращается к постороннему сайту, — это функция перевода страницы по ссылке, а не сбор данных для обучения модели. Разбираемся, почему здесь стоит быть осторожнее с формулировкой «сырьё для AI-продукта».

Что такое DeepL на самом деле

DeepL — немецкая AI-компания из Кёльна (DeepL SE, основана в 2017 году), известная прежде всего сервисом нейронного машинного перевода DeepL Translator, а также DeepL Write и корпоративным DeepL Agent. Перевод в DeepL Translator можно запускать не только по вставленному тексту, но и по ссылке на веб-страницу — сервис забирает содержимое конкретного URL, чтобы перевести его для пользователя.

Параметр Значение
Название DeepL
User-Agent / паттерн deepl
Оператор DeepL SE, Кёльн, Германия — сервис машинного перевода, с 2017 года
Категория TrafficVeil Вероятный пользовательский фетчер перевода страницы (не подтверждённый обучающий краулер)
Наиболее вероятная причина визита Пользователь DeepL Translator вставил URL вашей страницы, чтобы получить её перевод
Список IP ❌ Публичного списка нет; проверяйте ASN и поведение
robots.txt Отдельной технической документации по краулеру для перевода страниц компания не публикует
Пометка TrafficVeil Легитимный, но с оговоркой — официального подтверждения механики визита от DeepL нет

Честная оговорка: у DeepL, как и у ряда других нишевых AI-инструментов в этой энциклопедии, не нашлось публичной страницы, документирующей поведение краулера для перевода страниц. «Наиболее вероятная причина» — обоснованный вывод из наличия функции перевода по URL в самом продукте, а не подтверждённый факт.

Почему тревога «контент утечёт в обучающую выборку» здесь, скорее всего, преувеличена

DeepL не заявляет себя оператором масштабного обучающего краулера вроде GPTBot или CCBot, которые системно проходят интернет ради корпуса для тренировки модели. Переводческие модели такого типа компаний обычно обучаются на параллельных корпусах текстов, а не на произвольном обходе чужих сайтов. Обращение к конкретному URL логичнее объяснять тем, что кто-то — переводчик, читатель, исследователь — попросил DeepL перевести именно эту страницу здесь и сейчас, а не тем, что сайт попал в чей-то долгосрочный сбор данных.

Как найти DeepL в логах

# Базовый поиск
grep -i "deepl" /var/log/nginx/access.log

# Какие страницы запрашивались
grep -i "deepl" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP
grep -i "deepl" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

Официального списка IP нет, поэтому верификация особенно важна:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"

Точечные, разрозненные по времени запросы к отдельным страницам соответствуют гипотезе о переводе по запросу конкретного пользователя. Плотный, регулярный обход множества URL подряд — сигнал сверить IP отдельно, прежде чем считать источник переводческим фетчером.

robots.txt и настройка через TrafficVeil

# Разрешить точечные обращения
User-agent: deepl
Allow: /

# Закрыть чувствительные разделы
User-agent: deepl
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Allow: /

TrafficVeil: при редком, точечном паттерне запросов — allow без rate-limit; это не создаёт заметной нагрузки, а перевод вашей страницы по запросу читателя расширяет её аудиторию, а не «сливает» контент. Переключать на «запретить» стоит, если реальное поведение не соответствует гипотезе про единичный запрос перевода — то есть бот системно обходит сайт, а не забирает отдельные страницы по требованию.

Что в итоге делать с DeepL

Ситуация Действие
Визиты редкие, точечные, к отдельным страницам Allow без rate-limit
Поведение похоже на массовый обход, а не единичные запросы Rate-limit, затем Disallow / запрет в TrafficVeil
Принципиально не хочется даже точечного доступа сторонних AI-сервисов Disallow сразу, без промежуточных шагов
Подозрение на спуфинг UA Сверять по ASN и характеру запросов, а не по одной строке

Частые вопросы

Значит ли визит DeepL, что контент сайта пополнит обучающую выборку модели?

Скорее нет — DeepL не заявляет себя оператором масштабного обучающего краулера, и визит логичнее объяснить запросом на перевод конкретной страницы.

Как вообще устроена функция перевода страницы по ссылке в DeepL?

Пользователь вставляет URL в DeepL Translator, и сервис забирает содержимое именно этой страницы, чтобы вернуть перевод — без системного обхода остального сайта.

Есть ли у DeepL официальная документация про краулер, обходящий чужие сайты?

Нет, публичной технической страницы про такого бота компания не публикует, поэтому оценка его механики основана на функциях продукта, а не на подтверждённых данных.

Чем DeepL отличается от GPTBot или CCBot?

Эти краулеры системно обходят миллионы страниц ради обучающего корпуса, а переводческие модели вроде DeepL обычно обучаются на параллельных текстовых корпусах, а не на произвольном обходе сайтов.

Стоит ли считать перевод страницы через DeepL вредным для сайта?

Нет, скорее наоборот — перевод по запросу читателя расширяет аудиторию страницы, а не создаёт риск «утечки» контента.

Как отличить обычный визит DeepL от подозрительного поведения?

Точечные разрозненные запросы к отдельным страницам соответствуют гипотезе о переводе по запросу пользователя, а плотный системный обход — повод проверить IP.

#DeepL#боты#краулеры#антибот#машинный перевод#AI-инструменты#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

DeepL в логах: перевод страницы, а не обучающий бот