Боты4 мин чтения·24 августа 2026 г.

DeepL в логах: перевод страницы, не обучающий краулер

deepl в логах путают со сборщиком данных для обучения ИИ, хотя вероятнее — чей-то запрос на перевод вашей страницы. Разбираемся, почему тревога об «утечке контента» здесь преувеличена.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота DeepL: легитимный ai и llm-краулеры

Строка deepl в логах легко принять за очередного AI-краулера, наполняющего чужой обучающий корпус, — тем более DeepL действительно AI-компания. Но у DeepL основной продукт — машинный перевод, и самая очевидная причина, по которой его бот вообще обращается к постороннему сайту, — это функция перевода страницы по ссылке, а не сбор данных для обучения модели. Разбираемся, почему здесь стоит быть осторожнее с формулировкой «сырьё для AI-продукта».

Что такое DeepL на самом деле

DeepL — немецкая AI-компания из Кёльна (DeepL SE, основана в 2017 году), известная прежде всего сервисом нейронного машинного перевода DeepL Translator, а также DeepL Write и корпоративным DeepL Agent. Перевод в DeepL Translator можно запускать не только по вставленному тексту, но и по ссылке на веб-страницу — сервис забирает содержимое конкретного URL, чтобы перевести его для пользователя.

Параметр Значение
Название DeepL
User-Agent / паттерн deepl
Оператор DeepL SE, Кёльн, Германия — сервис машинного перевода, с 2017 года
Категория TrafficVeil Вероятный пользовательский фетчер перевода страницы (не подтверждённый обучающий краулер)
Наиболее вероятная причина визита Пользователь DeepL Translator вставил URL вашей страницы, чтобы получить её перевод
Список IP ❌ Публичного списка нет; проверяйте ASN и поведение
robots.txt Отдельной технической документации по краулеру для перевода страниц компания не публикует
Пометка TrafficVeil Легитимный, но с оговоркой — официального подтверждения механики визита от DeepL нет

Честная оговорка: у DeepL, как и у ряда других нишевых AI-инструментов в этой энциклопедии, не нашлось публичной страницы, документирующей поведение краулера для перевода страниц. «Наиболее вероятная причина» — обоснованный вывод из наличия функции перевода по URL в самом продукте, а не подтверждённый факт.

Почему тревога «контент утечёт в обучающую выборку» здесь, скорее всего, преувеличена

DeepL не заявляет себя оператором масштабного обучающего краулера вроде GPTBot или CCBot, которые системно проходят интернет ради корпуса для тренировки модели. Переводческие модели такого типа компаний обычно обучаются на параллельных корпусах текстов, а не на произвольном обходе чужих сайтов. Обращение к конкретному URL логичнее объяснять тем, что кто-то — переводчик, читатель, исследователь — попросил DeepL перевести именно эту страницу здесь и сейчас, а не тем, что сайт попал в чей-то долгосрочный сбор данных.

Как найти DeepL в логах

# Базовый поиск
grep -i "deepl" /var/log/nginx/access.log

# Какие страницы запрашивались
grep -i "deepl" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP
grep -i "deepl" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

Официального списка IP нет, поэтому верификация особенно важна:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"

Точечные, разрозненные по времени запросы к отдельным страницам соответствуют гипотезе о переводе по запросу конкретного пользователя. Плотный, регулярный обход множества URL подряд — сигнал сверить IP отдельно, прежде чем считать источник переводческим фетчером.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

robots.txt и настройка через TrafficVeil

# Разрешить точечные обращения
User-agent: deepl
Allow: /

# Закрыть чувствительные разделы
User-agent: deepl
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Allow: /

TrafficVeil: при редком, точечном паттерне запросов — allow без rate-limit; это не создаёт заметной нагрузки, а перевод вашей страницы по запросу читателя расширяет её аудиторию, а не «сливает» контент. Переключать на «запретить» стоит, если реальное поведение не соответствует гипотезе про единичный запрос перевода — то есть бот системно обходит сайт, а не забирает отдельные страницы по требованию.

Что в итоге делать с DeepL

Ситуация Действие
Визиты редкие, точечные, к отдельным страницам Allow без rate-limit
Поведение похоже на массовый обход, а не единичные запросы Rate-limit, затем Disallow / запрет в TrafficVeil
Принципиально не хочется даже точечного доступа сторонних AI-сервисов Disallow сразу, без промежуточных шагов
Подозрение на спуфинг UA Сверять по ASN и характеру запросов, а не по одной строке

Частые вопросы

Значит ли визит DeepL, что контент сайта пополнит обучающую выборку модели?
Скорее нет — DeepL не заявляет себя оператором масштабного обучающего краулера, и визит логичнее объяснить запросом на перевод конкретной страницы.
Как вообще устроена функция перевода страницы по ссылке в DeepL?
Пользователь вставляет URL в DeepL Translator, и сервис забирает содержимое именно этой страницы, чтобы вернуть перевод — без системного обхода остального сайта.
Есть ли у DeepL официальная документация про краулер, обходящий чужие сайты?
Нет, публичной технической страницы про такого бота компания не публикует, поэтому оценка его механики основана на функциях продукта, а не на подтверждённых данных.
Чем DeepL отличается от GPTBot или CCBot?
Эти краулеры системно обходят миллионы страниц ради обучающего корпуса, а переводческие модели вроде DeepL обычно обучаются на параллельных текстовых корпусах, а не на произвольном обходе сайтов.
Стоит ли считать перевод страницы через DeepL вредным для сайта?
Нет, скорее наоборот — перевод по запросу читателя расширяет аудиторию страницы, а не создаёт риск «утечки» контента.
Как отличить обычный визит DeepL от подозрительного поведения?
Точечные разрозненные запросы к отдельным страницам соответствуют гипотезе о переводе по запросу пользователя, а плотный системный обход — повод проверить IP.
#DeepL#боты#краулеры#антибот#машинный перевод#AI-инструменты#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil