Строка deepl в логах легко принять за очередного AI-краулера, наполняющего чужой обучающий корпус, — тем более DeepL действительно AI-компания. Но у DeepL основной продукт — машинный перевод, и самая очевидная причина, по которой его бот вообще обращается к постороннему сайту, — это функция перевода страницы по ссылке, а не сбор данных для обучения модели. Разбираемся, почему здесь стоит быть осторожнее с формулировкой «сырьё для AI-продукта».
Что такое DeepL на самом деле
DeepL — немецкая AI-компания из Кёльна (DeepL SE, основана в 2017 году), известная прежде всего сервисом нейронного машинного перевода DeepL Translator, а также DeepL Write и корпоративным DeepL Agent. Перевод в DeepL Translator можно запускать не только по вставленному тексту, но и по ссылке на веб-страницу — сервис забирает содержимое конкретного URL, чтобы перевести его для пользователя.
| Параметр | Значение |
| Название | DeepL |
| User-Agent / паттерн | deepl |
| Оператор | DeepL SE, Кёльн, Германия — сервис машинного перевода, с 2017 года |
| Категория TrafficVeil | Вероятный пользовательский фетчер перевода страницы (не подтверждённый обучающий краулер) |
| Наиболее вероятная причина визита | Пользователь DeepL Translator вставил URL вашей страницы, чтобы получить её перевод |
| Список IP | ❌ Публичного списка нет; проверяйте ASN и поведение |
| robots.txt | Отдельной технической документации по краулеру для перевода страниц компания не публикует |
| Пометка TrafficVeil | Легитимный, но с оговоркой — официального подтверждения механики визита от DeepL нет |
Честная оговорка: у DeepL, как и у ряда других нишевых AI-инструментов в этой энциклопедии, не нашлось публичной страницы, документирующей поведение краулера для перевода страниц. «Наиболее вероятная причина» — обоснованный вывод из наличия функции перевода по URL в самом продукте, а не подтверждённый факт.
Почему тревога «контент утечёт в обучающую выборку» здесь, скорее всего, преувеличена
DeepL не заявляет себя оператором масштабного обучающего краулера вроде GPTBot или CCBot, которые системно проходят интернет ради корпуса для тренировки модели. Переводческие модели такого типа компаний обычно обучаются на параллельных корпусах текстов, а не на произвольном обходе чужих сайтов. Обращение к конкретному URL логичнее объяснять тем, что кто-то — переводчик, читатель, исследователь — попросил DeepL перевести именно эту страницу здесь и сейчас, а не тем, что сайт попал в чей-то долгосрочный сбор данных.
Как найти DeepL в логах
# Базовый поиск
grep -i "deepl" /var/log/nginx/access.log
# Какие страницы запрашивались
grep -i "deepl" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP
grep -i "deepl" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
Официального списка IP нет, поэтому верификация особенно важна:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
Точечные, разрозненные по времени запросы к отдельным страницам соответствуют гипотезе о переводе по запросу конкретного пользователя. Плотный, регулярный обход множества URL подряд — сигнал сверить IP отдельно, прежде чем считать источник переводческим фетчером.
robots.txt и настройка через TrafficVeil
# Разрешить точечные обращения
User-agent: deepl
Allow: /
# Закрыть чувствительные разделы
User-agent: deepl
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Allow: /
TrafficVeil: при редком, точечном паттерне запросов — allow без rate-limit; это не создаёт заметной нагрузки, а перевод вашей страницы по запросу читателя расширяет её аудиторию, а не «сливает» контент. Переключать на «запретить» стоит, если реальное поведение не соответствует гипотезе про единичный запрос перевода — то есть бот системно обходит сайт, а не забирает отдельные страницы по требованию.
Что в итоге делать с DeepL
| Ситуация | Действие |
| Визиты редкие, точечные, к отдельным страницам | Allow без rate-limit |
| Поведение похоже на массовый обход, а не единичные запросы | Rate-limit, затем Disallow / запрет в TrafficVeil |
| Принципиально не хочется даже точечного доступа сторонних AI-сервисов | Disallow сразу, без промежуточных шагов |
| Подозрение на спуфинг UA | Сверять по ASN и характеру запросов, а не по одной строке |