Если отфильтровать access.log по jugendschutzprogramm-crawler, часто всплывает целый пласт машинных хитов с UA вида Jugendschutzprogramm-Crawler; Info: http://www.jugendschutzprogramm.de. Это не анонимный сканер — оператор известен: немецкая некоммерческая организация JusProg, основанная в 2003 году и официально признанная государственной комиссией по защите молодёжи в СМИ (KJM). Краулер собирает страницы, чтобы присвоить сайту возрастную категорию в системе родительского контроля, а не для индексации в привычном смысле.
1. Что такое Jugendschutzprogramm-Crawler
JusProg разрабатывает бесплатное, работающее без регистрации программное обеспечение родительского контроля, которое фильтрует контент по возрастным категориям на основании требований немецкого Договора о защите молодёжи в СМИ (JMStV). Краулер — лишь первый, автоматический этап оценки: если он классифицирует сайт как потенциально проблемный для несовершеннолетних, домен предварительно попадает в список фильтрации, а затем проходит проверку живыми людьми — штатной командой рейтеров (Netagents), которая работает с 2003 года.
| Название | Jugendschutzprogramm-Crawler |
| User-Agent / паттерн | jugendschutzprogramm-crawler — в логах встречается строка вида Jugendschutzprogramm-Crawler; Info: http://www.jugendschutzprogramm.de |
| Оператор | JusProg e.V. — немецкая некоммерческая организация защиты молодёжи в интернете, признана государственной комиссией KJM |
| Роль | Автоматически оценивает контент сайта (структуру страниц, язык, встроенные медиа, ссылочные связи) для присвоения возрастной категории в системе родительского контроля JusProg |
| Документация / ориентир | jugendschutzprogramm.de — включая раздел поддержки, где можно оспорить ошибочную классификацию через support@jusprog.de или онлайн-форму проверки |
| Список IP | ❌ Официального списка диапазонов IP не публикуется — проверяйте по UA и поведению |
| robots.txt | По одним источникам краулер учитывает правила, по другим — из-за своего законодательного мандата на выявление потенциально вредного контента может не соблюдать их последовательно; для гарантированного результата не полагайтесь на robots.txt как на единственную меру |
| Пометка TrafficVeil | Нежелательный / Прочие краулеры и сервисы |
2. Зачем Jugendschutzprogramm-Crawler приходит на сайт
Краулер применяет многоуровневую оценку: анализирует структуру страницы, языковые паттерны, встроенные медиа и ссылочные связи, чтобы решить, какой возрастной аудитории подходит контент. По наблюдениям сторонних каталогов ботов, частота запросов у него умеренная — обычно не более 30 запросов в минуту на домен — и интересуется он не сайтом целиком, а определённым типом контента: пользовательским контентом, медиатеками, каталогами ссылок и интеграциями с соцсетями.
- Какие зоны чаще трогает: публичные URL, разделы с пользовательским контентом, медиа и внешними ссылками — сайт целиком, если это оправдано типом контента, но приоритет именно у этих зон;
- Что ищет: признаки контента, требующего возрастных ограничений — язык, медиа, структуру ссылок — в логике немецкой системы возрастной классификации;
- Чем отличается от браузерного пользователя: нет нормальной сессии, обход методичный и привязан к типу контента, а не к интересу конкретного человека.
Отдельный практический момент, который стоит учитывать именно для доменов из вашей сети: если сайт публикует контент 18+, для немецкоязычной аудитории закон (JMStV) в принципе требует возрастной маркировки — можно самостоятельно разметить сайт через бесплатный генератор меток age.xml/age-de.xml на jugendschutzprogramm.de, вместо того чтобы полагаться только на автоматическую оценку краулера. Это не отменяет решение об allow/deny для самого бота, но может быть отдельным пунктом в чек-листе для DE-рынка.
3. Нагрузка и риски именно для Jugendschutzprogramm-Crawler
Отдельной строки в публичной сводке top-bot TrafficVeil у jugendschutzprogramm-crawler может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий. Заявленная умеренная частота (менее 30 запросов в минуту) обычно не создаёт серьёзной нагрузки сама по себе, но за счёт интереса именно к пользовательскому контенту и медиа глубина обхода на таких страницах может быть выше, чем у типового craulера общего назначения.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти Jugendschutzprogramm-Crawler в логах
Не ищите «просто ботов» — ищите конкретный токен jugendschutzprogramm-crawler и рядом смотрите соседей по семейству.
# Базовый поиск
grep -i "jugendschutzprogramm-crawler" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот (обратите внимание на медиа и UGC-разделы)
grep -i "jugendschutzprogramm-crawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "jugendschutzprogramm-crawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "jugendschutzprogramm-crawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Проверить частоту — заявленный потолок около 30 запросов/мин на домен
grep -i "jugendschutzprogramm-crawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1-3 | sort | uniq -c | sort -rn | head
# Отделить от похожих строк
grep -iE "jugendschutzprogramm-crawler|bot" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт. Для решения allow/deny смотрите связку: UA + IP + частоту + набор URL. Официального списка диапазонов оператор не публикует, поэтому опирайтесь на поведение и заявленный потолок частоты запросов.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для Jugendschutzprogramm-Crawler
# Жёсткий запрет
User-agent: Jugendschutzprogramm-Crawler
Disallow: /
# Разрешить всё
User-agent: Jugendschutzprogramm-Crawler
Allow: /
# Компромисс: закрыть деньги/кабинет, оставить публичку
User-agent: Jugendschutzprogramm-Crawler
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: ставьте Disallow или 403 для jugendschutzprogramm-crawler, если пользы нет — но учитывайте, что из-за законодательного мандата бот может не всегда следовать этим правилам. Если результат критичен, переходите к правилам на уровне nginx/Apache или к запрету в TrafficVeil, а для контента 18+ на немецком рынке дополнительно рассмотрите официальную возрастную маркировку через age.xml/age-de.xml.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "jugendschutzprogramm-crawler") {
return 403;
}
limit_req_zone $binary_remote_addr zone=jugendschutzprogra:10m rate=10r/m;
location / {
if ($http_user_agent ~* "jugendschutzprogramm-crawler") {
limit_req zone=jugendschutzprogra burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} jugendschutzprogramm-crawler [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите jugendschutzprogramm-crawler в ботах домена или в разделе /system/bots;
- Для нежелательного сценария выберите категорию «запретить»; для мягкого варианта — rate-limit;
- Allow оставляйте, только если осознанно хотите попасть в систему возрастной классификации JusProg для немецкоязычного рынка;
- После изменения сверьте логи: хиты Jugendschutzprogramm-Crawler должны уйти в блок или лимит, а нужные поисковики — остаться без изменений.
7. Рекомендации: что делать с Jugendschutzprogramm-Crawler
- Если пользы нет — Disallow/403 для jugendschutzprogramm-crawler, помня, что при законодательном мандате блокировка не всегда стопроцентно эффективна;
- Если сайт публикует контент 18+ для немецкоязычной аудитории — рассмотрите не только allow/deny для бота, но и официальную маркировку age.xml/age-de.xml как отдельную меру соответствия JMStV;
- Если нагрузка мешает — сначала rate-limit, затем полный запрет на уровне сервера;
- Не режьте слишком широко правилом User-agent: *, чтобы случайно не закрыть Googlebot или YandexBot;
- Что вы теряете при блокировке: обычно ничего критичного для SEO — это не поисковик, а система возрастной классификации для родительского контроля в Германии.
8. С кем не путать Jugendschutzprogramm-Crawler
| Бот / сосед | Кластер | UA | Комментарий |
| 360Spider | Прочие краулеры и сервисы | 360spider | нежелательный |
| A360-Search | Прочие краулеры и сервисы | a360-search | нежелательный |
| AASA-Bot | Прочие краулеры и сервисы | aasa-bot | нежелательный |
| ABEvalBot | Прочие краулеры и сервисы | abevalbot | нежелательный |
| ActiveComply | Прочие краулеры и сервисы | activecomply | нежелательный |
9. Стратегия allow/deny для Jugendschutzprogramm-Crawler
| Ситуация | Действие |
| Осознанно нужна корректная возрастная классификация на DE-рынке | Allow + закрыть /admin /cart /api, дополнительно рассмотреть age.xml/age-de.xml |
| Только мешает и жрёт ресурсы | Disallow + запрет в TrafficVeil на уровне сервера |
| Нужен доступ, но пики мешают | Rate-limit на nginx/TrafficVeil |
| Нежелательный по базе TrafficVeil | Deny по умолчанию, исключения — точечно |
| Подозрение на spoofing UA | Не доверять строке UA; смотреть IP и поведение, учитывая заявленный потолок ~30 запросов/мин |
Частые вопросы
Jugendschutzprogramm-Crawler — это государственный орган или частная компания?
Гарантированно ли сработает Disallow в robots.txt против этого бота?
Какой контент бот проверяет в первую очередь?
Что делать, если сайт публикует контент 18+ для немецкой аудитории?
Можно ли оспорить ошибочную возрастную классификацию сайта?
Насколько высокая нагрузка от этого краулера?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.