ICC-Crawler стоит отдельного правила в антиботе — но не потому, что это анонимный «ещё один hit». За этим токеном стоит конкретный, официально документированный оператор: государственный научно-исследовательский институт Японии. ICC-Crawler принадлежит NICT (National Institute of Information and Communications Technology) — точнее, его подразделению Universal Communication Research Institute (UCRI). Краулер автоматически собирает публичные веб-страницы для научно-исследовательских задач: разработки в области продвинутой обработки информации, включая многоязыковой перевод, анализ информации и искусственный интеллект. Оператор: NICT (Universal Communication Research Institute), государственный исследовательский институт Японии — официальная документация: ucri.nict.go.jp/en/icccrawler.html. Классификация: исследовательский/академический краулер, а не коммерческий сбор данных; решение allow/deny здесь — вопрос отношения к открытым государственным исследованиям, а не оценки «вредоносности».
Что такое ICC-Crawler
| Параметр | Значение |
|---|---|
| Название | ICC-Crawler |
| User-Agent / паттерн | ICC-Crawler/3.0 (Mozilla-compatible; ; https://ucri.nict.go.jp/en/icccrawler.html) |
| Оператор | NICT (Universal Communication Research Institute) — государственный НИИ Японии |
| Роль | Сбор публичных веб-страниц для научных исследований: многоязыковой перевод, анализ информации, ИИ |
| Документация / ориентир | ucri.nict.go.jp/en/icccrawler.html — официальная страница, ссылка на которую встроена прямо в строку UA |
| Список IP | ❌ Отдельного полного списка не публикуется; проверяйте ASN/поведение и не доверяйте только строке UA |
| robots.txt | Официально поддерживается — Cloudflare Radar приводит стандартный пример User-Agent: ICC-Crawler/ Disallow: / |
| Пометка TrafficVeil | Прочие краулеры и сервисы; фактически — академический исследовательский краулер |
Почему это не «обычный нежелательный скрейпер»
Ключевое отличие от большинства ботов в этой категории: ICC-Crawler работает в интересах государственного научного учреждения, а не частной компании, извлекающей коммерческую выгоду напрямую из вашего контента. Независимые каталоги ботов относят его к категории сборщиков данных для задач, связанных с ИИ (в духе академических краулеров вроде AI2Bot Allen Institute) — то есть, вероятно, собранные страницы используются в том числе для обучения или тестирования моделей обработки естественного языка в рамках публичных исследований NICT. Практический вывод: решение allow/deny здесь стоит принимать не как «опасно/безопасно», а как «готовы ли вы поддержать открытые государственные исследования Японии контентом своего сайта» — вопрос иной природы, чем при встрече с коммерческим скрапером без установленного оператора.
Зачем ICC-Crawler приходит на сайт
- Какие зоны чаще трогает: публичные URL с текстовым контентом — материалы, которые могут быть полезны для задач анализа языка и информации
- Что ищет: текстовые данные для научно-исследовательских задач NICT — перевод, анализ информации, ИИ
- Чем отличается от браузерного пользователя: нет обычной сессии, систематический обход по исследовательскому расписанию, а не по коммерческому интересу к конкретному контенту
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Нагрузка и риски
Отдельной строки в публичной сводке top-bot TrafficVeil у icc-crawler может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий — что ожидаемо, поскольку задача бота не привести читателя, а собрать материал для исследований. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на текстовых, а не служебных страницах.
Как найти ICC-Crawler в логах
# Базовый поиск
grep -i "icc-crawler" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "icc-crawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "icc-crawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "icc-crawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Верификация
Официального компактного списка IP NICT не публикует, а строку UA теоретически может подделать любой скрипт. Ссылка на официальную страницу ucri.nict.go.jp прямо внутри UA — хороший первичный ориентир, но для полной уверенности сверяйте поведение и ASN:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
robots.txt для ICC-Crawler
# Жёсткий запрет (официальный пример от Cloudflare Radar)
User-agent: ICC-Crawler
Disallow: /
# Разрешить всё
User-agent: ICC-Crawler
Allow: /
# Компромисс: закрыть служебные разделы, оставить публичный текстовый контент
User-agent: ICC-Crawler
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /
Важно: соблюдение robots.txt подтверждено официально, что делает эту директиву рабочим и предсказуемым инструментом контроля для данного бота — в отличие от многих неустановленных скрейперов, где Disallow — лишь первый, не гарантированный шаг.
Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "icc-crawler") {
return 403;
}
limit_req_zone $binary_remote_addr zone=icccrawler:10m rate=10r/m;
location / {
if ($http_user_agent ~* "icc-crawler") {
limit_req zone=icccrawler burst=20 nodelay;
}
}
Apache (.htaccess)
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} icc-crawler [NC]
RewriteRule ^ - [F,L]
TrafficVeil
- Найдите icc-crawler / ICC-Crawler в ботах домена или в /system/bots
- Готовы поддержать открытые государственные исследования Японии — Allow
- Приоритет — полный контроль над использованием контента в любых ИИ-задачах — Disallow/403, соблюдение подтверждено официально
- После изменения сверьте логи: хиты ICC-Crawler должны уйти в блок/лимит, а нужные поисковики остаться
Рекомендации: что делать с ICC-Crawler
- Нет принципиальных возражений против участия в государственных исследованиях NICT — Allow, соблюдение robots.txt подтверждено официально, риск минимален
- Приоритет — полный opt-out от использования контента в любых ИИ-связанных задачах — Disallow/403, это надёжно сработает благодаря подтверждённому соблюдению директив
- Если нагрузка мешает, но полностью закрывать не хочется — rate-limit как промежуточный вариант
- Не режьте слишком широко
User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot вместе с icc-crawler
С кем не путать ICC-Crawler
| Бот | Оператор | Отличие от ICC-Crawler |
|---|---|---|
| AI2Bot | Allen Institute for AI (некоммерческая организация, США) | Аналогичный по духу академический/некоммерческий сбор данных для открытых AI-исследований, но другая страна и организация |
| CCBot | Common Crawl (некоммерческая организация) | Открытый общедоступный веб-корпус для широкого круга исследователей, а не собственные закрытые исследования одного института |
Частые вопросы
Кто на самом деле управляет ICC-Crawler?
Собирает ли ICC-Crawler данные в коммерческих целях?
Соблюдает ли ICC-Crawler правила robots.txt?
Почему решение блокировать ICC-Crawler отличается от решения по обычному неизвестному скраперу?
Как проверить, что запрос действительно от ICC-Crawler?
Чем ICC-Crawler отличается от AI2Bot или CCBot?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.