Боты6 мин чтения·9 августа 2026 г.

ICC-Crawler служит науке, а не анонимной коммерции

За ICC-Crawler стоит государственный исследовательский институт Японии NICT, а не безымянный скрапер. Разбираем, почему решение allow/deny здесь скорее этическое, чем защитное, и как настроить доступ.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота ICC-Crawler: нежелательный прочие краулеры и сервисы

ICC-Crawler стоит отдельного правила в антиботе — но не потому, что это анонимный «ещё один hit». За этим токеном стоит конкретный, официально документированный оператор: государственный научно-исследовательский институт Японии. ICC-Crawler принадлежит NICT (National Institute of Information and Communications Technology) — точнее, его подразделению Universal Communication Research Institute (UCRI). Краулер автоматически собирает публичные веб-страницы для научно-исследовательских задач: разработки в области продвинутой обработки информации, включая многоязыковой перевод, анализ информации и искусственный интеллект. Оператор: NICT (Universal Communication Research Institute), государственный исследовательский институт Японии — официальная документация: ucri.nict.go.jp/en/icccrawler.html. Классификация: исследовательский/академический краулер, а не коммерческий сбор данных; решение allow/deny здесь — вопрос отношения к открытым государственным исследованиям, а не оценки «вредоносности».

Что такое ICC-Crawler

Параметр Значение
Название ICC-Crawler
User-Agent / паттерн ICC-Crawler/3.0 (Mozilla-compatible; ; https://ucri.nict.go.jp/en/icccrawler.html)
Оператор NICT (Universal Communication Research Institute) — государственный НИИ Японии
Роль Сбор публичных веб-страниц для научных исследований: многоязыковой перевод, анализ информации, ИИ
Документация / ориентир ucri.nict.go.jp/en/icccrawler.html — официальная страница, ссылка на которую встроена прямо в строку UA
Список IP ❌ Отдельного полного списка не публикуется; проверяйте ASN/поведение и не доверяйте только строке UA
robots.txt Официально поддерживается — Cloudflare Radar приводит стандартный пример User-Agent: ICC-Crawler/ Disallow: /
Пометка TrafficVeil Прочие краулеры и сервисы; фактически — академический исследовательский краулер

Почему это не «обычный нежелательный скрейпер»

Ключевое отличие от большинства ботов в этой категории: ICC-Crawler работает в интересах государственного научного учреждения, а не частной компании, извлекающей коммерческую выгоду напрямую из вашего контента. Независимые каталоги ботов относят его к категории сборщиков данных для задач, связанных с ИИ (в духе академических краулеров вроде AI2Bot Allen Institute) — то есть, вероятно, собранные страницы используются в том числе для обучения или тестирования моделей обработки естественного языка в рамках публичных исследований NICT. Практический вывод: решение allow/deny здесь стоит принимать не как «опасно/безопасно», а как «готовы ли вы поддержать открытые государственные исследования Японии контентом своего сайта» — вопрос иной природы, чем при встрече с коммерческим скрапером без установленного оператора.

Зачем ICC-Crawler приходит на сайт

  • Какие зоны чаще трогает: публичные URL с текстовым контентом — материалы, которые могут быть полезны для задач анализа языка и информации
  • Что ищет: текстовые данные для научно-исследовательских задач NICT — перевод, анализ информации, ИИ
  • Чем отличается от браузерного пользователя: нет обычной сессии, систематический обход по исследовательскому расписанию, а не по коммерческому интересу к конкретному контенту
Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Нагрузка и риски

Отдельной строки в публичной сводке top-bot TrafficVeil у icc-crawler может не быть, но в категории «Прочие краулеры и сервисы» такие агенты дают характерный фон: на отдельных доменах серии запросов выглядят как мини-волны автоматизации без конверсий — что ожидаемо, поскольку задача бота не привести читателя, а собрать материал для исследований. Смотрите не только абсолютный RPS, но и качество хитов: глубина обхода, повторы одних и тех же URL, отсутствие cookie/сессий и концентрация на текстовых, а не служебных страницах.

Как найти ICC-Crawler в логах

# Базовый поиск
grep -i "icc-crawler" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "icc-crawler" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "icc-crawler" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "icc-crawler" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

Верификация

Официального компактного списка IP NICT не публикует, а строку UA теоретически может подделать любой скрипт. Ссылка на официальную страницу ucri.nict.go.jp прямо внутри UA — хороший первичный ориентир, но для полной уверенности сверяйте поведение и ASN:

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

robots.txt для ICC-Crawler

# Жёсткий запрет (официальный пример от Cloudflare Radar)
User-agent: ICC-Crawler
Disallow: /

# Разрешить всё
User-agent: ICC-Crawler
Allow: /

# Компромисс: закрыть служебные разделы, оставить публичный текстовый контент
User-agent: ICC-Crawler
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /api/
Allow: /

Важно: соблюдение robots.txt подтверждено официально, что делает эту директиву рабочим и предсказуемым инструментом контроля для данного бота — в отличие от многих неустановленных скрейперов, где Disallow — лишь первый, не гарантированный шаг.

Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "icc-crawler") {
    return 403;
}

limit_req_zone $binary_remote_addr zone=icccrawler:10m rate=10r/m;
location / {
    if ($http_user_agent ~* "icc-crawler") {
        limit_req zone=icccrawler burst=20 nodelay;
    }
}

Apache (.htaccess)

RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} icc-crawler [NC]
RewriteRule ^ - [F,L]

TrafficVeil

  • Найдите icc-crawler / ICC-Crawler в ботах домена или в /system/bots
  • Готовы поддержать открытые государственные исследования Японии — Allow
  • Приоритет — полный контроль над использованием контента в любых ИИ-задачах — Disallow/403, соблюдение подтверждено официально
  • После изменения сверьте логи: хиты ICC-Crawler должны уйти в блок/лимит, а нужные поисковики остаться

Рекомендации: что делать с ICC-Crawler

  • Нет принципиальных возражений против участия в государственных исследованиях NICT — Allow, соблюдение robots.txt подтверждено официально, риск минимален
  • Приоритет — полный opt-out от использования контента в любых ИИ-связанных задачах — Disallow/403, это надёжно сработает благодаря подтверждённому соблюдению директив
  • Если нагрузка мешает, но полностью закрывать не хочется — rate-limit как промежуточный вариант
  • Не режьте слишком широко User-agent: *, чтобы случайно не закрыть Googlebot/YandexBot вместе с icc-crawler

С кем не путать ICC-Crawler

Бот Оператор Отличие от ICC-Crawler
AI2Bot Allen Institute for AI (некоммерческая организация, США) Аналогичный по духу академический/некоммерческий сбор данных для открытых AI-исследований, но другая страна и организация
CCBot Common Crawl (некоммерческая организация) Открытый общедоступный веб-корпус для широкого круга исследователей, а не собственные закрытые исследования одного института

Частые вопросы

Кто на самом деле управляет ICC-Crawler?
Государственный научно-исследовательский институт Японии NICT, конкретно подразделение Universal Communication Research Institute (UCRI).
Собирает ли ICC-Crawler данные в коммерческих целях?
Нет, по доступной информации это академический краулер для государственных научных исследований в области перевода, анализа информации и ИИ, а не коммерческий сбор данных.
Соблюдает ли ICC-Crawler правила robots.txt?
Да, это подтверждено официально, включая стандартный пример директивы от Cloudflare Radar.
Почему решение блокировать ICC-Crawler отличается от решения по обычному неизвестному скраперу?
Потому что оператор установлен и легитимен — вопрос здесь скорее в готовности поддержать открытые государственные исследования, а не в защите от потенциально вредоносного трафика.
Как проверить, что запрос действительно от ICC-Crawler?
Ссылка на официальную страницу ucri.nict.go.jp встроена прямо в строку UA, но для полной уверенности стоит дополнительно смотреть поведение и ASN.
Чем ICC-Crawler отличается от AI2Bot или CCBot?
Все три — некоммерческие исследовательские краулеры, но представляют разные организации и страны: ICC-Crawler — государственный институт Японии, AI2Bot — некоммерческая организация в США, CCBot — открытый общедоступный корпус для широкого круга исследователей.
#ICC-Crawler#NICT#японские исследования#академические краулеры#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil