Крупнейший открытый реестр AI-краулеров ai.robots.txt относит imageSpider к категории «AI Data Scrapers» (сборщики данных для AI-продуктов), но честно указывает: оператор неясен, соблюдение robots.txt неясно, частота обращений неясна — то есть даже сообщество, специально занимающееся каталогизацией подобных ботов, не смогло установить, кто стоит за этим именем. Это не редкость для менее раскрученных сборщиков, но здесь есть дополнительная ловушка, о которой стоит знать отдельно.
Ловушка с похожим именем в открытом коде
Тому, кто ищет происхождение бота, может попасться совершенно другая, не имеющая отношения вещь: в открытой Python-библиотеке advertools есть класс с точно таким же названием — ImageSpider, предназначенный для локального скачивания изображений с заданного домена в рамках SEO- и контент-аудита. Но у этого инструмента, судя по его исходному коду, есть существенное отличие: он по умолчанию представляется в заголовках как advertools/x.x.x (с номером версии библиотеки), а не как imageSpider, и по умолчанию соблюдает robots.txt (настройка ROBOTSTXT_OBEY: True явно прописана в его конфигурации). То есть открытый инструмент с похожим названием класса — не то же самое, что бот с токеном imagespider, замеченный в чужих логах; связывать их напрямую без дополнительных доказательств было бы поспешным выводом.
Параметры
| Параметр | Значение |
| User-Agent / паттерн | imagespider |
| Оператор | Не установлен — официально классифицирован как неясный даже в крупнейшем открытом реестре AI-ботов |
| Функция по классификации ai.robots.txt | AI Data Scraper — сбор данных (вероятно, изображений, судя по названию) для AI-продукта неустановленной принадлежности |
| Соблюдение robots.txt | Не подтверждено ни в одну сторону |
| Не путать с | Классом ImageSpider из открытой Python-библиотеки advertools — тот использует другой UA по умолчанию (advertools/x.x.x) и явно соблюдает robots.txt в стандартной конфигурации |
| Список IP-адресов | ❌ Отсутствует |
Почему стоит держать в уме нишу «сборщик изображений»
Само название намекает на специализацию именно на визуальном контенте — по аналогии с уже разобранными в этой серии ImagesiftBot (принадлежит Hive) и LAION-huggingface-processor (некоммерческий проект LAION), оба тоже нацелены прежде всего на изображения и метаданные к ним для построения датасетов или коммерческих визуальных сервисов. У imageSpider, в отличие от них, нет подтверждённого оператора — но общая логика та же: подобные боты обычно интересуются страницами с заметной концентрацией изображений (каталоги, галереи, карточки товаров), а не текстовым контентом как таковым.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "imagespider" /var/log/nginx/access.log
# Проверка: сфокусирован ли обход именно на страницах с изображениями
grep -i "imagespider" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Если запросы концентрируются на страницах-галереях, карточках товаров с фото или разделах с большим количеством изображений — это соответствует вероятной специализации бота; если обход равномерно распределён по всему сайту независимо от насыщенности визуальным контентом, стоит присмотреться к подлинности запроса.
Как заблокировать
При отсутствии подтверждённого оператора и пользы для сайта — запрет по умолчанию:
User-agent: imagespider
Disallow: /
if ($http_user_agent ~* "imagespider") {
return 403;
}
Поскольку строку User-Agent в принципе может подделать любой скрипт (в том числе кто-то, использующий открытую библиотеку advertools с изменённым заголовком, или наоборот — сторонний скрапер, намеренно представившийся похожим именем), для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois:
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
На позиции в поисковой выдаче Google, Bing или Яндекса присутствие или отсутствие этого бота не влияет — он не связан ни с одной поисковой системой.
Частые вопросы
Кто владеет краулером imageSpider?
Это тот же бот, что класс ImageSpider в библиотеке advertools?
На чём специализируется этот бот, судя по названию?
На что смотреть в логах при оценке этого бота?
Стоит ли доверять строке User-Agent при принятии решения?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.