В отличие от многих ботов с расплывчатым происхождением, у ImagesiftBot есть конкретный и легко проверяемый владелец: это краулер компании Hive (юридическое лицо — Castle Global, Inc.), который собирает изображения для коммерческой платформы визуальной разведки Imagesift. Если в логах регулярно всплывает строка ImagesiftBot, ваш сайт — источник картинок для чужого индекса обратного поиска изображений, а не жертва случайного «мусорного» скана.
Кто такой ImagesiftBot на самом деле
Полная строка User-Agent выглядит так: Mozilla/5.0 (compatible; ImagesiftBot; +imagesift.com). Бот принадлежит Hive — компании, которая специализируется на визуальном ИИ и модерации контента, а сервис Imagesift — один из продуктов её линейки. Задача краулера — скачивать общедоступные изображения со всего интернета и превращать их в индекс, на основе которого строятся коммерческие сервисы: обратный поиск изображений, поиск дубликатов и вариаций картинки в сети, инструменты модерации контента и анализ визуальных трендов. Проще говоря, бизнесы используют Imagesift, чтобы находить, где ещё в интернете используются их изображения (в том числе без разрешения), либо чтобы фильтровать нежелательный визуальный контент.
Параметры бота
| Параметр | Значение |
| User-Agent | Mozilla/5.0 (compatible; ImagesiftBot; +imagesift.com), в логах чаще всего фильтруется по токену imagesiftbot |
| Оператор | Hive (Castle Global, Inc.) |
| Продукт | Imagesift — платформа визуальной разведки: обратный поиск изображений, модерация контента, анализ визуальных трендов |
| Что именно собирает | Преимущественно изображения; попутно разбирает и текст страницы, на которой изображение размещено |
| Список IP-адресов | ❌ Официального фида нет — верификация по User-Agent и, при необходимости, по данным ASN конкретного IP |
| Поведение при отсутствии отдельного правила | По документации оператора, если сайт не задал правило именно для ImagesiftBot, бот при разборе доступа ориентируется на директивы, заданные для Googlebot |
Именно последний пункт — источник частой путаницы: администратор может считать, что закрыл всех ботов через User-agent: *, но если в robots.txt отдельно прописан блок для Googlebot с более мягкими правилами, ImagesiftBot по умолчанию последует именно за ним, а не за общим запретом.
Зачем это владельцу сайта
С точки зрения SEO блокировка ImagesiftBot ничего не меняет — он не связан ни с одной поисковой системой и не участвует в формировании выдачи Google, Bing или Яндекса. Реальный вопрос — стоит ли отдавать свои изображения в чужой коммерческий индекс:
- если для бизнеса важно контролировать несанкционированное использование своих фото и графики в сети — присутствие в индексе Imagesift может быть даже полезным: это тот самый инструмент, которым можно искать, где ещё используются ваши изображения;
- если сайт с картинками — коммерческий актив сам по себе (фотобанк, портфолио, каталог с авторскими фото), включение в чужой сервис обратного поиска без согласия — прямой повод для блокировки;
- заметная нагрузка на сервер от планового обхода изображений — ещё один практический аргумент для ограничения, независимо от позиции по лицензированию контента.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "imagesiftbot" /var/log/nginx/access.log
# Какие именно изображения/страницы вычитывает бот
grep -i "imagesiftbot" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Суточное распределение активности
grep -i "imagesiftbot" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
Поскольку официального списка IP-адресов Hive не публикует, для проверки подлинности при подозрительно высокой частоте запросов с одного адреса имеет смысл дополнительно сверить принадлежность IP через whois/ASN — так же, как и с любым другим ботом без официального фида.
Как заблокировать или ограничить
Прямой запрет специально для этого бота — без опоры на общее правило для * или Googlebot:
User-agent: ImagesiftBot
Disallow: /
Важно: имеющиеся сообщения о поведении бота разнятся — часть источников указывает, что оператор в целом следует robots.txt (в том числе через fallback-логику на правила Googlebot), другие фиксировали случаи, когда правила игнорировались. Поэтому для надёжной блокировки правило в robots.txt стоит продублировать принудительным запретом на уровне сервера:
if ($http_user_agent ~* "imagesiftbot") {
return 403;
}
Если задача не запретить обход полностью, а только снизить нагрузку (например, чтобы сохранить присутствие в индексе обратного поиска, но не отдавать ботам приоритет над живыми пользователями), логичнее ограничить частоту запросов через rate-limit вместо полной блокировки:
limit_req_zone $binary_remote_addr zone=imagesift:10m rate=10r/m;
location / {
if ($http_user_agent ~* "imagesiftbot") {
limit_req zone=imagesift burst=20 nodelay;
}
}
Итоговая рекомендация
ImagesiftBot — не анонимный скрапер и не угроза безопасности в привычном смысле, а вполне идентифицируемый инструмент коммерческой визуальной разведки Hive. Решение allow/deny здесь стоит принимать не по умолчанию «на всякий случай», а исходя из ценности изображений на конкретном сайте: для фотографических и медийных проектов присутствие в индексе Imagesift может быть инструментом защиты авторских прав, а не только источником лишней нагрузки.
Частые вопросы
Кто на самом деле стоит за ImagesiftBot?
Зачем бот скачивает изображения с сайта?
Правда ли, что бот игнорирует robots.txt?
Может ли присутствие в индексе Imagesift быть полезным?
Влияет ли блокировка бота на позиции в поисковых системах?
Как ограничить нагрузку от бота, не блокируя его полностью?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.