img2dataset — не безымянный «сервисный агент», а конкретный, открытый на GitHub инструмент (rom1504/img2dataset) для массового скачивания изображений по спискам URL и упаковки их в датасеты для машинного обучения. Именно этот инструмент лежит в основе того, как строились крупнейшие открытые мультимодальные датасеты последних лет — включая LAION-5B (5,86 миллиарда пар «изображение + текст»), тот самый набор данных от уже разобранного в этой серии некоммерческого проекта LAION.
Важная особенность: это не единый централизованный бот, а инструмент, который запускает кто угодно
В отличие от большинства ботов этой серии, img2dataset — не сервис с единой инфраструктурой одного оператора, а открытый Python-инструмент, который любой исследователь или компания может запустить на собственных серверах для скачивания произвольного списка URL. Официальная документация проекта прямо приводит примеры массовых загрузок — от 600 тысяч пар изображение-текст (MSCOCO) до полного датасета LAION-5B, для скачивания которого разработчики рекомендуют арендовать кластер из 10+ серверов и указывают, что процесс может занимать до недели непрерывной работы. Значит, конкретный оператор, чей трафик увидел владелец сайта, — не создатель инструмента (rom1504), а один из множества независимых пользователей, запустивших его для собственного проекта.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | содержит img2dataset; по исходному коду формат строки — (compatible; {токен}; +https://github.com/rom1504/img2dataset) |
| Природа инструмента | Открытый Python-инструмент для массового скачивания изображений по URL и упаковки в датасеты для машинного обучения — не единый централизованный сервис |
| Оператор конкретного трафика | Не создатель инструмента, а один из множества независимых исследователей/компаний, запустивших его на своей инфраструктуре |
| Официальный механизм opt-out | ✅ Инструмент по умолчанию уважает HTTP-заголовки X-Robots-Tag: noai, noindex, noimageai и noimageindex — если сайт отдаёт такой заголовок, изображение пропускается автоматически |
| Масштаб и скорость | По документации, инструмент способен обрабатывать до 100 миллионов URL за 20 часов на одной машине, скачивая порядка 1350 изображений в секунду при полной загрузке |
| Список IP-адресов | ❌ Неприменимо в принципе — источники организационно и географически не связаны |
Практически важная деталь: реальный, официально задокументированный способ защититься
В отличие от большинства ботов без единого оператора, здесь есть конкретный, работающий на уровне протокола механизм отказа: инструмент по умолчанию проверяет и уважает заголовки X-Robots-Tag со значениями noai или noimageai — это именно тот механизм, который сайты используют, чтобы явно заявить о нежелании участвовать в сборе данных для ИИ. Правда, официальная документация также прямо признаёт: это поведение можно отключить одной опцией командной строки (--disallowed_header_directives '[]'), поэтому полагаться только на HTTP-заголовок как на гарантию нельзя — это соглашение по умолчанию, а не техническое ограничение инструмента.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Почему связь с уже разобранным LAION особенно показательна
img2dataset и LAION-huggingface-processor из этой серии — не один и тот же бот, но тесно связанные части одной экосистемы: LAION собирает пары ссылок «изображение + текст» из открытого веба, а затем именно img2dataset массово используется сообществом для скачивания самих изображений по этим ссылкам — как в официальной документации самой LAION, так и в независимых проектах, обучающих модели на её датасетах. Появление трафика img2dataset может означать как прямое участие в построении открытого датасета вроде LAION, так и любой другой, никак не связанный с LAION проект машинного обучения, использующий тот же открытый инструмент.
Как найти бота в логах
# Базовый поиск
grep -i "img2dataset" /var/log/nginx/access.log
# Топ URL — обычно это конкретные пути к файлам изображений
grep -i "img2dataset" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Поскольку операторов множество и официального списка IP нет, для проверки происхождения конкретного всплеска активности стоит свериться с ASN через whois.
Стоит ли блокировать
- если сайт хранит изображения, публично доступные без ограничений, — трафик от произвольного пользователя img2dataset будет появляться время от времени, независимо от блокировки конкретных IP, поскольку инструмент не привязан к единой инфраструктуре;
- самый надёжный способ системно ограничить попадание изображений в подобные датасеты — не блокировка по UA (которую легко обойти сменой строки), а официально поддерживаемый инструментом HTTP-заголовок
X-Robots-Tag: noai, отдаваемый сервером для всех изображений, — это работает для любого запуска img2dataset, который не отключил проверку заголовка явно; - на позиции в поисковой выдаче Google, Bing или Яндекса присутствие или отсутствие этого инструмента не влияет.
Как настроить защиту
Наиболее надёжный метод — заголовок ответа сервера для страниц или директорий с изображениями:
X-Robots-Tag: noai, noimageai
Дополнительно — запрет по токену UA в robots.txt и на уровне сервера, хотя это не остановит запуски с намеренно изменённым идентификатором:
User-agent: img2dataset
Disallow: /
if ($http_user_agent ~* "img2dataset") {
return 403;
}Частые вопросы
img2dataset — это единый централизованный бот одной компании?
Какие крупные датасеты построены с помощью этого инструмента?
Есть ли у инструмента встроенный механизм отказа?
Можно ли отключить этот механизм отказа?
Почему блокировка по User-Agent ненадёжна для этого инструмента?
Какой самый надёжный способ защититься?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.