Боты6 мин чтения·12 августа 2026 г.·обновлено 8 сентября 2026 г.

Img2dataset: инструмент, на котором построен LAION-5B — и единственный реально работающий способ защиты от него

img2dataset — открытый Python-инструмент для массового скачивания изображений в датасеты машинного обучения, на котором строились крупнейшие открытые датасеты вроде LAION-5B (5,86 млрд пар изображение-текст). Разбираем, почему это не единый централизованный бот, а инструмент, который запускает кто угодно, и единственный реально работающий метод защиты — HTTP-заголовок X-Robots-Tag: noai, встроенный в сам инструмент по умолчанию.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота Img2dataset: нежелательный прочие краулеры и сервисы

img2dataset — не безымянный «сервисный агент», а конкретный, открытый на GitHub инструмент (rom1504/img2dataset) для массового скачивания изображений по спискам URL и упаковки их в датасеты для машинного обучения. Именно этот инструмент лежит в основе того, как строились крупнейшие открытые мультимодальные датасеты последних лет — включая LAION-5B (5,86 миллиарда пар «изображение + текст»), тот самый набор данных от уже разобранного в этой серии некоммерческого проекта LAION.

Важная особенность: это не единый централизованный бот, а инструмент, который запускает кто угодно

В отличие от большинства ботов этой серии, img2dataset — не сервис с единой инфраструктурой одного оператора, а открытый Python-инструмент, который любой исследователь или компания может запустить на собственных серверах для скачивания произвольного списка URL. Официальная документация проекта прямо приводит примеры массовых загрузок — от 600 тысяч пар изображение-текст (MSCOCO) до полного датасета LAION-5B, для скачивания которого разработчики рекомендуют арендовать кластер из 10+ серверов и указывают, что процесс может занимать до недели непрерывной работы. Значит, конкретный оператор, чей трафик увидел владелец сайта, — не создатель инструмента (rom1504), а один из множества независимых пользователей, запустивших его для собственного проекта.

Параметры бота

Параметр Значение
User-Agent / паттерн содержит img2dataset; по исходному коду формат строки — (compatible; {токен}; +https://github.com/rom1504/img2dataset)
Природа инструмента Открытый Python-инструмент для массового скачивания изображений по URL и упаковки в датасеты для машинного обучения — не единый централизованный сервис
Оператор конкретного трафика Не создатель инструмента, а один из множества независимых исследователей/компаний, запустивших его на своей инфраструктуре
Официальный механизм opt-out ✅ Инструмент по умолчанию уважает HTTP-заголовки X-Robots-Tag: noai, noindex, noimageai и noimageindex — если сайт отдаёт такой заголовок, изображение пропускается автоматически
Масштаб и скорость По документации, инструмент способен обрабатывать до 100 миллионов URL за 20 часов на одной машине, скачивая порядка 1350 изображений в секунду при полной загрузке
Список IP-адресов ❌ Неприменимо в принципе — источники организационно и географически не связаны

Практически важная деталь: реальный, официально задокументированный способ защититься

В отличие от большинства ботов без единого оператора, здесь есть конкретный, работающий на уровне протокола механизм отказа: инструмент по умолчанию проверяет и уважает заголовки X-Robots-Tag со значениями noai или noimageai — это именно тот механизм, который сайты используют, чтобы явно заявить о нежелании участвовать в сборе данных для ИИ. Правда, официальная документация также прямо признаёт: это поведение можно отключить одной опцией командной строки (--disallowed_header_directives '[]'), поэтому полагаться только на HTTP-заголовок как на гарантию нельзя — это соглашение по умолчанию, а не техническое ограничение инструмента.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

Почему связь с уже разобранным LAION особенно показательна

img2dataset и LAION-huggingface-processor из этой серии — не один и тот же бот, но тесно связанные части одной экосистемы: LAION собирает пары ссылок «изображение + текст» из открытого веба, а затем именно img2dataset массово используется сообществом для скачивания самих изображений по этим ссылкам — как в официальной документации самой LAION, так и в независимых проектах, обучающих модели на её датасетах. Появление трафика img2dataset может означать как прямое участие в построении открытого датасета вроде LAION, так и любой другой, никак не связанный с LAION проект машинного обучения, использующий тот же открытый инструмент.

Как найти бота в логах

# Базовый поиск
grep -i "img2dataset" /var/log/nginx/access.log

# Топ URL — обычно это конкретные пути к файлам изображений
grep -i "img2dataset" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

Поскольку операторов множество и официального списка IP нет, для проверки происхождения конкретного всплеска активности стоит свериться с ASN через whois.

Стоит ли блокировать

  • если сайт хранит изображения, публично доступные без ограничений, — трафик от произвольного пользователя img2dataset будет появляться время от времени, независимо от блокировки конкретных IP, поскольку инструмент не привязан к единой инфраструктуре;
  • самый надёжный способ системно ограничить попадание изображений в подобные датасеты — не блокировка по UA (которую легко обойти сменой строки), а официально поддерживаемый инструментом HTTP-заголовок X-Robots-Tag: noai, отдаваемый сервером для всех изображений, — это работает для любого запуска img2dataset, который не отключил проверку заголовка явно;
  • на позиции в поисковой выдаче Google, Bing или Яндекса присутствие или отсутствие этого инструмента не влияет.

Как настроить защиту

Наиболее надёжный метод — заголовок ответа сервера для страниц или директорий с изображениями:

X-Robots-Tag: noai, noimageai

Дополнительно — запрет по токену UA в robots.txt и на уровне сервера, хотя это не остановит запуски с намеренно изменённым идентификатором:

User-agent: img2dataset
Disallow: /
if ($http_user_agent ~* "img2dataset") {
    return 403;
}

Частые вопросы

img2dataset — это единый централизованный бот одной компании?
Нет, это открытый инструмент, который любой исследователь или компания может запустить на собственных серверах — конкретный оператор трафика не создатель инструмента, а один из множества независимых пользователей.
Какие крупные датасеты построены с помощью этого инструмента?
LAION-5B (5,86 млрд пар изображение-текст) и другие известные открытые датасеты для обучения генеративных моделей.
Есть ли у инструмента встроенный механизм отказа?
Да, по умолчанию он уважает HTTP-заголовки X-Robots-Tag: noai, noindex, noimageai и noimageindex — при их наличии изображение автоматически пропускается.
Можно ли отключить этот механизм отказа?
Да, одной опцией командной строки — поэтому HTTP-заголовок работает как соглашение по умолчанию, а не как техническая гарантия.
Почему блокировка по User-Agent ненадёжна для этого инструмента?
Потому что операторов множество и они независимы друг от друга — блокировка одного запуска не остановит другой, особенно с изменённым идентификатором.
Какой самый надёжный способ защититься?
Отдавать заголовок X-Robots-Tag: noai для изображений на сервере — это работает для любого запуска инструмента, не отключившего проверку явно.
#img2dataset#LAION-5B#датасеты изображений#machine learning#бот-энциклопедия#robots.txt#X-Robots-Tag#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil