TrafficVeil
Боты 6 мин13 августа 2026 г.

AI2Bot-Dolma в логах: открытый датасет без цитирований

Разбираем AI2Bot-Dolma — специализированный краулер Allen Institute for AI для датасета Dolma. Объясняем, почему у этого бота структурно нет механизма цитирований в AI-ответах, и почему правило только для AI2Bot не обязательно перекрывает вариант -Dolma.

TV
TrafficVeil Team
Эксперты по защите веб-трафика
Содержание статьи
  1. 1. Что такое AI2Bot-Dolma
  2. 2. Зачем AI2Bot-Dolma приходит на сайт
  3. 3. Нагрузка и риски именно для AI2Bot-Dolma
  4. 4. Как найти AI2Bot-Dolma в логах
  5. 5. robots.txt для AI2Bot-Dolma
  6. 6. Блокировка вручную и через TrafficVeil
  7. 7. Рекомендации: что делать с AI2Bot-Dolma
  8. 8. С кем не путать AI2Bot-Dolma
  9. 9. Стратегия allow/deny для AI2Bot-Dolma
DDoS L7

DDoS атака что это простыми словами и как защитить сайт

Разобрали виды атак, признаки DDoS, последствия, уровни защиты, L7 DDoS и схему подключения TrafficVeil через DNS/reverse proxy.

Читать про DDoS

Энциклопедия ботов TrafficVeil

618 ботов с описаниями, паттернами User-Agent и фильтром по категориям — открытый справочник для аудита логов и настройки защиты.

Открыть справочник

AI2Bot-Dolma стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «AI и LLM-краулеры». Оператор задокументирован — некоммерческий Allen Institute for AI (Ai2), основанный при участии Пола Аллена, сооснователя Microsoft. Это специализированный вариант их основного краулера AI2Bot, нацеленный конкретно на пополнение датасета Dolma — открытого мультитриллионного корпуса текста для обучения языковых моделей, в частности OLMo.

1. Что такое AI2Bot-Dolma

По официальному уведомлению о краулинге на allenai.org/crawler, бот исследует определённые домены в поисках веб-контента для тренировки открытых языковых моделей. Важный практический нюанс, который стоит знать именно про вариант -Dolma: он селективен — по независимым источникам, краулер обходит только «определённые домены», а не сплошь весь веб, и может со временем расширять список охватываемых сайтов. Ещё один нюанс, задокументированный независимым наблюдателем: даже сайты, у которых в robots.txt настроено правило только для базового токена AI2Bot, могут зафиксировать в логах именно суффикс -Dolma — то есть правило нужно прописывать для обоих токенов отдельно, а не полагаться на то, что один автоматически перекроет другой.

Название AI2Bot-Dolma
User-Agent / паттерн ai2bot-dolma — официальная строка Mozilla/5.0 (compatible) Ai2Bot-Dolma (+https://www.allenai.org/crawler)
Оператор Allen Institute for AI (Ai2) — некоммерческий исследовательский институт
Роль Специализированный сбор веб-контента конкретно для датасета Dolma, который используется для тренировки открытых моделей, включая OLMo
Документация / ориентир allenai.org/crawler — официальное уведомление о краулинге, включая контактную ссылку для запроса удаления или обсуждения поведения краулера напрямую с институтом
Список IP ❌ Allen Institute официально не публикует диапазоны IP — блокировка по IP в принципе ненадёжна для этого бота, полагайтесь на UA и поведение
robots.txt Соблюдается, но важно: правило Crawl-delay поддерживается не всегда стабильно, а группировка нескольких токенов в одном блоке правил иногда неправильно обрабатывается парсерами — прописывайте AI2Bot и AI2Bot-Dolma отдельными строками User-agent
Пометка TrafficVeil Нежелательный / AI и LLM-краулеры

2. Зачем AI2Bot-Dolma приходит на сайт

Бот собирает разнообразный публичный текст специально для пополнения открытого корпуса Dolma — в отличие от коммерческих AI-краулеров, конечный результат его работы (сам датасет и обученные на нём модели) публикуется в открытом доступе для исследовательского сообщества, а не остаётся закрытой собственностью компании. Важная деталь именно для оценки практической пользы: по независимому анализу, AI2Bot и его вариант -Dolma не питают никакой пользовательской поисковой системы или AI-ассистента, которые могли бы направлять реферальный трафик или цитировать сайт — в отличие от, например, PerplexityBot или Claude-SearchBot. То есть у этого краулера нет механизма «отдачи» в виде цитирований вообще, независимо от того, разрешён он или заблокирован.

  • Какие зоны чаще трогает: публичные текстовые страницы — краулер интересует прежде всего содержательный контент, а не служебные эндпоинты;
  • Что ищет: текстовый контент подходящего качества для пополнения корпуса Dolma;
  • Чем отличается от браузерного пользователя: нет сессии и cookie, посещения идут по списку отобранных доменов, а не по интересу конкретного пользователя.

Типичный кейс: маркетинг видит всплеск hits в Метрике/GA, но сессии пустые. Причина — AI2Bot-Dolma. В отличие от многих соседей по категории, здесь решение allow/deny стоит принимать не в надежде сохранить цитирования (их структурно не бывает), а исходя исключительно из отношения к идее участия в открытых исследовательских датасетах.

3. Нагрузка и риски именно для AI2Bot-Dolma

Отдельной строки в публичной сводке top-bot TrafficVeil у ai2bot-dolma может не быть, но в категории «AI и LLM-краулеры» такие агенты дают характерный фон: нагрузка может быть «тихой» — не DDoS в классическом смысле, но постоянный съём HTML и рост bandwidth. По независимым наблюдениям, объём трафика от Ai2 обычно ниже, чем у крупных коммерческих AI-краулеров, хотя значимость для открытых AI-бенчмарков высокая.

4. Как найти AI2Bot-Dolma в логах

Ищите отдельно и AI2Bot, и AI2Bot-Dolma — это разные строки, и правило для одной не обязательно перекрывает другую.

# Базовый поиск по обоим вариантам
grep -iE "AI2Bot-Dolma|AI2Bot" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -i "AI2Bot-Dolma" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -i "AI2Bot-Dolma" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -i "AI2Bot-Dolma" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Более широкий regex-фильтр на случай вариаций UA (независимо задокументирован другими вебмастерами)
grep -iE "ai[0-9]bot|allenai\.org" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP институт не публикует, поэтому надёжная верификация возможна только через связку UA + поведение + частоту, а не через IP/ASN.

IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"

5. robots.txt для AI2Bot-Dolma

# Блокировать оба варианта отдельными строками — группировка может обрабатываться парсерами некорректно
User-agent: AI2Bot
Disallow: /

User-agent: AI2Bot-Dolma
Disallow: /

# Разрешить
User-agent: AI2Bot
Allow: /

User-agent: AI2Bot-Dolma
Allow: /

Важно: не хотите, чтобы контент попал в открытый обучающий датасет — ставьте Disallow для обоих токенов отдельно. Поскольку у бота нет механизма цитирования или реферального трафика в принципе, решение здесь чисто мировоззренческое: поддерживаете ли вы идею открытых AI-датасетов или нет, а не вопрос «что я теряю в видимости».

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "AI2Bot-Dolma|AI2Bot") {
    return 403;
}

TrafficVeil

  • Найдите AI2Bot-Dolma и AI2Bot по отдельности в ботах домена или в /system/bots;
  • Если контент не должен попадать в открытые обучающие датасеты — категория «запретить» для обоих токенов;
  • Если позиция домена допускает участие в открытых research-инициативах — Allow;
  • После изменения сверьте логи и убедитесь, что поисковые роботы Google/Yandex продолжают заходить без изменений — правило их не затрагивает.

7. Рекомендации: что делать с AI2Bot-Dolma

  • Не хотите в open training datasets — Disallow + deny для обоих токенов семейства (AI2Bot и AI2Bot-Dolma) отдельными правилами;
  • Ок с open research — Allow, дополнительных рисков для нагрузки при типичном объёме нет;
  • Учитывайте, что вопреки шаблонной формулировке категории, у этого краулера нет пользовательского поискового продукта, который мог бы цитировать сайт — «потеря цитирований» при блокировке не актуальна для AI2Bot/Dolma;
  • При спорных случаях можно обратиться напрямую в Allen Institute через контактную ссылку на странице allenai.org/crawler;
  • На Google, Bing и Яндекс не влияет — это независимый некоммерческий краулер.

8. С кем не путать AI2Bot-Dolma

Бот / сосед Кластер UA Комментарий
AI2Bot AI и LLM-краулеры ai2bot тот же оператор, базовый/общий токен семейства
Ai2Bot-DeepResearchEval AI и LLM-краулеры ai2bot-deepresearcheval тот же оператор, но другая задача — фетчинг под живой запрос ассистента, не сбор датасета
AnthropicBot AI и LLM-краулеры anthropic-ai устаревший токен другого оператора (Anthropic), сегодня не соответствует их действующей инфраструктуре
AzureAI-SearchBot AI и LLM-краулеры azureai-searchbot другой оператор, поисковый, а не тренировочный краулер
Blockaid AI и LLM-краулеры blockaid другой оператор, другое назначение

9. Стратегия allow/deny для AI2Bot-Dolma

Ситуация Действие
Не хотите участвовать в открытых обучающих датасетах Disallow + deny для AI2Bot и AI2Bot-Dolma отдельными правилами
Устраивает идея открытых research-инициатив Allow, дополнительных мер не требуется
Настроено правило только для AI2Bot, но в логах видна -Dolma Добавить отдельное правило конкретно для AI2Bot-Dolma — они не перекрывают друг друга автоматически
Спорный случай, нужна прямая связь с оператором Контактная форма на странице allenai.org/crawler
Подозрение на spoofing UA Официальных IP нет — сверяйте по поведению и regex-паттерну ai[0-9]bot|allenai\.org

Частые вопросы

Правда ли, что блокировка AI2Bot-Dolma лишает сайт цитирований в AI-ответах?

Нет — у этого краулера структурно нет пользовательского поискового продукта или ассистента, который мог бы цитировать сайт, в отличие от PerplexityBot или Claude-SearchBot.

Чем AI2Bot-Dolma отличается от базового AI2Bot?

Это специализированный вариант того же семейства, нацеленный конкретно на пополнение датасета Dolma, а не на общий обход для других целей Ai2.

Если я уже заблокировал AI2Bot, защищает ли это от AI2Bot-Dolma?

Не обязательно — независимо задокументирован случай, когда суффикс -Dolma появлялся в логах даже при настроенном правиле только для базового AI2Bot, поэтому нужны отдельные строки для каждого токена.

Обходит ли этот краулер весь сайт целиком?

Нет, по независимым данным он селективен и обходит только определённые домены, список которых может со временем расширяться.

Можно ли напрямую связаться с оператором по поводу этого краулера?

Да, на официальной странице allenai.org/crawler есть контактная ссылка для запроса удаления или обсуждения поведения краулера с институтом.

На чём тогда основывать решение allow/deny для этого бота?

На отношении к идее открытых AI-исследовательских датасетов как таковой, а не на опасении потерять видимость или цитирования — их здесь в принципе не бывает.

#AI2Bot-Dolma#Allen Institute for AI#Dolma#OLMo#AI-краулеры#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак.

Похожие статьи

Skype (общий токен): не один бот, а минимум три разных

Общий поиск по слову «skype» в логах цепляет сразу несколько разных, исторически связанных механизмов Microsoft — от закрытого в мае 2025 года превью-бота до активной внутренней инфраструктуры Teams, унаследовавшей кодовое имя SkypeSpaces. Разбираемся, почему общее правило блокировки по этому слову рискованно, и как разделить разные варианты в своих логах.

7 мин

Fedicabot: превью-fetcher Fedica, а не краулер Fediverse

Fedicabot принадлежит Fedica — крупной платформе публикации и аналитики соцсетей, а не имеет отношения к Fediverse, несмотря на созвучное название. Официальная страница оператора прямо заявляет: бот не обходит сайты целиком, а читает только страницу, которую указал конкретный пользователь при планировании публикации, — это меняет всю логику оценки риска.

6 мин

Amazon Kendra: возможно, ваш корпоративный поиск

Amazon Kendra — реальный сервис корпоративного поиска AWS, и его коннектор Web Crawler обходит только те конкретные URL, которые явно указал клиент AWS при настройке источника данных — то есть это не свободный обход, а целевая индексация по чьему-то заданию. Разбираемся, почему первый шаг здесь — проверить, не настроен ли на вашем сайте (или у партнёра) такой поисковый индекс, прежде чем блокировать бота как постороннего.

6 мин

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.