AI2Bot-Dolma стоит отдельного правила в антиботе: это не «ещё один hit», а повторяемый паттерн автоматизации в категории «AI и LLM-краулеры». Оператор задокументирован — некоммерческий Allen Institute for AI (Ai2), основанный при участии Пола Аллена, сооснователя Microsoft. Это специализированный вариант их основного краулера AI2Bot, нацеленный конкретно на пополнение датасета Dolma — открытого мультитриллионного корпуса текста для обучения языковых моделей, в частности OLMo.
1. Что такое AI2Bot-Dolma
По официальному уведомлению о краулинге на allenai.org/crawler, бот исследует определённые домены в поисках веб-контента для тренировки открытых языковых моделей. Важный практический нюанс, который стоит знать именно про вариант -Dolma: он селективен — по независимым источникам, краулер обходит только «определённые домены», а не сплошь весь веб, и может со временем расширять список охватываемых сайтов. Ещё один нюанс, задокументированный независимым наблюдателем: даже сайты, у которых в robots.txt настроено правило только для базового токена AI2Bot, могут зафиксировать в логах именно суффикс -Dolma — то есть правило нужно прописывать для обоих токенов отдельно, а не полагаться на то, что один автоматически перекроет другой.
| Название | AI2Bot-Dolma |
| User-Agent / паттерн | ai2bot-dolma — официальная строка Mozilla/5.0 (compatible) Ai2Bot-Dolma (+https://www.allenai.org/crawler) |
| Оператор | Allen Institute for AI (Ai2) — некоммерческий исследовательский институт |
| Роль | Специализированный сбор веб-контента конкретно для датасета Dolma, который используется для тренировки открытых моделей, включая OLMo |
| Документация / ориентир | allenai.org/crawler — официальное уведомление о краулинге, включая контактную ссылку для запроса удаления или обсуждения поведения краулера напрямую с институтом |
| Список IP | ❌ Allen Institute официально не публикует диапазоны IP — блокировка по IP в принципе ненадёжна для этого бота, полагайтесь на UA и поведение |
| robots.txt | Соблюдается, но важно: правило Crawl-delay поддерживается не всегда стабильно, а группировка нескольких токенов в одном блоке правил иногда неправильно обрабатывается парсерами — прописывайте AI2Bot и AI2Bot-Dolma отдельными строками User-agent |
| Пометка TrafficVeil | Нежелательный / AI и LLM-краулеры |
2. Зачем AI2Bot-Dolma приходит на сайт
Бот собирает разнообразный публичный текст специально для пополнения открытого корпуса Dolma — в отличие от коммерческих AI-краулеров, конечный результат его работы (сам датасет и обученные на нём модели) публикуется в открытом доступе для исследовательского сообщества, а не остаётся закрытой собственностью компании. Важная деталь именно для оценки практической пользы: по независимому анализу, AI2Bot и его вариант -Dolma не питают никакой пользовательской поисковой системы или AI-ассистента, которые могли бы направлять реферальный трафик или цитировать сайт — в отличие от, например, PerplexityBot или Claude-SearchBot. То есть у этого краулера нет механизма «отдачи» в виде цитирований вообще, независимо от того, разрешён он или заблокирован.
- Какие зоны чаще трогает: публичные текстовые страницы — краулер интересует прежде всего содержательный контент, а не служебные эндпоинты;
- Что ищет: текстовый контент подходящего качества для пополнения корпуса Dolma;
- Чем отличается от браузерного пользователя: нет сессии и cookie, посещения идут по списку отобранных доменов, а не по интересу конкретного пользователя.
Типичный кейс: маркетинг видит всплеск hits в Метрике/GA, но сессии пустые. Причина — AI2Bot-Dolma. В отличие от многих соседей по категории, здесь решение allow/deny стоит принимать не в надежде сохранить цитирования (их структурно не бывает), а исходя исключительно из отношения к идее участия в открытых исследовательских датасетах.
3. Нагрузка и риски именно для AI2Bot-Dolma
Отдельной строки в публичной сводке top-bot TrafficVeil у ai2bot-dolma может не быть, но в категории «AI и LLM-краулеры» такие агенты дают характерный фон: нагрузка может быть «тихой» — не DDoS в классическом смысле, но постоянный съём HTML и рост bandwidth. По независимым наблюдениям, объём трафика от Ai2 обычно ниже, чем у крупных коммерческих AI-краулеров, хотя значимость для открытых AI-бенчмарков высокая.
4. Как найти AI2Bot-Dolma в логах
Ищите отдельно и AI2Bot, и AI2Bot-Dolma — это разные строки, и правило для одной не обязательно перекрывает другую.
# Базовый поиск по обоим вариантам
grep -iE "AI2Bot-Dolma|AI2Bot" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "AI2Bot-Dolma" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -i "AI2Bot-Dolma" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -i "AI2Bot-Dolma" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Более широкий regex-фильтр на случай вариаций UA (независимо задокументирован другими вебмастерами)
grep -iE "ai[0-9]bot|allenai\.org" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт. Официального списка IP институт не публикует, поэтому надёжная верификация возможна только через связку UA + поведение + частоту, а не через IP/ASN.
IP="1.2.3.4"
whois -h whois.cymru.com " -v $IP"
dig +short -x "$IP"
5. robots.txt для AI2Bot-Dolma
# Блокировать оба варианта отдельными строками — группировка может обрабатываться парсерами некорректно
User-agent: AI2Bot
Disallow: /
User-agent: AI2Bot-Dolma
Disallow: /
# Разрешить
User-agent: AI2Bot
Allow: /
User-agent: AI2Bot-Dolma
Allow: /
Важно: не хотите, чтобы контент попал в открытый обучающий датасет — ставьте Disallow для обоих токенов отдельно. Поскольку у бота нет механизма цитирования или реферального трафика в принципе, решение здесь чисто мировоззренческое: поддерживаете ли вы идею открытых AI-датасетов или нет, а не вопрос «что я теряю в видимости».
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "AI2Bot-Dolma|AI2Bot") {
return 403;
}
TrafficVeil
- Найдите AI2Bot-Dolma и AI2Bot по отдельности в ботах домена или в /system/bots;
- Если контент не должен попадать в открытые обучающие датасеты — категория «запретить» для обоих токенов;
- Если позиция домена допускает участие в открытых research-инициативах — Allow;
- После изменения сверьте логи и убедитесь, что поисковые роботы Google/Yandex продолжают заходить без изменений — правило их не затрагивает.
7. Рекомендации: что делать с AI2Bot-Dolma
- Не хотите в open training datasets — Disallow + deny для обоих токенов семейства (AI2Bot и AI2Bot-Dolma) отдельными правилами;
- Ок с open research — Allow, дополнительных рисков для нагрузки при типичном объёме нет;
- Учитывайте, что вопреки шаблонной формулировке категории, у этого краулера нет пользовательского поискового продукта, который мог бы цитировать сайт — «потеря цитирований» при блокировке не актуальна для AI2Bot/Dolma;
- При спорных случаях можно обратиться напрямую в Allen Institute через контактную ссылку на странице allenai.org/crawler;
- На Google, Bing и Яндекс не влияет — это независимый некоммерческий краулер.
8. С кем не путать AI2Bot-Dolma
| Бот / сосед | Кластер | UA | Комментарий |
| AI2Bot | AI и LLM-краулеры | ai2bot | тот же оператор, базовый/общий токен семейства |
| Ai2Bot-DeepResearchEval | AI и LLM-краулеры | ai2bot-deepresearcheval | тот же оператор, но другая задача — фетчинг под живой запрос ассистента, не сбор датасета |
| AnthropicBot | AI и LLM-краулеры | anthropic-ai | устаревший токен другого оператора (Anthropic), сегодня не соответствует их действующей инфраструктуре |
| AzureAI-SearchBot | AI и LLM-краулеры | azureai-searchbot | другой оператор, поисковый, а не тренировочный краулер |
| Blockaid | AI и LLM-краулеры | blockaid | другой оператор, другое назначение |
9. Стратегия allow/deny для AI2Bot-Dolma
| Ситуация | Действие |
| Не хотите участвовать в открытых обучающих датасетах | Disallow + deny для AI2Bot и AI2Bot-Dolma отдельными правилами |
| Устраивает идея открытых research-инициатив | Allow, дополнительных мер не требуется |
| Настроено правило только для AI2Bot, но в логах видна -Dolma | Добавить отдельное правило конкретно для AI2Bot-Dolma — они не перекрывают друг друга автоматически |
| Спорный случай, нужна прямая связь с оператором | Контактная форма на странице allenai.org/crawler |
| Подозрение на spoofing UA | Официальных IP нет — сверяйте по поведению и regex-паттерну ai[0-9]bot|allenai\.org |