Если в логах встречается токен AI2Bot, это не Googlebot и не рядовой SEO-краулер, а бот некоммерческого исследовательского института Allen Institute for AI (Ai2), основанного при участии Пола Аллена, сооснователя Microsoft. Ai2 собирает веб-контент не для поиска и не для индексации сайта, а для обучения открытых языковых моделей и исследовательских датасетов — в частности, для собственной модели OLMo и поисковой системы научных статей Semantic Scholar.
1. Что такое AI2Bot
AI2Bot — краулер, который наполняет открытый датасет Dolma: мультитриллионный (buквально — на триллионы токенов) корпус веб-текста, который Ai2 публикует в открытом доступе для обучения языковых моделей. Отдельно встречается вариант Ai2Bot-Dolma — по документации оператора это тот же краулер, ориентированный конкретно на сбор данных для Dolma; часть вебмастеров отмечает, что в реальных логах суффикс -Dolma появляется даже там, где официальное уведомление о краулинге описывало только базовый AI2Bot — то есть строка UA в логах может слегка отличаться от заявленной в документации.
| Название | AI2Bot (Allen Institute for AI) |
| User-Agent / паттерн | Mozilla/5.0 (compatible) AI2Bot (+https://www.allenai.org/crawler); также встречается Mozilla/5.0 (compatible) Ai2Bot-Dolma (+https://www.allenai.org/crawler) — в логах возможны небольшие вариации формата относительно документации |
| Оператор | Allen Institute for AI (Ai2) — некоммерческий исследовательский институт |
| Роль | Собирает открытый веб-контент для обучения открытых языковых моделей (OLMo) и датасета Dolma; отдельно поддерживает инфраструктуру Semantic Scholar |
| Документация / ориентир | allenai.org/crawler — официальное уведомление о краулинге с объяснением цели и токеном для фильтрации |
| Список IP | ❌ Официального списка диапазонов IP не публикуется — фильтруйте по UA и поведению |
| robots.txt | По заявлению оператора и по независимым наблюдениям — соблюдает |
| Пометка TrafficVeil | Не Googlebot; по нагрузке в вашем случае — около 0,3 тыс. запросов, некоммерческий исследовательский краулер |
2. Зачем AI2Bot приходит на сайт
AI2Bot исследует определённые домены в поисках веб-контента, который потом используется для обучения открытых языковых моделей — цитата из официального уведомления оператора именно так и формулирует задачу бота. В отличие от коммерческих AI-краулеров (например, тех, что питают закрытые проприетарные модели), результат работы Ai2 — открытые датасеты и открытые веса моделей, доступные исследовательскому сообществу.
- Какие зоны чаще трогает: публичные текстовые страницы сайта — краулер интересует в первую очередь контент, а не служебные эндпоинты;
- Что ищет: текстовый контент подходящего качества для пополнения открытого корпуса Dolma;
- Чем отличается от браузерного пользователя: нет сессии и cookie, посещения не привязаны к конкретному интересу пользователя, а идут по списку доменов для планового обхода.
Отдельно стоит знать про соседний бот — AI2Bot-DeepResearchEval. Это не тот же краулер, а другой инструмент того же оператора: он не пополняет обучающий датасет, а подгружает и сканирует ресурсы в момент, когда ассистенты Ai2 выполняют режим «глубокого исследования» по запросу пользователя — то есть это агентный фетчер под конкретный пользовательский запрос, а не фоновый сбор данных для тренировки. Если в логах встречается именно этот токен, логика allow/deny может быть другой, чем для базового AI2Bot.
3. Нагрузка и риски именно для AI2Bot
По вашей сводке TrafficVeil нагрузка от AI2Bot умеренная — порядка 0,3 тыс. запросов, что для некоммерческого исследовательского краулера типичный объём: сторонние наблюдатели тоже отмечают, что по сравнению с крупными коммерческими AI-краулерами объём трафика от Ai2 заметно ниже, хотя значимость для открытых AI-бенчмарков высокая. Сторонние каталоги ботов присваивают AI2Bot и Ai2Bot-Dolma пометку осторожности («caution»), в первую очередь из-за общего принципа — любой краулер, собирающий контент для стороннего использования, теоретически может быть использован и для конкурентной разведки, а не только из-за реального деструктивного поведения именно этого бота.
Практический риск: расход CPU/bandwidth от планового обхода; на позиции сайта в Google, Bing или Яндексе блокировка AI2Bot не влияет — это отдельный, не поисковый краулер.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
4. Как найти AI2Bot в логах
Ищите оба токена семейства — AI2Bot и Ai2Bot-Dolma — а также будьте готовы к вариациям формата UA.
# Базовый поиск по обоим токенам
grep -iE "AI2Bot|Ai2Bot-Dolma" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -iE "AI2Bot|Ai2Bot-Dolma" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
# Топ IP за этим UA
grep -iE "AI2Bot|Ai2Bot-Dolma" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head
# Суточная активность
grep -iE "AI2Bot|Ai2Bot-Dolma" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c
# Более широкий regex-фильтр на случай вариаций UA (встречался у других вебмастеров)
grep -iE "ai[0-9]bot|allenai\.org" /var/log/nginx/access.log | wc -l
# Отдельно проверить визиты AI2Bot-DeepResearchEval (другой инструмент, другая логика allow/deny)
grep -i "AI2Bot-DeepResearchEval" /var/log/nginx/access.log | wc -l
Верификация. Подделать User-Agent может любой скрипт. Официального списка IP оператор не публикует, поэтому для точной верификации остаётся связка UA + поведение + частота, а не IP/ASN.
5. robots.txt для AI2Bot
# Блокировать оба варианта краулера, используемых для тренировки моделей
User-agent: AI2Bot
Disallow: /
User-agent: Ai2Bot-Dolma
Disallow: /
# Разрешить
User-agent: AI2Bot
Allow: /
User-agent: Ai2Bot-Dolma
Allow: /
Важно: не хотите, чтобы контент попал в открытые обучающие датасеты — ставьте Disallow. Ок с идеей открытых research-датасетов — оставляйте Allow. На видимость в Google это правило не влияет: это разные, независимые друг от друга краулеры.
6. Блокировка вручную и через TrafficVeil
Nginx
if ($http_user_agent ~* "AI2Bot|Ai2Bot") {
return 403;
}
TrafficVeil
- Найдите AI2Bot / Ai2Bot-Dolma в ботах домена или в /system/bots;
- Если контент не должен попадать в открытые обучающие датасеты — категория «запретить»;
- Если позиция домена допускает участие в открытых research-инициативах — Allow;
- После изменения сверьте логи и убедитесь, что поисковые роботы Google/Yandex продолжают заходить без изменений — правило их не затрагивает.
7. Рекомендации: что делать с AI2Bot
- Не хотите в open training datasets — Disallow + deny на уровне nginx/TrafficVeil;
- Ок с open research — Allow, дополнительных рисков для нагрузки при текущем объёме (~0,3 тыс. запросов) нет;
- Если встречается AI2Bot-DeepResearchEval — решайте отдельно от базового AI2Bot: это агентный фетчер под живые пользовательские запросы, а не фоновый сбор датасета;
- На Google, Bing и Яндекс не влияет — это независимый некоммерческий краулер, а не поисковый бот.
8. С кем не путать AI2Bot
| Бот / сосед | Кластер | UA | Комментарий |
| AI2Bot-Dolma | AI-краулеры для обучения моделей | ai2bot-dolma | тот же оператор, фокус на датасете Dolma |
| AI2Bot-DeepResearchEval | AI-агенты | ai2bot-deepresearcheval | тот же оператор, но другая задача — фетчинг под живой запрос ассистента, не сбор датасета |
| GPTBot | AI-краулеры для обучения моделей | gptbot | оператор OpenAI, коммерческая модель |
| CCBot | AI-краулеры для обучения моделей | ccbot | Common Crawl, открытый общий веб-корпус |
| Google-Extended | AI-краулеры для обучения моделей | google-extended | отдельный токен Google для AI-тренировки, не влияет на обычную индексацию |
9. Стратегия allow/deny для AI2Bot
| Ситуация | Действие |
| Не хотите участвовать в открытых обучающих датасетах | Disallow + deny в nginx/TrafficVeil для AI2Bot и Ai2Bot-Dolma |
| Устраивает идея открытых research-инициатив | Allow, дополнительных мер не требуется |
| Встретился AI2Bot-DeepResearchEval | Решать отдельно — это агентный фетчер, а не тренировочный краулер |
| Нужно не задеть поисковые системы | Блокировать точечно по токену AI2Bot/Ai2Bot, не трогать Googlebot/YandexBot |
| Подозрение на spoofing UA | Официальных IP нет — сверяйте по поведению и regex-паттерну ai[0-9]bot|allenai\.org |
Частые вопросы
AI2Bot — это разновидность Googlebot?
Чем Ai2Bot-Dolma отличается от базового AI2Bot?
Что такое AI2Bot-DeepResearchEval и нужно ли его блокировать вместе с остальными?
Потеряет ли сайт позиции в поиске, если заблокировать AI2Bot?
Публикует ли Ai2 официальный список IP-адресов краулера?
Соблюдает ли AI2Bot правила robots.txt?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.