Боты5 мин чтения·13 августа 2026 г.

AI2Bot в логах сайта: краулер Allen Institute for AI, а не Google

Разбираем AI2Bot — некоммерческого краулера Ai2, который собирает контент для открытых языковых моделей и датасета Dolma. Показываем, чем он отличается от Ai2Bot-Dolma и AI2Bot-DeepResearchEval, как найти его в логах и настроить allow/deny.

TVTrafficVeil TeamЭксперты по защите веб-трафика
Уникальная иллюстрация бота AI2Bot: нежелательный ai и llm-краулеры

Если в логах встречается токен AI2Bot, это не Googlebot и не рядовой SEO-краулер, а бот некоммерческого исследовательского института Allen Institute for AI (Ai2), основанного при участии Пола Аллена, сооснователя Microsoft. Ai2 собирает веб-контент не для поиска и не для индексации сайта, а для обучения открытых языковых моделей и исследовательских датасетов — в частности, для собственной модели OLMo и поисковой системы научных статей Semantic Scholar.

1. Что такое AI2Bot

AI2Bot — краулер, который наполняет открытый датасет Dolma: мультитриллионный (buквально — на триллионы токенов) корпус веб-текста, который Ai2 публикует в открытом доступе для обучения языковых моделей. Отдельно встречается вариант Ai2Bot-Dolma — по документации оператора это тот же краулер, ориентированный конкретно на сбор данных для Dolma; часть вебмастеров отмечает, что в реальных логах суффикс -Dolma появляется даже там, где официальное уведомление о краулинге описывало только базовый AI2Bot — то есть строка UA в логах может слегка отличаться от заявленной в документации.

Название AI2Bot (Allen Institute for AI)
User-Agent / паттерн Mozilla/5.0 (compatible) AI2Bot (+https://www.allenai.org/crawler); также встречается Mozilla/5.0 (compatible) Ai2Bot-Dolma (+https://www.allenai.org/crawler) — в логах возможны небольшие вариации формата относительно документации
Оператор Allen Institute for AI (Ai2) — некоммерческий исследовательский институт
Роль Собирает открытый веб-контент для обучения открытых языковых моделей (OLMo) и датасета Dolma; отдельно поддерживает инфраструктуру Semantic Scholar
Документация / ориентир allenai.org/crawler — официальное уведомление о краулинге с объяснением цели и токеном для фильтрации
Список IP ❌ Официального списка диапазонов IP не публикуется — фильтруйте по UA и поведению
robots.txt По заявлению оператора и по независимым наблюдениям — соблюдает
Пометка TrafficVeil Не Googlebot; по нагрузке в вашем случае — около 0,3 тыс. запросов, некоммерческий исследовательский краулер

2. Зачем AI2Bot приходит на сайт

AI2Bot исследует определённые домены в поисках веб-контента, который потом используется для обучения открытых языковых моделей — цитата из официального уведомления оператора именно так и формулирует задачу бота. В отличие от коммерческих AI-краулеров (например, тех, что питают закрытые проприетарные модели), результат работы Ai2 — открытые датасеты и открытые веса моделей, доступные исследовательскому сообществу.

  • Какие зоны чаще трогает: публичные текстовые страницы сайта — краулер интересует в первую очередь контент, а не служебные эндпоинты;
  • Что ищет: текстовый контент подходящего качества для пополнения открытого корпуса Dolma;
  • Чем отличается от браузерного пользователя: нет сессии и cookie, посещения не привязаны к конкретному интересу пользователя, а идут по списку доменов для планового обхода.

Отдельно стоит знать про соседний бот — AI2Bot-DeepResearchEval. Это не тот же краулер, а другой инструмент того же оператора: он не пополняет обучающий датасет, а подгружает и сканирует ресурсы в момент, когда ассистенты Ai2 выполняют режим «глубокого исследования» по запросу пользователя — то есть это агентный фетчер под конкретный пользовательский запрос, а не фоновый сбор данных для тренировки. Если в логах встречается именно этот токен, логика allow/deny может быть другой, чем для базового AI2Bot.

3. Нагрузка и риски именно для AI2Bot

По вашей сводке TrafficVeil нагрузка от AI2Bot умеренная — порядка 0,3 тыс. запросов, что для некоммерческого исследовательского краулера типичный объём: сторонние наблюдатели тоже отмечают, что по сравнению с крупными коммерческими AI-краулерами объём трафика от Ai2 заметно ниже, хотя значимость для открытых AI-бенчмарков высокая. Сторонние каталоги ботов присваивают AI2Bot и Ai2Bot-Dolma пометку осторожности («caution»), в первую очередь из-за общего принципа — любой краулер, собирающий контент для стороннего использования, теоретически может быть использован и для конкурентной разведки, а не только из-за реального деструктивного поведения именно этого бота.

Практический риск: расход CPU/bandwidth от планового обхода; на позиции сайта в Google, Bing или Яндексе блокировка AI2Bot не влияет — это отдельный, не поисковый краулер.

Не уверены, кто ходит по вашему сайту?

Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.

Посмотреть свой трафик

4. Как найти AI2Bot в логах

Ищите оба токена семейства — AI2Bot и Ai2Bot-Dolma — а также будьте готовы к вариациям формата UA.

# Базовый поиск по обоим токенам
grep -iE "AI2Bot|Ai2Bot-Dolma" /var/log/nginx/access.log

# Топ URL, которые вычитывает бот
grep -iE "AI2Bot|Ai2Bot-Dolma" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head

# Топ IP за этим UA
grep -iE "AI2Bot|Ai2Bot-Dolma" /var/log/nginx/access.log | awk '{print $1}' | sort | uniq -c | sort -rn | head

# Суточная активность
grep -iE "AI2Bot|Ai2Bot-Dolma" /var/log/nginx/access.log | awk '{print $4}' | cut -d: -f1 | sort | uniq -c

# Более широкий regex-фильтр на случай вариаций UA (встречался у других вебмастеров)
grep -iE "ai[0-9]bot|allenai\.org" /var/log/nginx/access.log | wc -l

# Отдельно проверить визиты AI2Bot-DeepResearchEval (другой инструмент, другая логика allow/deny)
grep -i "AI2Bot-DeepResearchEval" /var/log/nginx/access.log | wc -l

Верификация. Подделать User-Agent может любой скрипт. Официального списка IP оператор не публикует, поэтому для точной верификации остаётся связка UA + поведение + частота, а не IP/ASN.

5. robots.txt для AI2Bot

# Блокировать оба варианта краулера, используемых для тренировки моделей
User-agent: AI2Bot
Disallow: /

User-agent: Ai2Bot-Dolma
Disallow: /

# Разрешить
User-agent: AI2Bot
Allow: /

User-agent: Ai2Bot-Dolma
Allow: /

Важно: не хотите, чтобы контент попал в открытые обучающие датасеты — ставьте Disallow. Ок с идеей открытых research-датасетов — оставляйте Allow. На видимость в Google это правило не влияет: это разные, независимые друг от друга краулеры.

6. Блокировка вручную и через TrafficVeil

Nginx

if ($http_user_agent ~* "AI2Bot|Ai2Bot") {
    return 403;
}

TrafficVeil

  • Найдите AI2Bot / Ai2Bot-Dolma в ботах домена или в /system/bots;
  • Если контент не должен попадать в открытые обучающие датасеты — категория «запретить»;
  • Если позиция домена допускает участие в открытых research-инициативах — Allow;
  • После изменения сверьте логи и убедитесь, что поисковые роботы Google/Yandex продолжают заходить без изменений — правило их не затрагивает.

7. Рекомендации: что делать с AI2Bot

  • Не хотите в open training datasets — Disallow + deny на уровне nginx/TrafficVeil;
  • Ок с open research — Allow, дополнительных рисков для нагрузки при текущем объёме (~0,3 тыс. запросов) нет;
  • Если встречается AI2Bot-DeepResearchEval — решайте отдельно от базового AI2Bot: это агентный фетчер под живые пользовательские запросы, а не фоновый сбор датасета;
  • На Google, Bing и Яндекс не влияет — это независимый некоммерческий краулер, а не поисковый бот.

8. С кем не путать AI2Bot

Бот / сосед Кластер UA Комментарий
AI2Bot-Dolma AI-краулеры для обучения моделей ai2bot-dolma тот же оператор, фокус на датасете Dolma
AI2Bot-DeepResearchEval AI-агенты ai2bot-deepresearcheval тот же оператор, но другая задача — фетчинг под живой запрос ассистента, не сбор датасета
GPTBot AI-краулеры для обучения моделей gptbot оператор OpenAI, коммерческая модель
CCBot AI-краулеры для обучения моделей ccbot Common Crawl, открытый общий веб-корпус
Google-Extended AI-краулеры для обучения моделей google-extended отдельный токен Google для AI-тренировки, не влияет на обычную индексацию

9. Стратегия allow/deny для AI2Bot

Ситуация Действие
Не хотите участвовать в открытых обучающих датасетах Disallow + deny в nginx/TrafficVeil для AI2Bot и Ai2Bot-Dolma
Устраивает идея открытых research-инициатив Allow, дополнительных мер не требуется
Встретился AI2Bot-DeepResearchEval Решать отдельно — это агентный фетчер, а не тренировочный краулер
Нужно не задеть поисковые системы Блокировать точечно по токену AI2Bot/Ai2Bot, не трогать Googlebot/YandexBot
Подозрение на spoofing UA Официальных IP нет — сверяйте по поведению и regex-паттерну ai[0-9]bot|allenai\.org

Частые вопросы

AI2Bot — это разновидность Googlebot?
Нет, это полностью независимый краулер некоммерческого исследовательского института Allen Institute for AI, и на индексацию в Google он никак не влияет.
Чем Ai2Bot-Dolma отличается от базового AI2Bot?
По документации оператора это тот же краулер с фокусом на пополнение датасета Dolma, но в реальных логах суффикс -Dolma может появляться даже там, где ожидался обычный AI2Bot
Что такое AI2Bot-DeepResearchEval и нужно ли его блокировать вместе с остальными?
Это отдельный инструмент того же оператора, который подгружает страницы в момент, когда ассистент Ai2 выполняет запрос пользователя в режиме глубокого исследования — решать по нему стоит отдельно от тренировочного краулера.
Потеряет ли сайт позиции в поиске, если заблокировать AI2Bot?
Нет, это некоммерческий исследовательский краулер, не связанный с поисковыми системами, и блокировка не отражается на видимости в Google, Bing или Яндексе.
Публикует ли Ai2 официальный список IP-адресов краулера?
Нет, официального реестра диапазонов IP институт не ведёт, поэтому для верификации нужно ориентироваться на строку User-Agent и поведение, а не на конкретные адреса.
Соблюдает ли AI2Bot правила robots.txt?
Да, по заявлению оператора и по независимым наблюдениям вебмастеров краулер учитывает запреты в robots.txt.
#AI2Bot#Allen Institute for AI#Ai2Bot-Dolma#AI-краулеры#robots.txt#TrafficVeil
TV
TrafficVeil Team

Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.

Похожие статьи

Ещё материалы из раздела «Боты» — те же вопросы, другие агенты.

Проверьте защиту своего сайта

Подключение занимает несколько минут. Начните с анализа трафика и включайте блокировки после проверки логов.

Тарифа на трафик нет. Платите за людей, а не за тех, кого отбили: боты, атаки и всё, что срезали фильтры, в счёт не идут. Тариф — число доменов и глубина настроек.

TrafficVeil