Ai2Bot-DeepResearchEval принадлежит Allen Institute for AI (Ai2) — некоммерческому исследовательскому институту, основанному покойным сооснователем Microsoft Полом Алленом. В отличие от коммерческих обучающих краулеров, этот конкретный бот из семейства Ai2 занимается не сбором сырья для тренировки моделей с нуля, а специфической задачей оценки: он проверяет ресурсы, которые используются при выполнении задач глубокого исследования (deep research) открытыми AI-моделями института.
Что такое «оценка глубокого исследования» и зачем ей краулер
Deep research — класс AI-функций, при которых модель не просто отвечает по своим внутренним знаниям, а самостоятельно ищет, открывает и анализирует несколько источников в интернете, чтобы собрать более полный и актуальный ответ на сложный вопрос. Чтобы понять, насколько хорошо открытые модели Ai2 справляются с такими задачами, нужен инструмент бенчмаркинга — набор тестовых запросов и ресурсов, на которых измеряется качество работы модели. Именно для этого Ai2Bot-DeepResearchEval и обращается к сайтам: не для построения общего обучающего датасета, а чтобы собрать и просканировать конкретные ресурсы, задействованные в оценочных прогонах (evaluation runs) моделей института.
Это отличает его даже от родственного основного AI2Bot, чья официальная документация прямо говорит про сбор веб-контента для обучения открытых языковых моделей, и от Ai2Bot-Dolma — отдельного краулера, который целенаправленно строит огромный открытый корпус Dolma для тренировки. Все три бота — часть одного семейства Ai2, но решают разные задачи внутри исследовательского пайплайна института.
Параметры бота
| Параметр | Значение |
| User-Agent / паттерн | ai2bot-deepresearcheval; родственный основной бот использует строку вида Mozilla/5.0 (compatible) AI2Bot (+https://www.allenai.org/crawler) |
| Оператор | Allen Institute for AI (Ai2) — некоммерческий исследовательский институт |
| Официальная страница о краулерах | allenai.org/crawler |
| Назначение | Сбор и сканирование ресурсов, задействованных в задачах и бенчмарках глубокого исследования (deep research) открытых моделей Ai2 — не общее обучение с нуля |
| Соблюдение robots.txt | Основной AI2Bot официально подтверждает соблюдение robots.txt; по отдельному дочернему боту DeepResearchEval подтверждения именно этого пункта в открытых источниках не найдено, но институт в целом заявляет о добросовестном поведении своих краулеров |
| Список IP-адресов | ❌ Отдельного официального фида не публикуется — верификация по строке User-Agent |
| Некоммерческий статус оператора | Ai2 — институт, а не коммерческая компания; часть его моделей и датасетов (включая корпус Dolma) публикуется в открытом доступе для исследовательского сообщества |
Как это меняет оценку риска по сравнению с типовым «нежелательным» AI-краулером
Шаблонное отнесение к категории «нежелательный» стоит пересмотреть в свете двух фактов. Во-первых, у бота есть явно раскрытый некоммерческий оператор с открытой контактной страницей — это не анонимный скрапер без опознавательных знаков. Во-вторых, задача конкретно этого бота — не массовое обучающее накопление, а точечная проверка ресурсов в рамках оценочных бенчмарков, что по своей природе предполагает меньший и более сфокусированный объём обращений, чем у краулера, который системно проходит по всему сайту ради тренировочного корпуса. Тем не менее для владельца сайта прямой выгоды от участия в чужом бенчмарке по-прежнему нет — уникальный контент используется третьей стороной без клика, атрибуции или компенсации, даже если конечная цель — некоммерческое исследование, а не коммерческий продукт.
Подключите домен и посмотрите живую ленту: кто пришёл, с какой сети, что запрашивал и по какому правилу был пропущен или заблокирован.
Как найти бота в логах
# Базовый поиск
grep -i "ai2bot-deepresearcheval" /var/log/nginx/access.log
# Топ URL, которые вычитывает бот
grep -i "ai2bot-deepresearcheval" /var/log/nginx/access.log | awk '{print $7}' | sort | uniq -c | sort -rn | head
Поскольку официального списка IP нет, а строку UA в принципе может подделать любой скрипт, для проверки подлинности при аномальной активности стоит свериться с ASN конкретных IP через whois — как и с большинством ботов без опубликованного фида.
Как заблокировать
Стандартный запрет через robots.txt:
User-agent: ai2bot-deepresearcheval
Disallow: /
if ($http_user_agent ~* "ai2bot-deepresearcheval") {
return 403;
}
Если полный запрет кажется избыточным для бота с явно раскрытым некоммерческим оператором и относительно точечной задачей, а беспокоит именно фоновая нагрузка («тихий» съём HTML и рост bandwidth без классического DDoS-профиля), разумная альтернатива — ограничение частоты вместо жёсткой блокировки:
limit_req_zone $binary_remote_addr zone=ai2deepresearch:10m rate=10r/m;
location / {
if ($http_user_agent ~* "ai2bot-deepresearcheval") {
limit_req zone=ai2deepresearch burst=20 nodelay;
}
}
На позиции в органической выдаче Google, Bing или Яндекса блокировка не влияет — этот краулер не связан ни с одной поисковой системой и обслуживает исключительно внутренние оценочные бенчмарки открытых моделей Ai2.
Частые вопросы
Кто владеет ботом Ai2Bot-DeepResearchEval?
Чем этот бот отличается от основного AI2Bot?
А чем он отличается от Ai2Bot-Dolma?
Означает ли некоммерческий статус оператора отсутствие риска для сайта?
Соблюдает ли этот бот правила robots.txt?
Повлияет ли блокировка на позиции в поисковых системах?
Команда TrafficVeil разрабатывает инструменты защиты сайтов от ботов, DDoS и веб-атак. Разборы ботов пишем по логам подключённых доменов и открытым данным операторов.